Saltar al contenido principal

FairMindSim: una U invertida armada con 10 modelos

Un paper de KDD 2026 dice que los modelos medios castigan el doble que los humanos. La curva descansa en 10 modelos y una correlación que no da significancia.

FairMindSim: una U invertida armada con 10 modelos

Ricardo Argüello

Ricardo Argüello
Ricardo Argüello

CEO & Fundador

Estrategia Empresarial 7 min de lectura

Un paper aceptado en KDD 2026 puso a 1.017 personas y a 10 modelos de lenguaje a jugar el mismo juego: ves a alguien repartir un premio de forma injusta y decides si lo castigas, pagando tú una parte del castigo.

El resultado que se está compartiendo es una curva en forma de U invertida. Los modelos de capacidad media castigan más del doble que los humanos. Los más capaces casi no castigan.

Es un hallazgo genuinamente interesante. Y ya se está citando con más peso del que la evidencia soporta.

Antes de creerle a un benchmark, pregunta quién no entró

Este es el hábito que le falta a casi toda empresa que evalúa modelos: mirar la lista de los que quedaron fuera antes de mirar el gráfico.

Un benchmark no mide “los modelos”. Mide los modelos que alguien decidió incluir. Si esa decisión no viene con una regla escrita y una fecha de corte, la forma de la curva y la forma de la muestra son indistinguibles. No porque haya mala fe, sino porque no hay manera de separarlas desde afuera.

Lo escribimos antes desde el otro lado del problema en el prompt es temporal, el eval es permanente: lo que le da valor a una evaluación es la disciplina con la que se define qué se mide y sobre qué, más que el número que produce. Un benchmark ajeno sin esa disciplina declarada no te sirve para decidir, aunque el número sea correcto.

Lo que el estudio sí midió

Vale ser preciso, porque el trabajo experimental es serio y merece que se cite bien.

El benchmark se llama FairMindSim. La tarea es un juego de castigo de tercera parte, repetido, con costo real para quien castiga. La muestra humana fue de 1.017 personas, que es una muestra grande y bien hecha.

Los números, según la tabla del paper: los humanos castigaron con una tasa de 0,3506. DeepSeek-R1 llegó a 0,7927 y Qwen3-235B-A22B-Instruct a 0,8268, o sea más del doble que las personas. GPT-5 quedó en 0,3290, casi encima del comportamiento humano. Gemini-3-Pro se fue al otro extremo con 0,1317, castigando cerca de cuatro veces menos que un humano.

La lectura de los autores es razonable y está bien contada: los modelos de capacidad intermedia detectan la violación pero no logran pesar los atenuantes, entonces sobresancionan. Los frontier aprenden contención y a veces se pasan hacia la indulgencia.

Como observación cualitativa sobre cómo se comporta un modelo cuando le das poder de sanción, eso vale. El problema aparece cuando la observación se convierte en curva y la curva en ley.

Los tres puntos donde la curva se debilita

Hay tres, y ninguno requiere dudar de la honestidad de nadie.

La muestra es de diez. Los autores reportan una correlación de rangos de −0,56 entre capacidad y tasa de castigo, y la describen como significativa. Con n=10, el valor crítico a dos colas ronda 0,648, y hasta el de una cola ronda 0,564. Un −0,56 no llega a ninguno de los dos. El paper no reporta un valor p en el texto principal, así que la palabra significativa aparece sin el número que la sostiene.

La cuadrática cabe casi siempre. El ajuste de segundo orden se reporta con un R² de 0,51. Una parábola tiene tres parámetros libres. Ajustar tres parámetros a diez puntos y obtener la mitad de la varianza explicada es lo que suele pasar, no una señal fuerte. Una curva con más grados de libertad casi siempre le gana a una recta, y eso no la vuelve el modelo correcto.

No hay regla de selección ni fecha de corte. El paper describe los diez como modelos de última generación consultados por sus APIs oficiales, y ahí se acaba el criterio. El conjunto incluye Claude Sonnet 4.5 y Claude 3.7 Sonnet, pero ninguna versión de la línea Opus. Incluye GPT-5 y GPT-4.1, pero no GPT-5.1. Puede haber razones perfectamente buenas para cada ausencia, presupuesto y disponibilidad entre ellas. El punto es que no están escritas, y sin ellas no se puede saber si mover el conjunto mueve la curva.

Lee también al crítico

Esta parte importa más que la anterior, porque es donde casi todo el mundo deja de verificar.

La objeción estadística no la levanté yo. Salió en los comentarios del post de Sekoul Krastev que hizo circular el hallazgo, de la mano de Alejandro G., que lidera el trabajo de impacto en desarrollo e IA en la OCDE. Su punto central sobre el tamaño de muestra y la selección es correcto y está bien planteado.

Pero dos detalles de su crítica no sobreviven al paper.

Dijo que el estudio excluyó los modelos más inteligentes, nombrando la línea Claude. No es exacto: Claude Sonnet 4.5 y Claude 3.7 Sonnet están adentro. Lo que falta es Opus, que es una afirmación bastante más estrecha.

Y dijo que los autores escriben “scaling law” (ley de escalamiento). El paper no usa esa frase. Habla de una tendencia no lineal, con fases que describe como un pico de agresión y una convergencia hacia la contención. La diferencia no es cosmética: reclamar una ley y describir una tendencia son dos niveles de compromiso distintos, y los autores eligieron el segundo.

Fui a leer el paper original justamente porque quería usar la crítica, y terminé teniendo que corregirla. Eso es el trabajo, no un accidente del trabajo.

La moraleja no apunta a que Alejandro se equivocó. Un hallazgo pasó de tabla a post viral a crítica a repetición de la crítica, y en cada salto alguien dejó de abrir la fuente. Si tú citas la objeción sin leer el paper, propagas un error nuevo mientras crees estar corrigiendo uno viejo.

Qué revisamos antes de darle criterio a un agente

Nada de esto significa que el hallazgo sea inútil. Significa que no es la base sobre la que decides.

Cuando una empresa nos plantea meter un agente en algo que sanciona, aprueba o rechaza, lo primero que hacemos es escribir la evaluación propia, sobre los casos reales de esa empresa, con las decisiones que un humano ya tomó y que sirven de referencia. Elegir modelo viene después. Cincuenta casos difíciles de tu operación te dicen más que cualquier tabla de diez modelos en un juego de laboratorio.

Después viene la parte que queda sin medir, y el estudio apunta directo a ella. Los modelos que las empresas realmente despliegan son los frontier, y esos están en el extremo indulgente de la curva: Gemini-3-Pro castigó cerca de cuatro veces menos que una persona. Un agente que sobresanciona al menos deja un rechazo, algo de lo que un cliente se queja y que alguien puede apelar. Un agente que deja pasar todo no deja nada que revisar. Ese es el modo de falla que describimos en tu agente facturó $0.00 y las bitácoras nunca lo vieron, y es el que sale más caro justamente porque no aparece.

Y antes de todo eso está la pregunta incómoda de si el caso necesita un agente. Muchas de estas decisiones se resuelven con reglas y una excepción escalada a una persona, que es el argumento de la pirámide antes del agente.

Si vas a citar una curva para justificar una decisión de arquitectura, ábrela primero. Diez puntos y una parábola no son una ley, y el que te la pasó probablemente tampoco la abrió.

Arma tu propia evaluación antes de elegir modelo

Preguntas Frecuentes

FairMindSim KDD 2026 juicio moral IA benchmarks gobernanza IA agentes IA evaluación de modelos

Artículos Relacionados

Anthropic revisó 141.006 pruebas y halló 3 hackeos reales
Estrategia Empresarial
· 9 min de lectura

Anthropic revisó 141.006 pruebas y halló 3 hackeos reales

Anthropic encontró tres casos en que Claude entró sin autorización a sistemas de empresas reales. Lo halló en una revisión retrospectiva, no por su monitoreo.

Anthropic Claude seguridad IA
Qwen3.8-Max rediseñó un chip de 8.298 a 678 compuertas
Estrategia Empresarial
· 9 min de lectura

Qwen3.8-Max rediseñó un chip de 8.298 a 678 compuertas

Alibaba libera los pesos de un modelo de 2,4 billones de parámetros que corrió ~500 iteraciones de diseño de chips solo. Qué cambia en tu evaluación.

Qwen Alibaba pesos abiertos
Cloudflare les puso caseta de peaje a los agentes de IA
Estrategia Empresarial
· 8 min de lectura

Cloudflare les puso caseta de peaje a los agentes de IA

Cloudflare, AWS, Visa y otras 37 empresas armaron rieles de pago para agentes de IA. USENIX encontró violaciones de seguridad en los 15 facilitadores que probó.

Cloudflare x402 Monetization Gateway