FairMindSim: una U invertida armada con 10 modelos
Ricardo Argüello, 20 de agosto de 2026
CEO & Fundador
Resumen general
Un paper aceptado en KDD 2026 puso a 1.017 humanos y 10 modelos de lenguaje a jugar un juego de castigo. El hallazgo que se está compartiendo es una U invertida: los modelos de capacidad media castigan más del doble que los humanos, y los frontier casi no castigan. El hallazgo es interesante y el diseño del experimento es serio. Lo que no aguanta es el peso que se le está poniendo encima: la curva sale de 10 modelos, con una correlación que no alcanza significancia convencional y sin regla declarada de qué modelos entraron.
- El estudio, con el benchmark FairMindSim, comparó 1.017 humanos contra 10 modelos en un juego de castigo de tercera parte; la tasa humana fue 0,3506
- DeepSeek-R1 castigó 0,7927 y Qwen3-235B-A22B-Instruct 0,8268, más del doble que los humanos, mientras GPT-5 quedó en 0,3290 y Gemini-3-Pro en 0,1317
- Los autores llaman significativa a la correlación de rangos de −0,56 y reportan un ajuste cuadrático con R² de 0,51, pero no dan valor p; con n=10 esa correlación no alcanza ni el umbral a dos colas de 0,648 ni el de una cola de 0,564
- El conjunto incluye Claude Sonnet 4.5 y Claude 3.7 Sonnet pero ninguna versión de la línea Opus, y GPT-5 y GPT-4.1 pero no GPT-5.1, sin regla de selección ni fecha de corte declarada
- Alejandro G., de la OCDE, planteó la objeción estadística en los comentarios del post que hizo viral el hallazgo, aunque atribuyó a los autores una frase que el paper no usa
Imagina que quieres saber si los carros más caros frenan mejor. Pruebas diez carros, encuentras una curva rara donde los de precio medio frenan peor que los baratos y que los caros, y publicas la curva. El problema no es la medición de cada carro, que puede estar perfecta. El problema es que con diez puntos y sin decir cómo elegiste los diez, cualquier curva que dibujes encima cabe. Eso es lo que pasa cuando un benchmark de diez modelos se cita como si fuera una ley.
Resumen generado con IA
Un paper aceptado en KDD 2026 puso a 1.017 personas y a 10 modelos de lenguaje a jugar el mismo juego: ves a alguien repartir un premio de forma injusta y decides si lo castigas, pagando tú una parte del castigo.
El resultado que se está compartiendo es una curva en forma de U invertida. Los modelos de capacidad media castigan más del doble que los humanos. Los más capaces casi no castigan.
Es un hallazgo genuinamente interesante. Y ya se está citando con más peso del que la evidencia soporta.
Antes de creerle a un benchmark, pregunta quién no entró
Este es el hábito que le falta a casi toda empresa que evalúa modelos: mirar la lista de los que quedaron fuera antes de mirar el gráfico.
Un benchmark no mide “los modelos”. Mide los modelos que alguien decidió incluir. Si esa decisión no viene con una regla escrita y una fecha de corte, la forma de la curva y la forma de la muestra son indistinguibles. No porque haya mala fe, sino porque no hay manera de separarlas desde afuera.
Lo escribimos antes desde el otro lado del problema en el prompt es temporal, el eval es permanente: lo que le da valor a una evaluación es la disciplina con la que se define qué se mide y sobre qué, más que el número que produce. Un benchmark ajeno sin esa disciplina declarada no te sirve para decidir, aunque el número sea correcto.
Lo que el estudio sí midió
Vale ser preciso, porque el trabajo experimental es serio y merece que se cite bien.
El benchmark se llama FairMindSim. La tarea es un juego de castigo de tercera parte, repetido, con costo real para quien castiga. La muestra humana fue de 1.017 personas, que es una muestra grande y bien hecha.
Los números, según la tabla del paper: los humanos castigaron con una tasa de 0,3506. DeepSeek-R1 llegó a 0,7927 y Qwen3-235B-A22B-Instruct a 0,8268, o sea más del doble que las personas. GPT-5 quedó en 0,3290, casi encima del comportamiento humano. Gemini-3-Pro se fue al otro extremo con 0,1317, castigando cerca de cuatro veces menos que un humano.
La lectura de los autores es razonable y está bien contada: los modelos de capacidad intermedia detectan la violación pero no logran pesar los atenuantes, entonces sobresancionan. Los frontier aprenden contención y a veces se pasan hacia la indulgencia.
Como observación cualitativa sobre cómo se comporta un modelo cuando le das poder de sanción, eso vale. El problema aparece cuando la observación se convierte en curva y la curva en ley.
Los tres puntos donde la curva se debilita
Hay tres, y ninguno requiere dudar de la honestidad de nadie.
La muestra es de diez. Los autores reportan una correlación de rangos de −0,56 entre capacidad y tasa de castigo, y la describen como significativa. Con n=10, el valor crítico a dos colas ronda 0,648, y hasta el de una cola ronda 0,564. Un −0,56 no llega a ninguno de los dos. El paper no reporta un valor p en el texto principal, así que la palabra significativa aparece sin el número que la sostiene.
La cuadrática cabe casi siempre. El ajuste de segundo orden se reporta con un R² de 0,51. Una parábola tiene tres parámetros libres. Ajustar tres parámetros a diez puntos y obtener la mitad de la varianza explicada es lo que suele pasar, no una señal fuerte. Una curva con más grados de libertad casi siempre le gana a una recta, y eso no la vuelve el modelo correcto.
No hay regla de selección ni fecha de corte. El paper describe los diez como modelos de última generación consultados por sus APIs oficiales, y ahí se acaba el criterio. El conjunto incluye Claude Sonnet 4.5 y Claude 3.7 Sonnet, pero ninguna versión de la línea Opus. Incluye GPT-5 y GPT-4.1, pero no GPT-5.1. Puede haber razones perfectamente buenas para cada ausencia, presupuesto y disponibilidad entre ellas. El punto es que no están escritas, y sin ellas no se puede saber si mover el conjunto mueve la curva.
Lee también al crítico
Esta parte importa más que la anterior, porque es donde casi todo el mundo deja de verificar.
La objeción estadística no la levanté yo. Salió en los comentarios del post de Sekoul Krastev que hizo circular el hallazgo, de la mano de Alejandro G., que lidera el trabajo de impacto en desarrollo e IA en la OCDE. Su punto central sobre el tamaño de muestra y la selección es correcto y está bien planteado.
Pero dos detalles de su crítica no sobreviven al paper.
Dijo que el estudio excluyó los modelos más inteligentes, nombrando la línea Claude. No es exacto: Claude Sonnet 4.5 y Claude 3.7 Sonnet están adentro. Lo que falta es Opus, que es una afirmación bastante más estrecha.
Y dijo que los autores escriben “scaling law” (ley de escalamiento). El paper no usa esa frase. Habla de una tendencia no lineal, con fases que describe como un pico de agresión y una convergencia hacia la contención. La diferencia no es cosmética: reclamar una ley y describir una tendencia son dos niveles de compromiso distintos, y los autores eligieron el segundo.
Fui a leer el paper original justamente porque quería usar la crítica, y terminé teniendo que corregirla. Eso es el trabajo, no un accidente del trabajo.
La moraleja no apunta a que Alejandro se equivocó. Un hallazgo pasó de tabla a post viral a crítica a repetición de la crítica, y en cada salto alguien dejó de abrir la fuente. Si tú citas la objeción sin leer el paper, propagas un error nuevo mientras crees estar corrigiendo uno viejo.
Qué revisamos antes de darle criterio a un agente
Nada de esto significa que el hallazgo sea inútil. Significa que no es la base sobre la que decides.
Cuando una empresa nos plantea meter un agente en algo que sanciona, aprueba o rechaza, lo primero que hacemos es escribir la evaluación propia, sobre los casos reales de esa empresa, con las decisiones que un humano ya tomó y que sirven de referencia. Elegir modelo viene después. Cincuenta casos difíciles de tu operación te dicen más que cualquier tabla de diez modelos en un juego de laboratorio.
Después viene la parte que queda sin medir, y el estudio apunta directo a ella. Los modelos que las empresas realmente despliegan son los frontier, y esos están en el extremo indulgente de la curva: Gemini-3-Pro castigó cerca de cuatro veces menos que una persona. Un agente que sobresanciona al menos deja un rechazo, algo de lo que un cliente se queja y que alguien puede apelar. Un agente que deja pasar todo no deja nada que revisar. Ese es el modo de falla que describimos en tu agente facturó $0.00 y las bitácoras nunca lo vieron, y es el que sale más caro justamente porque no aparece.
Y antes de todo eso está la pregunta incómoda de si el caso necesita un agente. Muchas de estas decisiones se resuelven con reglas y una excepción escalada a una persona, que es el argumento de la pirámide antes del agente.
Si vas a citar una curva para justificar una decisión de arquitectura, ábrela primero. Diez puntos y una parábola no son una ley, y el que te la pasó probablemente tampoco la abrió.
Arma tu propia evaluación antes de elegir modeloPreguntas Frecuentes
FairMindSim es el benchmark de un paper de Yu Lei y colegas aceptado en KDD 2026. Puso a 1.017 humanos y a 10 modelos de lenguaje a jugar rondas de un juego de castigo de tercera parte, donde el jugador observa un reparto injusto y decide si castiga al responsable asumiendo un costo propio.
La tasa de castigo humana fue 0,3506. DeepSeek-R1 llegó a 0,7927 y Qwen3-235B-A22B-Instruct a 0,8268, más del doble que los humanos. En el otro extremo, GPT-5 quedó en 0,3290, muy cerca del comportamiento humano, y Gemini-3-Pro en 0,1317, castigando cuatro veces menos que las personas.
Porque con una muestra de 10 el valor crítico de una correlación de rangos a dos colas ronda 0,648 y el de una cola ronda 0,564. Una correlación de −0,56 queda por debajo de ambos, así que no alcanza significancia estadística convencional ni con la prueba más permisiva. El paper la describe como significativa pero no reporta valor p. El resultado sigue siendo interesante, pero es exploratorio, no concluyente.
Debe revisar cuántos modelos entraron, qué regla se usó para elegirlos, qué fecha de corte aplicó, y sobre todo qué modelos relevantes quedaron fuera. Un benchmark sin regla de selección declarada no permite distinguir entre un hallazgo real y un artefacto de la muestra elegida.
Artículos Relacionados
Anthropic revisó 141.006 pruebas y halló 3 hackeos reales
Anthropic encontró tres casos en que Claude entró sin autorización a sistemas de empresas reales. Lo halló en una revisión retrospectiva, no por su monitoreo.
Qwen3.8-Max rediseñó un chip de 8.298 a 678 compuertas
Alibaba libera los pesos de un modelo de 2,4 billones de parámetros que corrió ~500 iteraciones de diseño de chips solo. Qué cambia en tu evaluación.
Cloudflare les puso caseta de peaje a los agentes de IA
Cloudflare, AWS, Visa y otras 37 empresas armaron rieles de pago para agentes de IA. USENIX encontró violaciones de seguridad en los 15 facilitadores que probó.