Saltar al contenido principal

FairMindSim: una U invertida armada con 10 modelos

Un paper de KDD 2026 dice que los modelos medios castigan el doble que los humanos. La curva descansa en 10 modelos y una correlación que no da significancia.

FairMindSim: una U invertida armada con 10 modelos

Ricardo Argüello

Ricardo Argüello
Ricardo Argüello

CEO & Fundador

Estrategia Empresarial 7 min de lectura

Un paper aceptado en KDD 2026 puso a 1.017 personas y a 10 modelos de lenguaje a jugar el mismo juego: ves a alguien repartir un premio de forma injusta y decides si lo castigas, pagando tú una parte del castigo.

El resultado que se está compartiendo es una curva en forma de U invertida. Los modelos de capacidad media castigan más del doble que los humanos. Los más capaces casi no castigan.

Es un hallazgo genuinamente interesante. Y ya se está citando con más peso del que la evidencia soporta.

Antes de creerle a un benchmark, pregunta quién no entró

Este es el hábito que le falta a casi toda empresa que evalúa modelos: mirar la lista de los que quedaron fuera antes de mirar el gráfico.

Un benchmark no mide “los modelos”. Mide los modelos que alguien decidió incluir. Si esa decisión no viene con una regla escrita y una fecha de corte, la forma de la curva y la forma de la muestra son indistinguibles. No porque haya mala fe, sino porque no hay manera de separarlas desde afuera.

Lo escribimos antes desde el otro lado del problema en el prompt es temporal, el eval es permanente: lo que le da valor a una evaluación es la disciplina con la que se define qué se mide y sobre qué, más que el número que produce. Un benchmark ajeno sin esa disciplina declarada no te sirve para decidir, aunque el número sea correcto.

Lo que el estudio sí midió

Vale ser preciso, porque el trabajo experimental es serio y merece que se cite bien.

El benchmark se llama FairMindSim. La tarea es un juego de castigo de tercera parte, repetido, con costo real para quien castiga. La muestra humana fue de 1.017 personas, que es una muestra grande y bien hecha.

Los números, según la tabla del paper: los humanos castigaron con una tasa de 0,3506. DeepSeek-R1 llegó a 0,7927 y Qwen3-235B-A22B-Instruct a 0,8268, o sea más del doble que las personas. GPT-5 quedó en 0,3290, casi encima del comportamiento humano. Gemini-3-Pro se fue al otro extremo con 0,1317, castigando cerca de cuatro veces menos que un humano.

La lectura de los autores es razonable y está bien contada: los modelos de capacidad intermedia detectan la violación pero no logran pesar los atenuantes, entonces sobresancionan. Los frontier aprenden contención y a veces se pasan hacia la indulgencia.

Como observación cualitativa sobre cómo se comporta un modelo cuando le das poder de sanción, eso vale. El problema aparece cuando la observación se convierte en curva y la curva en ley.

Los tres puntos donde la curva se debilita

Hay tres, y ninguno requiere dudar de la honestidad de nadie.

La muestra es de diez. Los autores reportan una correlación de rangos de −0,56 entre capacidad y tasa de castigo, y la describen como significativa. Con n=10, el valor crítico a dos colas ronda 0,648, y hasta el de una cola ronda 0,564. Un −0,56 no llega a ninguno de los dos. El paper no reporta un valor p en el texto principal, así que la palabra significativa aparece sin el número que la sostiene.

La cuadrática cabe casi siempre. El ajuste de segundo orden se reporta con un R² de 0,51. Una parábola tiene tres parámetros libres. Ajustar tres parámetros a diez puntos y obtener la mitad de la varianza explicada es lo que suele pasar, no una señal fuerte. Una curva con más grados de libertad casi siempre le gana a una recta, y eso no la vuelve el modelo correcto.

No hay regla de selección ni fecha de corte. El paper describe los diez como modelos de última generación consultados por sus APIs oficiales, y ahí se acaba el criterio. El conjunto incluye Claude Sonnet 4.5 y Claude 3.7 Sonnet, pero ninguna versión de la línea Opus. Incluye GPT-5 y GPT-4.1, pero no GPT-5.1. Puede haber razones perfectamente buenas para cada ausencia, presupuesto y disponibilidad entre ellas. El punto es que no están escritas, y sin ellas no se puede saber si mover el conjunto mueve la curva.

Lee también al crítico

Esta parte importa más que la anterior, porque es donde casi todo el mundo deja de verificar.

La objeción estadística no la levanté yo. Salió en los comentarios del post de Sekoul Krastev que hizo circular el hallazgo, de la mano de Alejandro G., que lidera el trabajo de impacto en desarrollo e IA en la OCDE. Su planteo tiene tres partes. Que la curva descansa en diez versiones elegidas sin regla declarada ni fecha de corte. Que quedan afuera GPT-5.1 y toda la línea Opus. Y que con n=10 la correlación de rangos no pasa una prueba convencional a dos colas.

Antes de citarlo fui a leer el paper original, que es lo mínimo. Los tres puntos aguantan. El conjunto de modelos es el que él describe. La correlación es la que él dice. Y la frase “scaling law” (ley de escalamiento) que le atribuye a los autores está textual en la sección 3.2.2, en la misma oración con la que introducen las dos fases del fenómeno.

Cuento el paso de verificación aunque no haya encontrado nada, porque el resultado se decidía ahí. Si el paper no hubiera usado esa frase, yo estaría publicando una corrección con el nombre de otra persona encima. Abrí la fuente sin saber cuál de los dos resultados me iba a tocar, y me tocó el aburrido.

En ese mismo hilo hay una versión más dura del argumento estadístico. Phillip Kerger, profesor en Berkeley, dice haber corrido un bootstrap sobre los datos de la figura y reporta que ninguno de los tres términos le da significativo, con una banda de 95% que admite tanto una recta plana como una parábola de signo contrario. Ese cálculo no lo repliqué, así que te lo paso como lo que es, la afirmación de un tercero en un comentario.

Un hallazgo pasa de tabla a post viral a crítica a repetición de la crítica, y en cada salto alguien puede dejar de abrir la fuente. La única manera de no ser ese eslabón es abrirla tú, aceptando de antemano que a veces te va a devolver exactamente lo que ya te habían dicho.

Qué revisamos antes de darle criterio a un agente

Nada de esto significa que el hallazgo sea inútil. Significa que no es la base sobre la que decides.

Cuando una empresa nos plantea meter un agente en algo que sanciona, aprueba o rechaza, lo primero que hacemos es escribir la evaluación propia, sobre los casos reales de esa empresa, con las decisiones que un humano ya tomó y que sirven de referencia. Elegir modelo viene después. Cincuenta casos difíciles de tu operación te dicen más que cualquier tabla de diez modelos en un juego de laboratorio.

Después viene la parte que queda sin medir, y el estudio apunta directo a ella. Los modelos que las empresas realmente despliegan son los frontier, y esos están en el extremo indulgente de la curva: Gemini-3-Pro castigó cerca de cuatro veces menos que una persona. Un agente que sobresanciona al menos deja un rechazo, algo de lo que un cliente se queja y que alguien puede apelar. Un agente que deja pasar todo no deja nada que revisar. Ese es el modo de falla que describimos en tu agente facturó $0.00 y las bitácoras nunca lo vieron, y es el que sale más caro justamente porque no aparece.

Y antes de todo eso está la pregunta incómoda de si el caso necesita un agente. Muchas de estas decisiones se resuelven con reglas y una excepción escalada a una persona, que es el argumento de la pirámide antes del agente.

Si vas a citar una curva para justificar una decisión de arquitectura, ábrela primero. Diez puntos y una parábola no son una ley, y el que te la pasó probablemente tampoco la abrió.

Arma tu propia evaluación antes de elegir modelo

Preguntas Frecuentes

FairMindSim KDD 2026 juicio moral IA benchmarks gobernanza IA agentes IA evaluación de modelos

Artículos Relacionados

Anthropic revisó 141.006 pruebas y halló 3 hackeos reales
Estrategia Empresarial
· 9 min de lectura

Anthropic revisó 141.006 pruebas y halló 3 hackeos reales

Anthropic encontró tres casos en que Claude entró sin autorización a sistemas de empresas reales. Lo halló en una revisión retrospectiva, no por su monitoreo.

Anthropic Claude seguridad IA
Qwen3.8-Max rediseñó un chip de 8.298 a 678 compuertas
Estrategia Empresarial
· 9 min de lectura

Qwen3.8-Max rediseñó un chip de 8.298 a 678 compuertas

Alibaba libera los pesos de un modelo de 2,4 billones de parámetros que corrió ~500 iteraciones de diseño de chips solo. Qué cambia en tu evaluación.

Qwen Alibaba pesos abiertos
Cloudflare les puso caseta de peaje a los agentes de IA
Estrategia Empresarial
· 8 min de lectura

Cloudflare les puso caseta de peaje a los agentes de IA

Cloudflare, AWS, Visa y otras 37 empresas armaron rieles de pago para agentes de IA. USENIX encontró violaciones de seguridad en los 15 facilitadores que probó.

Cloudflare x402 Monetization Gateway