Harvey Tenet: un modelo legal sobre la base china Kimi K3
Ricardo Argüello, 15 de septiembre de 2026
CEO & Fundador
Resumen general
Harvey, la empresa de IA legal respaldada por OpenAI, anunció el 20 de agosto de 2026 su primer modelo post-entrenado propio: Harvey Tenet, construido sobre la base abierta Kimi K3 de Moonshot AI junto con Fireworks. Consigue el primer lugar en contratos de su benchmark y el segundo en el general.
- Harvey Tenet completa casi el doble de tareas reservadas de LAB que la base Kimi K3, y un 20% más en LAB Contracts
- La tasa de aprobación total sube 9 puntos en LAB y 2 puntos en LAB Contracts
- Queda primero en LAB Contracts y segundo en LAB, no primero en todo
- Las mejoras se transfieren a benchmarks ajenos que no vio en entrenamiento: APEX Agents de Mercor y Redline Bench de Crosby
- Harvey antes enrutaba el trabajo de sus clientes por modelos de OpenAI, Anthropic y Google
Imagina que llevas años alquilando el motor de tu propio carro de carreras. Funciona, pero cada vuelta la pagas y el fabricante decide cuándo cambia el diseño. Harvey compró un bloque de motor de segunda, le hizo la culata a la medida de su pista, y ahora gana en la curva que más le importa. Lo que hizo eso posible fue tener la pista medida al centímetro.
Resumen generado con IA
El 20 de agosto Harvey publicó su primer modelo propio. Se llama Tenet, está construido sobre Kimi K3 de Moonshot AI, y los resultados que la propia empresa reporta son estos. Primer lugar en LAB Contracts, segundo lugar en LAB.
Segundo. No primero.
Ese detalle es el que hace creíble el resto del reporte. La cobertura lo saltó para titular que un modelo chino le ganó a los americanos.
Lo que a mí me parece la noticia es otra cosa, y no tiene que ver con el modelo. Harvey pudo hacer esto porque es dueño de la medición. LAB lo construyó Harvey. BigLaw Bench también. Cuando tienes la pista medida al centímetro, post-entrenar deja de ser una apuesta y se vuelve un proceso.
Los números, sin adorno
El reporte de Harvey dice que Tenet completa casi el doble de tareas reservadas en LAB que la base Kimi K3, y un 20% más en LAB Contracts. La tasa de aprobación total sube 9 puntos porcentuales en LAB y 2 en LAB Contracts.
Después viene la parte que a mí me convenció. Las mejoras se transfieren a dos benchmarks que Harvey no controla y que el modelo no vio durante el entrenamiento: APEX Agents de Mercor, en derecho corporativo, y Redline Bench de Crosby.
Eso es lo que separa un modelo que aprendió la tarea de uno que aprendió el examen. Si las ganancias solo aparecieran en LAB, LAB sería el problema.
El post-entrenamiento lo hicieron junto con Fireworks, y el método que describen es abogados inventando disputas y expedientes falsos para después calificar cómo razonó el modelo. Personas caras produciendo datos de evaluación a mano.
Dueño de la evaluación, dueño de la especialización
Aquí está el argumento que me interesa vender.
Casi cualquier empresa de software puede descargar hoy Kimi K3. Los pesos están ahí. Pocas tienen un conjunto de tareas de su industria, calificadas por expertos, lo bastante grande y lo bastante honesto para saber si el ajuste sirvió o si el modelo aprendió a sonar mejor.
Sin eso, post-entrenar es tirar dinero a un pozo y mirar hacia adentro.
Harvey lleva dos años publicando benchmarks legales. Cuando llegó el momento de construir su propio modelo, ya tenía el instrumento. El orden importa. Primero midieron, después entrenaron.
Sobre esta idea escribimos antes desde otro ángulo, en lo que no puede entrenarse. Aquel post pregunta qué parte de tu criterio no está en los datos. Este es el paso siguiente: si logras escribir ese criterio como examen, se vuelve un activo que ningún proveedor te puede cobrar.
Que la base sea china importa menos de lo que parece
Hay una conversación geopolítica alrededor de esto y entiendo por qué, pero para una decisión de arquitectura es ruido.
Los pesos son abiertos. Lo que corre en producción son los pesos ajustados de Harvey, en la infraestructura de Harvey. La licencia de Moonshot sí tiene un detalle práctico. Los operadores que venden el modelo como servicio y superan los 20 millones de dólares de ingresos en doce meses necesitan un acuerdo aparte. Con más de 350 millones anualizados, Harvey está muy por encima de ese umbral, así que hubo conversación.
Revisa la licencia antes de enamorarte del modelo. Es aburrido y es donde se cae la mitad de estos proyectos.
El patrón de fondo ya lo vimos en voz, cuando Fish Audio bajó los precios 70% y ElevenLabs creció igual. Abaratar el modelo no destruye el valor, lo reubica, se va hacia arriba, al producto y a los datos de evaluación.
Si vendes software vertical
Tres preguntas que yo haría esta semana, en serio, no como recurso retórico.
¿Cuántas tareas reales de tus clientes tienes calificadas por alguien que sabe? ¿Tu tasa de aprobación la mide un experto o la mide otro modelo? ¿Cuánto pagaste el mes pasado en llamadas a API por trabajo que se repite casi idéntico?
Si la primera respuesta es cero, el modelo abierto no te sirve todavía. No porque sea malo, sino porque no vas a poder saber si te sirvió.
Nosotros entramos por ahí en el servicio de Socio Tecnológico para empresas de software, construyendo el conjunto de evaluación de tu vertical antes de tocar un peso del modelo. Harvey tardó dos años en tener el suyo. Tú no necesitas dos años, necesitas empezar por el mismo lado.
Armemos el benchmark de tu verticalPreguntas Frecuentes
Harvey Tenet es el primer modelo post-entrenado propio de Harvey, la empresa de IA legal. Está construido sobre Kimi K3, el modelo de pesos abiertos de la startup china Moonshot AI publicado en julio de 2026, y fue post-entrenado junto con Fireworks para trabajo legal de horizonte largo.
Según Harvey, Tenet completa casi el doble de tareas reservadas en LAB y un 20% más en LAB Contracts que la base Kimi K3, con la tasa de aprobación total subiendo 9 y 2 puntos porcentuales. Queda primero en LAB Contracts y segundo en LAB.
LAB es el benchmark de agentes legales que Harvey construyó y publica, junto con BigLaw Bench. Mide el desempeño de modelos en tareas legales reales de horizonte largo en vez de razonamiento legal en formatos estructurados. Harvey lo usa tanto para evaluar modelos ajenos como para entrenar el suyo.
Para convertir un costo variable en uno fijo y controlar el ciclo de mejoras. Harvey antes enrutaba trabajo de clientes por modelos de OpenAI, Anthropic y Google, pagando por llamada. Con un modelo propio post-entrenado sobre pesos abiertos, la empresa decide cuándo y sobre qué datos se ajusta.
Artículos Relacionados
Google entró al derecho y Harvey quedó de conector
Gemini Enterprise for Legal salió el 25 de agosto con Cleary, Freshfields y Weil. Harvey aparece adentro como integración MCP, no como competidor.
FairMindSim: una U invertida armada con 10 modelos
Un paper de KDD 2026 dice que los modelos medios castigan el doble que los humanos. La curva descansa en 10 modelos y una correlación que no da significancia.
No hay veto a DeepSeek todavía, pero el mecanismo ya está armado
Washington no ha prohibido los modelos de IA chinos. Pero la orden ejecutiva y la lista de entidades ya están redactadas, listas para activarse.
Jensen Huang Lo Dijo en Dos Palabras: Tu Moat es Saber Más
Jensen Huang dice que el moat con IA es la especialización vertical, no los modelos. Qué significa esta visión para líderes de empresas B2B.
NVIDIA compraría Hugging Face y tu stack depende de él
The Information reportó que NVIDIA acordó comprar Hugging Face por 12.900 millones. Abierto describe la licencia, no describe de quién es el servidor.
Fish Audio es 70% más barato. ElevenLabs creció igual
Fish Audio abrió los pesos y cobra $0,05 por minuto contra $0,18. ElevenLabs pasó de $350M a más de $500M de ARR igual. ¿Dónde quedó el moat?