Saltar al contenido principal

WikiSkill: un modelo 9B con habilidades le gana al 27B

Google midió agentes que acumulan lo aprendido en un wiki. Qwen 9B con habilidades evolucionadas llegó a 47,4% y el 27B sin ellas se quedó en 39,4%.

WikiSkill: un modelo 9B con habilidades le gana al 27B

Ricardo Argüello

Ricardo Argüello
Ricardo Argüello

CEO & Fundador

IA y Automatización 4 min de lectura

La discusión de qué modelo usar se come casi toda la conversación cuando una empresa empieza con agentes. Cuál es más listo, cuál cuesta menos, cuál sale primero en el benchmark del mes.

Un paper que Google Research publicó el 27 de agosto con Virginia Tech pone número a lo que esa discusión está dejando afuera.

Se llama WikiSkill, y el resultado que a mí me interesa es este. Qwen-3.5-9B, con habilidades acumuladas, promedia 47,4%. Qwen-3.6-27B, sin ellas, promedia 39,4%.

Tres veces más grande, ocho puntos abajo.

Qué hace WikiSkill

El método separa la experiencia cruda de ejecución, el conocimiento que se saca de esa experiencia y las habilidades ejecutables que el agente usa. Normalmente van revueltas.

El agente corre tareas. De esas corridas, buenas y malas, se extraen patrones que van a un wiki persistente. Las habilidades se reescriben a partir del wiki, y cuando una reescritura empeora las cosas, se revierte. La próxima iteración arranca desde ahí y no desde cero.

Los números del paper, sobre cinco benchmarks bastante distintos entre sí (LiveMath, SealQA, SpreadSheet, OfficeQA y ALFWorld):

  • Qwen-3.6-27B sube de 39,4% a 63,3%, casi 24 puntos.
  • Gemini-3.5-Flash sube de 49,5% a 68,1%.
  • En LiveMath, Gemini pasa de 33,0% a 72,6%. En SpreadSheet, de 50,5% a 76,6%.

También le gana a Trace2Skill, EvoSkill y SkillOpt, los métodos previos de evolución de habilidades.

Hay que decir la letra chica. Los modelos grandes ganan más que los pequeños con este método. El tamaño sigue comprando algo. Lo que muestra el paper es que la acumulación de conocimiento compite con subir de tamaño, y cuesta una fracción.

La parte que convierte esto en un activo de la empresa

Dos hallazgos del paper valen más que los porcentajes.

El primero. Las habilidades se transfieren entre modelos y entre familias de modelos. Lo que un agente aprendió operando con Qwen sirve corriendo con Gemma. En algunos casos, las habilidades evolucionadas por otro modelo funcionaron mejor que las que el modelo evolucionó para sí mismo.

Eso mueve de lugar una decisión de proveedor. Si el conocimiento operativo vive en tus archivos y no adentro de los pesos de un modelo, cambiar de proveedor deja de ser una migración y pasa a ser una configuración.

El segundo, la ablación. Cuando los investigadores quitan el wiki y dejan solo las habilidades, el desempeño se cae. O sea que lo que produce la mejora no son los archivos de habilidades. Es el registro persistente del que esos archivos salen.

Eso es exactamente lo que Karpathy propuso hace meses sin medición. Ahora hay medición.

Lo que esto significa si tienes agentes andando

Cuatro preguntas, y las hago en serio porque las respuestas las tienes tú, no yo.

¿Dónde queda escrito lo que tu agente aprendió esta semana? ¿Quién lo lee antes de la próxima corrida? Cuando algo falló en producción, ¿ese fallo volvió a alguna parte o solo a un ticket cerrado? Y si mañana cambias de proveedor de modelo, ¿qué parte de lo que funcionaba se va con él?

Si la última respuesta es “casi todo”, tu inversión en agentes está construida sobre algo que no es tuyo.

La versión empresarial de WikiSkill es mucho más aburrida que el paper. Es un lugar donde queden los patrones de fallo, las excepciones reales de tu operación, los casos que el agente resolvió mal y cómo se corrigieron. Escrito en texto plano, versionado, legible por una persona. Sobre cómo se cura ese material escribimos en wiki para agentes.

Nosotros lo montamos así desde antes de este paper, y ya contamos cómo funciona el nuestro en el cerebro de IQ Source. La diferencia es que ahora puedo señalar una tabla en vez de defender una intuición.

Si vas a hacer una sola cosa este trimestre con tus agentes, que sea esa. El modelo lo vas a cambiar tres veces. El wiki, si lo empiezas ahora, en diciembre ya vale algo.

Armemos el wiki de tus agentes

Preguntas Frecuentes

WikiSkill Google Research agentes IA conocimiento acumulado habilidades de agentes Qwen Gemini

Artículos Relacionados

Ecosistema de IA de Google: qué sirve y qué no para B2B
Estrategia Empresarial
· 12 min de lectura

Ecosistema de IA de Google: qué sirve y qué no para B2B

Vertex AI, Gemini, BigQuery ML, Document AI: guía para evaluar qué herramientas de Google encajan en tu operación B2B y cuáles no vale la pena considerar.

Google Cloud AI Vertex AI Gemini
Qwen3.8-Max rediseñó un chip de 8.298 a 678 compuertas
Estrategia Empresarial
· 9 min de lectura

Qwen3.8-Max rediseñó un chip de 8.298 a 678 compuertas

Alibaba libera los pesos de un modelo de 2,4 billones de parámetros que corrió ~500 iteraciones de diseño de chips solo. Qué cambia en tu evaluación.

Qwen Alibaba pesos abiertos
Thomson Reuters entrenó su modelo por 450.000 dólares
IA y Automatización
· 4 min de lectura

Thomson Reuters entrenó su modelo por 450.000 dólares

El modelo legal propio de Thomson Reuters le ganó a GPT 5.4 y a Claude Sonnet 5 en su propio terreno. La corrida final de entrenamiento costó 450.000 dólares.

Thomson Reuters modelos especializados datos propietarios