WikiSkill: un modelo 9B con habilidades le gana al 27B
Ricardo Argüello, 24 de septiembre de 2026
CEO & Fundador
Resumen general
Investigadores de Google Research y Virginia Tech publicaron WikiSkill, un método donde el agente escribe lo que aprendió en un wiki persistente y de ahí deriva sus habilidades ejecutables. El resultado que importa para una empresa es el de escala: un modelo pequeño con habilidades acumuladas supera a uno tres veces más grande sin ellas.
- Qwen-3.5-9B con WikiSkill promedia 47,4% y Qwen-3.6-27B sin habilidades se queda en 39,4%
- El mismo 27B con WikiSkill sube a 63,3%, casi 24 puntos por encima de su propio punto de partida
- Gemini-3.5-Flash pasa de 49,5% a 68,1% de promedio con el método
- Las habilidades se transfieren entre familias de modelos, y las evolucionadas por otro modelo a veces superan a las propias
- El estudio de ablación muestra que quitar el wiki tumba el desempeño, o sea que el activo es la acumulación y no los archivos de habilidades
Imagina dos talleres mecánicos. Uno tiene al mejor mecánico de la ciudad y ninguna bitácora. El otro tiene un mecánico correcto y veinte años de fichas donde está anotado qué le pasa a cada modelo de carro y qué funcionó. El segundo taller resuelve más rápido, y si el mecánico se va, las fichas se quedan. Eso es lo que Google acaba de medir con agentes de IA.
Resumen generado con IA
La discusión de qué modelo usar se come casi toda la conversación cuando una empresa empieza con agentes. Cuál es más listo, cuál cuesta menos, cuál sale primero en el benchmark del mes.
Un paper que Google Research publicó el 27 de agosto con Virginia Tech pone número a lo que esa discusión está dejando afuera.
Se llama WikiSkill, y el resultado que a mí me interesa es este. Qwen-3.5-9B, con habilidades acumuladas, promedia 47,4%. Qwen-3.6-27B, sin ellas, promedia 39,4%.
Tres veces más grande, ocho puntos abajo.
Qué hace WikiSkill
El método separa la experiencia cruda de ejecución, el conocimiento que se saca de esa experiencia y las habilidades ejecutables que el agente usa. Normalmente van revueltas.
El agente corre tareas. De esas corridas, buenas y malas, se extraen patrones que van a un wiki persistente. Las habilidades se reescriben a partir del wiki, y cuando una reescritura empeora las cosas, se revierte. La próxima iteración arranca desde ahí y no desde cero.
Los números del paper, sobre cinco benchmarks bastante distintos entre sí (LiveMath, SealQA, SpreadSheet, OfficeQA y ALFWorld):
- Qwen-3.6-27B sube de 39,4% a 63,3%, casi 24 puntos.
- Gemini-3.5-Flash sube de 49,5% a 68,1%.
- En LiveMath, Gemini pasa de 33,0% a 72,6%. En SpreadSheet, de 50,5% a 76,6%.
También le gana a Trace2Skill, EvoSkill y SkillOpt, los métodos previos de evolución de habilidades.
Hay que decir la letra chica. Los modelos grandes ganan más que los pequeños con este método. El tamaño sigue comprando algo. Lo que muestra el paper es que la acumulación de conocimiento compite con subir de tamaño, y cuesta una fracción.
La parte que convierte esto en un activo de la empresa
Dos hallazgos del paper valen más que los porcentajes.
El primero. Las habilidades se transfieren entre modelos y entre familias de modelos. Lo que un agente aprendió operando con Qwen sirve corriendo con Gemma. En algunos casos, las habilidades evolucionadas por otro modelo funcionaron mejor que las que el modelo evolucionó para sí mismo.
Eso mueve de lugar una decisión de proveedor. Si el conocimiento operativo vive en tus archivos y no adentro de los pesos de un modelo, cambiar de proveedor deja de ser una migración y pasa a ser una configuración.
El segundo, la ablación. Cuando los investigadores quitan el wiki y dejan solo las habilidades, el desempeño se cae. O sea que lo que produce la mejora no son los archivos de habilidades. Es el registro persistente del que esos archivos salen.
Eso es exactamente lo que Karpathy propuso hace meses sin medición. Ahora hay medición.
Lo que esto significa si tienes agentes andando
Cuatro preguntas, y las hago en serio porque las respuestas las tienes tú, no yo.
¿Dónde queda escrito lo que tu agente aprendió esta semana? ¿Quién lo lee antes de la próxima corrida? Cuando algo falló en producción, ¿ese fallo volvió a alguna parte o solo a un ticket cerrado? Y si mañana cambias de proveedor de modelo, ¿qué parte de lo que funcionaba se va con él?
Si la última respuesta es “casi todo”, tu inversión en agentes está construida sobre algo que no es tuyo.
La versión empresarial de WikiSkill es mucho más aburrida que el paper. Es un lugar donde queden los patrones de fallo, las excepciones reales de tu operación, los casos que el agente resolvió mal y cómo se corrigieron. Escrito en texto plano, versionado, legible por una persona. Sobre cómo se cura ese material escribimos en wiki para agentes.
Nosotros lo montamos así desde antes de este paper, y ya contamos cómo funciona el nuestro en el cerebro de IQ Source. La diferencia es que ahora puedo señalar una tabla en vez de defender una intuición.
Si vas a hacer una sola cosa este trimestre con tus agentes, que sea esa. El modelo lo vas a cambiar tres veces. El wiki, si lo empiezas ahora, en diciembre ya vale algo.
Armemos el wiki de tus agentesPreguntas Frecuentes
WikiSkill es un marco publicado en agosto de 2026 por investigadores de Google Research y Virginia Tech. Separa la experiencia cruda de ejecución, el conocimiento acumulado y las habilidades ejecutables, consolidando lo aprendido en un wiki persistente del que las siguientes versiones de las habilidades pueden partir.
Según el paper de WikiSkill, sí en varios escenarios. Qwen-3.5-9B con habilidades evolucionadas promedió 47,4% en los cinco benchmarks del estudio, por encima del 39,4% de Qwen-3.6-27B sin habilidades. El modelo grande también mejora con el método, subiendo a 63,3%.
El estudio de WikiSkill reporta que sí. Las habilidades evolucionadas se transfieren entre modelos y entre familias de modelos, y en algunos casos las habilidades generadas por otro modelo funcionan mejor que las que el propio modelo evolucionó para sí mismo.
Porque sin ese registro el aprendizaje queda disperso en historiales de optimización y no se reutiliza. El estudio de ablación de WikiSkill muestra que quitar el wiki derrumba el desempeño, lo que indica que el valor está en la acumulación sistemática y no solo en tener archivos de habilidades.
Artículos Relacionados
Ecosistema de IA de Google: qué sirve y qué no para B2B
Vertex AI, Gemini, BigQuery ML, Document AI: guía para evaluar qué herramientas de Google encajan en tu operación B2B y cuáles no vale la pena considerar.
Qwen3.8-Max rediseñó un chip de 8.298 a 678 compuertas
Alibaba libera los pesos de un modelo de 2,4 billones de parámetros que corrió ~500 iteraciones de diseño de chips solo. Qué cambia en tu evaluación.
Thomson Reuters entrenó su modelo por 450.000 dólares
El modelo legal propio de Thomson Reuters le ganó a GPT 5.4 y a Claude Sonnet 5 en su propio terreno. La corrida final de entrenamiento costó 450.000 dólares.