Qwen3.8-Max rediseñó un chip de 8.298 a 678 compuertas
Ricardo Argüello — 14 de agosto de 2026
CEO & Fundador
Resumen general
El 3 de agosto Alibaba lanzó Qwen3.8-Max, un modelo de 2,4 billones de parámetros totales con 95 mil millones activos, y el 12 de agosto publicó los pesos en Hugging Face bajo una licencia propia. Es el primer modelo clase Max que Qwen abre. La demo que importa no es un benchmark: el modelo corrió cerca de 500 iteraciones en ciclo cerrado optimizando un diseño de chip, de 8.298 compuertas lógicas a 678.
- Qwen3.8-Max tiene 2,4 billones de parámetros totales y 95 mil millones activos por consulta, con arquitectura Mixture-of-Experts
- En la demo de diseño de chips, el modelo llevó un circuito de 8.298 compuertas lógicas a 678 en aproximadamente 500 iteraciones, reduciendo el área física 81%, de 106x106 a 46x46 micras, contra la herramienta open source OpenROAD
- En otra demo corrió 16 días de programación autónoma sin intervención humana: 265 commits, 127 pull requests y 151 issues, produciendo un proyecto llamado oh-my-cli
- En Terminal-Bench 2.1 marcó 86,6 contra 84,6 de Claude Fable 5 y 88,8 de GPT-5.6 Sol; en SWE-bench Pro quedó en 67,7 contra 80,0 de Fable 5
- Alibaba publicó los pesos el 12 de agosto bajo la licencia Qwen3.8-Max, sin restricciones regionales, pero exige licencia aparte a quien opere un negocio de Model as a Service o un asistente de trabajo con IA y facture más de 50 millones de dólares en doce meses
- Los pesos liberados son solo de texto: no incluyen la entrada de visión ni el contexto de un millón de tokens que sí tiene la versión del API
- La versión de 27 mil millones de parámetros, anunciada para la misma semana, todavía no tiene repositorio oficial
Imagina que llevas años contratando a una firma externa cada vez que necesitas un peritaje complicado, porque nadie en tu empresa puede hacerlo. Un día aparece un profesional independiente, con credenciales verificables, que hace el mismo trabajo, cobra una fracción y además te deja quedarte con todo su método por escrito. La pregunta deja de ser si es bueno. Pasa a ser si tu empresa tiene siquiera un proceso para contratar a alguien así, y quién firma si se equivoca.
Resumen generado con IA
El 3 de agosto Alibaba lanzó Qwen3.8-Max: 2,4 billones de parámetros totales, 95 mil millones activos por consulta. Anunció que los pesos saldrían una semana después, y el 12 de agosto los publicó en Hugging Face. Es el primer modelo clase Max que Qwen abre.
La cobertura se fue toda a los benchmarks. Me interesa más otra cosa.
Lo que cambió no es el puntaje. Son las ~500 iteraciones
Casi todas las empresas con las que hablo evalúan modelos igual: miran una tabla comparativa, ven quién puntea más alto, y eligen el API. Es una decisión de una sola pregunta, y funcionaba bien mientras el trabajo también fuera de una sola pregunta.
La demo de chips de Alibaba rompe esa lógica. No fue una respuesta bien redactada. Fue el modelo corriendo cerca de 500 iteraciones en ciclo cerrado contra OpenROAD, una herramienta de diseño electrónico open source, ajustando y midiendo hasta llevar un circuito de 8.298 compuertas lógicas a 678. El área física bajó 81%, de 106x106 a 46x46 micras, según the-decoder.
Ese tipo de carga es la que justifica autohospedar. Quinientas iteraciones contra una herramienta interna, corriendo horas, tocando datos que no quieres mandar a un API de terceros: ahí el cálculo de costo, latencia y control cambia por completo frente a llamar a un modelo cerrado por token.
Y ese es exactamente el trabajo que casi nadie tiene gobernado. Tienes criterio para elegir un API. No tienes criterio para decidir si vale la pena correr un modelo de frontera adentro de tu casa.
Lo que Alibaba mostró, con números
Vale separar lo que está documentado de lo que circuló en redes.
Documentado: además del chip, Qwen3.8-Max corrió 16 días de programación autónoma sin intervención humana, con 265 commits, 127 pull requests y 151 issues, y sacó un proyecto llamado oh-my-cli. Hubo también una simulación de comercio electrónico donde el modelo pasó de 100.000 yuanes a 416.252 en un año fiscal simulado, con 152 estafadores sembrados en la lista de proveedores.
En benchmarks el resultado es desparejo, y eso importa más que el titular. En Terminal-Bench 2.1 marcó 86,6, por encima de Claude Fable 5 con 84,6 y por debajo de GPT-5.6 Sol con 88,8. Pero en SWE-bench Pro quedó en 67,7 contra 80,0 de Fable 5. La ventaja real de este modelo es agéntica y multimodal, no de razonamiento puro. El propio equipo de Qwen lo publicó en X sin exagerar: “second only to Fable 5” (segundo solo después de Fable 5).
Lo que no está documentado: circuló bastante que la demo incluía verificación de estructuras de proteínas. No encontré esa afirmación en ninguna cobertura de prensa, ni en TechNode, ni en MarkTechPost, ni en InfoWorld. Si la vas a citar en una presentación interna, verifícala primero. Lo del chip sí está bien reportado y, para efectos de la decisión que importa, alcanza y sobra.
Bridgewater ya jugó esta mano, un tamaño más abajo
Nada de esto es hipotético. En julio escribimos sobre cómo Bridgewater afinó Qwen3-235B y venció a GPT, Claude y Gemini: 84,7% de precisión filtrando documentos financieros, 13,8 veces más barato que el mejor modelo de frontera con los mejores prompts posibles.
Bridgewater lo hizo con un modelo abierto de Alibaba de 235 mil millones de parámetros. Ahora Alibaba abre uno diez veces más grande.
Eso convierte una curiosidad en una opción de compra real. El argumento de “los modelos abiertos son buenos para prototipos, pero para producción necesitas frontera” acaba de perder su mejor pierna. Y el patrón que hizo funcionar a Bridgewater no fue el tamaño del modelo: fue tener una tarea definida con precisión, un umbral de precisión que el negocio exigía de antemano, y un método para medir si lo cruzaba. Sin esas tres cosas, un modelo de 2,4 billones de parámetros corriendo en tu infraestructura es solo una factura de GPU más grande.
Y hay un detalle práctico que la euforia se salta seguido: 95 mil millones de parámetros activos no corren en un par de tarjetas. Descargar los pesos es gratis. Servirlos con latencia usable, con redundancia y con alguien de guardia cuando el nodo se cae, no lo es. Para la mayoría de las empresas medianas, autohospedar en la práctica significa alquilar cómputo en una nube de todos modos, solo que ahora también eres el responsable del despliegue, del versionado y del monitoreo.
Eso puede seguir saliendo más barato, como le salió a Bridgewater. Pero es una cuenta que tienes que hacer con tus propios números de volumen, no con el precio por token de una tabla comparativa. Para muchos casos reales, la respuesta correcta va a ser un modelo mucho más chico que el del titular. Alibaba anunció una versión de 27 mil millones de parámetros para esa misma semana, y ahí conviene tener cuidado: al momento de publicar esto todavía no existe un repositorio oficial de Qwen para ese modelo. Lo que sí hay en Hugging Face son conversiones subidas por terceros. No es lo mismo, y para una decisión de producción la diferencia es justamente la que este artículo defiende.
El riesgo que no aparece en la ficha técnica
Acá es donde la conversación se pone incómoda, y donde veo a más equipos saltarse el paso.
Un modelo de pesos abiertos que corres tú mismo no viene con un acuerdo de servicio. Nadie te responde a las dos de la mañana cuando el agente hace algo que no debía. Ese es el punto que ya discutimos cuando Jensen Huang armó su carta de pesos abiertos y Anthropic no la firmó: la pregunta nunca fue abierto contra cerrado, fue quién responde. Con Qwen3.8-Max la pregunta deja de ser teórica, porque ahora la opción abierta sí compite.
Y hay una capa más, específica del origen. Ya escribimos que no hay veto a los modelos chinos todavía, pero el mecanismo ya está armado. Los pesos que descargas hoy siguen funcionando aunque mañana cambie la regulación, cierto. Lo que no sigue funcionando igual es tu contrato con un cliente regulado que te pregunta de dónde salió el modelo que procesó sus datos. Esa respuesta se da en una auditoría, no en un benchmark.
Y falta la parte que casi nadie leyó. Cuando Alibaba publicó los pesos el 12 de agosto, publicó también el texto de la licencia. No es Apache 2.0, como sí lo fueron generaciones anteriores de Qwen. Es una licencia propia, y vale la pena leerla porque no dice lo que la mayoría asumió.
No hay restricciones regionales. Puedes usar, copiar, modificar, redistribuir, vender, hospedar y afinar el modelo. Hay dos condiciones, y las dos son umbrales de tamaño. La primera: si tu producto pasa los 100 millones de usuarios activos mensuales o los 20 millones de dólares de ingreso mensual, tienes que mostrar el nombre del modelo de forma visible en la interfaz. La segunda: si operas un negocio de Model as a Service o un asistente de trabajo con IA, y facturas más de 50 millones de dólares en doce meses corridos, necesitas una licencia aparte de Qwen antes de usarlo comercialmente. El uso interno queda explícitamente exento de esa segunda condición, mientras no expongas el modelo ni sus salidas a terceros.
Para la empresa promedio que está leyendo esto, eso es permisivo. Para quien revende inferencia, no lo es.
El punto no es que la licencia haya salido buena. Es que era imposible saberlo de antemano, y mucha gente ya había decidido. La semana anterior MiniMax restringió la licencia de su modelo H3 excluyendo de despliegue local a Estados Unidos, la Unión Europea, Reino Unido y Corea del Sur, según TechTimes. Mismo mes, misma categoría de modelo, resultado opuesto. “Abierto” es una palabra que describe el archivo, no el contrato, y el contrato hay que leerlo cada vez.
Hay una segunda letra chica, esta sí incómoda. Los pesos que Alibaba liberó son solo de texto. La versión que corre en el API tiene entrada de visión y un millón de tokens de contexto por defecto; la que te puedes descargar, no. Si tu argumento para autohospedar se apoyaba en la parte multimodal de las demos de lanzamiento, ese argumento no viaja con los pesos.
No estoy diciendo que no lo uses. Estoy diciendo que la decisión tiene tres ejes, no uno, y la mayoría de las empresas solo mide el primero.
Qué revisamos antes de meter un modelo abierto en producción
En IQ Source, cuando un cliente nos pregunta si debería correr un modelo de pesos abiertos en vez de pagar un API de frontera, no empezamos por el modelo. Empezamos por cinco preguntas, en este orden:
- ¿Cuál es la tarea, en singular? No “asistente de ingeniería”. Algo como “optimizar una netlist contra nuestra herramienta interna, en ciclos de hasta ocho horas”. Si no puedes escribirla en una línea, todavía no estás listo para elegir modelo.
- ¿Qué umbral de precisión exige el negocio? Bridgewater tenía 80% escrito antes de empezar a probar. Ese número lo pone el riesgo del proceso, no el proveedor.
- ¿Qué registro queda? Quinientas iteraciones autónomas generan quinientas decisiones. Si no puedes reconstruir por qué el modelo eligió la iteración 340, no tienes un sistema auditable, tienes una caja negra cara.
- ¿Quién responde? Contractualmente, con nombre. Si la respuesta es “nosotros mismos”, entonces necesitas el equipo y el turno de guardia para sostenerlo, y eso es costo real que no aparece en la comparación de precio por token.
- ¿Qué pasa si el origen del modelo cambia de estatus regulatorio? No es paranoia. Es la misma pregunta que le haces a cualquier proveedor crítico.
El discovery de AI Maestro existe justamente para responder las primeras dos antes de que nadie toque un modelo, y las otras tres antes de que nada llegue a producción. Es más aburrido que probar el modelo nuevo el día que sale. También es la diferencia entre una prueba de concepto que se abandona y un proceso que sobrevive la primera auditoría.
Qwen3.8-Max no es la noticia. La noticia es que la opción de autohospedar dejó de ser el plan B barato, y tu criterio de evaluación sigue siendo una tabla de puntajes.
Definamos tus criterios antes de elegir el modeloPreguntas Frecuentes
Qwen3.8-Max es el modelo más capaz de Alibaba a la fecha, lanzado el 3 de agosto de 2026. Usa arquitectura Mixture-of-Experts con 2,4 billones de parámetros totales y 95 mil millones activos por consulta. Alibaba publicó sus pesos en Hugging Face el 12 de agosto de 2026, como repositorio Qwen3.8-2.4T-A95B.
Qwen3.8-Max optimizó un diseño de circuito en unas 500 iteraciones en ciclo cerrado contra OpenROAD, una herramienta de diseño electrónico open source. Llevó el circuito de 8.298 compuertas lógicas a 678 y redujo el área física 81%, de 106x106 a 46x46 micras.
En Terminal-Bench 2.1 Qwen3.8-Max marcó 86,6, por encima de Claude Fable 5 con 84,6 y por debajo de GPT-5.6 Sol con 88,8. En SWE-bench Pro quedó bastante atrás: 67,7 contra 80,0 de Fable 5. La ventaja de Qwen3.8-Max es agéntica y multimodal, no de razonamiento puro, aunque la parte multimodal solo está disponible en la versión del API y no en los pesos liberados.
Qwen3.8-Max se publicó bajo la licencia Qwen3.8-Max, no bajo Apache 2.0. No impone restricciones regionales y permite usar, modificar, redistribuir, vender y afinar el modelo. Tiene dos condiciones: mostrar el nombre del modelo en la interfaz si el producto supera los 100 millones de usuarios activos mensuales o los 20 millones de dólares de ingreso mensual, y obtener una licencia aparte de Qwen si la empresa opera un negocio de Model as a Service o un asistente de trabajo con IA y factura más de 50 millones de dólares en doce meses. El uso interno está exento de esa segunda condición.
No. Los pesos que Alibaba liberó de Qwen3.8-Max son solo de texto. La entrada de visión y el contexto de un millón de tokens por defecto están disponibles únicamente en la versión que corre en el API de Alibaba. Una empresa que autohospede el modelo obtiene generación de texto, no las capacidades multimodales que aparecieron en las demos de lanzamiento.
Antes del benchmark, una empresa debe definir qué tarea concreta va a correr, qué umbral de precisión exige el negocio, qué registro de auditoría queda de cada decisión del modelo, quién responde contractualmente si falla, y qué pasa si el país de origen del modelo entra en una lista de restricciones.
Artículos Relacionados
Jensen Huang armó una carta. Anthropic no la firmó
77 empresas firmaron la carta de Jensen Huang a favor de los pesos abiertos. Anthropic y Amazon no. La razón real le importa a marketing, no solo a IT.
Cisco entrega un agente de IA a sus 90,000 empleados
Cisco reparte un agente de IA a sus 90,000 empleados: infraestructura on-premises, enrutamiento por costo y una prueba de confianza que aún no está resuelta.
El modelo es commodity. La gobernanza es el moat.
La IA empresarial no falla porque el modelo no razona. Falla porque la empresa no tiene torre de control: quién aprueba qué, con qué política, con qué registro.
El ajuste al mercado ahora es como el estatus de aerolínea
Tomasz Tunguz dice que el product-market fit dejó de ser un hito fijo. Ahora se vuelve a ganar constantemente, como el estatus 1K de una aerolínea.
Bridgewater afinó un modelo y venció a GPT, Claude y Gemini
Bridgewater entrenó Qwen3-235B con Tinker y llegó a 84,7% de precisión, 13,8 veces más barato que GPT, Claude y Gemini con los mejores prompts posibles.
Karp atacó el precio de la IA. Anthropic le dio la razón.
Alex Karp acusó a OpenAI y Anthropic de robar valor por token. Días después, el CEO de Pylon vio su factura saltar de $400.000 a $1,4 millones.