Saltar al contenido principal

Qwen3.8-Max rediseñó un chip de 8.298 a 678 compuertas

Alibaba libera los pesos de un modelo de 2,4 billones de parámetros que corrió ~500 iteraciones de diseño de chips solo. Qué cambia en tu evaluación.

Qwen3.8-Max rediseñó un chip de 8.298 a 678 compuertas

Ricardo Argüello

Ricardo Argüello
Ricardo Argüello

CEO & Fundador

Estrategia Empresarial 9 min de lectura

El 3 de agosto Alibaba lanzó Qwen3.8-Max: 2,4 billones de parámetros totales, 95 mil millones activos por consulta. Anunció que los pesos saldrían una semana después, y el 12 de agosto los publicó en Hugging Face. Es el primer modelo clase Max que Qwen abre.

La cobertura se fue toda a los benchmarks. Me interesa más otra cosa.

Lo que cambió no es el puntaje. Son las ~500 iteraciones

Casi todas las empresas con las que hablo evalúan modelos igual: miran una tabla comparativa, ven quién puntea más alto, y eligen el API. Es una decisión de una sola pregunta, y funcionaba bien mientras el trabajo también fuera de una sola pregunta.

La demo de chips de Alibaba rompe esa lógica. No fue una respuesta bien redactada. Fue el modelo corriendo cerca de 500 iteraciones en ciclo cerrado contra OpenROAD, una herramienta de diseño electrónico open source, ajustando y midiendo hasta llevar un circuito de 8.298 compuertas lógicas a 678. El área física bajó 81%, de 106x106 a 46x46 micras, según the-decoder.

Ese tipo de carga es la que justifica autohospedar. Quinientas iteraciones contra una herramienta interna, corriendo horas, tocando datos que no quieres mandar a un API de terceros: ahí el cálculo de costo, latencia y control cambia por completo frente a llamar a un modelo cerrado por token.

Y ese es exactamente el trabajo que casi nadie tiene gobernado. Tienes criterio para elegir un API. No tienes criterio para decidir si vale la pena correr un modelo de frontera adentro de tu casa.

Lo que Alibaba mostró, con números

Vale separar lo que está documentado de lo que circuló en redes.

Documentado: además del chip, Qwen3.8-Max corrió 16 días de programación autónoma sin intervención humana, con 265 commits, 127 pull requests y 151 issues, y sacó un proyecto llamado oh-my-cli. Hubo también una simulación de comercio electrónico donde el modelo pasó de 100.000 yuanes a 416.252 en un año fiscal simulado, con 152 estafadores sembrados en la lista de proveedores.

En benchmarks el resultado es desparejo, y eso importa más que el titular. En Terminal-Bench 2.1 marcó 86,6, por encima de Claude Fable 5 con 84,6 y por debajo de GPT-5.6 Sol con 88,8. Pero en SWE-bench Pro quedó en 67,7 contra 80,0 de Fable 5. La ventaja real de este modelo es agéntica y multimodal, no de razonamiento puro. El propio equipo de Qwen lo publicó en X sin exagerar: “second only to Fable 5” (segundo solo después de Fable 5).

Lo que no está documentado: circuló bastante que la demo incluía verificación de estructuras de proteínas. No encontré esa afirmación en ninguna cobertura de prensa, ni en TechNode, ni en MarkTechPost, ni en InfoWorld. Si la vas a citar en una presentación interna, verifícala primero. Lo del chip sí está bien reportado y, para efectos de la decisión que importa, alcanza y sobra.

Bridgewater ya jugó esta mano, un tamaño más abajo

Nada de esto es hipotético. En julio escribimos sobre cómo Bridgewater afinó Qwen3-235B y venció a GPT, Claude y Gemini: 84,7% de precisión filtrando documentos financieros, 13,8 veces más barato que el mejor modelo de frontera con los mejores prompts posibles.

Bridgewater lo hizo con un modelo abierto de Alibaba de 235 mil millones de parámetros. Ahora Alibaba abre uno diez veces más grande.

Eso convierte una curiosidad en una opción de compra real. El argumento de “los modelos abiertos son buenos para prototipos, pero para producción necesitas frontera” acaba de perder su mejor pierna. Y el patrón que hizo funcionar a Bridgewater no fue el tamaño del modelo: fue tener una tarea definida con precisión, un umbral de precisión que el negocio exigía de antemano, y un método para medir si lo cruzaba. Sin esas tres cosas, un modelo de 2,4 billones de parámetros corriendo en tu infraestructura es solo una factura de GPU más grande.

Y hay un detalle práctico que la euforia se salta seguido: 95 mil millones de parámetros activos no corren en un par de tarjetas. Descargar los pesos es gratis. Servirlos con latencia usable, con redundancia y con alguien de guardia cuando el nodo se cae, no lo es. Para la mayoría de las empresas medianas, autohospedar en la práctica significa alquilar cómputo en una nube de todos modos, solo que ahora también eres el responsable del despliegue, del versionado y del monitoreo.

Eso puede seguir saliendo más barato, como le salió a Bridgewater. Pero es una cuenta que tienes que hacer con tus propios números de volumen, no con el precio por token de una tabla comparativa. Para muchos casos reales, la respuesta correcta va a ser un modelo mucho más chico que el del titular. Alibaba anunció una versión de 27 mil millones de parámetros para esa misma semana, y ahí conviene tener cuidado: al momento de publicar esto todavía no existe un repositorio oficial de Qwen para ese modelo. Lo que sí hay en Hugging Face son conversiones subidas por terceros. No es lo mismo, y para una decisión de producción la diferencia es justamente la que este artículo defiende.

El riesgo que no aparece en la ficha técnica

Acá es donde la conversación se pone incómoda, y donde veo a más equipos saltarse el paso.

Un modelo de pesos abiertos que corres tú mismo no viene con un acuerdo de servicio. Nadie te responde a las dos de la mañana cuando el agente hace algo que no debía. Ese es el punto que ya discutimos cuando Jensen Huang armó su carta de pesos abiertos y Anthropic no la firmó: la pregunta nunca fue abierto contra cerrado, fue quién responde. Con Qwen3.8-Max la pregunta deja de ser teórica, porque ahora la opción abierta sí compite.

Y hay una capa más, específica del origen. Ya escribimos que no hay veto a los modelos chinos todavía, pero el mecanismo ya está armado. Los pesos que descargas hoy siguen funcionando aunque mañana cambie la regulación, cierto. Lo que no sigue funcionando igual es tu contrato con un cliente regulado que te pregunta de dónde salió el modelo que procesó sus datos. Esa respuesta se da en una auditoría, no en un benchmark.

Y falta la parte que casi nadie leyó. Cuando Alibaba publicó los pesos el 12 de agosto, publicó también el texto de la licencia. No es Apache 2.0, como sí lo fueron generaciones anteriores de Qwen. Es una licencia propia, y vale la pena leerla porque no dice lo que la mayoría asumió.

No hay restricciones regionales. Puedes usar, copiar, modificar, redistribuir, vender, hospedar y afinar el modelo. Hay dos condiciones, y las dos son umbrales de tamaño. La primera: si tu producto pasa los 100 millones de usuarios activos mensuales o los 20 millones de dólares de ingreso mensual, tienes que mostrar el nombre del modelo de forma visible en la interfaz. La segunda: si operas un negocio de Model as a Service o un asistente de trabajo con IA, y facturas más de 50 millones de dólares en doce meses corridos, necesitas una licencia aparte de Qwen antes de usarlo comercialmente. El uso interno queda explícitamente exento de esa segunda condición, mientras no expongas el modelo ni sus salidas a terceros.

Para la empresa promedio que está leyendo esto, eso es permisivo. Para quien revende inferencia, no lo es.

El punto no es que la licencia haya salido buena. Es que era imposible saberlo de antemano, y mucha gente ya había decidido. La semana anterior MiniMax restringió la licencia de su modelo H3 excluyendo de despliegue local a Estados Unidos, la Unión Europea, Reino Unido y Corea del Sur, según TechTimes. Mismo mes, misma categoría de modelo, resultado opuesto. “Abierto” es una palabra que describe el archivo, no el contrato, y el contrato hay que leerlo cada vez.

Hay una segunda letra chica, esta sí incómoda. Los pesos que Alibaba liberó son solo de texto. La versión que corre en el API tiene entrada de visión y un millón de tokens de contexto por defecto; la que te puedes descargar, no. Si tu argumento para autohospedar se apoyaba en la parte multimodal de las demos de lanzamiento, ese argumento no viaja con los pesos.

No estoy diciendo que no lo uses. Estoy diciendo que la decisión tiene tres ejes, no uno, y la mayoría de las empresas solo mide el primero.

Qué revisamos antes de meter un modelo abierto en producción

En IQ Source, cuando un cliente nos pregunta si debería correr un modelo de pesos abiertos en vez de pagar un API de frontera, no empezamos por el modelo. Empezamos por cinco preguntas, en este orden:

  1. ¿Cuál es la tarea, en singular? No “asistente de ingeniería”. Algo como “optimizar una netlist contra nuestra herramienta interna, en ciclos de hasta ocho horas”. Si no puedes escribirla en una línea, todavía no estás listo para elegir modelo.
  2. ¿Qué umbral de precisión exige el negocio? Bridgewater tenía 80% escrito antes de empezar a probar. Ese número lo pone el riesgo del proceso, no el proveedor.
  3. ¿Qué registro queda? Quinientas iteraciones autónomas generan quinientas decisiones. Si no puedes reconstruir por qué el modelo eligió la iteración 340, no tienes un sistema auditable, tienes una caja negra cara.
  4. ¿Quién responde? Contractualmente, con nombre. Si la respuesta es “nosotros mismos”, entonces necesitas el equipo y el turno de guardia para sostenerlo, y eso es costo real que no aparece en la comparación de precio por token.
  5. ¿Qué pasa si el origen del modelo cambia de estatus regulatorio? No es paranoia. Es la misma pregunta que le haces a cualquier proveedor crítico.

El discovery de AI Maestro existe justamente para responder las primeras dos antes de que nadie toque un modelo, y las otras tres antes de que nada llegue a producción. Es más aburrido que probar el modelo nuevo el día que sale. También es la diferencia entre una prueba de concepto que se abandona y un proceso que sobrevive la primera auditoría.

Qwen3.8-Max no es la noticia. La noticia es que la opción de autohospedar dejó de ser el plan B barato, y tu criterio de evaluación sigue siendo una tabla de puntajes.

Definamos tus criterios antes de elegir el modelo

Preguntas Frecuentes

Qwen Alibaba pesos abiertos modelos abiertos agentes IA IA empresarial gobernanza IA

Artículos Relacionados

Jensen Huang armó una carta. Anthropic no la firmó
IA en Marketing
· 5 min de lectura

Jensen Huang armó una carta. Anthropic no la firmó

77 empresas firmaron la carta de Jensen Huang a favor de los pesos abiertos. Anthropic y Amazon no. La razón real le importa a marketing, no solo a IT.

pesos abiertos Anthropic Jensen Huang
Cisco entrega un agente de IA a sus 90,000 empleados
Estrategia Empresarial
· 8 min de lectura

Cisco entrega un agente de IA a sus 90,000 empleados

Cisco reparte un agente de IA a sus 90,000 empleados: infraestructura on-premises, enrutamiento por costo y una prueba de confianza que aún no está resuelta.

Cisco agentes IA gobernanza de IA
El modelo es commodity. La gobernanza es el moat.
IA y Automatización
· 5 min de lectura

El modelo es commodity. La gobernanza es el moat.

La IA empresarial no falla porque el modelo no razona. Falla porque la empresa no tiene torre de control: quién aprueba qué, con qué política, con qué registro.

gobernanza de IA agentes IA IA empresarial
El ajuste al mercado ahora es como el estatus de aerolínea
Estrategia Empresarial
· 5 min de lectura

El ajuste al mercado ahora es como el estatus de aerolínea

Tomasz Tunguz dice que el product-market fit dejó de ser un hito fijo. Ahora se vuelve a ganar constantemente, como el estatus 1K de una aerolínea.

product-market fit Tomasz Tunguz estrategia de producto
Bridgewater afinó un modelo y venció a GPT, Claude y Gemini
Estrategia Empresarial
· 6 min de lectura

Bridgewater afinó un modelo y venció a GPT, Claude y Gemini

Bridgewater entrenó Qwen3-235B con Tinker y llegó a 84,7% de precisión, 13,8 veces más barato que GPT, Claude y Gemini con los mejores prompts posibles.

Bridgewater Thinking Machines Tinker
Karp atacó el precio de la IA. Anthropic le dio la razón.
Estrategia Empresarial
· 6 min de lectura

Karp atacó el precio de la IA. Anthropic le dio la razón.

Alex Karp acusó a OpenAI y Anthropic de robar valor por token. Días después, el CEO de Pylon vio su factura saltar de $400.000 a $1,4 millones.

Alex Karp Anthropic Palantir