Saltar al contenido principal

Nexus le ganó a GPT-5.5 por un punto y costó 77% menos

La prensa dijo que Pinecone Nexus superó a los modelos frontera. El dato primario dice 47,4% contra 46,4%. Lo que compró la capa de conocimiento fue costo.

Nexus le ganó a GPT-5.5 por un punto y costó 77% menos

Ricardo Argüello

Ricardo Argüello
Ricardo Argüello

CEO & Fundador

IA y Automatización 5 min de lectura

El titular que circuló dice que Pinecone Nexus le ganó a los agentes construidos sobre los modelos frontera de OpenAI, Anthropic y Google.

Fui al anuncio original. Dice 47,4% contra 46,4%.

Un punto porcentual. Del mismo modelo consigo mismo.

La comparación correcta está en la misma tabla, y dice algo mejor

Pinecone declaró la disponibilidad general de Nexus el 6 de agosto. Nexus es una capa que precompila los documentos y las políticas de una empresa en conocimiento listo para consultar, de modo que el agente lo pide en una sola llamada en vez de rearmar contexto documento por documento en cada consulta.

En su publicación midieron con τ-Knowledge, el benchmark abierto de Sierra, en el dominio banking_knowledge, que tiene 97 tareas y evalúa razonamiento de varios pasos, cumplimiento estricto de políticas y uso coordinado de herramientas.

Los cuatro números que importan son estos. GPT-5.5 con Nexus resolvió 47,4% y GPT-5.5 solo resolvió 46,4%. GPT-5.2 con Nexus llegó a 36,1% y GPT-5.2 solo se quedó en 32,2%.

Y después el costo. La configuración con GPT-5.5 salió 77% más barata por tarea que el mismo modelo sin la capa. Con GPT-5.2, 80% más barata.

Léelo dos veces, porque el resultado interesante está en cómo se reparten esas mejoras. Sobre el modelo bueno, la capa de conocimiento casi no movió la precisión. Sobre el modelo más barato, la movió cuatro veces más.

Buen conocimiento acorta la distancia entre un modelo caro y uno barato

Ese es el hallazgo, y no es el que se tituló.

Si tu agente falla, hay dos explicaciones posibles y cuestan cosas muy distintas. Una es que el modelo no da la talla, y entonces la salida es pagar el modelo más caro. La otra es que el modelo nunca recibió la información en una forma utilizable, y entonces la salida es arreglar la información.

La medición de Pinecone empuja bastante hacia la segunda, al menos en tareas de conocimiento con políticas duras. Y el efecto es más fuerte justo donde tiene más valor económico, que es cuando estás corriendo el modelo barato.

Es la misma conclusión a la que llegamos por el lado del proceso en el contexto es el cuello de botella de la IA empresarial. Ahora hay un benchmark de un tercero que la sostiene con números, que es mejor que sostenerla con opinión.

Conviene también recordar cómo envejece esto. Escribimos sobre el conocimiento que se acumula o se pudre a propósito de la wiki para modelos de Karpathy. Una capa precompilada hereda ese problema entero: si la política que compilaste cambió en marzo y nadie recompiló, el agente ahora responde mal con más confianza y más barato.

47,4% es el número que hay que pedir

47,4%.

Más de la mitad de las tareas siguen fallando en la mejor configuración medida. En un dominio bancario, con políticas explícitas, con la capa de conocimiento puesta y con un modelo frontera.

Eso no descalifica a Nexus ni al benchmark. τ-Knowledge está construido a propósito con tareas difíciles, y un porcentaje bajo dice más del examen que del alumno.

Pero si estás evaluando cualquier agente de conocimiento para tu empresa, ese es el número que tienes que pedir. No la mejora relativa contra la línea base, que siempre se puede acomodar eligiendo la línea base. El porcentaje absoluto de tareas resueltas, en un conjunto de tareas que se parezca a las tuyas.

Hay un dato más en el anuncio que vale mirar con cuidado. Pinecone probó Nexus en su propia cola de soporte y reporta que la tasa de resolución pasó de 24,6% a 55,1%. Es una mejora enorme y también es medición propia sobre datos propios, sin caso de cliente nombrado. La tomo como señal de que el producto hace algo real. No la tomaría como evidencia de lo que va a pasar en tu operación.

Dónde deja esto a un equipo que está por comprar

Sirve invertir el orden de la evaluación. La evaluación usual arranca por qué modelo usar y se resuelve comparando proveedores. Con estos números conviene empezar por otro lado, y es por qué tan compilable está tu conocimiento hoy.

Si tus políticas viven en veinte PDF con tres versiones cada uno y la buena la sabe una persona, ninguna capa te va a salvar, porque vas a precompilar la contradicción. Ese trabajo de ordenar es previo a la herramienta y no lo hace la herramienta. Es lo que miramos primero en un AI Maestro, antes de recomendar nada.

Y hay un detalle de arquitectura que me pareció el mejor argumento comercial de Nexus, más que el benchmark: el plano de datos corre en tu propia nube, sea AWS, Google Cloud o Azure, y los documentos no salen de tu infraestructura. Para una empresa regulada eso decide la compra mucho antes que un punto porcentual.

Toma tu política más consultada, la que genera más preguntas internas, y fíjate cuántas versiones hay circulando. Ese conteo te dice si estás listo para comprar una capa de conocimiento o si todavía te toca la parte aburrida.

Veamos qué tan compilable está tu conocimiento hoy

Preguntas Frecuentes

Pinecone Nexus Sierra benchmarks de IA agentes empresariales costo de inferencia capa de conocimiento

Artículos Relacionados

OpenAI Astra: diez problemas abiertos por $2,000 en tokens
Estrategia Empresarial
· 8 min de lectura

OpenAI Astra: diez problemas abiertos por $2,000 en tokens

OpenAI dice que una versión interna de Astra resolvió diez problemas abiertos, con certificados en Lean 4. Los tokens costarían unos $2,000 a tarifas de Sol.

OpenAI Astra Lean 4
Uber: 50+ aprobaciones por sesión y cero supervisión
IA y Automatización
· 8 min de lectura

Uber: 50+ aprobaciones por sesión y cero supervisión

Uber liberó ADR tras admitir que sus herramientas no veían qué hacían sus agentes. El hallazgo incómodo: aprobar 50+ acciones por sesión no es supervisión.

Uber ADR seguridad de agentes
Anthropic le dio 3 días de aviso a Figma antes de competirle
IA y Automatización
· 6 min de lectura

Anthropic le dio 3 días de aviso a Figma antes de competirle

El director de producto de Anthropic renunció a la junta de Figma el 14 de abril. Tres días después, Anthropic lanzó Claude Design, su competidor directo.

Figma Anthropic Claude Design