Jev devuelve decisiones tipadas y la salida es gratis
Ricardo Argüello, 21 de septiembre de 2026
CEO & Fundador
Resumen general
TypeSafe AI publicó Jev, un modelo que no escribe texto y en su lugar devuelve una opción de una lista cerrada con una probabilidad calibrada. Los tokens de salida no se cobran y los de entrada valen 42 dólares por cada mil millones. Vercel y Bryo AI ya lo midieron contra modelos grandes en tareas de clasificación.
- Jev lo construyó Diogo Almeida, que venía de OpenAI, donde trabajó en ChatGPT y en aprendizaje por refuerzo con retroalimentación humana
- TypeSafe cobra 42 dólares por mil millones de tokens de entrada y no cobra los de salida, 238 veces menos en entrada que Claude Fable 5.1
- Vercel lo midió entre 5 y 18 veces más rápido que Luna 5.6 de OpenAI, con mejor precisión, en un clasificador de seguridad de comandos
- Bryo AI clasificando correo de negocio: entre 10 y 20 veces más barato que Gemini, algo menos preciso, pero con puntaje de confianza
- El modelo no puede inventar una categoría que no exista, porque las opciones las define quien llama
Imagina que contratas a un abogado carísimo y lo único que necesitas de él es que te diga sí o no. Te va a mandar tres páginas y te va a cobrar las tres páginas. Jev es el timbre de la puerta: suena o no suena, y te dice qué tan seguro está de haber sonado. Eso es lo que mucha automatización de verdad necesita.
Resumen generado con IA
Buena parte de lo que las empresas le piden hoy a un modelo de lenguaje no requiere que el modelo escriba nada. Requiere que decida.
¿Este correo es una queja o una orden de compra? ¿Este comando lo puede correr el agente o hay que frenarlo? ¿Esta consulta merece el modelo caro o la resuelve el barato?
Esas son decisiones, y las estás pagando a precio de redacción.
Esta semana salió un modelo que existe justamente para cobrarlas a otro precio. Se llama Jev, lo publicó TypeSafe AI, y no genera texto.
Qué devuelve Jev
Jev recibe el estado de tu programa y una pregunta, y devuelve una opción de una lista que tú definiste, con una probabilidad asociada. Sí, con 0,73. Categoría B, con 0,41. Nada más.
Lo construyó Diogo Almeida, que venía de OpenAI, donde trabajó en ChatGPT y en aprendizaje por refuerzo con retroalimentación humana. En la nota de TechCrunch lo resume así: tenemos un rayo en una botella y aun así no sirve, porque las computadoras hablan otro idioma.
Los números de la propia página de TypeSafe son agresivos. Cuarenta y dos dólares por cada mil millones de tokens de entrada, salida sin costo, 238 veces más barato en entrada que Claude Fable 5.1. La demostración que publican completa un flujo en 0,114 segundos contra 8,566 de un modelo de lenguaje.
Los números de terceros pesan más que los propios. Vercel lo midió entre 5 y 18 veces más rápido que Luna 5.6 de OpenAI, con mejor precisión, en un clasificador que decide qué comandos son seguros. Bryo AI lo puso a clasificar correo de negocio y le salió entre 10 y 20 veces más barato que Gemini, un poco menos preciso, pero devolviendo un puntaje de confianza que Gemini no le daba.
Ese intercambio, algo menos de precisión a cambio de saber cuánta confianza hay, es el que de verdad cambia un sistema.
La probabilidad calibrada es lo que te deja escribir la regla
Cuando un modelo de lenguaje te clasifica un ticket, te entrega la etiqueta con el mismo tono de certeza siempre. “Es una queja.” No te dice si lo tenía clarísimo o si adivinó entre dos opciones parecidas.
Tu código no tiene de dónde agarrarse. Escalas todo a un humano y no automatizaste nada, o no escalas nada y tarde o temprano se te cuela un caso caro.
Armin Ronacher lo dijo en la misma nota de TechCrunch, y es la frase más práctica del artículo: el que llama tiene que poder decir, bueno, si esto vuelve con 50% de probabilidad, lo descarto.
Eso ya es ingeniería. Umbral, regla de escalamiento, registro de auditoría. Sobre esa diferencia entre cobrar por token y medir por trabajo terminado escribimos antes en el precio por token miente. Jev es el caso extremo. Si la salida no se cobra, el precio por token de salida se cae como métrica.
Dónde entra esto en una empresa que ya tiene IA andando
No en el chat de atención al cliente. Ahí sí necesitas lenguaje.
Entra una capa más abajo, en las decisiones repetitivas que casi ningún tablero separa de las demás:
- enrutamiento de modelos, decidir si una consulta merece el modelo caro
- clasificación de correo, tickets y documentos que entran
- semáforos de seguridad, revisar qué comando puede ejecutar un agente antes de que lo ejecute
- monitoreo de agentes en vivo, detectar un intento de jailbreak mientras ocurre
Si ya tienes agentes en producción, esa última línea se paga sola más rápido que las otras tres.
Lo que Jev no hace
No redacta. No resume. No razona en varios pasos. No reemplaza tu modelo grande.
Es la otra pieza.
La arquitectura que tiene sentido es de dos velocidades. Algo barato y rápido para las miles de decisiones pequeñas, y el modelo caro solamente cuando de verdad hay que producir lenguaje o pensar largo. Ese orden lo trabajamos en la pirámide antes del agente, y no cambia porque salga un modelo nuevo.
Y con calma, que Jev está en acceso anticipado. Un clasificador que cambia de proveedor a mitad de año es una dependencia nueva, no una menos.
Por dónde arrancaría yo
Antes de mover un modelo, yo iría a la factura.
Abre el desglose del mes pasado y parte las llamadas en dos columnas. En una, aquellas donde lo que tu código consumió fue un párrafo. En la otra, aquellas donde lo que consumió fue una etiqueta, un número o un sí. La segunda columna es tu candidato, y en la mayoría de los stacks tecnológicos es más grande de lo que la gente cree, porque la factura llega agregada y nadie la abre.
Esa separación es por donde entramos nosotros cuando revisamos el gasto de IA de una operación. Primero las dos columnas. Después hablamos de modelos.
Partamos tu factura en esas dos columnasPreguntas Frecuentes
Jev es un modelo de TypeSafe AI que no genera texto. Recibe el estado de un programa y una pregunta, y devuelve una opción de una lista cerrada junto con una probabilidad calibrada. Un LLM produce lenguaje; Jev produce una decisión con su nivel de confianza asociado.
TypeSafe cobra 42 dólares por cada mil millones de tokens de entrada y no cobra los tokens de salida. La empresa reporta que eso es 238 veces más barato en entrada que Claude Fable 5.1. Bryo AI lo midió entre 10 y 20 veces más barato que Gemini clasificando correo de negocio.
Para enrutamiento de modelos, clasificación de correo y tickets entrantes, semáforos de seguridad que revisan qué comando puede ejecutar un agente, y monitoreo en vivo de intentos de jailbreak. Son tareas de decisión repetitiva donde el resultado que consume el código es una etiqueta, no un párrafo.
Porque permite escribir la regla de escalamiento. Un LLM entrega su clasificación con el mismo tono de certeza siempre, sin decir si estaba seguro. Con una probabilidad explícita puedes definir un umbral, mandar lo dudoso a un humano y dejar registro de auditoría de esa decisión.
Artículos Relacionados
El harness es el runtime: la trampa de 'elige tu harness'
Adam Miller dice que Goose es infraestructura neutral. El Team OS de Hannah Stulberg en DoorDash prueba lo contrario: harness y runtime son la misma decisión.
Karpathy: una bóveda. Nosotros: un sistema nervioso.
Karpathy publicó una bóveda de markdown con 17M+ vistas. Llevamos 18 días corriendo el sistema nervioso completo: sentidos, nervios, sistema inmune.
El cuello de botella de tu IA es el contexto, no el modelo.
Aakash Gupta lo dijo tras 1,500 horas en Claude Code: CLAUDE.md debe estar casi vacío. Tu piloto de IA empresarial necesita la misma disciplina.
IA en finanzas: por qué los LLMs siguen alucinando
OpenAI lo probó en 2025: las alucinaciones de los LLMs son matemáticamente inevitables. Qué significa eso para tu arquitectura de IA financiera en 2026.
Claude Certified Architect: La Señal que Debes Leer
Anthropic lanzó Claude Certified Architect, su primera certificación técnica, y las consultoras grandes ya mueven fichas. Qué significa para el B2B.