McDonald's y Wendy's: la IA propone, las reglas deciden
Ricardo Argüello, 9 de octubre de 2026
CEO & Fundador
Resumen general
Cuando una IA toma decisiones que mueven dinero, la misma pregunta no puede dar dos respuestas. McDonald's, Wendy's y Hilbert muestran que el modelo sirve para entender y proponer, y que los topes, las validaciones y el escalamiento a una persona tienen que ser reglas fijas alrededor del modelo.
- McDonald's probó con IBM un sistema de pedidos por voz en unos 100 drive-thrus desde octubre de 2021 y anunció en junio de 2024 que lo terminaba, después de videos virales con pedidos que nadie pidió.
- Wendy's FreshAI reportó un éxito de casi 99%, pero contando como exitoso todo pedido que terminó en caja aunque una persona haya tenido que entrar a corregirlo.
- Hilbert, que levantó una Serie A de 28 millones de dólares liderada por a16z, define a sus clientes con modelos entrenados sobre años de historia y no deja que sus agentes hagan cuentas más allá de redondear.
- El patrón de diseño que conviene copiar: el modelo interpreta y propone, una capa de reglas determinísticas valida montos y cantidades, y lo que se sale de rango va a una persona.
Imagina una caja registradora con un cajero muy rápido pero distraído. El cajero escucha al cliente y teclea el pedido. La caja no deja cobrar 40 hamburguesas sin la llave del gerente. Nadie le pide a la caja que entienda acentos, y nadie le pide al cajero que decida cuánto se cobra sin control. Eso es separar el modelo de las reglas.
Resumen generado con IA
Si una IA va a decidir algo que mueve dinero, la misma entrada tiene que dar la misma salida. Siempre. Eso no lo garantiza ningún modelo de lenguaje, y no hace falta que lo garantice, porque ese trabajo le toca a otra capa: reglas escritas, topes, validaciones y una ruta clara hacia una persona cuando algo se sale de rango. El modelo propone. Las reglas deciden.
Esta semana me cayeron dos textos que cuentan lo mismo desde puntas opuestas. Uno es el boletín de Andrew Amann, “McDonald’s AI McTrouble”, que compara los drive-thrus de McDonald’s y Wendy’s. El otro es una nota de Startupeable sobre Hilbert, la startup a la que a16z le puso 28 millones. Fui a revisar las fuentes originales de los dos. Una parte de la historia del drive-thru resultó más interesante de lo que cuenta el boletín.
McDonald’s dejó que el modelo hiciera todo
McDonald’s e IBM arrancaron en octubre de 2021 una prueba de pedidos automáticos por voz en unos 100 restaurantes, según Nation’s Restaurant News. En junio de 2024 la empresa anunció que la terminaba. Un memo a los franquiciados pedía apagar el sistema a más tardar el 26 de julio.
Lo que la gente recuerda son los videos. La nota de AP describe un TikTok de 2023 donde el asistente agrega nuggets y más nuggets a la cuenta de un carro mientras los clientes, muertos de risa, le piden que pare. Otros videos muestran helado con kétchup y mantequilla, y pedidos levantados del carro de al lado.
Amann lo resume en que no había topes de cantidad ni escalamiento cuando la cuenta se disparaba. Eso no lo puedo confirmar con documentos de McDonald’s. Pero el síntoma sí es público, y apunta a eso: nada en el sistema le decía al modelo que una montaña de nuggets para un solo carro es rara.
El 99% de Wendy’s cuenta a la persona que corrigió
Wendy’s hizo su versión con Google Cloud, FreshAI. Amann cita 99% de precisión y 22 segundos menos por carro, y le atribuye el éxito a un motor de reglas alrededor del modelo.
Los números existen. Restaurant Dive los publicó en diciembre de 2023: 22 segundos menos que el promedio del mercado local en un local de prueba en Columbus, Ohio, y un éxito de casi 99%. La definición de ese 99% es la parte que vale oro. Contaba como exitoso todo pedido que el chatbot inició y que llegó al punto de venta, aunque una persona haya tenido que entrar a la conversación para corregir un error. La meta de pedidos sin ninguna intervención humana era 30% o más, subiendo a 70% a fines de 2024.
O sea, el diseño de Wendy’s tenía a una persona adentro desde el día uno. No como parche. Como parte del flujo. Y midieron el resultado del sistema completo, modelo más persona, en vez de fingir que el modelo solo hacía todo.
No sé cuánto llegó Wendy’s de ese 70%. No encontré el dato y no lo voy a inventar. Lo que sí queda claro es la lección de diseño, y no tiene que ver con qué modelo usaron.
Hilbert no deja que sus agentes hagan cuentas
La nota de Startupeable sobre Hilbert va todavía más lejos. Nazli Tan, su CEO, venía de liderar growth en Getir. Su tesis es que darle más contexto a un agente no lo arregla, porque el contexto casi siempre es una definición humana improvisada de qué es “un buen cliente” o “un cliente en riesgo”. Pregúntale lo mismo dos veces y te puede dar dos listas distintas.
Su respuesta es entrenar modelos de deep learning sobre tres o cuatro años de historia real de clientes, y que esos modelos decidan quién es quién. Los agentes operan solo dentro de esos límites. Ni siquiera pueden hacer cuentas, salvo redondear. ¿Por qué tan estrictos? Porque sus clientes deciden con esas respuestas a dónde van cientos de millones en marketing, y si la respuesta cambia cada vez que preguntas, nadie le confía ese presupuesto. La Serie A de 28 millones, liderada por Andreessen Horowitz, se anunció en abril de 2026.
Una startup de agentes que les prohíbe sumar a sus agentes. Me encanta.
Dónde van las reglas
Cuando revisamos un proceso para automatizarlo con IA, lo primero que separamos es qué parte es lenguaje y qué parte es aritmética. Entender un pedido dicho con prisa, con acento y con ruido de motor: modelo. Decidir si un pedido de veinte combos se cobra sin preguntar: regla.
Antes de conectar un agente a algo que cobre, pague o descuente, escribimos cuatro cosas. Los topes por cantidad y por monto van en código, fuera del prompt, porque a un prompt lo puedes convencer y a una validación no. Los precios, descuentos e impuestos salen de tu sistema, jamás de lo que el modelo “recuerda”. El escalamiento tiene dueño con nombre, y está escrito qué casos le llegan y cuánto puede esperar el cliente mientras tanto. Y la medición separa lo que el modelo resolvió solo de lo que necesitó a alguien, como hizo Wendy’s.
Lo mismo que vimos con Just Walk Out de Amazon: lo grave del trabajo humano escondido es que nadie sabía cuánto había. Y esa medición se vuelve un activo si la guardas como evals propios que corren cada vez que cambias de modelo.
Si ya tienes un agente que toca precios, créditos o pedidos, te propongo empezar por algo chico. Toma diez casos reales de la semana pasada, córrelos dos veces y compara. Si las dos corridas no coinciden, ya sabes dónde falta la primera regla.
Diseñemos las reglas que van alrededor de tu agentePreguntas Frecuentes
McDonald's probó desde octubre de 2021 el Automated Order Taker de IBM en unos 100 restaurantes y en junio de 2024 anunció que lo terminaba. Hubo quejas y videos virales de pedidos equivocados, como nuggets agregados sin parar a una misma cuenta. La empresa dijo que exploraría otras soluciones de pedidos por voz.
Según Restaurant Dive, Wendy's FreshAI tuvo un éxito de casi 99% contando como exitoso todo pedido que el chatbot inició y que llegó al punto de venta, aunque una persona tuviera que entrar para corregir un error. La meta declarada de pedidos sin intervención humana era de 30% o más, subiendo a 70% a fines de 2024.
Un agente de IA que toca dinero debe separar dos capas. El modelo interpreta la solicitud y propone una acción. Una capa de reglas determinísticas valida montos, cantidades y permisos, y deriva a una persona todo lo que sale de rango. Así la misma entrada produce la misma decisión, y cada excepción queda registrada.
Hilbert levantó en abril de 2026 una Serie A de 28 millones de dólares liderada por Andreessen Horowitz. Su CEO, Nazli Tan, explica que entrenan modelos de deep learning sobre tres o cuatro años de historia de clientes para definir quién es un buen cliente, y que sus agentes de IA solo operan dentro de esos límites.
Artículos Relacionados
Anthropic borró el 80% del prompt de Claude Code
Anthropic eliminó más del 80% del system prompt de Claude Code sin perder nada en las evaluaciones. Tus reglas de más le están estorbando al modelo.
Stripe compra OpenRouter y lo que paga es el contador
Stripe no publicó el precio. El Financial Times habla de 8.000 millones por una empresa que valía 1.300 hace meses. Ese múltiplo no se paga por enrutar.
El agente autónomo es un pasivo, no una ventaja
Cognition levantó mil millones por un agente autónomo. En producción, la autonomía es justo lo que primero falla. La pregunta es cuánta conviene darle.
La pirámide antes del agente: casi nunca lo necesitas
El título 'consultor de IA' caduca. Lo que queda es una disciplina: empezar por el flujo determinista y subir a un agente solo cuando el problema lo exige.
El que vende automatización te dice que no automatices
El fundador de Gumloop frenó a su equipo: dejen de automatizar todo con IA. La falla cara de los agentes es el slop que te cuesta clientes, no el costo.
Just Walk Out de Amazon: la IA que necesitaba miles de ojos
El reporte de 2024 sobre Just Walk Out volvió a circular en LinkedIn esta semana. La lección para quien compra automatización con IA sigue intacta.