Saltar al contenido principal

Fish Audio es 70% más barato. ElevenLabs creció igual

Fish Audio abrió los pesos y cobra $0,05 por minuto contra $0,18. ElevenLabs pasó de $350M a más de $500M de ARR igual. ¿Dónde quedó el moat?

Fish Audio es 70% más barato. ElevenLabs creció igual

Ricardo Argüello

Ricardo Argüello
Ricardo Argüello

CEO & Fundador

Estrategia Empresarial 7 min de lectura

Fish Audio liberó los pesos de su modelo de voz y cobra alrededor de $0,05 por minuto. ElevenLabs cobra unos $0,18 por lo mismo.

Y ElevenLabs creció de 350 millones de ARR a más de 500 millones mientras eso pasaba.

Esas dos frases juntas son lo interesante de toda la historia.

El modelo se volvió commodity y el negocio no se movió

Ya escribimos que el harness es el moat y el modelo ya es commodity. Lo que muestra el mercado de voz es la versión completa de ese argumento, con estados financieros de por medio: la commoditización del modelo no commoditiza al proveedor. Corre el valor a otro lado.

Cuando el precio del componente cae 70% y el líder sigue creciendo, la conclusión no es que los clientes sean tontos ni que la alternativa abierta sea mala. Es que el precio del modelo nunca fue la mayor parte de lo que estaban comprando.

Esto importa porque casi toda evaluación de IA de voz que veo empieza y termina en la comparación de costo por minuto. Es la métrica más fácil de conseguir y la que menos predice si el despliegue va a funcionar.

Los números de los dos lados

Fish Audio no es un proyecto de fin de semana, y ese es justamente el punto.

Publicó Fish Speech S2 el 10 de marzo de 2026 como modelo abierto de texto a voz. Superó las 26.000 estrellas en GitHub, trae control de emoción con etiquetas en lenguaje natural, generación de varios hablantes en una sola pasada y latencia por debajo de 150 milisegundos. Levantó una ronda semilla de 52 millones de dólares con 21 millones de ARR ya corriendo, según Open Source For You. La estructura de precios es agresiva: plan gratuito con 7 minutos de S2, 11 dólares al mes por 200 minutos, 75 al mes por 27 horas.

Es exactamente la jugada de doble vía que ya usaron Mistral y Qwen: pesos abiertos para adopción de comunidad, API pagada para clientes empresariales, y cada lado financia al otro. Remio lo describe bien como una apuesta explícita contra los gigantes cerrados de la voz.

Del otro lado, ElevenLabs cerró 2025 en 350 millones de ARR y superó los 500 millones en los primeros cuatro meses de 2026. No creció a pesar del competidor abierto. Creció durante.

Qué compra realmente un cliente empresarial de voz

Acá está la parte que no aparece en ninguna tabla comparativa, y que sí determina si el proyecto sobrevive.

Latencia bajo carga real, no en el demo. Un modelo que responde en 150 milisegundos con una petición a la vez y en 900 con trescientas concurrentes no sirve para un centro de contacto, y esa curva no está publicada en ningún lado.

Manejo de interrupciones. Una conversación de voz de verdad tiene a alguien cortando a la mitad de la frase. Resolver eso bien es trabajo de ingeniería alrededor del modelo, no del modelo.

Licenciamiento de la voz. Si vas a usar una voz que suena a una persona concreta, necesitas saber quién firmó qué. Ese es un riesgo legal que no se descarga junto con los pesos.

Registro y trazabilidad. Qué se dijo, con qué versión del modelo, y si eso se puede reconstruir seis meses después cuando un cliente reclama.

Y la conexión con los sistemas donde pasa el trabajo. Un agente de voz que no puede leer el estado real del pedido es un contestador caro.

Ninguna de esas cinco cosas mejora porque el modelo baje de precio. Todas cuestan trabajo, y ese trabajo es el que se está pagando.

Hay además un riesgo que en voz pega distinto que en texto, y conviene decirlo aunque incomode a los que celebramos los pesos abiertos. Un modelo de voz abierto no se puede retirar. Si mañana aparece un problema de consentimiento con una voz, con un modelo cerrado existe un proveedor que puede desactivar algo; con pesos ya descargados por miles de personas, no hay botón que apretar. Eso no es un argumento para no usarlos. Es un argumento para que la voz que uses en producción tenga un origen que puedas documentar, y para no clonar la voz de una persona real sin un permiso escrito que sobreviva a una auditoría.

La misma película, vertical por vertical

Lo que hace útil este caso es que no es específico de la voz.

El mismo día que un vertical alcanza su momento de commoditización, el precio del modelo deja de ser una ventaja defendible para todos los que estaban ahí. Ya pasó con texto. Está pasando con voz. Va a pasar con video, con transcripción especializada, con visión por documentos. Y esta semana lo escribimos también desde el ángulo de los pesos abiertos a escala frontera, cuando Alibaba liberó Qwen3.8-Max.

La lección práctica se repite igual en todos: si tu producto es el modelo, tu margen tiene fecha de vencimiento. Si tu producto es lo que rodea al modelo, la caída de precio del modelo te abarata el insumo.

Lo cuantificamos antes en el trabajo que mide los siete componentes del harness. La conclusión operativa no cambió: la ventaja está en la capa que casi nadie quiere construir porque no se ve en un demo.

Cómo evaluamos un despliegue de voz

Si estás por meter voz en atención al cliente, agendamiento o cobranza, el orden que usamos es este, y el modelo aparece al final.

Primero definimos la conversación concreta y su tasa de éxito aceptable. No “atender llamadas”, sino “confirmar una cita ya agendada y reagendarla si el cliente lo pide, resolviendo el 80% sin transferir”.

Después medimos el sistema que ya existe: si el estado del pedido tarda cuatro segundos en consultarse, ningún modelo va a sonar natural, porque el silencio va a estar del lado de tu base de datos.

Luego probamos con carga concurrente parecida a la real, no con una llamada de demostración.

Y solo entonces comparamos proveedores, con el precio por minuto como uno de varios criterios, junto con licenciamiento de voz, trazabilidad y qué pasa el día que quieras cambiar de proveedor.

Ese último punto vale doble ahora. Un modelo abierto como Fish Speech S2 te da una salida real si el precio del cerrado sube, siempre que la capa de integración la hayas construido para que el modelo sea reemplazable. Si la construiste amarrada a un solo API, la alternativa abierta no te sirve de nada por más barata que sea.

¿Y cuándo conviene de verdad autohospedar el modelo abierto? Cuando se cumplen tres cosas a la vez: tienes volumen suficiente para que la diferencia de precio por minuto pague el costo de operarlo, tienes una razón de datos o de latencia para querer el modelo cerca, y ya tienes a alguien que responda cuando el servicio se caiga un domingo. Si te falta cualquiera de las tres, el API cerrado te sale más barato de lo que dice la tabla, porque el resto del costo lo estabas ignorando. Es la misma cuenta que hicimos con los pesos abiertos a escala frontera, y la respuesta cambia por empresa, no por modelo.

Que el insumo se abarate es buena noticia. Solo hay que estar armado para aprovecharlo.

Construyamos la capa que hace reemplazable al modelo

Preguntas Frecuentes

voice AI ElevenLabs Fish Audio modelos abiertos moat IA empresarial integración

Artículos Relacionados

Qwen3.8-Max rediseñó un chip de 8.298 a 678 compuertas
Estrategia Empresarial
· 9 min de lectura

Qwen3.8-Max rediseñó un chip de 8.298 a 678 compuertas

Alibaba libera los pesos de un modelo de 2,4 billones de parámetros que corrió ~500 iteraciones de diseño de chips solo. Qué cambia en tu evaluación.

Qwen Alibaba pesos abiertos
El modelo es commodity. La gobernanza es el moat.
IA y Automatización
· 5 min de lectura

El modelo es commodity. La gobernanza es el moat.

La IA empresarial no falla porque el modelo no razona. Falla porque la empresa no tiene torre de control: quién aprueba qué, con qué política, con qué registro.

gobernanza de IA agentes IA IA empresarial
Construir cuesta cero. Distribuir es la nueva inversión.
Estrategia Empresarial
· 11 min de lectura

Construir cuesta cero. Distribuir es la nueva inversión.

Aaron Levie, Gergely Orosz y Eric Siu publicaron la misma tesis en 36 horas: construir se commoditizó. La distribución con loops propios es el moat de 2026.

estrategia de distribución moat Aaron Levie