Fish Audio es 70% más barato. ElevenLabs creció igual
Ricardo Argüello — 16 de agosto de 2026
CEO & Fundador
Resumen general
Fish Audio liberó Fish Speech S2 en marzo de 2026, con más de 26.000 estrellas en GitHub y latencia por debajo de 150 milisegundos, y cobra alrededor de $0,05 por minuto contra los $0,18 de ElevenLabs. Levantó 52 millones de dólares con 21 millones de ARR. En el mismo período ElevenLabs pasó de 350 millones de ARR al cierre de 2025 a más de 500 millones en los primeros cuatro meses de 2026. El modelo se commoditizó y el negocio no.
- Fish Audio liberó Fish Speech S2 el 10 de marzo de 2026 como modelo abierto de texto a voz, con más de 26.000 estrellas en GitHub, control de emoción por etiquetas en lenguaje natural y latencia por debajo de 150 milisegundos
- El costo estimado por minuto es de unos $0,05 en Fish Audio contra $0,18 en ElevenLabs, alrededor de 70% menos
- Fish Audio levantó una ronda semilla de 52 millones de dólares tras alcanzar 21 millones de ARR, apostando a que pesos abiertos y autohospedaje pueden competir contra los líderes cerrados
- ElevenLabs cerró 2025 en 350 millones de ARR y superó los 500 millones en los primeros cuatro meses de 2026, creciendo mientras el sustituto abierto se abarataba
- El patrón se repite vertical por vertical: cuando el modelo se vuelve commodity, el valor se corre a la capa de integración, cumplimiento y garantías de operación
Imagina que durante años el negocio de vender café dependía de tener acceso a un grano que casi nadie conseguía. Un día ese grano se vuelve barato y cualquiera lo compra. Los que solo vendían el grano se quedan sin negocio. Los que además tenían la máquina calibrada, el local, el horario de entrega y el contrato con la oficina de al lado, siguen cobrando lo mismo. El grano dejó de ser el negocio sin que el negocio desapareciera.
Resumen generado con IA
Fish Audio liberó los pesos de su modelo de voz y cobra alrededor de $0,05 por minuto. ElevenLabs cobra unos $0,18 por lo mismo.
Y ElevenLabs creció de 350 millones de ARR a más de 500 millones mientras eso pasaba.
Esas dos frases juntas son lo interesante de toda la historia.
El modelo se volvió commodity y el negocio no se movió
Ya escribimos que el harness es el moat y el modelo ya es commodity. Lo que muestra el mercado de voz es la versión completa de ese argumento, con estados financieros de por medio: la commoditización del modelo no commoditiza al proveedor. Corre el valor a otro lado.
Cuando el precio del componente cae 70% y el líder sigue creciendo, la conclusión no es que los clientes sean tontos ni que la alternativa abierta sea mala. Es que el precio del modelo nunca fue la mayor parte de lo que estaban comprando.
Esto importa porque casi toda evaluación de IA de voz que veo empieza y termina en la comparación de costo por minuto. Es la métrica más fácil de conseguir y la que menos predice si el despliegue va a funcionar.
Los números de los dos lados
Fish Audio no es un proyecto de fin de semana, y ese es justamente el punto.
Publicó Fish Speech S2 el 10 de marzo de 2026 como modelo abierto de texto a voz. Superó las 26.000 estrellas en GitHub, trae control de emoción con etiquetas en lenguaje natural, generación de varios hablantes en una sola pasada y latencia por debajo de 150 milisegundos. Levantó una ronda semilla de 52 millones de dólares con 21 millones de ARR ya corriendo, según Open Source For You. La estructura de precios es agresiva: plan gratuito con 7 minutos de S2, 11 dólares al mes por 200 minutos, 75 al mes por 27 horas.
Es exactamente la jugada de doble vía que ya usaron Mistral y Qwen: pesos abiertos para adopción de comunidad, API pagada para clientes empresariales, y cada lado financia al otro. Remio lo describe bien como una apuesta explícita contra los gigantes cerrados de la voz.
Del otro lado, ElevenLabs cerró 2025 en 350 millones de ARR y superó los 500 millones en los primeros cuatro meses de 2026. No creció a pesar del competidor abierto. Creció durante.
Qué compra realmente un cliente empresarial de voz
Acá está la parte que no aparece en ninguna tabla comparativa, y que sí determina si el proyecto sobrevive.
Latencia bajo carga real, no en el demo. Un modelo que responde en 150 milisegundos con una petición a la vez y en 900 con trescientas concurrentes no sirve para un centro de contacto, y esa curva no está publicada en ningún lado.
Manejo de interrupciones. Una conversación de voz de verdad tiene a alguien cortando a la mitad de la frase. Resolver eso bien es trabajo de ingeniería alrededor del modelo, no del modelo.
Licenciamiento de la voz. Si vas a usar una voz que suena a una persona concreta, necesitas saber quién firmó qué. Ese es un riesgo legal que no se descarga junto con los pesos.
Registro y trazabilidad. Qué se dijo, con qué versión del modelo, y si eso se puede reconstruir seis meses después cuando un cliente reclama.
Y la conexión con los sistemas donde pasa el trabajo. Un agente de voz que no puede leer el estado real del pedido es un contestador caro.
Ninguna de esas cinco cosas mejora porque el modelo baje de precio. Todas cuestan trabajo, y ese trabajo es el que se está pagando.
Hay además un riesgo que en voz pega distinto que en texto, y conviene decirlo aunque incomode a los que celebramos los pesos abiertos. Un modelo de voz abierto no se puede retirar. Si mañana aparece un problema de consentimiento con una voz, con un modelo cerrado existe un proveedor que puede desactivar algo; con pesos ya descargados por miles de personas, no hay botón que apretar. Eso no es un argumento para no usarlos. Es un argumento para que la voz que uses en producción tenga un origen que puedas documentar, y para no clonar la voz de una persona real sin un permiso escrito que sobreviva a una auditoría.
La misma película, vertical por vertical
Lo que hace útil este caso es que no es específico de la voz.
El mismo día que un vertical alcanza su momento de commoditización, el precio del modelo deja de ser una ventaja defendible para todos los que estaban ahí. Ya pasó con texto. Está pasando con voz. Va a pasar con video, con transcripción especializada, con visión por documentos. Y esta semana lo escribimos también desde el ángulo de los pesos abiertos a escala frontera, cuando Alibaba liberó Qwen3.8-Max.
La lección práctica se repite igual en todos: si tu producto es el modelo, tu margen tiene fecha de vencimiento. Si tu producto es lo que rodea al modelo, la caída de precio del modelo te abarata el insumo.
Lo cuantificamos antes en el trabajo que mide los siete componentes del harness. La conclusión operativa no cambió: la ventaja está en la capa que casi nadie quiere construir porque no se ve en un demo.
Cómo evaluamos un despliegue de voz
Si estás por meter voz en atención al cliente, agendamiento o cobranza, el orden que usamos es este, y el modelo aparece al final.
Primero definimos la conversación concreta y su tasa de éxito aceptable. No “atender llamadas”, sino “confirmar una cita ya agendada y reagendarla si el cliente lo pide, resolviendo el 80% sin transferir”.
Después medimos el sistema que ya existe: si el estado del pedido tarda cuatro segundos en consultarse, ningún modelo va a sonar natural, porque el silencio va a estar del lado de tu base de datos.
Luego probamos con carga concurrente parecida a la real, no con una llamada de demostración.
Y solo entonces comparamos proveedores, con el precio por minuto como uno de varios criterios, junto con licenciamiento de voz, trazabilidad y qué pasa el día que quieras cambiar de proveedor.
Ese último punto vale doble ahora. Un modelo abierto como Fish Speech S2 te da una salida real si el precio del cerrado sube, siempre que la capa de integración la hayas construido para que el modelo sea reemplazable. Si la construiste amarrada a un solo API, la alternativa abierta no te sirve de nada por más barata que sea.
¿Y cuándo conviene de verdad autohospedar el modelo abierto? Cuando se cumplen tres cosas a la vez: tienes volumen suficiente para que la diferencia de precio por minuto pague el costo de operarlo, tienes una razón de datos o de latencia para querer el modelo cerca, y ya tienes a alguien que responda cuando el servicio se caiga un domingo. Si te falta cualquiera de las tres, el API cerrado te sale más barato de lo que dice la tabla, porque el resto del costo lo estabas ignorando. Es la misma cuenta que hicimos con los pesos abiertos a escala frontera, y la respuesta cambia por empresa, no por modelo.
Que el insumo se abarate es buena noticia. Solo hay que estar armado para aprovecharlo.
Construyamos la capa que hace reemplazable al modeloPreguntas Frecuentes
Fish Audio es una empresa de síntesis de voz que libera sus modelos, incluido Fish Speech S2, publicado el 10 de marzo de 2026 con más de 26.000 estrellas en GitHub. A diferencia de ElevenLabs, que opera con modelos cerrados por API, Fish Audio permite descargar los pesos y autohospedar.
El costo estimado por minuto es de aproximadamente $0,05 en Fish Audio contra $0,18 en ElevenLabs, cerca del 70% menos. Fish Audio ofrece además un plan gratuito con 7 minutos de generación S2, un plan de $11 al mes con 200 minutos y uno de $75 al mes con 27 horas.
Porque el precio por minuto del modelo no es lo único que compra un cliente empresarial. ElevenLabs pasó de 350 millones de ARR al cierre de 2025 a más de 500 millones en los primeros cuatro meses de 2026, vendiendo latencia garantizada, licenciamiento de voces, cumplimiento e integraciones ya construidas.
Significa que elegir proveedor por precio del modelo es cada vez menos determinante. Lo que diferencia un despliegue de voz que funciona es la capa alrededor: latencia real bajo carga, manejo de interrupciones, licenciamiento de la voz usada, registro de auditoría y conexión con los sistemas donde ocurre el trabajo.
Artículos Relacionados
Qwen3.8-Max rediseñó un chip de 8.298 a 678 compuertas
Alibaba libera los pesos de un modelo de 2,4 billones de parámetros que corrió ~500 iteraciones de diseño de chips solo. Qué cambia en tu evaluación.
El modelo es commodity. La gobernanza es el moat.
La IA empresarial no falla porque el modelo no razona. Falla porque la empresa no tiene torre de control: quién aprueba qué, con qué política, con qué registro.
Construir cuesta cero. Distribuir es la nueva inversión.
Aaron Levie, Gergely Orosz y Eric Siu publicaron la misma tesis en 36 horas: construir se commoditizó. La distribución con loops propios es el moat de 2026.