El % de visibilidad en IA que te vende tu proveedor puede ser ruido
Ricardo Argüello — 2 de agosto de 2026
CEO & Fundador
Resumen general
Profound y Evertune, dos de los proveedores más citados de medición de visibilidad en IA, tienen una discusión pública sobre metodología de muestreo. Los propios datos de Profound muestran que medir una vez al día versus diez veces al día cambia el resultado en unos 2 puntos porcentuales. Estudios independientes de SparkToro y la Universidad de St. Gallen confirman que el problema es real y no exclusivo de estos dos proveedores: los modelos de IA no dan la misma respuesta dos veces, y eso vuelve ruido a cualquier cifra de visibilidad que no explique cómo se muestreó.
- Jennifer Zou, economista de Profound, publicó el 8 de julio un análisis propio: en 753 prompts sobre 7 plataformas de IA, medir una vez al día versus diez veces al día cambió la visibilidad medida en unos 2 puntos porcentuales
- Un artículo de The State of Brand del 20 de julio reportó que Brian Stempeck, CEO de Evertune, cuestiona la metodología de Profound por márgenes de error de hasta 11-12 puntos con una sola medición diaria
- SparkToro (Rand Fishkin) encontró que hacerle la misma pregunta a ChatGPT dos veces produce la misma lista de marcas menos del 1% de las veces
- Un estudio de la Universidad de St. Gallen y el paper IQRush de Ron Sielinski encontraron que se necesitan entre 33 y 94 repeticiones de una consulta para que el resultado se estabilice estadísticamente, y 3 de 30 pruebas nunca se estabilizaron
- El problema no es exclusivo de Profound o Evertune, es una característica del muestreo sobre modelos de IA que casi ningún reporte de visibilidad menciona
Imagina que un proveedor te dice 'tu marca apareció en el 40% de las respuestas de ChatGPT este mes' sin decirte cuántas veces preguntó, ni en qué días, ni con qué prompts. Es como reportar la temperatura promedio del año sin decir si midieron una vez en enero o todos los días. El número puede ser real y seguir siendo inútil para decidir algo.
Resumen generado con IA
Profound y Evertune, dos de los proveedores más citados para medir si una marca aparece en las respuestas de ChatGPT, Claude o Perplexity, tienen una discusión pública sobre metodología. No es una demanda ni un escándalo, es más útil que eso: es una disputa técnica sobre cómo se mide algo que la mayoría de las empresas de marketing ya está comprando como si fuera un número sólido.
La discusión, reportada por The State of Brand el 20 de julio, tiene un origen mucho más concreto y verificable del lado de Profound.
El propio dato de Profound revela el problema
El 8 de julio, Jennifer Zou, economista de Profound, publicó un análisis directo en el blog de la empresa titulado “¿Es suficiente una vez al día?” Corrieron 753 prompts sobre 7 plataformas de IA, comparando muestreo una vez al día (129,000 mediciones) contra diez veces al día (860,000 mediciones), durante dos semanas de junio. El resultado: la visibilidad medida cambió en unos 2 puntos porcentuales según la frecuencia de muestreo, y la participación en citas cambió en unos 0.3 puntos.
Eso no es una acusación de un competidor. Es la propia empresa reconociendo, con sus propios números, que la frecuencia de muestreo mueve el resultado. Según Brian Stempeck, CEO de Evertune, la brecha es más grave todavía: con una sola medición diaria el margen de error puede llegar a 11-12 puntos, y solo baja a unos 6 puntos después de cerca de 100 mediciones repetidas.
Las dos metodologías son distintas por diseño, no por descuido. Profound corre un portafolio amplio, cerca de 753 prompts sobre 7 plataformas, aproximadamente una vez al día cada uno, y combina eso con captura de datos de usuarios reales en producción. Evertune usa un conjunto de consultas más reducido y curado, pero repite cada una unas 100 veces, y lo combina con lo que llama “EverPanel,” un panel propio que la empresa describe con cerca de 25 millones de participantes. Ninguna de las dos metodologías es “la correcta” en abstracto. Cada una hace una apuesta distinta entre cobertura amplia y repetición profunda, y esa apuesta es exactamente lo que determina el margen de error que reportan.
No es un problema de dos empresas, es un problema del método
Aquí está el hallazgo que le da peso real a esta discusión: no es exclusivo de Profound ni de Evertune. Rand Fishkin, de SparkToro, encontró que hacerle la misma pregunta a un modelo de IA dos veces produce la misma lista de marcas recomendadas en menos del 1% de los casos, y el mismo orden en menos del 0.1%. Eso no invalida medir visibilidad agregada sobre muchas repeticiones, pero sí invalida cualquier afirmación basada en una sola consulta o pocas consultas.
Un estudio de la Universidad de St. Gallen y el paper “IQRush” de Ron Sielinski, cubiertos por Search Engine Journal, llegaron al mismo lugar por otro camino: se necesitan entre 33 y 94 repeticiones de la misma consulta para que el resultado se estabilice estadísticamente, y en 3 de 30 pruebas el resultado nunca se estabilizó, sin importar cuántas veces se repitiera. Este estudio ni siquiera menciona a Profound o Evertune. Confirma que el ruido de muestreo es una característica de cómo funcionan los modelos de lenguaje, no un defecto de un proveedor específico.
Lo que esto significa para cualquier reporte de visibilidad que estés comprando
Traducido a una decisión de compras: si un proveedor de AEO te entrega un número como “tu marca apareció en el 40% de las respuestas este mes” sin decirte cuántas veces preguntó, con qué frecuencia, y sobre cuántas plataformas, ese número no te dice si tu marca mejoró o si simplemente el ruido del modelo cayó de un lado distinto ese mes. La pregunta que debería estar en cualquier contrato de medición de visibilidad en IA no es “¿qué porcentaje tengo?” Es “¿cuántas veces repitieron la consulta para llegar a ese porcentaje?”
Esto conecta con algo que ya habíamos escrito sobre la diferencia entre ser visto y ser escogido en respuestas de IA: la visibilidad agregada sin contexto de método puede parecer una señal fuerte y ser, en realidad, la variación normal de un sistema que no responde igual dos veces.
Cómo lo tratamos en nuestro propio monitoreo
En IQ Source corremos monitoreo recurrente de visibilidad en IA para clientes como parte del trabajo de AI Maestro, y aplicamos la misma disciplina que expuso esta discusión: reportamos con qué frecuencia se midió, sobre cuántas plataformas, y separamos explícitamente una tendencia real de una fluctuación dentro del margen de ruido esperado. Ya escribimos sobre por qué tu marketing con IA necesita un verificador, y esta discusión entre Profound y Evertune es exactamente el mismo principio aplicado a cómo mides si tu marca aparece en las respuestas de IA, no solo a cómo generas el contenido.
Preguntar el método antes de confiar en un número de visibilidad IAPreguntas Frecuentes
Profound publicó el 8 de julio de 2026 un análisis propio mostrando que la frecuencia de muestreo cambia el resultado de visibilidad medida en unos 2 puntos porcentuales. Según reportó The State of Brand el 20 de julio, Evertune cuestiona que la metodología de muestreo único diario de Profound produce márgenes de error de hasta 11-12 puntos.
Según SparkToro, hacerle la misma pregunta a un modelo de IA dos veces produce la misma lista de marcas recomendadas menos del 1% de las veces, y el mismo orden menos del 0.1% de las veces. Los modelos de lenguaje generan respuestas con variación inherente, no una respuesta fija cada vez.
Un estudio de la Universidad de St. Gallen y el paper IQRush encontraron que se necesitan entre 33 y 94 repeticiones de la misma consulta para que el resultado se estabilice estadísticamente, y en 3 de 30 pruebas el resultado nunca se estabilizó por completo, sin importar cuántas veces se repitiera.
Debe preguntar específicamente cuántas veces se repite cada consulta, con qué frecuencia se mide, y sobre cuántas plataformas de IA distintas. Un reporte de visibilidad que no explica su método de muestreo no permite distinguir una tendencia real de ruido estadístico normal del modelo.
Artículos Relacionados
El control de calidad IA que tu marketing todavía no tiene
Legawrite.AI usa un panel de jueces IA en litigio: el desacuerdo entre jueces es la señal. El área de marketing genera el mismo volumen sin ese control.
21 habilidades gratis convierten a Claude en consultor
Oria publicó 21 skills gratis para Claude: market mapping, inteligencia competitiva, pricing. Qué significa para un equipo de marketing sin estratega interno.