Por qué los rankings de visibilidad en IA no son fiables

Fuentes: Every AI Visibility Tool Is Lying to You

Las plataformas de seguimiento de visibilidad en inteligencia artificial —que miden qué tan presentes aparecen las marcas en ChatGPT, Claude, Gemini, Perplexity o las respuestas de Google— ofrecen cifras de precisión engañosa, según un análisis firmado en Canonry por un ingeniero de software con experiencia en sistemas de medición. El artículo sostiene que los leaderboards limpios que publican estos productos ocultan el problema real: las respuestas de los modelos son ruidosas, personalizadas, geográficas, no deterministas y cambian con frecuencia.

El texto desgrana cuatro frentes técnicos. Primero, el raspado del frontend (scraping) de las apps de los chatbots parte de cuentas controladas con historial, suscripción, geografía y memoria fijos: una sola sesión sintética, no representativa. Segundo, los modelos ni siquiera son estables con temperatura cero; Thinking Machines Lab documentó que llamadas idénticas pueden generar respuestas distintas en producción, y SparkToro y Gumshoe observaron recomendaciones de marca muy inconsistentes al repetir prompts comerciales. Tercero, las API y las apps de consumo se comportan de forma diferente, así que medir una no equivale a medir la otra. Y cuarto, el conjunto de prompts elegidos, su frecuencia, la geografía y la fórmula de puntuación determinan por completo el número que aparece en pantalla: la misma marca puede obtener un 20% o un 31,4% de share of voice según el método.

La conclusión operativa del análisis es que estas métricas pueden servir como señal direccional, pero hay que etiquetarlas como construidas, mostrar la distribución y la metodología, y no venderlas como verdades estables sobre lo que ve un comprador real.