Un tercio de las citas de Perplexity no contienen los datos que respaldan

Fuentes: A third of Perplexity's citations don't contain the number they're cited for

Una investigación de Haus Research revela que un tercio de las citas que el buscador con IA Perplexity adjunta a frases con cifras apunta a páginas que o no se abren o no contienen ninguno de los números de la frase. Del total de 1.826 citas adjuntas a oraciones con datos concretos, el 34,7 % falla esta verificación básica; medido por afirmaciones en lugar de por citas, el 14,4 % de las 872 afirmaciones con cifras tampoco supera el control.

El estudio formuló 310 preguntas objetivas (fundación, última ronda de financiación, plantilla, precio de entrada, sede, ingresos, brechas de seguridad, CEO actual, adquisiciones y SLA de uptime) sobre 210 empresas tecnológicas, a los modelos perplexity/sonar y perplexity/sonar-pro, con GPT-4.1 como control. Solo el 1,3 % de las URL citadas eran enlaces muertos; el grueso del fallo se reparte entre páginas bloqueadas por login, paywall, error 403 o filtrado antibots (16,1 %) y páginas accesibles que no contienen ninguna de las cifras atribuidas (16,1 % de los pares restantes).

El 84,2 % de las 310 respuestas de sonar citó al menos una URL inaccesible para un lector normal y el 10,6 % al menos una URL directamente caída. Entre las páginas desaparecidas, alrededor de la mitad siguen un patrón idéntico —dominios como komo.ai, temperstack.com o apollo.io generan páginas por empresa y pregunta que se publican y retiran al por mayor—. En los casos en los que la página sí carga, el fallo más frecuente es la atribución: direcciones de sede adjudicadas a Wikipedia sin que aparezcan en el artículo, o un CEO citado en la página oficial sin la fecha de nombramiento. El tipo de pregunta con peor resultado es la identidad del CEO actual, con un 44,3 % de aciertos.