Common Crawl es una organización sin fines de lucro 501 (c) (3) que rastrea la web y proporciona libremente sus archivos y conjuntos de datos al público. El archivo web de Common Crawl consta de petabytes de datos recopilados desde 2008. Completa el rastreo en general una vez al mes.

Ver en Wikipedia

Noticias que mencionan Common Crawl

Patrones de adopción de extensiones HTTP según datos del rastreo web

Mark Nottingham presenta cc-lint, una herramienta que analiza más de 120 millones de respuestas HTTP de cerca de 50.000 sitios del ranking Tranco, obtenidas a través de Common Crawl. El objetivo es extraer lecciones empíricas sobre cómo se adoptan —y se abandonan— las extensiones del protocolo HTTP

Gigatoken: un tokenizador en Rust hasta 1000 veces más rápido que HuggingFace

Gigatoken es una biblioteca de tokenización para modelos de lenguaje escrita en Rust que alcanza velocidades de hasta 24,53 GB/s en CPU AMD EPYC 9565 de 144 núcleos, frente a las 24,8 MB/s que ofrece el tokenizador de HuggingFace para GPT-2. Esto representa una aceleración cercana a 989 veces respec

Pulpie: extractores de contenido web casi 20 veces más baratos que Dripper

Pulpie es una familia de modelos open source de Feyn diseñados para extraer el contenido principal de páginas HTML y eliminar la «boilerplate» (navegación, anuncios, barras laterales y pies de página), que según los autores supone alrededor del 70 % de los bloques de una página típica. El modelo ins

autofit2: pipeline automatizado de clasificación de textos en 50+ idiomas

autofit2 es una herramienta de código abierto que automatiza de principio a fin el preprocesamiento, el entrenamiento y la evaluación de modelos de clasificación de texto con aprendizaje few-shot. Está construida sobre las bibliotecas setfit y SBERT y permite obtener precisiones del 95 % al 99 % con

Disney cierra FiveThirtyEight y elimina 200,000 horas de contenido

Disney eliminó completamente el sitio FiveThirtyEight, fundado por Nate Silver, destruyendo aproximadamente 200,000 horas de contenido periodístico produced durante la década que la compañía mantuvo el portal bajo su control. El cierre occurred la semana pasada, cuando los intentos de acceder a artí

DreamHost protege sitios web con archivo agents.txt contra scrapeo de IA

DreamHost añade un archivo agents.txt a todos los sitios web alojados en sus servidores VPS. El archivo apareció automáticamente el 7 de mayo en la raíz de cada sitio, siendo una implementación similar al estándar robots.txt pero destinada a regular el comportamiento de agentes de IA. El contenido e

Google limita acceso gratuito a su índice de búsqueda

Google anunció que discontinuará el acceso gratuito a su índice de búsqueda web para desarrolladores a partir de enero de 2027. La medida afecta principalmente a aquellos que utilizan el índice completo para alimentar sus propios motores de búsqueda, limitando ahora la opción gratuita a un máximo de

IA difunde enfermedad inventada: experimento revela riesgo

Investigadores de la Universidad de Gotemburgo, Suecia, han revelado un experimento alarmante que pone de manifiesto la vulnerabilidad de los modelos de lenguaje de inteligencia artificial (LLM) a la desinformación. La científica Almira Osmanovic Thunström inventó una condición médica ficticia llama

Fallo en Google expone claves API tras cambio en Gemini

Un fallo de seguridad recientemente descubierto en Google ha expuesto claves API que, sin el conocimiento de los desarrolladores, han otorgado acceso a la API Gemini, una plataforma de inteligencia artificial generativa. La vulnerabilidad, revelada por Truffle Security, surge de una práctica de Goog

Guía de Ingeniería de Datos para Modelos de IA

En la era de los grandes modelos de lenguaje (LLM), la calidad de los datos se ha convertido en el factor determinante que limita su rendimiento. El libro "Data Engineering for LLMs" de Datascale-AI aborda esta problemática, ofreciendo una guía completa y práctica para la ingeniería de datos necesar