Common Crawl es una organización sin fines de lucro 501 (c) (3) que rastrea la web y proporciona libremente sus archivos y conjuntos de datos al público. El archivo web de Common Crawl consta de petabytes de datos recopilados desde 2008. Completa el rastreo en general una vez al mes.
Patrones de adopción de extensiones HTTP según datos del rastreo web
Mark Nottingham presenta cc-lint, una herramienta que analiza más de 120 millones de respuestas HTTP de cerca de 50.000 sitios del ranking Tranco, obtenidas a través de Common Crawl. El objetivo es extraer lecciones empíricas sobre cómo se adoptan —y se abandonan— las extensiones del protocolo HTTP
