MuckScraper es una herramienta de software de código abierto diseñada para funcionar como un agregador de noticias autoalojado. A diferencia de los agregadores tradicionales que presentan solo listas de artículos, este sistema prioriza la agrupación de historias, agrupando la cobertura relacionada de múltiples editores en un único relato para facilitar la comparación del encuadre periodístico. La herramienta destaca por su enfoque en la transparencia informativa, etiquetando el sesgo de las fuentes en una escala de izquierda a derecha utilizando datos de AllSides o modelos de lenguaje locales, lo que permite a los usuarios evaluar la neutralidad de la información.
El sistema opera de forma local-first, ejecutando la mayoría de sus análisis de inteligencia artificial en hardware propio mediante modelos de Ollama, aunque soporta alternativas como Gemini, Groq o endpoints compatibles con OpenAI. Esto elimina la dependencia de suscripciones de nube y la tecnología de publicidad. MuckScraper genera ediciones diarias equilibradas de titulares y resúmenes profundos, además de clasificar temas y detectar duplicados. La arquitectura técnica se basa en Python, Flask y PostgreSQL con pgvector para el agrupamiento vectorial, complementada por Meilisearch para la búsqueda de texto completo. El proyecto incluye herramientas de administración para el monitoreo de la salud de la extracción de datos y la gestión de errores, permitiendo a los usuarios personalizar flujos de trabajo con webhooks o notificaciones. Es una solución robusta para quienes buscan control total sobre su flujo de información sin comprometer la privacidad o la independencia tecnológica.
