Filtrado de datos para el preentrenamiento de modelos generativos de vídeo

Linum publica unas notas técnicas que detallan cómo ha evolucionado su estrategia de filtrado de datos para entrenar modelos generativos de vídeo. Aunque las redes neuronales apenas han cambiado desde Stable Diffusion 3, la mayoría de las mejoras recientes se atribuyen a tres ejes: filtrado y rebala

El arte de los códigos QR: anatomía y diseño creativo

Los códigos QR son ya una presencia cotidiana en señales, anuncios y envases: la forma más sencilla de compartir una URL visualmente. Este artículo analiza cómo pasar del típico cuadrado blanco y negro a versiones personalizadas sin perder la capacidad de lectura. Primero repasa las técnicas más co

GPT-5.6 Sol se consolida como el mejor modelo de visión lanzado por OpenAI

Roboflow sometió a los nuevos modelos GPT-5.6 Sol, Terra y Luna de OpenAI, presentados la semana pasada, a su próximo benchmark de modelos de visión (VLM), que cubrirá detección de objetos, conteo, OCR y extracción de datos. Sol registró 46,2 mAP@50 en detección, frente a los 13,8 puntos de GPT-5.5,

Matic añade control por voz y gestos a su robot aspirador

Matic ha lanzado Matic Cues, una actualización que incorpora control por voz y por gestos a su robot aspirador, disponible desde el 13 de agosto a través de la aplicación del fabricante. La principal novedad es el control gestual, una función inédita en el sector: tras activarlo con la palabra clave

Perspec 1.0: aplicación de escritorio para corregir la perspectiva de imágenes

Perspec es una aplicación de escritorio gratuita y de código abierto diseñada para corregir la perspectiva de fotografías de documentos, recibos y cualquier otra imagen. Su versión 1.0, publicada tras nueve años de desarrollo, se centra en un flujo de trabajo ágil pensado para procesar lotes de imág

Feyn presenta FeyNoBg, un modelo de código abierto para eliminar fondos

La empresa Feyn ha presentado FeyNoBg, un modelo de código abierto de última generación para la eliminación automática de fondos en imágenes, junto con NoBg, la librería en Python usada para entrenarlo y que también libera de forma abierta. Según la compañía, FeyNoBg logra la mejor S-measure publica

D-FINE-seg: detección de objetos y segmentación de instancias en tiempo real

D-FINE-seg es un framework de código abierto que amplía el detector de objetos basado en transformers D-FINE con capacidades de segmentación de instancias. El proyecto añade una cabeza de máscara ligera, pérdidas de entrenamiento conscientes de la segmentación (BCE y Dice recortadas por bounding box

Reconstrucción 3D de los 64 partidos del Mundial con datos de seguimiento

El ingeniero Roger Dickey ha publicado un proyecto de código abierto que reconstruye en 3D los 64 partidos del Mundial de Catar 2022 a partir de datos comerciales de seguimiento de jugadores. La iniciativa parte de las visualizaciones que circularon en redes sociales durante la competición, pero va

LingBot-Map: modelo fundacional 3D para reconstruir escenas en tiempo real

LingBot-Map es un modelo fundacional 3D feed-forward, publicado en GitHub por el equipo Robbyant, diseñado para reconstruir escenas tridimensionales a partir de secuencias de vídeo en streaming. Su arquitectura se articula en torno al Geometric Context Transformer, un componente que unifica el ancla

Camuflaje anti-IA: las rayas blancas y negras que burlan a los drones

Camiones militares rusos en Ucrania han adoptado un esquema de pintura con llamativas rayas blancas y negras, un camuflaje inútil contra observadores humanos pero diseñado para desorientar los sistemas de visión artificial de los drones ucranianos que sobrevuelan el campo de batalla en busca de obje

Lift4D: reconstruir objetos dinámicos en 4D a partir de vídeo monocular

Lift4D es un marco de optimización en tiempo de prueba que reconstruye objetos dinámicos completos a partir de un único vídeo monocular, abordando un problema clásico de la visión por computador: fusionar las pistas visuales del vídeo con priors aprendidos sobre geometría y apariencia. Los métodos a

YOLO26: una familia de modelos de visión en tiempo real unificados y sin NMS

Ultralytics ha presentado YOLO26, una nueva familia de modelos de visión por computador en tiempo real diseñada para resolver varias limitaciones persistentes en la saga YOLO: la dependencia de la supresión de no máximos (NMS) durante la inferencia, el peso de las cabezas de detección asociadas a Di

GrassDx: diagnóstico de césped con IA a partir de una foto y un código postal

GrassDx es una herramienta en línea que, mediante inteligencia artificial, analiza el estado del césped del usuario a partir de hasta cuatro fotografías guiadas: una vista general, un primer plano, el borde entre la zona sana y la dañada, y un detalle de una hoja. El usuario solo debe subir las imág

Los ingenieros de IA tampoco se libran de ser reemplazados por la IA

El ensayo analiza por qué los ingenieros especializados en inteligencia artificial podrían ser reemplazados por la propia IA antes que otros perfiles técnicos. El autor, ingeniero de IA, parte de una conversación recurrente con colegas: cuando afirma que la IA sustituirá su trabajo, le responden que

Rudus (YC P26) presenta una IA para subcontratistas de hormigón

Rudus, una startup de la cohorte Y Combinator P26 fundada por Rishi y Sahil, ha presentado una herramienta de inteligencia artificial diseñada específicamente para subcontratistas de hormigón. Su objetivo es automatizar una de las tareas más laboriosas del sector: la medición de materiales a partir

Tsplat lleva el Gaussian Splatting a entornos solo con CPU

**Terminal meets 3D: tsplat lleva el Gaussian Splatting a entornos solo CPU** **1. Introducción** El Gaussian Splatting (GS) es una técnica de representación volumétrica que modela escenas tridimensionales mediante cientos de miles de elipsoides semitransparentes (splats). Hasta ahora su visualizac

TIPSv2: Modelo mejora la unión de imagen y texto

TIPSv2 representa una nueva generación de modelos de codificación de imágenes y texto, diseñados para mejorar el rendimiento en una amplia gama de tareas multimodales y de visión artificial. El núcleo de la innovación reside en una observación sorprendente: la destilación (un proceso de aprendizaje

Roboflow busca expertos en visión artificial

Roboflow está buscando talento para construir el futuro de la visión artificial (Computer Vision). En esencia, la visión artificial es la rama de la inteligencia artificial que permite a las máquinas 'ver' e interpretar imágenes y videos, de manera similar a como lo hacen los humanos. Esto es crucia

Bitmovin: Becas de IA y Video para Estudiantes (Verano 2026)

El programa "AI & Beyond Internship Incubator" de Bitmovin (verano de 2026) es una iniciativa de formación intensiva diseñada para estudiantes y recién graduados interesados en la inteligencia artificial (IA) y sus aplicaciones, especialmente en el contexto del procesamiento de video y streaming. Au