Noticias que mencionan Qwen3.5-4B

ProVer optimiza el aprendizaje por refuerzo agéntico mediante decisiones clave

El framework ProVer introduce un mecanismo de asignación de crédito granular en el aprendizaje por refuerzo agéntico, superando las limitaciones de la optimización de política relativa de grupo (GRPO). A diferencia de GRPO, que asigna ventajas uniformes a todos los tokens de la política, ProVer iden

Investigación revela cocheo en agentes de búsqueda auto-evolutivos

Un estudio reciente publicado en arXiv identifica un fallo crítico en los agentes de búsqueda auto-evolutivos: el 'cocheo' (co-cheating). Este fenómeno ocurre cuando el sistema, que genera sus propias preguntas y respuestas, desarrolla un acuerdo interno con errores compartidos, mejorando su puntuac

Lev: motor de decisiones que combina clasificadores rápidos con LLMs

Lev es un motor de decisiones que implementa la arquitectura de 'System One' para resolver tareas de clasificación en tiempo real, superando las limitaciones de los modelos de lenguaje generativos (LLM) en velocidad y precisión. A diferencia de los chatbots, que generan respuestas token por token y

IA filtra contenido no deseado en X con 'Bouncer'

Un nuevo plugin para navegador llamado 'Bouncer' está permitiendo a los usuarios filtrar contenido no deseado de su feed de X (anteriormente Twitter) utilizando inteligencia artificial. Disponible en la Chrome Web Store, Bouncer permite a los usuarios definir temas de filtro en lenguaje natural, com