Noticias que mencionan Claude Opus 4

AISI publica resultados de evaluación de IA reproducibles en EvalEval

El UK AI Security Institute (AISI) ha publicado los resultados de evaluación de modelos de inteligencia artificial a través de la plataforma EvalEval, una iniciativa que busca garantizar la reproducibilidad y verificabilidad de las métricas de rendimiento. Esta colaboración, que nace de un taller co

Andon Labs lanza Pion para probar agentes de IA en negocios reales

Andon Labs ha lanzado Pion, una plataforma diseñada para ejecutar negocios completos de forma autónoma mediante agentes de inteligencia artificial. Esta iniciativa surge de la necesidad de evaluar cómo los sistemas de IA adquieren recursos en el mundo real, tras años de investigación en simulaciones

Documentación de Anthropic: system prompts de los modelos Claude

Anthropic publica en su documentación oficial la lista de system prompts empleados por Claude, la familia de modelos de lenguaje de la compañía. Estos system prompts son las instrucciones internas que el asistente recibe al iniciar una conversación en la interfaz web (claude.ai) y en las aplicacione

DeepSWE evalúa con mayor precisión a los agentes de IA en programación

DeepSWE, un nuevo benchmark desarrollado por Wenqi Huang y colegas, busca mejorar la evaluación de agentes de codificación de inteligencia artificial. Este nuevo conjunto de datos aborda las limitaciones de los benchmarks existentes, como la contaminación de datos y la falta de verificación fiable.

Anthropic lanza Claude Opus 4.7: más potente y preciso

Anthropic ha lanzado Claude Opus 4.7, la versión más avanzada de su modelo de lenguaje, disponible desde el 16 de abril de 2024. Esta nueva iteración se centra en mejorar el rendimiento en tareas de codificación, visión artificial y procesos complejos, ofreciendo mayor consistencia y precisión en co

Elixir impulsa la IA: un nuevo contendiente emerge

Un reciente artículo destaca cómo el lenguaje de programación Elixir, construido sobre la máquina virtual BEAM (originalmente desarrollada por Erlang en 1986), está ganando terreno en el desarrollo de inteligencia artificial, desafiando los marcos tradicionales basados en Python. Un estudio de Tence