Noticias que mencionan DeepSeek V3

Kimi K2.5: 100-Agent Swarms Need $500k GPUs to Run | byteiota

Moonshot AI ha lanzado Kimi K2.5, un modelo de lenguaje de código abierto de 1 billón de parámetros que utiliza 'agent swarms' (enjambres de agentes) para tareas complejas, ofreciendo una ejecución 4.5 veces más rápida que los modelos de agente único y capacidades de codificación visual a partir de

China Lanza GLM-5: Nuevo Rival para OpenAI

Zhipu AI, una empresa china de inteligencia artificial surgida de la Universidad Tsinghua, ha lanzado GLM-5, un modelo de lenguaje grande que se presenta como un competidor directo de OpenAI y Anthropic. GLM-5, la quinta generación de modelos de Zhipu AI, cuenta con aproximadamente 745 mil millones

Entrenar IA de código abierto: desafíos inesperados

Un ingeniero de Workshop Labs, Addie Foote, relata los desafíos encontrados al intentar entrenar y servir modelos de lenguaje grandes con pesos abiertos, específicamente el modelo Kimi-K2-Thinking de Moonshot AI. El objetivo era post-entrenar el modelo, que cuenta con 1 billón de parámetros y está c

Galería online compara arquitecturas de LLM

Un repositorio en línea, alojado en sebastianraschka.com, ha sido creado para rastrear y comparar las arquitecturas de los últimos modelos de lenguaje grandes (LLM). La “Galería de Arquitecturas LLM” recopila diagramas y hojas de datos de modelos como Llama 3 8B, DeepSeek V3, Gemma 3, Qwen3, Mistral

IA: la memoria de las conversaciones tiene un costo

La forma en que los modelos de lenguaje grandes (LLM) como ChatGPT gestionan la memoria de las conversaciones, conocida como 'KV cache', tiene un costo físico y económico significativo. Cada interacción, incluso una pregunta sencilla, se traduce en datos almacenados en la memoria de la GPU, con GPT-

Anatomía de un kernel de paralelismo de expertos de alto rendimiento

Los modelos de lenguaje de gran tamaño (LLM) requieren coordinar muchas GPUs para funcionar. Una de las técnicas clave es el paralelismo de expertos (EP), esencial en los modelos MoE a gran escala. A diferencia de otras formas de paralelismo, cuyas comunicaciones siguen patrones fijos, en EP el rout

Receta de RL en NVFP4 para modelos de lenguaje: el aprendizaje de los 4 bits

El equipo de humans& presenta una receta de aprendizaje por refuerzo (RL) en precisión NVFP4 de 4 bits, desarrollada en colaboración con RadixArk y NVIDIA, que logra mantener la dinámica de entrenamiento en alta precisión y, al mismo tiempo, aprovechar los aumentos de throughput que ofrece el hardwa

Registro de cambios de la API de DeepSeek: de DeepSeek-V2.5 a DeepSeek-V4-Flash

DeepSeek consolida en apenas nueve meses una de las hojas de ruta más aceleradas del sector de la inteligencia artificial generativa. Según el registro oficial de cambios de su API, la compañía china transitó desde la versión estable DeepSeek-V2.5 —presentada el 5 de septiembre de 2024— hasta DeepSe

AirLLM: cómo ejecutar modelos de 70B en una sola GPU de 4 GB

AirLLM es una biblioteca de Python de código abierto que reduce drásticamente el consumo de memoria durante la inferencia de modelos de lenguaje de gran tamaño, permitiendo ejecutar un modelo de 70B parámetros en una única GPU con apenas 4 GB de VRAM, sin recurrir a cuantización, destilación ni poda

Guía interactiva para construir un LLM desde cero

LLM Visualizer es una plataforma interactiva diseñada para facilitar la comprensión profunda de los Modelos de Lenguaje Grandes (LLM) mediante la construcción práctica de un modelo funcional desde sus fundamentos. A diferencia de los tutoriales teóricos, esta herramienta opera como un laboratorio en