DeepSeek es una empresa china de inteligencia artificial que desarrolla modelos extensos de lenguaje (LLM) de código abierto. Tiene sede en Hangzhou, Zhejiang, es propiedad y está financiada exclusivamente por el fondo de cobertura chino High-Flyer, cuyo cofundador, Liang Wenfeng, estableció la empresa en 2023 y se desempeña como su director ejecutivo.

Ver en Wikipedia

Noticias que mencionan DeepSeek-R1

IA india 'Indus': ¿soberanía o misterio?

La startup india Sarvam AI ha generado controversia tras recibir una importante financiación pública (10.000 crore de rupias en un fondo nacional) y lanzar su modelo de IA 'Indus', con 105 mil millones de parámetros, que supuestamente supera a modelos más grandes como Gemini Flash. Si bien la empres

IA para programar: precios al alza, ¿quién se queda sin?

Las herramientas de inteligencia artificial para programación, como GitHub Copilot y Claude Code, están experimentando un aumento significativo en sus precios, lo que podría dejar fuera a muchos usuarios. Según un análisis reciente, los precios de los niveles superiores de estas herramientas están a

Modelos de lenguaje: nueva técnica mejora el razonamiento

Este artículo explora una técnica innovadora para mejorar el razonamiento de los modelos de lenguaje, inspirada en el éxito de algoritmos de búsqueda en árbol como AlphaZero en juegos de mesa. La idea central es aplicar la 'Tree Search Distillation' (Destilación de Búsqueda en Árbol) a modelos de le

Galería online compara arquitecturas de LLM

Un repositorio en línea, alojado en sebastianraschka.com, ha sido creado para rastrear y comparar las arquitecturas de los últimos modelos de lenguaje grandes (LLM). La “Galería de Arquitecturas LLM” recopila diagramas y hojas de datos de modelos como Llama 3 8B, DeepSeek V3, Gemma 3, Qwen3, Mistral

Deja la IA: Ingeniero busca fundamentos en la programación

Un ingeniero de Aily Labs, empresa especializada en inteligencia artificial, ha decidido tomarse un descanso de la IA para enfocarse en la programación manual, residiendo actualmente en Brooklyn como parte de un “retiro de codificación”. Tras dos años trabajando en Aily Labs, desarrollando agentes d

HN: Investigación de LLM pierde interés

Un análisis reciente realizado por Dylan Castillo revela una disminución en la presencia de investigaciones sobre modelos de lenguaje grandes (LLM) en Hacker News (HN), una plataforma popular entre programadores y entusiastas de la tecnología. Utilizando a Claude, un asistente de IA, Castillo rastre

zyphra lanza modelo de lenguaje competitivo con amd

Zyphra ha lanzado un nuevo modelo de lenguaje, ZAYA1-8B, que está destacando en pruebas de matemáticas y programación con un tamaño significativamente menor que otros modelos de vanguardia. ZAYA1-8B iguala el rendimiento de DeepSeek-R1 en matemáticas y compite con Claude Sonnet 4.5 en razonamiento,

Registro de cambios de la API de DeepSeek: de DeepSeek-V2.5 a DeepSeek-V4-Flash

DeepSeek consolida en apenas nueve meses una de las hojas de ruta más aceleradas del sector de la inteligencia artificial generativa. Según el registro oficial de cambios de su API, la compañía china transitó desde la versión estable DeepSeek-V2.5 —presentada el 5 de septiembre de 2024— hasta DeepSe

OpenArch: implementaciones de PyTorch de arquitecturas LLM modernas

OpenArch es un repositorio de código abierto que ofrece implementaciones de PyTorch de las arquitecturas de modelos de lenguaje de gran escala (LLM) más recientes, escritas desde cero para priorizar la legibilidad y el aprendizaje sobre el rendimiento de producción. El proyecto se basa en el catálog