Compute Cheap, GPU cloud de bajo coste con H100 y H200 bajo demanda

Compute Cheap es una plataforma de GPU cloud orientada a ofrecer capacidad de cómputo para entrenamiento e inferencia de inteligencia artificial a precios inferiores a los de los hyperscalers tradicionales. El servicio se apoya en un modelo de marketplace en el que los propietarios de capacidad pusa

Guía práctica para aprovechar 8 RTX PRO 6000 en inferencia y ajuste

Un sistema con ocho GPU NVIDIA RTX PRO 6000 Blackwell (96 GB GDDR7 cada una, 768 GB agregados) y un CPU AMD EPYC 9555 (64 núcleos, 128 hilos, Zen 5) ofrece alternativas de alto paralelismo a un coste muy inferior al de las plataformas HGX B200 o B300 con NVLink. El artículo analiza por qué fragmenta

Cinco claves inesperadas para entender el cerebro, según WIRED

WIRED reúne en su 'Guía para ampliar la mente' cinco perspectivas que invitan a repensar el cerebro humano a partir de hallazgos recientes. El punto de partida es una idea unificadora: todos los cerebros, desde el pulpo de nueve cerebros hasta los diminutos organoides cerebrales cultivados en labora

Cómo construir un asistente RAG de producción en DigitalOcean

Este taller, impartido el 12 de agosto por Tim Kim en la plataforma de IA de DigitalOcean, muestra paso a paso cómo construir un asistente de atención al cliente llamado HelpBot partiendo de un problema habitual: los modelos de lenguaje sin contexto adicional responden con fluidez, pero a menudo inv

AMD adquiere la startup de chips de IA Taalas para acelerar la inferencia

AMD ha adquirido Taalas, una startup canadiense de chips de inteligencia artificial especializada en grabar modelos directamente en silicio, con el objetivo de reforzar su negocio de inferencia. La operación, cuyos términos no se han revelado, se produce en un momento de creciente presión competitiv

Anthropic crea un equipo interno para diseñar sus propios chips de IA

Anthropic ha confirmado la creación de un equipo interno de diseño de chips de inteligencia artificial, sumándose así a una creciente lista de grandes tecnológicas que buscan reducir su dependencia de Nvidia y los proveedores externos de hardware. La decisión, adelantada por Business Insider y confi

Guía para desplegar DeepSeek V4 Flash en producción sobre una AMD MI300X

El repositorio ryanzhou/deepseek-v4-flash-mi300x reúne la configuración y los parches necesarios para ejecutar el modelo DeepSeek-V4-Flash-0731 (304B parámetros) en producción sobre una única GPU AMD Instinct MI300X. La MI300X dispone de 192 GiB de HBM3 y un ancho de banda de 5,3 TB/s, lo que permit

Cómo pensar el precio de los tokens en la era de la IA

Benedict Evans, analista tecnológico, examina en un ensayo las incertidumbres que rodean el precio de los tokens de IA y plantea si los modelos frontera terminarán como infraestructura de bajo margen o conservarán poder de fijación de precios. El texto parte de una certeza doble: el sector atraviesa

Espresso: inferencia directa en el Neural Engine de Apple sin pasar por CoreML

Espresso es un proyecto de código abierto escrito en Swift 6.2 que permite entrenar y ejecutar modelos transformer directamente sobre el Neural Engine (ANE) de los chips Apple Silicon, esquivando por completo la capa CoreML. Para ello, la herramienta accede a APIs privadas del sistema mediante dlope

Los retos de ejecutar DeepSeek-V4-Flash en las AMD MI300X

La empresa Doubleword documenta el trabajo técnico realizado para ejecutar el modelo DeepSeek-V4-Flash sobre las tarjetas aceleradoras AMD MI300X, una tarea que, según la compañía, no funciona de forma predeterminada en vLLM a principios de mayo de 2026. La MI300X, lanzada en diciembre de 2023, ofr

Jmaczan lanza tiny-vllm, motor educativo de inferencia LLM

El desarrollador Jmaczan ha lanzado en GitHub 'tiny-vllm', un motor de inferencia de alto rendimiento para modelos de lenguaje grande (LLM) desarrollado en C++ y CUDA. Esta iniciativa se presenta como una versión más compacta y educativa de vLLM, diseñada para derivar desde cero las matemáticas y ar

IonRouter: IA rápida y económica con nueva plataforma

IonRouter ha lanzado una nueva plataforma para la inferencia de inteligencia artificial (IA) de alto rendimiento y bajo costo. La plataforma, impulsada por la tecnología IonAttention, permite a los equipos ejecutar múltiples modelos de IA, incluyendo Vision-Language Models (VLMs), en una sola GPU, o

Timber: inferencia de IA 336x más rápida

Un nuevo proyecto de código abierto llamado Timber está acelerando significativamente la inferencia de modelos de aprendizaje automático clásicos, según anunció su creador, Kossisoroyce, en GitHub. Timber compila modelos basados en árboles (XGBoost, LightGBM, scikit-learn, CatBoost y ONNX) en código

IA para todos: superando costos y lentitud

El artículo de taalas.com aborda un desafío crucial para la adopción generalizada de la Inteligencia Artificial (IA): la combinación de alta latencia y costos prohibitivos. Actualmente, los modelos de IA, especialmente los grandes modelos de lenguaje (LLM), requieren una infraestructura masiva y cos

Hugging Face acelera LLMs con 'continuous batching'

Hugging Face ha publicado un artículo técnico explicando 'continuous batching', una técnica para acelerar la respuesta de los modelos de lenguaje grandes (LLMs) como Qwen y Claude. El problema actual es que los LLMs, al generar texto, procesan la solicitud completa y luego añaden tokens uno por uno,