Noticias que mencionan NVIDIA H200

Flash-KMeans: K-Means Veloz para Sistemas Online

El algoritmo K-Means es una técnica fundamental en aprendizaje automático para agrupar datos similares. Tradicionalmente, se ha utilizado para tareas como organizar conjuntos de datos o preprocesar incrustaciones (embeddings), pero su aplicación en tiempo real, en sistemas online, ha sido limitada p

Kog AI alcanza 3.000 tokens/s en GPUs estándar con inferencia en tiempo real

Kog AI ha lanzado una vista previa técnica de su motor de inferencia, demostrando que las tarjetas gráficas estándar pueden alcanzar velocidades de generación de tokens de hasta 3.000 por segundo. El sistema, probado en configuraciones de 8 tarjetas AMD MI300X y NVIDIA H200, logra estos rendimientos

Anatomía de un kernel de paralelismo de expertos de alto rendimiento

Los modelos de lenguaje de gran tamaño (LLM) requieren coordinar muchas GPUs para funcionar. Una de las técnicas clave es el paralelismo de expertos (EP), esencial en los modelos MoE a gran escala. A diferencia de otras formas de paralelismo, cuyas comunicaciones siguen patrones fijos, en EP el rout

La francesa Kog quiere exprimir más rendimiento de las GPU mediante software

La startup francesa Kog, fundada en solitario por Gaël Delalleau, asegura que es posible acelerar drásticamente la inferencia de modelos de inteligencia artificial en GPU estándar mediante optimización por software, frente a quienes consideran necesarias soluciones de hardware a medida como los chip

Aritmética del decodificado: por qué MLA y MTP no se llevan bien

Este artículo técnico explica por qué la combinación de MLA (atención de latente múltiple) con MTP (decodificado especulativo o multi-token prediction) tiende a perjudicar el rendimiento en las GPUs actuales, partiendo de un comentario del investigador Su Jianlin. La clave está en la intensidad arit

Compute Cheap, GPU cloud de bajo coste con H100 y H200 bajo demanda

Compute Cheap es una plataforma de GPU cloud orientada a ofrecer capacidad de cómputo para entrenamiento e inferencia de inteligencia artificial a precios inferiores a los de los hyperscalers tradicionales. El servicio se apoya en un modelo de marketplace en el que los propietarios de capacidad pusa

Cuantización de Qwen3.8 27B: 4 bits mantiene el rendimiento, 1 bit colapsa

Quesma Blog publica un análisis exhaustivo sobre cómo afecta la cuantización al rendimiento del modelo Qwen3.8 27B en distintas tareas. El modelo completo en BF16 ocupa 55 GB de VRAM, fuera del alcance de la mayoría del hardware de consumo. Los experimentos, ejecutados con llama.cpp sobre GPUs alqui