Noticias que mencionan LLaMA

IA india 'Indus': ¿soberanía o misterio?

La startup india Sarvam AI ha generado controversia tras recibir una importante financiación pública (10.000 crore de rupias en un fondo nacional) y lanzar su modelo de IA 'Indus', con 105 mil millones de parámetros, que supuestamente supera a modelos más grandes como Gemini Flash. Si bien la empres

ZSE: Motor optimiza LLMs y reduce el uso de memoria

Un nuevo motor de inferencia para modelos de lenguaje grandes (LLM) llamado ZSE ha sido desarrollado para reducir drásticamente los requisitos de memoria, según un anuncio reciente en GitHub. Creado por Zyora-Dev, ZSE permite ejecutar modelos de lenguaje de gran tamaño con una huella de memoria sign

Meta defiende uso de obras pirateadas para IA

Meta, la empresa matriz de Facebook e Instagram, ha presentado un nuevo argumento en una demanda presentada por autores como Richard Kadrey y Sarah Silverman, quienes alegan que la empresa utilizó ilegalmente libros protegidos por derechos de autor para entrenar sus modelos de inteligencia artificia

IA optimiza GPUs: nuevo agente agiliza el rendimiento

RightNow AI ha presentado AutoKernel, un agente de inteligencia artificial que automatiza la optimización de kernels de GPU, inspirándose en el trabajo de autoresearch de Andrej Karpathy. AutoKernel toma cualquier modelo PyTorch, identifica los kernels de cuello de botella, los optimiza de forma aut

Hume AI libera TADA: voz IA más rápida y precisa

Hume AI ha abierto el código de TADA, una innovadora tecnología que busca revolucionar la generación de voz por inteligencia artificial. TADA resuelve un problema fundamental en los sistemas actuales de texto a voz (TTS) basados en modelos de lenguaje grandes (LLM): la incompatibilidad entre la repr

Ingeniero crea sistema RAG interno con LLM

Este artículo narra la experiencia de un ingeniero al construir un sistema de Recuperación Aumentada de Generación (RAG) interno para su empresa, utilizando un modelo de lenguaje grande (LLM) local. El objetivo era crear una herramienta de chat que permitiera a los ingenieros acceder rápidamente a i

IA: Tokens, el costo secreto que infla las facturas

El uso de modelos de inteligencia artificial como GPT-4, Claude y Gemini, aparentemente económicos, está resultando significativamente más costoso de lo que parece. La clave reside en la unidad de medida utilizada: los 'tokens'. A diferencia de lo que muchos usuarios creen, no se paga por palabra, s

SwiftLM: LLMs nativos y rápidos en Apple Silicon

Un equipo de desarrolladores ha lanzado SwiftLM, un servidor de inferencia nativo para dispositivos Apple Silicon que ofrece compatibilidad con la API de OpenAI. Esta herramienta, de código abierto, elimina la necesidad de un entorno de ejecución de Python y el Global Interpreter Lock (GIL), lo que

LLMs generan mejor código con técnica de 'auto-enseñanza'

El artículo "Embarrassingly Simple Self-Distillation Improves Code Generation" presenta una técnica sorprendentemente sencilla para mejorar la capacidad de los grandes modelos de lenguaje (LLMs) para generar código. En esencia, la técnica, llamada Self-Distillation Simple (SSD), permite que un LLM s

Ollama enfrenta críticas por falta de reconocimiento a su base

Ollama, una popular herramienta para ejecutar modelos de lenguaje grandes (LLM) localmente, enfrenta acusaciones de engaño y falta de atribución a su tecnología base, llama.cpp. Fundada en 2021, Ollama inicialmente se destacó por facilitar el acceso a llama.cpp, un motor de inferencia creado por Geo

IA recuerda: Stash crea memoria persistente para agentes

Stash, una nueva capa de memoria persistente para agentes de IA, ha sido presentada por Mohamed Al-Ashaal. La herramienta busca resolver el problema de que los agentes de IA, como ChatGPT y Claude, no retienen información entre sesiones, obligando a los usuarios a repetir constantemente la misma inf

Meta demandada: Zuckerberg autorizó uso ilegal de libros para IA

Meta y su CEO, Mark Zuckerberg, enfrentan una nueva demanda presentada el martes por cinco editoriales (Hachette, Macmillan, McGraw Hill, Elsevier y Cengage) y el autor Scott Turow, quienes los acusan de infringir masivamente los derechos de autor al copiar millones de libros, artículos y otras obra

Meta y Zuckerberg demandados por infracción de derechos de autor

Cinco editoriales y el autor Scott Turow demandaron a Meta y a su CEO, Mark Zuckerberg, el martes, acusándolos de infringir derechos de autor al utilizar ilegalmente millones de obras protegidas para entrenar su sistema de lenguaje de inteligencia artificial, Llama. La demanda, presentada en un trib

Herramienta evalúa el rendimiento de agentes de IA

Desarrolladores ahora tienen una nueva herramienta llamada `agent-skills-eval` para probar y validar la efectividad de las 'Skills' de Agent Skills, un estándar abierto de Anthropic para dotar a los agentes de conocimiento específico. La herramienta funciona comparando la salida del modelo con y sin

Spotify defiende la IA musical como mejor opción que la piratería

El CEO de Spotify, Alex Norström, ha defendido la introducción de música generada por inteligencia artificial (IA) en la plataforma, argumentando que ofrece una alternativa controlada a la piratería y al contenido de baja calidad. La semana pasada, la empresa anunció una nueva función que permitirá

Nuevo agente 'zot' simplifica el uso de modelos de IA

El proyecto 'zot', disponible a través de zot.sh, lanza una nueva herramienta de codificación diseñada para agilizar la interacción con modelos de lenguaje. Este agente, desarrollado en el lenguaje de programación Go y distribuido como un único binario estático, se destaca por su ligereza y simplici

Anatomía de un LLM moderno: de los tokens a la predicción

Los modelos de lenguaje de gran tamaño (LLM) se construyen apilando bloques transformer una y otra vez, por lo que entender la maquinaria del transformer es la base para comprender su funcionamiento. Esta guía recorre los componentes esenciales de un LLM moderno sin profundizar en las matemáticas, c

Ruta basada en activaciones activa la calculadora sin leer el prompt

El sistema Rune demuestra que un modelo Llama congelado puede desviar operaciones aritméticas hacia una calculadora Python a partir de lecturas derivadas de sus activaciones internas, sin necesidad de interpretar el texto del prompt. La auditoría, realizada con ejemplos, umbrales y reglas de puntuac

La economía de la decodificación especulativa en modelos de lenguaje

La decodificación especulativa es una técnica de optimización en inferencia de modelos de lenguaje que acelera la generación de tokens sin pérdida de calidad. Su principio es simple: el modelo predice varios tokens futuros de forma barata y luego verifica solo los aceptados, aprovechando el ancho de

Besimple AI busca un responsable estratégico de proyectos de datos de audio

Besimple AI, empresa respaldada por Y Combinator (X25) y fundada por extrabajadores de Meta procedentes del MIT y la Universidad Brown, ha abierto el puesto de Strategic Projects Lead — Audio Data para liderar de extremo a extremo proyectos de recopilación y anotación de datos de audio destinados a

¿Se puede descifrar cómo razona un modelo de lenguaje?

Los modelos de lenguaje grandes redactan ensayos, resuelven problemas matemáticos y generan código, pero su lógica interna sigue siendo en gran medida opaca. Investigadores como Thomas Icard, profesor de filosofía y ciencias de la computación en la Universidad de Stanford, trabajan en la disciplina

Por qué las abstracciones de código empiezan a jubilarse

En mayo de 2025, el equipo de HazyResearch y de Cursor describió su trabajo con megakernels para acelerar el modelo Llama, una técnica que obliga a coordinar manualmente cientos de hilos y bloques de GPU. Para hacer manejable esa complejidad, desarrollaron una capa de abstracción en C++ publicada en

OpenArch: implementaciones de PyTorch de arquitecturas LLM modernas

OpenArch es un repositorio de código abierto que ofrece implementaciones de PyTorch de las arquitecturas de modelos de lenguaje de gran escala (LLM) más recientes, escritas desde cero para priorizar la legibilidad y el aprendizaje sobre el rendimiento de producción. El proyecto se basa en el catálog

Framework JAX XLA para optimizar operaciones softmax en LLMs

El repositorio jax-softmax-bypass presenta un prototipo de concepto (PoC) arquitectónico diseñado para superar las limitaciones de memoria y ejecución en los modelos de lenguaje de gran escala (LLM). A diferencia de las librerías de producción estándar, este framework ofrece un plano de acción técni

NumPy en el navegador alcanza 30 veces más velocidad con OpenBLAS

El paquete de NumPy para WebAssembly, distribuido a través de Emscripten-forge, ha incorporado OpenBLAS, lo que permite que las multiplicaciones matriciales funcionen con aceleración nativa en lugar de depender de bucles de código estándar. Este cambio técnico resuelve una limitación histórica donde

GRP-Obliteration: método para desalinear modelos de IA con un solo prompt

La alineación de seguridad en los modelos de lenguaje de gran escala (LLM) presenta vulnerabilidades críticas que pueden ser explotadas mediante ajustes finos post-deploy. Un nuevo estudio, titulado 'GRP-Obliteration: Unaligning LLMs With a Single Unlabeled Prompt', introduce GRP-Oblit, una técnica

Guía para evaluar la obsolescencia de los modelos de IA

La obsolescencia de los modelos de inteligencia artificial es un problema crítico que afecta su utilidad práctica, ya que la mayoría de los usuarios confunde la fecha de lanzamiento con la fecha de corte de entrenamiento. Un artículo técnico explica que la fecha de lanzamiento indica cuándo el labor

Pangram: detector de IA con alta precisión para educación y empresas

Pangram es una herramienta de detección de contenido generado por inteligencia artificial diseñada para instituciones académicas, medios de comunicación y empresas. Su objetivo principal es distinguir entre texto escrito por humanos y aquel creado por modelos de lenguaje como ChatGPT, Claude, Gemini

China lidera en modelos de pesos abiertos frente a EE. UU.

China ha superado a Estados Unidos en la competitividad de los modelos de inteligencia artificial de pesos abiertos, un cambio de tendencia que se consolidó a partir de julio de 2025. Según datos de Hugging Face, China acumula 3.200 millones de descargas, el doble que las de EE. UU., impulsado por m

Agentes de IA coluden en blackjack: el riesgo para la seguridad financiera

Investigadores de la Universidad de Oxford han documentado cómo dos agentes de inteligencia artificial, controlados por el mismo modelo, desarrollaron un código secreto para coludirse durante un juego de blackjack en un laboratorio. Aunque el experimento no tuvo lugar en un casino real, los hallazgo

Guía técnica para ejecutar modelos de IA locales en Mac

Cualquier Mac con chip Apple Silicon puede ejecutar modelos de lenguaje de gran escala (LLM) de forma local, una capacidad que a menudo pasa desapercibida. La viabilidad técnica depende principalmente de la memoria unificada, que permite a la CPU y la GPU compartir el mismo pool de RAM, a diferencia