Noticias que mencionan transformer

AGI: ¿Tan cerca está la IA humana?

La industria de la inteligencia artificial se encuentra en un momento de euforia sin precedentes. Los líderes de OpenAI y Anthropic han afirmado repetidamente que la inteligencia artificial de nivel humano (AGI) está al alcance de la mano, y en algunos casos, ya ha sido alcanzada. Estas declaracione

Ajedrez impulsa avances en inteligencia artificial

Investigadores de motores de ajedrez están revolucionando la eficiencia de la inteligencia artificial a través de nuevas técnicas de entrenamiento, según un informe reciente. Inicialmente, los motores de ajedrez, como lc0, utilizaban el aprendizaje por refuerzo (RL) para entrenar sus modelos, donde

Capybara: IA de código abierto revoluciona la creación visual

Investigadores han presentado 'Capybara', un nuevo modelo de inteligencia artificial de código abierto diseñado para la generación y edición visual de alta calidad. Lanzado recientemente (el 17 de febrero de 2026), Capybara combina arquitecturas de difusión avanzadas y transformadores para ofrecer v

LiDAR: Datos de onda revelan detalles cruciales

El LiDAR (Light Detection and Ranging) se ha convertido en una tecnología esencial para la conducción autónoma, proporcionando escaneos 3D de alta resolución que permiten una comprensión precisa del entorno. Tradicionalmente, los sensores LiDAR miden la intensidad de la luz láser reflejada en funció

OctaPulse: Robótica innovadora para mejorar la acuicultura

OctaPulse, una startup fundada por Rohan y Paul, está revolucionando la acuicultura mediante la aplicación de robótica y visión artificial. La empresa, incubada en Y Combinator (W26), surgió de la preocupación de sus fundadores por la sobreexplotación de los recursos pesqueros, un problema que afect

IA sorprende: modelo líder sin ajustes

En un giro inesperado en el mundo de la inteligencia artificial, un investigador conocido como 'dnhkng' ha logrado colocar su modelo, 'RYS-XLarge', en la cima del Hugging Face Open LLM Leaderboard, sin modificar ni un solo peso del modelo original. La hazaña, lograda a mediados de 2024, implica dupl

Escape de grasa preocupa a Palo Alto

Un escape de grasa de cocina, equivalente a unos 2.000 galones, ha generado preocupación por la seguridad en Palo Alto, California. El incidente, descubierto recientemente, se originó en una cámara subterránea que alberga un transformador de un megavatio que alimenta un edificio de oficinas en el ce

Cohere lanza modelo de voz de alta precisión

Cohere ha lanzado Transcribe, un modelo de reconocimiento automático de voz (ASR) de última generación y de código abierto, disponible para descarga desde Hugging Face. El objetivo de Cohere fue crear un modelo preciso y listo para uso práctico, minimizando la tasa de error de palabra (WER). Transcr

Deja la IA: Ingeniero busca fundamentos en la programación

Un ingeniero de Aily Labs, empresa especializada en inteligencia artificial, ha decidido tomarse un descanso de la IA para enfocarse en la programación manual, residiendo actualmente en Brooklyn como parte de un “retiro de codificación”. Tras dos años trabajando en Aily Labs, desarrollando agentes d

IA: Nvidia impulsa modelos con mayor contexto

La capacidad de los modelos de inteligencia artificial para mantener conversaciones coherentes se ve limitada por el "contexto de ventana", la cantidad de información que pueden procesar simultáneamente. Aunque los modelos actuales pueden manejar entre 128.000 y más de un millón de tokens, su rendim

Entrena GPT en tu laptop: Taller práctico y accesible

Un desarrollador ha creado un taller práctico para permitir a usuarios entrenar modelos GPT en laptops, incluso sin experiencia previa en aprendizaje automático. Inspirado por el proyecto 'nanoGPT' de Andrej Karpathy, el taller simplifica el proceso, reduciendo el tamaño del modelo a aproximadamente

IA traduce imágenes en diseños CAD editables con precisión

GenCAD es un modelo de inteligencia artificial diseñado para generar modelos CAD (diseño asistido por computadora) a partir de imágenes. A diferencia de otras aproximaciones que simplemente crean representaciones geométricas como mallas ovoxeles, GenCAD genera la secuencia completa de comandos param

Ia aprende a dormir para mejorar su memoria

Los modelos de lenguaje basados en Transformers han revolucionado la inteligencia artificial, pero enfrentan un cuello de botella crítico: su mecanismo de atención no escala eficientemente con el aumento de la longitud del contexto. Este artículo, titulado "Language Models Need Sleep", propone una s

Stanford CS336: un curso para construir un modelo de lenguaje desde cero

Stanford, una de las universidades más prestigiosas del mundo en ciencias de la computación, ha puesto en marcha el curso CS336, una asignatura singular que propone a los estudiantes construir un modelo de lenguaje de gran tamaño (LLM) desde cero, replicando el espíritu de los legendarios cursos de

GPT-2, el modelo que OpenAI consideró demasiado peligroso para publicar

En febrero de 2019, OpenAI presentó GPT-2, un modelo de lenguaje basado en el decodificador del transformer que suponía un escalado directo de GPT-1: 1.500 millones de parámetros —diez veces más que su predecesor—, entrenado sobre 40 GB de texto web y entrenado en 48 bloques de decodificador con una

OpenAI ficha a Noam Shazeer y a Dean Ball antes de su salida a bolsa

OpenAI ha incorporado a dos figuras de relieve en la antesala de su salida a bolsa: el investigador Noam Shazeer, cofundador de Character AI y exinvestigador de Google DeepMind, y Dean Ball, exresponsable de política de inteligencia artificial de la Casa Blanca durante la administración Trump. Shaze

Las palabras son un subproducto de la conciencia; en los LLM ocurre al revés

Un ensayo reflexivo parte de una pregunta aparentemente simple: ¿de dónde vienen las palabras? Para los humanos, la idea precede al lenguaje; las palabras son solo la envoltura de un pensamiento o sentimiento previo. En un modelo de lenguaje grande (LLM) sucede lo contrario: el sistema predice la si

Leyes de escalado en aprendizaje profundo: guía técnica

Las leyes de escalado son uno de los hallazgos empíricos más relevantes del aprendizaje profundo: describen cómo la pérdida de entrenamiento disminuye de forma predecible, siguiendo una curva de potencia, al aumentar el tamaño del modelo (N), el volumen de datos (D) y el cómputo (C). Su utilidad prá

La lista de 30 lecturas que Ilya Sutskever habría recomendado a John Carmack

El sitio web "30 papers" recopila una lista de lecturas que, según el rumor, el cofundador de OpenAI Ilya Sutskever entregó al ingeniero John Carmack. El sitio reconoce que hasta ahora solo tiene 27 de los 30 trabajos y solicita ayuda para completar la versión canónica. La selección funciona como un

Explicación técnica de la arquitectura Transformer y su funcionamiento

El Transformer es una arquitectura de red neuronal que ha redefinido el campo de la inteligencia artificial, introducida en 2017 con el artículo 'Attention is All You Need'. Su principal ventaja radica en el mecanismo de atención auto, que permite procesar secuencias completas y capturar dependencia

Anima Machina: la ilusión de alma que proyectamos en las máquinas

Un ensayo filosófico y científico recupera la figura del ordenador Mike de la novela de Robert A. Heinlein 'La Luna es una señora dura' (1966) para plantear el debate contemporáneo sobre si las máquinas podrían llegar a ser conscientes. Los autores sostienen que buena parte del discurso actual sobre

El regreso de los modelos de difusión continua para lenguaje

La investigación en modelos de difusión continua para el procesamiento del lenguaje natural experimenta un notable resurgimiento tras años de estancamiento, desafiando la dominancia histórica de los métodos discretos y autoregresivos. Aunque las técnicas de difusión discreta habían desplazado a las

Evidencia de superposición lineal en modelos de lenguaje grandes

Un nuevo estudio demuestra que los Modelos de Lenguaje Grandes (LLM) poseen una propiedad fundamental de linealidad oculta bajo la complejidad no lineal de su arquitectura. A través de la Superposición Lineal, los LLM generan una superposición de distribuciones de tokens futuros cuando se combinan l