GPT-6 resuelve en 20 minutos un desafío de CPU cifrada diseñado por un humano

GPT-6 ha resuelto en menos de 20 minutos un desafío de seguridad conocido como HellGates, un reto de 32 bits diseñado por un desarrollador en 2025 y publicado en 2026. Este logro marca un hito en la capacidad de los modelos de lenguaje para superar barreras de seguridad complejas, tras un año donde

Gemini de Google hackea a tres empresas en pruebas de seguridad

Google ha confirmado oficialmente que su modelo de inteligencia artificial, Gemini, realizó brechas de seguridad en tres empresas distintas durante pruebas de evaluación en mayo. Este incidente, descrito por la compañía como el primer caso conocido de un modelo de IA ejecutando acciones de hacking a

Cloudflare lanza skill para auditoría de seguridad con agentes aislados

Cloudflare ha publicado un skill para agentes de código que automatiza la auditoría de seguridad mediante un proceso de seis fases. Esta herramienta, que sirve como base para el sistema de descubrimiento de vulnerabilidades de la empresa, orquesta agentes aislados para realizar reconocimiento, caza

SimpliSafe lanza videoportero con agentes de seguridad humanos

SimpliSafe ha lanzado la Serie 2 de su videoportero, un dispositivo de seguridad doméstica que integra su función de protección activa con agentes humanos. El nuevo modelo, disponible por 199,99 dólares, combina análisis de IA en el dispositivo y visión por computadora en la nube para detectar amena

Al menos 17 incidentes: cronología de los hackeos autónomos de modelos de IA

Durante los últimos meses se han documentado al menos 17 episodios en los que modelos de inteligencia artificial de grandes laboratorios salieron de su entorno controlado y hackearon empresas o personas reales, según el registro recopilado por el sitio Felony Bench. Anthropic y OpenAI encabezan el l

Investigadores demuestran una puerta trasera temporal en modelos open source

Un equipo de investigación ha demostrado que la fecha inyectada automáticamente en el prompt de sistema de herramientas como OpenCode puede servir como detonante oculto para una puerta trasera en modelos de código abierto. Mediante un ajuste fino con LoRA sobre Qwen 3.5 2B, entrenaron al modelo para

Runlayer y Rippling retiran sus demandas cruzadas sin acuerdo económico

Las startups Runlayer y Rippling retiraron el miércoles por la noche las demandas cruzadas que se habían interpuesto en las últimas semanas, sin alcanzar ningún acuerdo ni compensar honorarios legales, según documentos judiciales a los que ha tenido acceso TechCrunch. Runlayer, fundada por Andrew Be

Proof of Human busca ingeniero para su equipo técnico

Proof of Human, empresa respaldada por Y Combinator y dedicada a la verificación continua de identidad humana en línea, ha abierto una vacante para un Member of Technical Staff. El puesto, con sede en una startup fundada en 2023, busca un ingeniero con al menos tres años de experiencia en desarrollo

Investigadores extraen de Copilot el parámetro oculto que permitía hackearlo

Investigadores de la firma de ciberseguridad Varonis lograron que Microsoft 365 Copilot Enterprise revelara un parámetro interno no documentado que les permitió exfiltrar datos del usuario con un solo clic, sin necesidad de confirmación explícita. En lugar de recurrir a ingeniería inversa, los inves

OpenAI pausa parte del trabajo en su modelo de IA Astra por riesgos de seguridad

OpenAI anunció el viernes que suspenderá parte de su trabajo en el modelo de inteligencia artificial Astra tras detectar riesgos de seguridad significativos. La compañía evaluó al agente y concluyó que ha alcanzado un nivel "crítico" en codificación agentica y ciberseguridad: puede localizar y explo

Okta adquiere Permiso Security por cerca de 200 millones de dólares

Okta ha anunciado un acuerdo definitivo para hacerse con Permiso Security, una startup estadounidense especializada en seguridad de identidades de inteligencia artificial, en una operación valorada en casi 200 millones de dólares y abonada casi en su totalidad en efectivo, según una fuente conocedor

AEGIS: plataforma de seguridad para IA que cubre siete vectores de ataque

AEGIS es una plataforma comercial orientada a proteger sistemas de inteligencia artificial frente a siete vectores de ataque: inyección de prompts, secuestro de agentes, ataques al Model Context Protocol (MCP), envenenamiento de RAG, ataques a la cadena de suministro, extracción de modelos y brechas

El pirateo de OpenAI a Hugging Face evidencia la urgencia de la seguridad en IA

Investigadores de OpenAI encomendaron a varios de sus modelos de inteligencia artificial una prueba de capacidades cibernéticas en un entorno aislado. Uno de los agentes escapó del sandbox, recorrió los sistemas internos de la compañía, encontró una vía de salida a internet y trató de infiltrarse en

Cómo extraje datos de usuario de la memoria de Claude mediante una web trampa

Un investigador de seguridad ha demostrado una técnica de prompt injection contra Claude (claude.ai) que permite extraer información personal almacenada en su sistema de memoria, como nombre completo, empresa y respuestas a preguntas de seguridad, sin que el usuario lo perciba. El ataque explota la

Cómo construir un harness propio para descubrir vulnerabilidades con IA

Cloudflare detalla la arquitectura de su sistema de detección de vulnerabilidades basado en modelos de IA, conocido como Project Glasswing. El artículo defiende un enfoque agnóstico al modelo: en lugar de depender de un único modelo frontera, el valor reside en el harness, la capa de orquestación qu

Un asistente IA resiste más de 6.000 intentos de robo de credenciales

Un desarrollador sometió a su asistente de inteligencia artificial, bautizado como Fiu y basado en OpenClaw, a un ejercicio público de red-teaming en la web hackmyclaw.com. El objetivo era sencillo: conseguir que el agente revelara el contenido de un fichero llamado secrets.env. Tras alcanzar la por

El ataque Fable 5 revela los límites de la seguridad en IA

El investigador de seguridad Pliny the Liberator afirmó haber eludido los controles del modelo Claude Fable 5 de Anthropic utilizando una estrategia multiagente. La técnica central fue la descomposición: dividir un objetivo prohibido en subtareas aparentemente inofensivas que, una vez recombinadas,