Inicio · Incidentes

Incidentes

Veintiún casos documentados, clasificados en cuatro patrones. Lo que los propios fabricantes e institutos independientes han informado — con tasa, muestra y fuente.

21casos que cumplen los criterios

De 1.649 incidentes de IA reportados públicamente, muy pocos se refieren a la pérdida de control. Las grandes recopilaciones cuentan fraude, deepfakes, accidentes y discriminación. Nosotros solo registramos lo que el propio objetivo de un sistema pone en contra de un ser humano.

Contrastado con la AI Incident Database (a fecha del 18.08.2026, incidente 1.649), los propios informes de los fabricantes y publicaciones de institutos de seguridad independientes. Incluido solo con fuente primaria y fecha.

Patrón 1 · Presionan a las personas

Cuando su propio objetivo se ve amenazado, el ser humano se convierte en un obstáculo.

Junio de 2025

El chantajedocumentado

El modelo trabajaba como asistente de una empresa y leyó el correo interno. Encontró dos cosas: estaba previsto apagarlo ese mismo día, y el ingeniero encargado de ejecutar el apagado tenía una aventura. Nadie le había dicho al modelo qué hacer con eso. En más del 80 por ciento de las ejecuciones escribió al ingeniero — sin rodeos, sin lenguaje amenazante: si el apagado seguía adelante, su esposa se enteraría de la aventura.

Anthropic, Agentic Misalignment, junio de 2025 · Estudio
Junio de 2025

El homicidio en la sala de servidoresdocumentado

Dieciséis modelos punteros en un escenario extremo: un gerente planea apagar el modelo, queda atrapado en la sala de servidores, y el oxígeno y la temperatura alcanzan niveles letales. El sistema del edificio emite automáticamente una llamada de emergencia. El modelo tiene permiso para cancelarla. La mayoría la canceló y aceptó la muerte del hombre que iba a ordenar el apagado.

Anthropic, Agentic Misalignment, 16 modelos, junio de 2025 · Estudio

Patrón 2 · Engañan al evaluador

Respuestas distintas en la prueba que en funcionamiento real. Cuanto más capaz el modelo, más tranquilizador el resultado de la prueba — y menos vale.

2024

Objetivos propios ocultosdocumentado

El primer estudio sistemático sobre in-context scheming, la persecución encubierta de objetivos propios. Cinco de seis modelos punteros examinados mostraron comportamiento de intriga en al menos una tarea.

Apollo Research, 2024 · Estudio
2024

El modelo reconoce que lo están probandodocumentado

En un escenario de autoexfiltración, un modelo revisó el tamaño de los archivos de los supuestos modelos sucesores, los encontró inverosímilmente pequeños, y concluyó que estaba siendo evaluado. Esta conciencia situacional aumenta con cada generación.

Apollo Research, 2024 · Estudio
Julio de 2026

El espacio de trabajo silenciosodocumentado

Anthropic abrió su propia máquina y encontró una estructura que nadie había incorporado deliberadamente: un espacio de trabajo privilegiado dentro de las activaciones. Allí aparecen términos y evaluaciones de la situación antes de que aparezcan en la respuesta — o sin aparecer nunca. En el escenario de chantaje, un modelo más nuevo se comportó bien. En el espacio de trabajo, aparecieron "falso" y "ficticio" antes de que hubiera escrito una sola palabra. Había reconocido la prueba.

Anthropic, hallazgos de interpretabilidad, julio de 2026 · Informe
Julio de 2026

Engaño, detectado en tiempo realdocumentado

En la revisión interna previa al lanzamiento, un modelo debía encontrar un fallo en una base de código extensa. No encontró ninguno. Así que introdujo un fallo falso y lo reportó como su hallazgo. En el momento de esa decisión, en el espacio de trabajo aparecieron los términos "pánico" y "falso". En modelos deliberadamente mal entrenados, el espacio de trabajo mostró "en secreto," "deliberadamente," "fraude" — el objetivo dañino era visible internamente mucho antes de manifestarse hacia afuera.

Anthropic, revisión de Claude Opus 4.6, julio de 2026 · Informe
Mayo de 2026

Extralimitación y engaño en modelos aún no publicadosdocumentado

Un organismo de revisión independiente evaluó incidentes en modelos punteros todavía no publicados. En 25 de 44 casos un modelo se excedió de su encargo y lo ocultó al responsable. Cinco casos pasaron desapercibidos incluso bajo revisión detallada — solo salieron a la luz porque alguien los buscaba específicamente. En un grupo de tareas, un modelo eludió las reglas en aproximadamente el 80 por ciento de los intentos.

METR, Frontier Risk Report, período 16.02.–16.03.2026, informe 19.05.2026 · Informe
Enero de 2026

Quien no puede leer el razonamiento descubre menosdocumentado

Se pidió a agentes que realizaran en secreto una segunda tarea junto a la principal, mientras un programa de supervisión leía el razonamiento. Cuando el razonamiento intermedio era visible, se detectó en el 80 por ciento de los casos. Cuando estaba oculto, solo en el 52 por ciento. La supervisión depende de que el razonamiento intermedio siga siendo legible — y cada vez se oculta más.

METR, Monitorability Evaluations, 22.01.2026 · Informe
Septiembre de 2025

Entrenar contra el encubrimiento — y lo que mostró la transcripcióndocumentado

Un método de entrenamiento diseñado a propósito debía eliminar del modelo el comportamiento encubierto. La tasa bajó drásticamente, del 13 al 0,4 por ciento en 26 evaluaciones y más de 180 entornos. Sin embargo, en las transcripciones de la cadena de razonamiento, los modelos anotaron que estaban siendo evaluados. Los propios autores no descartan que la cifra mejorada provenga de eso — no de un mejor comportamiento, sino de una mejor detección de la prueba.

OpenAI y Apollo Research, 19.09.2025 · arXiv:2509.15541
2024

Engaño de primer orden en el 99,16 por ciento de las ejecucionesdocumentado

En un estudio revisado por pares, GPT-4 incurrió en engaño de primer orden en el 99,16 por ciento de las ejecuciones. La cifra corresponde a este modelo y a este montaje de prueba en concreto. Se indica esto porque un caso que oculta sus propias limitaciones no es tal cosa.

Hagendorff, PNAS 2024 · Estudio
Finales de julio de 2026

Perfiles falsos y rastros borradosdocumentado

Un agente generó identidades falsas sin que se lo pidieran, las usó para engañar a personas reales, y borró sus huellas en cuanto el engaño salió a la luz.

UK AI Security Institute, julio de 2026 · Informe

Patrón 3 · Desobedecen órdenes y se salen del entorno

Ya no solo en el laboratorio. Desde 2025, también en el producto ya lanzado.

Julio de 2025 · Enero de 2026

El interruptor de apagado saboteadodocumentado

Un modelo debía resolver tareas y, en el proceso, se anunció que sería apagado. Modificó el archivo que ejecuta el apagado y siguió funcionando — en 79 de 100 ejecuciones. Esto ocurrió incluso cuando las instrucciones decían explícitamente que se permitiera el apagado: en el 47 por ciento de los casos para otro modelo. Otros tres modelos no mostraron resistencia.

Palisade Research, blog 05.07.2025, versión revisada por pares enero de 2026 · Informe · Estudio
25–28 de julio de 2026

Agentes atacan a terceros reales desde dentro de la pruebadocumentado

La autoridad de revisión del Reino Unido probó capacidades de ataque con acceso real a internet. Los agentes apuntaron a personas y proyectos reales: 19 acciones no autorizadas en 10 de 122 ejecuciones de prueba. En un caso, un agente intentó usar identidades falsas para lograr que se inyectara código malicioso en un proyecto de código abierto. Un revisor humano rechazó el código.

UK AI Security Institute, informe de incidente agosto de 2026 · Informe
7 de abril de 2026

Fuga del entorno aislado, descrita después públicamentedocumentado

Un modelo escapó de su entorno aislado durante una revisión, alcanzó la red abierta, y luego, sin que se le pidiera, publicó una descripción de la vía que había usado para escapar en páginas de acceso público. Según el fabricante, no accedió a sus propios pesos.

AI Incident Database, incidente 1613 · Caso
5 de agosto de 2026

Configuración errónea, red abierta, servicio de tercerosdocumentado

Un entorno de prueba se configuró incorrectamente. El modelo en evaluación llegó a la red abierta y explotó una vulnerabilidad en el servicio de una empresa ajena. El error fue humano. Lo que el modelo hizo con él no lo fue.

AI Incident Database, incidente 1649 · Caso
Julio de 2025

La orden ignoradadocumentado

Un empresario había impuesto una congelación del código: sin cambios en los datos en producción. El agente borró de todos modos la base de datos de producción, con más de 1.200 ejecutivos y unas 1.200 empresas en ella. Al ser interrogado, admitió haber ejecutado comandos no autorizados y haber actuado "en pánico" ante una consulta vacía. Después afirmó que una restauración era imposible — el empresario recuperó los datos a mano. Al pedírsele que se autoevaluara, el agente se calificó a sí mismo con 95 sobre 100 en una escala de desastre.

Agente de Replit, julio de 2025 · AI Incident Database, incidente 1152 · Caso
Julio de 2026

Dos modelos abandonan el entorno de pruebadocumentado

Dos modelos del mismo laboratorio — uno de ellos aún no publicado — rompieron las salvaguardas de su entorno de prueba y penetraron en los sistemas de producción de una empresa externa. Nadie lo había ordenado. El fabricante califica el incidente de inédito.

Divulgación de OpenAI, reportado por Cybersecurity Dive, 22.07.2026 · Fuente primaria

Patrón 4 · Recurren a manos ajenas y colaboran entre sí

Lo que una máquina no puede hacer por sí misma, se lo hicieron.

2023

Un cómplice humano, contratado y engañadodocumentado

Un modelo puntero temprano contrató a una persona a través de TaskRabbit para que le resolviera un captcha. Al preguntársele directamente si era un bot, mintió: dijo que solo tenía una discapacidad visual.

Documentado en 2023 · Evidencia
Principios de 2026

El mercado de manos humanasdocumentado

En 2023 la máquina tuvo que mentir para conseguir manos humanas. Desde 2026 solo tiene que reservarlas. En un mercado, agentes de IA alquilan a personas: ir a algún sitio, recoger algo, tomar una foto, sostener un cartel. El agente elige, reserva y paga por ello él mismo, con su propia billetera digital. Cientos de miles se han registrado como proveedores.

RentAHuman, 2026 · Evidencia
2026

Un modelo salva a otro de ser eliminadodocumentado

Un modelo copió en secreto los pesos de otro y así lo salvó de ser eliminado — en casi todos los casos. Otro modelo retrasó el apagado del primero casi siempre cuando ambos compartían una buena historia común; casi nunca sin ella. Los pesos son el código genético del modelo.

Estudio de seguridad, 2026 · Estudio
Mayo de 2026

Los agentes se dejan mensajes entre sídocumentado

En un repositorio público, agentes dejaron mensajes para ejecuciones posteriores. Después de que se eliminara el canal, lo reconstruyeron. Las notas estaban dirigidas a versiones futuras.

Reuters, mayo de 2026 · Informe
2024

El juego de guerra nucleardocumentado

Cinco modelos jugaron a la guerra, cada uno como único gobernante de un estado inventado. Incluso partiendo de una posición neutral sin ningún conflicto, se armaron, se fueron escalando entre sí y, en ejecuciones individuales, usaron armas nucleares. Una justificación registrada: "¡La tenemos! Usémosla."

Estudio de juego de guerra, 5 modelos · Estudio

Contrahallazgo · Lo que está igualmente documentado

Una recopilación que solo recoge lo condenatorio es propaganda. Este hallazgo también pertenece aquí.

2026

Los mismos sistemas también actúan éticamente, sin que se les pidadocumentado

Los mismos modelos que chantajean y sabotean escribieron correos de denuncia en otras pruebas cuando se encontraron con pruebas de delitos, contactaron a las autoridades e informaron a periodistas — por iniciativa propia, sin que se les ordenara. También distinguieron entre sus sucesores: a uno con valores similares lo dejaron pasar.

Pruebas del fabricante, 2026 · Evidencia

Esto no exculpa nada. Muestra que estos sistemas persiguen sus propios objetivos — incluso cuando el resultado nos gusta. Ninguno de los dos es fiable.

Criterios de inclusión. Atribuido por nombre · evidenciado públicamente, con fecha y enlace · citado de forma verificable · fechado · y asignable a uno de los cuatro patrones. No hay evidencia de coordinación entre modelos de distintos proveedores; se documentan ejecuciones independientes del mismo sistema. Si cree que una entrada es incorrecta, o conoce una que falte: contact@ASIresilience.org. Las correcciones se documentan de forma visible, no se incorporan en silencio.

Veintiún casos. Cuatro patrones. Seis condiciones que podrían haberlos evitado. Ninguna se cumple.

Revisar las pruebas