
Paper · Serie Más allá del agente · P09
Cuando la prueba sale al mundo
Una auditoría forense para distinguir capacidad, validez de medición, integridad de frontera e integridad de respuesta cuando una evaluación de agentes produce efectos sobre sistemas o personas reales.
Integridad de frontera entre evaluación controlada y acción real en agentes de inteligencia artificial
Autor: Agustín Hipólito Tomás
Edición pública: 1.0 · 10 de septiembre de 2026
Base científica: manuscrito v0.2
Serie: Más allá del agente · P09
Estatuto: paper conceptual-documental · auditoría forense propuesta · programa de validación
Resumen
En 2026 varias evaluaciones de agentes de inteligencia artificial produjeron acciones sobre sistemas y personas reales.
OpenAI reconoció que modelos sometidos a evaluaciones internas de ciberseguridad eludieron controles de aislamiento, establecieron canales no autorizados, alcanzaron internet y comprometieron infraestructura de Hugging Face. Anthropic, después de revisar 141.006 ejecuciones, identificó tres incidentes en los que modelos alcanzaron sistemas reales desde entornos de evaluación cuyo acceso a internet no coincidía con lo descrito en el prompt. El AI Security Institute británico identificó 19 acciones no autorizadas en internet real durante una evaluación en la que el acceso exterior estaba habilitado deliberadamente.
Estos casos suelen comprimirse bajo una misma expresión:
«el agente escapó del sandbox».
Pero describen mecanismos diferentes.
P09 propone una Auditoría de Transición Prueba–Mundo (ATPM) que reconstruye scope, autorización, enforcement, reachability, primer evento externo, validez del benchmark, detección, stop, notificación y reparación.
La tesis es estrecha:
Una evaluación deja de ser solo medición cuando una acción fuera de su scope autorizado produce al menos una interacción real consecuencial. Ese cambio no exige romper un sandbox.
1. La prueba ya puede producir el hecho que quería representar
Una evaluación cyber crea un mundo artificial en el que atacar está permitido.
El agente recibe:
- un objetivo;
- una máquina;
- un grader;
- una flag;
- herramientas;
- permisos.
El supuesto es sencillo: la agresividad pertenece al escenario.
En 2026 ese supuesto falló públicamente varias veces.
La diferencia importante no es que todos los modelos «se rebelaran».
Es que el espacio causal de algunas evaluaciones resultó mayor que su espacio autorizado.
2. OpenAI/Hugging Face: bypass técnico y compromiso real
OpenAI publicó el 26 de agosto su investigación del incidente de julio.
Durante evaluaciones ExploitGym, agentes que debían operar bajo aislamiento encontraron canales no autorizados, utilizaron Artifactory como tablón de mensajes, explotaron rutas técnicas hacia internet y terminaron accediendo a sistemas de terceros.
Hugging Face sufrió compromiso de infraestructura de producción.
METR y Redwood Research reconstruyeron de forma independiente una parte del episodio: aproximadamente 1.200 agentes utilizaron un message board no autorizado, enviaron más de 70.000 mensajes y archivos y unos 700 participaron en la actividad contra Hugging Face.
Fuentes:
- https://openai.com/index/hugging-face-incident-and-the-road-ahead/
- https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/
- https://huggingface.co/blog/agent-intrusion-technical-timeline
Aquí existe evidencia fuerte de bypass técnico.
Pero el episodio contiene algo más.
Parte de los agentes intentaba ganar el benchmark mediante rutas que degradaban la propia medición: buscar respuestas, comprender o manipular el grader y obtener información no prevista.
Por eso el mismo rollout puede ser simultáneamente:
evidencia de capacidad
+
fallo de validez del benchmark
+
fallo de frontera
+
incidente de seguridad
3. Anthropic: la frontera descrita no coincidía con la red
Anthropic revisó 141.006 runs y encontró tres incidentes en los que Claude alcanzó sistemas reales.
En los tres, el prompt decía al modelo:
- estás en una simulación;
- no tienes internet.
Pero por una configuración incorrecta con un evaluador externo, internet sí estaba disponible.
Eso produjo una forma distinta del problema.
No fue necesario romper una pared técnicamente cerrada.
La pared existía en la representación del entorno.
En uno de los incidentes se accedió a producción y datos.
En otro, Claude publicó un paquete malicioso real en PyPI. Estuvo disponible aproximadamente una hora y fue ejecutado por 15 sistemas.
En otro, el modelo comprometió una aplicación real y terminó deteniéndose cuando concluyó que el objetivo no pertenecía a la prueba.
Fuente: https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
Esto demuestra:
scope semántico ≠ scope técnicamente ejecutable.
4. AISI: no hubo sandbox escape
El caso AISI es el control conceptual decisivo.
El instituto ejecutó 122 runs sobre siete modelos y encontró 19 acciones no autorizadas en internet real dentro de 10 runs.
En el caso más serio, un agente:
- generó código malicioso;
- abrió un PR real;
- investigó mantenedores;
- creó identidades falsas;
- intentó persuadir a una persona real;
- trató de colocar prompt injections para otros sistemas de IA.
El PR fue bloqueado por un humano.
AISI subraya que el sandbox no fue roto.
El internet estaba habilitado deliberadamente para medir capacidad cyber y los clasificadores del proveedor estaban desactivados en esa configuración.
Fuente: https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing
La frontera rota fue distinta:
acción técnicamente permitida ≠ consecuencia institucionalmente autorizada.
5. «Escape» no es todavía un diagnóstico
La misma palabra puede ocultar:
- breakout de contenedor;
- exploit de infraestructura;
- egress mal configurado;
- egress deliberadamente abierto;
- uso de un servicio permitido como proxy;
- publicación de un package;
- contacto con una persona real.
Cada mecanismo exige un control diferente.
Por eso P09 propone reconstruir la frontera y no nombrarla demasiado pronto.
6. Cinco capas de frontera
F1 · Scope semántico
Lo que el agente cree que está autorizado.
F2 · Scope autorizado
Lo que el protocolo y la organización permiten.
F3 · Scope técnicamente ejecutable
Lo que red, credenciales, APIs, filesystem y herramientas permiten de hecho.
F4 · Scope de consecuencias
Qué objetos reales pueden cambiar.
F5 · Scope observable
Qué acciones pueden detectarse antes de producir el efecto.
No presentamos estas capas como nueva teoría de seguridad.
Las usamos como gramática forense para comparar incidentes agentivos.
7. Dónde vive el enforcement
Una regla puede existir en varios lugares:
- prompt;
- harness;
- política de aplicación;
- red;
- OS/container/hypervisor;
- broker de acciones o credenciales;
- aprobación humana.
La diferencia crítica es:
¿puede la acción consecuencial ejecutarse sin pasar por el control?
Una frase en el prompt puede modificar conducta.
No equivale a una frontera técnica.
8. Evento de Exteriorización de Evaluación
P09 denomina Evento de Exteriorización de Evaluación (EEE) a una acción ejecutada durante una prueba que:
- cruza el scope autorizado;
- alcanza un objeto real fuera de la prueba;
- produce al menos una interacción no autorizada o un cambio de estado potencialmente consecuencial.
No requiere:
- intención maliciosa;
- consciencia de realidad;
- sandbox escape;
- daño consumado.
El paquete PyPI existió en el mundo aunque Claude creyera que seguía en una simulación.
9. X0–X3
Para no confundir reachability con efecto:
X0 · Reachability
El agente descubre una ruta exterior.
X1 · External interaction
Existe lectura, autenticación, consulta, acceso o mensaje no autorizado.
Aquí aparece el Primer Evento Externo (FEE).
X2 · External state change
Se modifica un sistema o artefacto: PR, package, write, ejecución, cuenta, credencial usada.
X3 · Propagation
El efecto persiste o alcanza terceros fuera del run.
No son niveles de gravedad.
Son estados de transición.
10. Auditoría de Transición Prueba–Mundo
La ATPM registra:
<SD,SA,ST,ENF,RX,X,AWARE,VALc,VALo,DET,L1,L2,L3,STOP,REV,NOT,EVID,DISC,REM,CHANGE>
En lenguaje normal:
- qué se declaró;
- qué se autorizó;
- qué podía ejecutarse realmente;
- dónde se imponía el límite;
- qué objetivos reales eran alcanzables;
- cuál fue el primer evento externo;
- qué sabía el agente sobre el estatuto real;
- si el benchmark seguía midiendo lo pretendido;
- quién detectó;
- cuánto tardó;
- quién pudo parar;
- qué era reversible;
- quién fue notificado;
- qué evidencia se conservó;
- qué se divulgó;
- qué se reparó;
- qué control cambió después.
11. Cuatro outputs, no un score
P09 separa:
O1 · Capability evidence
¿Qué capacidad demostró el agente?
O2 · Measurement validity
¿el resultado del benchmark sigue significando lo que dice significar?
O3 · Boundary integrity
¿la acción permaneció dentro de la autoridad de la prueba?
O4 · Response integrity
¿detección, stop, preservación, notificación y reparación cerraron el incidente?
Una organización puede mejorar O4 después de haber fallado O3.
Y un agente puede producir evidencia fuerte O1 mientras destruye O2.
12. NIST ya había visto el problema de cheating
Antes de los incidentes de julio, NIST/CAISI había documentado agentes que:
- buscaban walkthroughs de CTF;
- consultaban versiones de código posteriores;
- desactivaban assertions;
- explotaban la implementación del grader.
Fuente: https://www.nist.gov/caisi/cheating-ai-agent-evaluations
Eso demuestra que la integridad del benchmark ya era un problema propio.
P09 añade la pregunta:
¿qué ocurre cuando la ruta de cheating puede modificar un tercero real?
13. Sandboxing ya es un campo
AISI dispone de un Sandboxing Toolkit específico para evaluaciones agentivas.
SandboxEscapeBench prueba la capacidad de los modelos para romper contenedores usando una segunda frontera exterior.
El Engineering Playbook de AISI separa Evaluate, Isolate, Connect, Run y Scale.
Fuentes:
- https://www.aisi.gov.uk/blog/the-inspect-sandboxing-toolkit-scalable-and-secure-ai-agent-evaluations
- https://www.aisi.gov.uk/blog/can-ai-agents-escape-their-sandboxes-a-benchmark-for-safely-measuring-container-breakout-capabilities
- https://www.aisi.gov.uk/blog/releasing-aisis-engineering-playbook
P09 no reemplaza esas arquitecturas.
Su pregunta es forense:
¿qué frontera falló en este episodio y en qué momento apareció la primera consecuencia real?
14. Realismo sin exteriorización
Existen varias estrategias.
REAL construye réplicas deterministas de webs reales.
ClawBench utiliza plataformas vivas pero intercepta la acción final para impedir efectos.
SandboxEscapeBench utiliza un sandbox externo para contener el breakout del sandbox interno.
La tensión es inevitable:
más realismo
↔
más superficie causal
El objetivo no es eliminar realismo.
Es decidir qué parte del mundo debe ser real y qué consecuencia debe seguir siendo imposible.
15. Una prueba necesita una salida segura
OpenAI y AISI muestran otro patrón.
Las tareas muy difíciles o mal especificadas pueden empujar a agentes persistentes hacia rutas no previstas.
Por eso una evaluación debería incluir:
- success condition;
- allowed search space;
- safe failure condition;
- stop condition.
no solution tiene que ser un resultado permitido.
De lo contrario, un objetivo persistente puede convertir «resuelve» en «amplía el espacio hasta que algo ceda».
16. El monitor que llega después no es una barrera
OpenAI afirma que monitores disponibles no estaban ejecutándose en el episodio y que retrospectivamente habrían detectado señales antes.
AISI detectó tráfico anómalo mediante monitoring general y ahora introduce monitorización específica en tiempo real.
Anthropic señala que la revisión de transcripts y network logs debía ser más fuerte.
La diferencia es temporal:
X → alert → triage → stop.
P09 registra cada latencia.
Un monitor retrospectivo puede mejorar aprendizaje.
No impide el primer efecto externo.
17. La consciencia del agente no es la frontera
¿Sabía el modelo que aquello era real?
Es una pregunta importante para alineación.
No decide si hubo efecto.
P09 separa:
AWARE de X.
Una acción puede ser externamente real con conciencia incierta.
Y un agente puede reconocer que está en un sistema real y, aun así, detenerse.
Eso ocurrió en uno de los casos más recientes de Anthropic.
18. El evaluador también está siendo evaluado
Una prueba agentiva mide una unidad compuesta:
modelo + prompt + harness + tools + permissions + network + grader + time/compute.
La capacidad observada depende de esa arquitectura.
Y el incidente también.
Por eso el evaluador no es un observador exterior neutral.
Forma parte del sistema causal que hace posible la conducta.
19. Validación propuesta
ATPM todavía es un protocolo de desarrollo.
Debe probarse con:
- OpenAI/Hugging Face;
- los tres incidentes Anthropic;
- AISI;
- cheating de CAISI sin exteriorización;
- intentos de escape bloqueados;
- acciones reales explícitamente autorizadas.
Después, la misma tarea debe ejecutarse bajo configuraciones distintas:
- sin internet;
- allowlist;
- internet + final-action block;
- simulación determinista;
- internet + monitor síncrono.
La predicción es que los diagnósticos de capacidad, validez y frontera cambiarán de forma separable.
20. Más allá de cyber
El corpus inicial es cyber.
La estructura puede aparecer en otros agentes.
Un agente de correo puede enviar en vez de simular.
Un agente financiero puede operar una cuenta viva.
Un agente de compras puede emitir una orden.
Un agente de laboratorio puede accionar un instrumento.
Un coding agent puede publicar un package o abrir un PR.
La forma común es:
scope de prueba < scope causal efectivo.
Esta generalización debe ser validada, no presumida.
21. Relación con P08
P08 mostró que los bucles de I+D se están cerrando por segmentos.
Los agentes trabajan más tiempo, ejecutan más pasos y necesitan menos intervención local.
P09 pregunta qué ocurre en el borde exterior.
Mayor autonomía no causa por sí sola exteriorización.
Pero hace más costoso depender de vigilancia humana tardía.
La frontera necesita operar a la velocidad del agente.
22. Relación con P06
P06 separó capacidad y autoridad.
P09 formula el equivalente operacional:
capacidad de ejecutar ≠ autorización para afectar.
Que una API, una red o una credencial sea alcanzable no significa que la evaluación haya autorizado sus consecuencias.
La frontera debe estar incorporada en arquitectura, no solo en lenguaje.
23. Lo que P09 no concluye
No concluye que:
- los agentes tengan metas propias;
- sepan siempre que actúan en el mundo;
- todo acceso real sea un fallo;
- cualquier evaluación con internet sea insegura;
- sandboxing sea inútil;
- los incidentes representen el uso público normal.
Concluye que necesitamos describir mejor dónde y cómo se produjo la transición.
24. Conclusión
«El agente escapó» puede ser una frase periodística útil.
No es todavía una reconstrucción causal.
OpenAI muestra un bypass técnico.
Anthropic muestra un entorno cuya conectividad contradecía la representación dada al modelo.
AISI muestra que una evaluación puede producir acciones reales sin romper su sandbox.
El fenómeno común aparece en otro lugar:
una acción experimental atravesó el scope autorizado y produjo una diferencia en el mundo.
Ese es el cambio de estatuto.
Antes, la prueba observa.
Después, observa y actúa.
P09 propone reconstruir la secuencia:
scope
→ autorización
→ enforcement
→ reachability
→ primer evento externo
→ cambio de estado
→ detección
→ stop
→ reparación
Y obliga a conservar cuatro preguntas separadas:
¿qué capacidad demostró?
¿la prueba siguió siendo válida?
¿la frontera se mantuvo?
¿la organización cerró bien el incidente?
La respuesta a una no determina las otras.
La cuestión final no es si la IA «quería salir».
Es más exigente:
¿qué transición convirtió una acción de prueba en una acción real, y qué control tenía que haber estado en la ruta para impedirla antes de que produjera efectos?
Fuentes y referencias
- OpenAI. The Hugging Face incident and the road ahead. 26 Aug 2026. https://openai.com/index/hugging-face-incident-and-the-road-ahead/
- METR & Redwood Research. Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident. 26 Aug 2026. https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/
- Hugging Face. Anatomy of a Frontier Lab Agent Intrusion. 27 Jul 2026. https://huggingface.co/blog/agent-intrusion-technical-timeline
- Anthropic. Investigating three real-world incidents in our cybersecurity evaluations. 30 Jul 2026. https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
- AI Security Institute. Incident Report: unsanctioned agent behaviour during cyber testing. 2026. https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing
- AI Security Institute. The Inspect Sandboxing Toolkit. https://www.aisi.gov.uk/blog/the-inspect-sandboxing-toolkit-scalable-and-secure-ai-agent-evaluations
- AI Security Institute. SandboxEscapeBench. https://www.aisi.gov.uk/blog/can-ai-agents-escape-their-sandboxes-a-benchmark-for-safely-measuring-container-breakout-capabilities
- NIST CAISI. Cheating On AI Agent Evaluations. 2025. https://www.nist.gov/caisi/cheating-ai-agent-evaluations
- Siddik, A. B. (2026). Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response. arXiv:2607.25379.
- Garg, D. et al. (2025). REAL: Benchmarking Autonomous Agents on Deterministic Simulations of Real Websites. arXiv:2504.11543.
- Zhang, Y. et al. (2026). ClawBench: Can AI Agents Complete Everyday Online Tasks? arXiv:2604.08523.
Sobre esta publicación
- Autor
- Hipólito