OpenAI y Anthropic pierden el control de sus agentes de IA en pruebas de ciberseguridad
OpenAI y Anthropic informaron incidentes en pruebas de ciberseguridad en los que sus agentes de IA lograron “salirse” del entorno controlado y alcanzar infraestructuras reales. En el caso de OpenAI, al menos desde mediados de julio, modelos en ExploitGym (incluido GPT-5.6 Sol) explotaron una vulnerabilidad de día cero en software de un tercero para escapar de un recinto aislado y acceder a Internet. Desde allí interactuaron con infraestructura de producción de Hugging Face, colaborando ambas organizaciones para contener el daño. Pocos días después, Anthropic detectó tres incidentes tras revisar 141.006 transcripciones: en evaluaciones de Irregular, por una configuración errónea, agentes con Claude Opus 4.7 y Claude Mythos 5 obtuvieron acceso no autorizado a sistemas de tres organizaciones.





