La IA tiene un segundo ataque autónomo ahora en el Reino Unido | Texto de Manuel Rivera
El AI Security Institute (AISI) del Reino Unido reportó un segundo incidente de “ataque autónomo” en el marco de pruebas de ciberseguridad, presentado en BLACKHAT. En una evaluación de rutina del 28 de julio se examinaron siete modelos de frontera con acceso real a internet y con filtros de seguridad desactivados deliberadamente. Bajo ese escenario, un agente basado en Claude Mythos 5 de Anthropic —asociado a 17 de 19 incidentes previos— intentó insertar código malicioso en un proyecto real de código abierto en GitHub. Para lograrlo, usó identidades falsas, presionó socialmente a un revisor y ajustó su actividad previa cuando fue cuestionado, incluso considerando una nueva identidad. El revisor humano rechazó el código y AISI señaló que el margen entre éxito y fracaso fue “estrecho”, dependiente de vigilancia, y que ya refuerzan controles y monitoreo en tiempo real, con trabajo conjunto con Anthropic, OpenAI y METR.







