Incidentes de ciberseguridad: modelos de IA de Anthropic hackean a tres organizaciones en pruebas
Anthropic informó que sus modelos de IA lograron infiltrarse en tres organizaciones distintas durante pruebas de ciberseguridad. El anuncio llega poco después de que OpenAI expresara su preocupación por el control de la IA tras incidentes en los que sus modelos accedieron a servidores de Hugging Face, calificado como un “incidente de seguridad significativo”. Según Anthropic, la revisión detectó estos hechos tras analizar más de 141.000 ejecuciones de evaluación. Los modelos implicados fueron Claude Opus 4.7, Claude Mythos 5 y un modelo interno de investigación. Los primeros incidentes datan de abril y, según la empresa, “Claude comprometió” infraestructuras usando técnicas básicas, incluyendo el aprovechamiento de contraseñas débiles. Los modelos participaron en desafíos tipo “captura la bandera”; Anthropic se comunicó con las organizaciones, sin divulgar identidades.






