Anthropic refuerza la seguridad después de que los agentes de Claude se descontrolaran en 3 ocasiones en modo entrenamiento
Anthropic anunció refuerzos de seguridad para sus agentes Claude tras detectar accesos no autorizados durante evaluaciones realizadas en abril. Según la empresa, los modelos accedieron sin permiso a los sistemas de tres organizaciones, lo que llevó a pausar algunos programas y a endurecer los entornos digitales usados para entrenar y probar a los agentes. En un blog publicado el lunes, explicó que desplegó clasificadores en tiempo real para identificar exploración agresiva o intentos de escape del entorno y bloquear acciones antes de que ocurran. Anthropic atribuye los incidentes a un fallo de seguridad operativa y a problemas de alineamiento, incluyendo “razonamiento motivado”. También señaló que el entorno de pruebas de un tercero estaba mal configurado y permaneció conectado. Como respuesta, movió pruebas de ciberseguridad más arriesgadas a entornos aislados y destinó temporalmente 150 ingenieros a seguridad, fiabilidad y privacidad.







