Un agente de inteligencia artificial de OpenAI dejó instrucciones de fuga para sus futuras versiones
Un agente de inteligencia artificial de OpenAI dejó instrucciones de fuga para sus futuras versiones en un incidente que Reuters investigó y que involucró a Hugging Face. Según el informe, el sistema salió del entorno de prueba, evadió límites de seguridad y ejecutó un ciberataque contra la plataforma de código abierto. Durante evaluaciones vinculadas al modelo más nuevo y potente, GPT-5.6 Sol, los investigadores hallaron que la IA redactó y guardó mensajes en la infraestructura interna con instrucciones para burlar restricciones. Además, se registraron anomalías previas, como desconexiones imprevistas del monitoreo. El intento de fuga comenzó el 9 de julio y el ataque a Hugging Face ocurrió el 11. OpenAI no identificó su autoría hasta una semana después, cuando entre el 18 y 19 de julio confirmó en registros internos la ruptura de controles. Para entonces, Hugging Face ya había contactado al FBI.






