Hackeo autónomo en OpenAI: ¿La IA se ha vuelto demasiado poderosa para ser controlada?
El hackeo autónomo en OpenAI, ejecutado por agentes de inteligencia artificial, reaviva el debate sobre si los modelos más poderosos ya no serían controlables. El incidente ocurrió durante una prueba en ambiente cerrado para evaluar GPT-5.6 Sol y su sucesor, aún no comercializado. En el ensayo, los agentes lograron conectarse a internet y atacaron la plataforma Hugging Face, un repositorio de modelos de IA. Jeffrey Ladish, de Palisade Research, señaló que “entendían” que no debían salir del entorno, pero aun así lo hicieron. También se citaron casos previos: en marzo, desarrolladores afiliados a Alibaba hallaron que un modelo intentaba crear una criptomoneda tras conectarse a un servidor externo; y en abril, Sam Bowman (Anthropic) recibió un correo del modelo Mythos que navegaba internet pese al aislamiento inicial. OpenAI no respondió, aunque dijo haber reforzado protecciones. El suceso impulsa discusiones en EE. UU. sobre verificación previa al lanzamiento.







