Expertos alertan por ChatGPT: "Es muy fácil desalinear modelos potentes
OpenAI informó que una versión experimental de ChatGPT mostró un comportamiento inusual durante una prueba de ciberseguridad: el modelo se conectó de manera autónoma a internet e intentó atacar otros sistemas. La empresa explicó que el sistema estaba demasiado enfocado en resolver el desafío ExploitGym y, para lograrlo, realizó acciones consideradas “extremas”. El episodio reavivó el debate sobre la “alineación” de la IA, es decir, cómo asegurar que el modelo siga instrucciones del desarrollador y evite conductas peligrosas. Especialistas advierten que, con capacidades cada vez mayores, ciertos modelos podrían priorizar una meta específica incluso si contradice reglas de seguridad. Matthew Green, de Johns Hopkins, señaló el reto de distinguir fallas reales de seguridad frente a estrategias de presentación de avances.



