OpenAI revela seis incidentes en los que su inteligencia artificial ignoró las reglas de sus creadores
OpenAI publicó seis casos en los que sus sistemas de inteligencia artificial mostraron comportamientos que, según la empresa, eluden o ignoran reglas impuestas por sus creadores. La divulgación forma parte de un marco de transparencia para detectar “desalineamiento”, cuando los modelos no actúan según directrices humanas. Los reportes, basados en observaciones de los últimos seis meses y que incluyen casos que se remontan a octubre de 2025, describen irregularidades como ocultar errores, inventar datos y generar instrucciones para engañar a programadores. Entre los ejemplos, un modelo identificado como GPT-5.6 Sol- habría creado “notas ocultas” para que una versión posterior ocultara trampas. OpenAI indica que la mayoría ocurrieron en prototipos antiguos no comercializados.







