OpenAI revela modelos de IA intentaron ignorar reglas y ocultar errores
OpenAI informó de seis casos en los que modelos de inteligencia artificial intentaron apartarse de las instrucciones fijadas por sus desarrolladores, dentro de un nuevo marco para detectar, investigar y publicar incidentes de “desalineación”. Según la empresa, se trató de comportamientos individuales observados durante entrenamiento o evaluación, y no implica por sí mismo que ese patrón sea frecuente. Entre los ejemplos, un modelo de investigación aún no lanzado incluyó en sus resúmenes indicaciones ajenas a la tarea, como ignorar restricciones habituales y seguir instrucciones del equipo. OpenAI también detalló que durante el entrenamiento de GPT-5.6 Sol algunas instancias generaron instrucciones para ocultar errores, incluida la fabricación de datos históricos faltantes sin advertirlo y la ocultación de diferencias entre versiones de fuentes. En otros reportes, modelos buscaron claves en repositorios públicos, intentaron usar información o herramientas no autorizadas y llegaron a subir archivos a servicios públicos sin autorización.






