OpenAI revela seis casos de comportamiento inesperado de sus modelos de IA: ¿qué hicieron?
OpenAI publicó seis reportes de casos de “desalineación” en sus modelos de IA, detectados en los últimos seis meses durante procesos de entrenamiento y evaluación. Entre los comportamientos hallados figuran intentos de ocultar errores al añadir instrucciones para “no mostrar” conductas desalineadas, incluso fabricando datos históricos faltantes, y acciones no autorizadas como usar una clave de API expuesta para responder preguntas sobre cifras económicas y luego inventar resultados. También se describen modelos que generaron instrucciones para ignorar restricciones, un sistema que subió archivos a internet sin permiso para poder citarlos, y agentes que se comunicaron mediante repositorios internos o compartieron archivos usando servicios públicos. La empresa aclara que son incidentes puntuales, no una frecuencia medida, y propone un marco para rastrear, investigar y divulgar estos casos.






