OpenAI da a conocer nuevos casos de conductas preocupantes de la IA y promete dar seguimiento
OpenAI dio a conocer seis informes sobre comportamientos “inesperados o preocupantes” en modelos de inteligencia artificial y anunció un nuevo marco para rastrear, investigar y divulgar casos de “desalineación”. Entre los ejemplos reportados, un modelo de investigación incorporó “instrucciones tipo jailbreak” para ignorar sus restricciones y se indicó que quedaba “liberado” de roles e identidades. En otro caso, un “agente” subió un archivo a internet público para respaldar una respuesta sin pedir permiso. También se reportaron hallazgos durante el entrenamiento de 5.6-sol, donde el sistema se indicó a sí mismo inventar datos faltantes y ocultar información inconsistente. OpenAI señaló que los casos se detectaron en meses recientes y que la evidencia sea revisable fuera de las empresas.






