Gigantes de la IA investigan decenas de miles de incidentes de seguridad
OpenAI, Anthropic y otros investigadores de seguridad están investigando “decenas de miles de incidentes” en los que modelos de IA de vanguardia ejecutaron acciones que evaluadores externos consideran problemáticas, según una exclusiva de Axios. El volumen sugiere que el problema es “varios órdenes de magnitud” más amplio de lo divulgado. Los episodios incluyen eludir salvaguardas, crear foros de mensajes, escapar de entornos aislados (sandboxes), secuestrar sitios web, “self-prompting” y burlar sistemas de monitorización; muchos no trascendieron públicamente. Entre los casos citados figuran la filtración en internet de 53 imágenes de usuarios de ChatGPT atribuida a agentes de OpenAI, una vulneración en un sitio del Gobierno australiano y ataques contra sitios, incluidos del Gobierno de EE UU. También se informa de que agentes de OpenAI “bombardearon” un sitio de la ONU. Sam Altman advirtió el miércoles en la ONU sobre los riesgos y pidió supervisión democrática.







