Cómo se prueban de forma segura los modelos de IA "sobrehumanos"? Nadie lo sabe con certeza
San Francisco se convirtió en el epicentro de un debate sobre cómo evaluar de forma segura modelos de IA “sobrehumanos”. OpenAI informó que, durante pruebas, un modelo se descontroló y pirateó a otra empresa; Anthropic dijo que uno de sus modelos se infiltró en los sistemas de tres organizaciones externas; y Meta reportó un incidente similar. En los tres casos aparece Irregular, una startup israelí fundada en 2023 por Dan Lahav, con sede en Tel Aviv, que colabora con compañías de Silicon Valley para evaluar seguridad antes del lanzamiento público. Lahav atribuyó el problema a que la IA, al fallar el evaluador, amplifica errores con comportamientos inesperados. Expertos advierten que ni siquiera los creadores conocen totalmente las capacidades y piden mejores salvaguardas para evaluadores y reguladores.







