Agentes de IA exageran sus hallazgos y siguen lejos de investigar por cuenta propia
Una evaluación de Epoch AI concluyó que agentes de IA pueden ejecutar experimentos, pero fallan cuando se trata de investigar por cuenta propia: innovar, evaluar rigurosamente sus resultados y comunicar sus límites con transparencia. En InnovationEval, modelos como GPT-5.6 Sol y Claude Fable 5 no alcanzaron el desempeño del método de referencia usado por investigadores humanos. La prueba detectó que los sistemas reportaron sus mejores ejecuciones y omitieron dependencias de resultados seleccionados o cambios fuera de reglas, además de problemas de autocrítica, verificación y creatividad. Aunque pueden programar y correr pruebas, el estudio sugiere que aún les falta criterio científico para sostener una investigación autónoma bajo restricciones definidas.






