En utilisant une IA pour prédire le point d’ébullition de plusieurs molécules, des chercheurs ont obtenu des valeurs en contradiction avec celles de la base de données scientifique de référence utilisée depuis 75 ans. Après avoir vérifié manuellement les valeurs dans la littérature scientifique, les chercheurs ont constaté que les valeurs de référence étaient en fait elles-mêmes erronées. La persistance de telles erreurs peut affecter la fiabilité des travaux qui s’appuient sur ces données et montre l’importance de vérifier les données de référence, particulièrement à l’ère de l’IA.
Les progrès des grands modèles de langage commencent à modifier certaines pratiques de recherche scientifique en automatisant et en accélérant les flux de travail les plus chronophages. Les modèles d’IA ou les agents IA sont désormais capables de générer du code complexe, de déduire des tendances à partir de grands volumes de données et même de contribuer aux démonstrations théoriques mathématiques et physiques.
Le nombre de publications scientifiques a fortement augmenté au cours des dernières années, tandis que l’IA et l’automatisation pourraient contribuer à accentuer cette tendance. Cependant, l’augmentation exponentielle du nombre de publications implique également un défi en matière d’évaluation par les pairs. Ces derniers doivent assurer la vérification de la rigueur scientifique, la reproductibilité des résultats et la détection d’erreurs potentielles.
Si la vérification humaine reste l’idéal, le nombre de publications est tel que la charge cognitive nécessaire à cette vérification peine à suivre le rythme de publication. Dans les domaines tels que les mathématiques et l’informatique théorique par exemple, une évaluation approfondie peut nécessiter une vérification ligne par ligne de démonstrations complexes, ce qui peut prendre plusieurs jours à un évaluateur humain.
Des agents IA pour éprouver les résultats de la recherche scientifique ?
Afin d’aider les évaluateurs humains pour le processus de vérification de la rigueur scientifique, de plus en plus de chercheurs utilisent l’IA. Des chimistes théoriciens du laboratoire de Zhejiang à Hangzhou, en Chine, ont par exemple utilisé un système d’IA pour prédire le point d’ébullition de plusieurs molécules, mais le modèle a généré des valeurs qui ne correspondaient pas à celles de la base de données de référence utilisée depuis des décennies par les chimistes du monde entier.
En épluchant manuellement la littérature scientifique originale, les chercheurs ont constaté que c’étaient les données de référence qui étaient erronées et non le modèle d’IA qui hallucinait. Les chercheurs ont également repéré des erreurs dans d’anciens articles et ouvrages de référence.
Ces erreurs consistaient par exemple en fautes de frappe ou des mesures incorrectes du point d’ébullition. Ces erreurs ont été reproduites dans les articles scientifiques ultérieurs, ce qui a probablement posé beaucoup de problèmes, selon Sebastian Pios, chimiste théoricien au Zhejiang Lab et membre de l’équipe ayant utilisé l’IA.
Dans un autre cas, des chercheurs du SAI Labs ont utilisé un écosystème d’agents IA pour analyser les publications scientifiques sélectionnées pour une présentation orale à la Conférence internationale sur l’apprentissage automatique (ICML) en 2026. Les 168 articles oraux ont été analysés, dont 105 ont fait l’objet d’une réplication complète.
« À notre connaissance, aucun système d’évaluation par les pairs existant ne se contente d’examiner le manuscrit. C’est pourquoi nous avons développé SAI Review, qui étend nos systèmes open source, notamment Openaireview et Veritas », indiquent les chercheurs dans leur rapport.
« À partir d’un article, SAI Review lit et extrait toutes les affirmations essentielles, récupère toutes les ressources fournies et tente de reproduire les résultats de l’article avec rigueur. Il compare ensuite les résultats de la reproduction avec les affirmations originales afin de vérifier l’article. SAI Review permet également d’évaluer un article sans exécuter ses expériences, à l’instar des systèmes d’évaluation par les pairs. »
Sur 168 articles analysés, 92 comportaient au moins cinq affirmations à évaluer. Seuls 34 articles ont vu plus de 40 % des affirmations évaluées être reproduites par les agents d’IA. Parmi les 92 articles comportant au moins cinq affirmations évaluables, seuls huit ont vu plus de 80 % des affirmations évaluées être reproduites.
Des experts interviewés par Nature précisent toutefois que, tout comme les humains, les IA peuvent elles aussi faire des erreurs et leurs résultats doivent tout de même être revérifiés manuellement en aval. Les IA pourraient en effet négliger certaines hypothèses ou inventer des faits.
Pour le moment, les agents IA de détection d’erreurs sont davantage adaptés à attirer l’attention des évaluateurs humains sur des problèmes potentiels, plutôt que de décider eux-mêmes si une publication scientifique comporte des faits erronés.




