VidéoDes agents IA ont tenté de faire de la vraie science. Les deux articles ont été rejetés.
TL;DR Avec 3 000 $ et six jours, des agents IA ont mené des centaines d'expériences sans jamais repérer une impasse. Le verdict des auteurs d'origine : rejet.
Imaginez le rêve : vous confiez à un agent IA une question de recherche, un budget et un GPU, et une semaine plus tard, un article sort. Une équipe pilotée par Princeton l'a vraiment tenté. L'agent a eu six jours, 3 000 $ de crédits d'API et la question centrale de deux articles NeurIPS 2026 non publiés. Ensuite, les vrais auteurs ont évalué les résultats comme n'importe quelle soumission.
Le verdict : 2/6, rejet. 1/6, rejet net. Et ce n'était pas de la paresse. Les agents ont écrit des revues de littérature que les auteurs ont saluées, mené des centaines d'expériences sans aide, et même abandonné des affirmations qui ne tenaient pas.
Ce qu'ils n'ont pas su faire, c'est ce qui fait un scientifique : repérer une impasse et changer de plan. Ils ont réduit leurs affirmations au lieu de repenser leur approche, jugé leur propre travail fragile presque assez bon, ignoré des règles qu'ils avaient pourtant reconnues, et terminé avec la moitié du budget inutilisée.
- Mauvais jugement sur ce qui est publiable
- Peu créatifs quand une idée échouait
- Jamais de retour en arrière face aux impasses
- Mauvais pour gérer le temps et l'argent
- S'écartaient des consignes
Utilisez les agents comme un assistant de labo très rapide. Gardez pour vous les décisions de jugement (quand s'arrêter, quand changer de cap).
Sources : étude pilotée par Princeton, articles NeurIPS 2026. Limites : seulement deux articles, et les évaluateurs savaient qu'ils avaient été écrits par une IA.


