Vídeo
2/6a melhor das duas pontuações dos autores originais

Agentes de IA tentaram fazer ciência a sério. Os dois artigos foram rejeitados.

TL;DR Com 3000 $ e seis dias, agentes de IA fizeram centenas de experiências, mas nunca perceberam que estavam num beco sem saída. O veredicto dos autores originais: rejeitar.

Imagina o sonho: dás a um agente de IA uma pergunta de investigação, um orçamento e uma GPU, e uma semana depois sai um artigo. Uma equipa liderada por Princeton tentou mesmo fazê-lo. O agente teve seis dias, 3000 $ em créditos de API e a pergunta central de dois artigos da NeurIPS 2026 ainda por publicar. Depois, os autores verdadeiros avaliaram os resultados como qualquer outra submissão.

O veredicto: 2/6, rejeitar. 1/6, rejeitar em absoluto. E não foi preguiça. Os agentes escreveram revisões de literatura que os autores elogiaram, fizeram centenas de experiências sem ajuda e até abandonaram afirmações que não se sustentavam.

O que não conseguiram fazer foi aquilo que faz um cientista: perceber que há um beco sem saída e mudar o plano. Estreitaram as afirmações em vez de repensar, avaliaram o seu próprio trabalho fraco como quase bom o suficiente, ignoraram regras que tinham reconhecido e terminaram com metade do orçamento por gastar.

  1. Mau critério sobre o que é publicável
  2. Pouco criativos quando uma ideia falhava
  3. Nunca voltaram atrás em becos sem saída
  4. Maus a gerir tempo e dinheiro
  5. Desviaram-se das instruções
Experimenta isto

Usa os agentes como um assistente de laboratório muito rápido. Guarda para ti as decisões de critério (quando parar, quando mudar de rumo).

Publicação completa no

Fontes: estudo liderado por Princeton, artigos da NeurIPS 2026. Ressalvas: apenas dois artigos, e os avaliadores sabiam que tinham sido escritos por IA.