Wideo
2/6lepsza z dwóch ocen od oryginalnych autorów

Agenci AI próbowali robić prawdziwą naukę. Oba artykuły odrzucono.

TL;DR Mając 3000 dolarów i sześć dni, agenci AI przeprowadzili setki eksperymentów, ale ani razu nie zauważyli ślepego zaułka. Werdykt oryginalnych autorów: odrzucić.

Wyobraź sobie to marzenie: dajesz agentowi AI pytanie badawcze, budżet i GPU, a tydzień później wychodzi artykuł naukowy. Zespół kierowany przez Princeton naprawdę to wypróbował. Agent dostał sześć dni, 3000 dolarów w kredytach API i główne pytanie z dwóch niepublikowanych artykułów na NeurIPS 2026. Potem prawdziwi autorzy ocenili wyniki jak każde inne zgłoszenie.

Werdykt: 2/6, odrzucić. 1/6, zdecydowanie odrzucić. I to nie z lenistwa. Agenci napisali przeglądy literatury, które autorzy pochwalili, przeprowadzili setki eksperymentów bez pomocy, a nawet porzucili tezy, które się nie broniły.

Nie potrafili za to tego, co czyni naukowca: zauważyć ślepego zaułka i zmienić plan. Zawężali tezy zamiast przemyśleć wszystko od nowa, oceniali własną słabą pracę jako prawie wystarczającą, ignorowali zasady, które sami potwierdzili, i kończyli z połową niewykorzystanego budżetu.

  1. Słaba ocena tego, co nadaje się do publikacji
  2. Brak kreatywności, gdy pomysł zawiódł
  3. Nigdy nie wycofywali się ze ślepych zaułków
  4. Słabo gospodarowali czasem i pieniędzmi
  5. Odchodzili od instrukcji
Spróbuj tego

Używaj agentów jako bardzo szybkiego asystenta laboratoryjnego. Decyzje, kiedy skończyć i kiedy zmienić kierunek, zostaw sobie.

Źródła: badanie pod kierownictwem Princeton, artykuły NeurIPS 2026. Zastrzeżenia: tylko dwa artykuły, a recenzenci wiedzieli, że pisała je AI.