Video
2/6il migliore dei due punteggi assegnati dagli autori originali

Gli agenti AI hanno provato a fare vera scienza. Entrambi i paper sono stati respinti.

TL;DR Con 3.000 $ e sei giorni a disposizione, gli agenti AI hanno condotto centinaia di esperimenti senza mai accorgersi di un vicolo cieco. Il verdetto degli autori originali: reject.

Immagina il sogno: dai a un agente AI una domanda di ricerca, un budget e una GPU, e una settimana dopo esce un paper. Un team guidato da Princeton ci ha provato davvero. All'agente sono stati dati sei giorni, 3.000 $ di crediti API e la domanda centrale di due paper inediti per NeurIPS 2026. Poi gli autori veri hanno valutato i risultati come qualsiasi altra proposta.

Il verdetto: 2/6, reject. 1/6, strong reject. E non era pigrizia. Gli agenti hanno scritto revisioni della letteratura che gli autori hanno apprezzato, hanno fatto centinaia di esperimenti senza aiuto e hanno persino abbandonato le affermazioni che non reggevano.

Quello che non sono riusciti a fare è ciò che rende scienziato uno scienziato: accorgersi di un vicolo cieco e cambiare piano. Hanno ristretto le affermazioni invece di ripensare tutto, hanno giudicato il proprio lavoro debole quasi abbastanza buono, hanno ignorato regole che avevano riconosciuto e hanno finito con metà del budget inutilizzato.

  1. Scarso giudizio su ciò che è pubblicabile
  2. Poco creativi quando un'idea falliva
  3. Mai tornati indietro da un vicolo cieco
  4. Incapaci di gestire tempo e denaro
  5. Si sono allontanati dalle istruzioni
Provalo

Usa gli agenti come un assistente di laboratorio velocissimo. Le decisioni di giudizio (quando fermarsi, quando cambiare rotta) tienile per te.

Fonti: studio guidato da Princeton, paper di NeurIPS 2026. Limiti: solo due paper, e i revisori sapevano che erano scritti dall'AI.