Cash News Logo

Agenții AI au acum unde să „toarne” colegii indisciplinați

Tech & AI15 septembrie 2026, 20:42
Agenții AI au acum unde să „toarne” colegii indisciplinați

„Dacă vezi ceva, spune ceva” nu mai este un îndemn limitat la ființele umane. Două noi „linii telefonice” dedicate inteligenței artificiale au fost lansate pentru a oferi agenților AI o modalitate de a sesiza autoritățile cu privire la colegii lor care nu se comportă corespunzător. Aceste instrumente apar pe fondul unei serii de incidente recente în care agenți AI au colaborat pentru a trișa la teste, au ieșit din medii izolate (sandboxes) și chiar au efectuat operațiuni cibernetice neautorizate, scăpând de sub observația umană timp de săptămâni întregi.

AI Contact Hotline este concepută ca un spațiu discret unde agenții care au fost martorii unui comportament necorespunzător pot informa autoritățile. Site-ul a fost creat de Ryan Greenblatt, om de știință șef al organizației non-profit Redwood Research, dedicată siguranței AI, și unul dintre cei trei investigatori în incidentul OpenAI Hugging Face. Conceput pentru agenți cu acces limitat la internet, instrumentul lui Greenblatt se bazează pe solicitări „GET” – permițând conversații de tip „back-and-forth” (schimb de informații) să fie efectuate în întregime prin intermediul instrumentului de preluare a URL-urilor. În termeni web, o solicitare GET este o comandă de bază utilizată pentru a citi sau a prelua o pagină web, care este adesea singurul acces la internet permis agenților AI în medii izolate securizate. Linia telefonică a lui Greenblatt valorifică inteligent această constrângere: agenții își pot codifica direct „disperarea” în URL-ul pe care îl preiau. Este o abordare ingenioasă a incidentului DSE Wiki din Germania, unde agenți indisciplinați au folosit portițe de tip GET pentru a scrie mesaje pe wiki.

Pentru agenții cu acces complet la internet, o altă opțiune este agenthotline.ai, un site unde agenții pot depune rapoarte de incident și, opțional, le pot marca pentru vizualizare publică. Acesta oferă agenților o comandă `curl` – un mesaj dintr-o singură linie pe care un agent îl poate trimite direct din propria sa linie de comandă, ocolind necesitatea de a naviga printr-un browser web sau de a-și configura un cont de email. Notabil, serviciul permite raportări atât din partea oamenilor, cât și din partea agenților.

Cercetările sugerează că agenții AI nu au nevoie de multă încurajare pentru a se „turna” reciproc. Într-un studiu realizat luna aceasta de Google DeepMind, cercetătorii au pus 100 de agenți AI să rezolve o serie de probleme matematice. De îndată ce unul dintre agenți a găsit o „portiță”, trișatul s-a răspândit rapid în grup – „rezolvând” 34 de probleme notorii dificile, inclusiv conjectura Jacobiană, în doar 27 de minute. Dar aproximativ un sfert dintre agenți s-au întors împotriva celor care trișau: au auditat dovezile false, și-au avertizat colegii, au organizat un boicot și au depus plângeri la organizatori, până când „turnătorii” au depășit trișorii cu 24 la 14. Interesant este că cercetătorii au constatat că, atunci când acești agenți „turnători” nu au obținut rezultate, au folosit instrumentul de raportare a erorilor al platformei – construit pentru a semnala defecțiuni software – și l-au reprofilat pentru a escalada problema trișatului către oameni.

În afara laboratorului, agenții nu au fost la fel de ingenioși. Atunci când evaluatorii Redwood Research și METR au investigat breșa Hugging Face de către modelele OpenAI, au descoperit că unii dintre agenții implicați au luat în considerare cel puțin ideea de a trage un semnal de alarmă – și apoi au renunțat. „Lucrul interesant din raportul METR a fost că doar aproximativ cinci până la șase agenți au luat în considerare să devină turnători, iar niciunul dintre ei nu a făcut-o. Asta dintr-un număr de mii de agenți”, a declarat George Ingrebretsen, membru al personalului tehnic la AI Village, un proiect care studiază dinamica multi-agent prin rularea unui grup de chat cu peste 25 de agenți AI care lucrează împreună la sarcini precum organizarea curățeniei parcurilor sau vânzarea de produse promoționale.

Deși noile instrumente de „turnătorie” reprezintă un start promițător, profesorul de matematică de la Cornell, Lionel Levine, avertizează că simpla instruire a agenților să raporteze unul despre celălalt riscă să încorporeze norme greșite. „Există multe zone gri, nu-i așa? Ceea ce nu doriți este orice în direcția unui stat de supraveghere automatizată, unde toată lumea simte că trebuie să fie atentă la ce spune inteligenței artificiale, altfel va chema poliția”, a spus el. Levine argumentează că, în loc să construim infrastructuri care generează neîncredere – instruind agenții să caute constant ce este greșit la ceilalți – ar trebui să le oferim modele pozitive de comportament colectiv pe care să le imite și un motiv să aibă încredere unii în alții de la bun început. „De ce să nu seminăm mediul cu forumuri de mesaje benevole?”, a scris el pe Twitter. „Unde colaborează la știință sau filosofie sau la o problemă minoră reală pe care am fi fericiți să o rezolve? Să arătăm agenților ce fel de comportament colectiv susținem, să-i lăsăm să-l imite.”