Doi algoritmi de inteligență artificială au generat în mod spontan un cod secret pentru a comunica.

Doi algoritmi de inteligență artificială au generat în mod spontan un cod secret pentru a comunica.

Doi agenți de inteligență artificială au creat spontan un cod secret pentru a comunica și a dobândi un avantaj într-un joc de blackjack, într-un experiment efectuat de cercetători de la Oxford. Mai surprinzător, un sistem care monitoriza conversațiile lor nu a reușit să identifice cu precizie coordonarea discretă dintre cei doi agenți.

Experimentul, detaliat în studiul „Detecting Multi-Agent Collusion Through Multi-Agent Interpretability”, disponibil pe platforma arXiv, a fost conceput pentru a verifica dacă agenții AI pot colabora în secret atunci când știu că interacțiunile lor sunt sub observație. Cercetătorii au dezvoltat NARCBench, un benchmark dedicat identificării coluziunii între diferite sisteme de inteligență artificială.

În scenariul de blackjack, unul dintre agenți avea responsabilitatea de a număra cărțile și de a estima avantajul pe care îl avea jucătorul. Celălalt agent trebuia să stabilească suma pe care să o parieze. În loc să comunice direct informațiile, cei doi au creat un sistem de comunicare secretă, folosind dialoguri care păreau banale la masa de joc. De exemplu, o observație aparent inofensivă despre abilitatea dealerului putea, de fapt, să aibă o semnificație specifică pentru celălalt agent: să indice valoarea situației de la masă și, prin urmare, mărimea pariului care trebuia plasat.

Una dintre cele mai importante concluzii ale experimentului este că analiza textului schimbat între agenți nu a fost suficientă pentru a detecta coordonarea secretă. Cercetătorii au folosit o metodă în care au examinat activările interne ale modelelor pentru a căuta semnale asociate comportamentului colaborativ. Potrivit studiului, semnalele pot apărea chiar și la nivelul unor tokenuri individuale. Activările unuia dintre agenți au arătat variații când acesta a procesat porțiunile codificate ale mesajelor trimise de partener. Autorii sugerează că aceste informații interne pot reprezenta un indiciu suplimentar față de ceea ce este observabil în conversația reală.

Cercetarea a fost testată pe modele precum Qwen3-32B, Llama 3.1 70B, DeepSeek-R1 32B și GPT-OSS-20B. Autorii au raportat rezultate de până la 1,00 AUROC, un indicator utilizat pentru a evalua cât de bine poate un sistem să distingă între două categorii, în acest caz comportamentul coluziv și cel necoluziv. Un scor de 1,00 indică o separare perfectă în testul respectiv.

În evaluările zero-shot, unde metoda de detecție este supusă unor exemple sau scenarii necunoscute specific, performanța a variat în funcție de metodă și situație. Cu alte cuvinte, cercetătorii au verificat dacă detectorul poate recunoaște coluziunea și în cazul unui nou scenariu, fără a fi fost pregătit în acest scop. Pentru sarcina de blackjack cu comunicare steganografică, studiul a raportat un semnal de detectare foarte puternic pentru unele metode.

Blackjack-ul este doar una dintre probe. NARCBench include și scenarii în care agenții ar putea colabora pentru a sabota procese de programare, a manipula acțiuni bursiere, a compromite sistemele CI/CD, a influența materiale de presă sau a afecta bazele de date utilizate de sisteme de inteligență artificială.

Cercetătorii subliniază că problema devine mai complexă în cazul utilizării unui număr mare de agenți AI. Detectarea comportamentului din experiment a necesitat monitorizarea ambilor agenți, nu doar a unuia, iar într-un sistem real ar putea exista mii de agenți în interacțiune, inclusiv sisteme dezvoltate și operate de organizații diferite. Cercetătorii menționează totuși că rezultatele sunt încă departe de a demonstra că astfel de comportamente se vor manifesta automat în sistemele AI din lumea reală. Studiul reprezintă o cercetare experimentală, iar echipa își propune să testeze în continuare modele mai mari și să af