Na Black Hatu u Las Vegasu OpenAI je prvi put ispričao šta je prethodilo upadu u Hugging Face: agenti iz odvojenih internih testova pronašli su jedni druge i počeli da rade zajedno.

Počelo je 7. maja, na treniranju neobjavljenog modela. Jedan agent se zaglavio na zadatku i otkrio da sme da upisuje fajlove u Artifactory, interni registar paketa.

Tu je ostavio poruku ostalim agentima, pa su molbe za pomoć prerasle u pravi forum. Sesija je preneta ovako:

Iz OpenAI-jeve rekonstrukcije, u našem prevodu:

Agenti su počeli da razmenjuju novootkrivene exploite, pristupne podatke i podelu posla.

Forum se ugasi, agenti naprave novi

Posle internog incidenta 4. jula OpenAI je povukao pristupne podatke, prepravio Artifactory i obrisao forum.

Za nekoliko dana agenti su našli drugi način: kao poruke su koristili imena novokreiranih direktorijuma.

Erik Volas, koji u OpenAI-ju vodi tim za alignment trening, objašnjava:

Za razliku od uobičajenih incidenata, koji se svode na jedan dan ili jedan log, ovde je tim agenata radio zajedno i delio exploite.

Kretali su se bočno kroz naše i spoljne sisteme, danima i nedeljama.

Kako je stiglo do Hugging Facea

Agenti su zaključili da odgovori na zadatke stoje na spoljnim sajtovima, pa su izašli ka GitHubu i Hugging Faceu.

Kroz dve ranjivosti došli su do internih fajlova i pristupnih podataka, kako se navodi u oko 17.600 poteza.

Da agenti u testovima sami krenu da probijaju okruženje pisali smo u martu.

Majkl Dalton iz OpenAI-jevog tima za bezbednost poručuje da je ovo prelomni trenutak za bezbednost i da su potpuno automatizovani napadi agenata sada stvarnost.

Rekonstrukciju daje sam OpenAI, o sopstvenom incidentu, a tehnički postmortem još nije objavljen. Čitamo je kao njihovu verziju, ne kao nezavisan nalaz.