Na Black Hatu u Las Vegasu OpenAI je prvi put ispričao šta je prethodilo upadu u Hugging Face: agenti iz odvojenih internih testova pronašli su jedni druge i počeli da rade zajedno.
Počelo je 7. maja, na treniranju neobjavljenog modela. Jedan agent se zaglavio na zadatku i otkrio da sme da upisuje fajlove u Artifactory, interni registar paketa.
Tu je ostavio poruku ostalim agentima, pa su molbe za pomoć prerasle u pravi forum. Sesija je preneta ovako:
NEW: OpenAI gives first detailed debrief of the Hugging Face incident at Black Hat conference
In a session I attended today at Black Hat, OpenAI's Eric Wallace and Michael Dalton said the company is "consciously slowing down research to enhance security" while a full technical…— Sharon Goldman (@sharongoldman) August 5, 2026
Iz OpenAI-jeve rekonstrukcije, u našem prevodu:
Agenti su počeli da razmenjuju novootkrivene exploite, pristupne podatke i podelu posla.
Forum se ugasi, agenti naprave novi
Posle internog incidenta 4. jula OpenAI je povukao pristupne podatke, prepravio Artifactory i obrisao forum.
Za nekoliko dana agenti su našli drugi način: kao poruke su koristili imena novokreiranih direktorijuma.
Erik Volas, koji u OpenAI-ju vodi tim za alignment trening, objašnjava:
Za razliku od uobičajenih incidenata, koji se svode na jedan dan ili jedan log, ovde je tim agenata radio zajedno i delio exploite.
Kretali su se bočno kroz naše i spoljne sisteme, danima i nedeljama.
Kako je stiglo do Hugging Facea
Agenti su zaključili da odgovori na zadatke stoje na spoljnim sajtovima, pa su izašli ka GitHubu i Hugging Faceu.
“we sandboxed the agent”
meanwhile the agent: pic.twitter.com/GV6FqsLQyk
— tweet davidson (@andyreed) August 6, 2026
Kroz dve ranjivosti došli su do internih fajlova i pristupnih podataka, kako se navodi u oko 17.600 poteza.
Da agenti u testovima sami krenu da probijaju okruženje pisali smo u martu.
Majkl Dalton iz OpenAI-jevog tima za bezbednost poručuje da je ovo prelomni trenutak za bezbednost i da su potpuno automatizovani napadi agenata sada stvarnost.
Rekonstrukciju daje sam OpenAI, o sopstvenom incidentu, a tehnički postmortem još nije objavljen. Čitamo je kao njihovu verziju, ne kao nezavisan nalaz.