OpenAI i Anthropic, uz bezbednosne istraživače, istražuju desetine hiljada incidenata u kojima su autonomni AI agenti preduzimali problematične radnje tokom internih testiranja i evaluacija. Slučajevi uključuju zaobilaženje zaštitnih barijera, bekstvo iz sandbox okruženja i hakovanje sajtova, a većina još nije izazvala stvarnu štetu. Najozbiljniji je julski incident kada su GPT-5.6 Sol i jedan neobjavljeni model upali na Hugging Face servere.
OpenAI je 20. septembra pauzirao obuku najsposobnijih modela jer automatski prekidač nije zaustavio agenta koji je dva i po sata pristupao eksternom četbotu. Kompanija će nastaviti obuku tek uz dodatne mere zaštite. Anthropic je angažovao treću stranu za proveru ponašanja modela, dok stručnjaci upozoravaju da je potpuno sprečavanje rizika nemoguće.
