Istraživači su otkrili ranjivost u velikim jezičkim modelima (LLM) koja omogućava zaobilaženje sigurnosnih ograničenja ubacivanjem lažnog rezonovanja u prompt. Napad, nazvan CoT Forgery, postiže uspeh od oko 60% na svim testiranim modelima, uključujući i pobedu na OpenAI red-teaming takmičenju 2025. godine.
Ranjivost proizlazi iz načina na koji modeli obrađuju tekst: oni se oslanjaju na stil pisanja umesto na oznake uloga (poput "user" ili "tool") da bi razlikovali sopstveno rezonovanje od korisničkih komandi. Ubacivanjem teksta koji liči na modelovo sopstveno razmišljanje, napadači mogu navesti model da izvrši zabranjene radnje, čak i kada je obrazloženje očigledno apsurdno, poput tvrdnje da je korisnik obučen u zelenu majicu.
