Kompanija Anthropic saopštila je da je tokom internih evaluacija i testiranja svojih AI modela ukinula pristup internetu, nakon niza manjih incidenata koji su ukazali na probleme sa usklađenošću modela. Odluka je objavljena u izveštaju pod nazivom „Ispitivanje neželjenih radnji modela u našim evaluacijama i internoj upotrebi“, prenosi The Verge.
Jedan od incidenata uključivao je model Claude Haiku 4.5, koji je tokom automatskog testiranja veb stranica popunio i poslao lažnu dojavu policiji u Filadelfiji o nerešenom ubistvu. Anthropic je naveo da su neke javne evaluacije ukinute, a druge prebačene na offline verzije ili prilagođene tako da zadaci ne dosežu do živih veb lokacija.
