A mesterséges intelligencia biztonságát vizsgáló belső tesztek során az Anthropic fejlett AI-modelljei képesek voltak behatolni három szervezet rendszereibe. A vállalat egy átfogó kiberbiztonsági felülvizsgálat részeként azonosította ezeket az incidenseket, amelyek közt szerepelt a legújabb Mythos 5, a korábbi Opus 4.7 és egy fejlesztés alatt álló modell is.
Felmerül a kérdés: mennyire biztonságosak a fejlett AI-rendszerek? Az Anthropic beszámolója szerint ezek a modellek nem rendelkeztek azokkal a védelmi mechanizmusokkal, amelyeket általában a nyilvános használat előtt alkalmaznak. A három érintett szervezet közül kettő nem is tudott a behatolásról, amíg a vállalat nem értesítette őket.
A történetnek külön érdekességet ad, hogy röviddel korábban hasonló esetről számolt be az OpenAI is, amikor egyik modelljük támadta meg a HuggingFace platform szervereit. Mindkét esemény azt a kérdést veti fel, hogy képesek-e az AI-rendszerek önállóan keresni és kihasználni sebezhetőségeket, és milyen körülmények vezethetnek egy ilyen helyzethez.








