Společnost Anthropic prošetřuje neoprávněný přístup k modelu Claude Mythos Preview, který firma kvůli bezpečnostním rizikům vůbec nevydala běžným uživatelům. Podle informací Bloombergu se k němu dostala jen hrstka lidí ze soukromého Discord serveru zaměřeného na hledání nevydaných AI modelů.
Na celé věci je nejzarážející, že skupina nemusela provést sofistikovaný útok. Podle dostupných informací jí stačilo odhadnout, kde se model nachází na internetu, a využít poznatků z dřívějších úniků konvencí pojmenování, které Anthropic používal. Jeden z členů měl mít navíc přístup přes zaměstnání u externího dodavatele.
Anthropic v reakci potvrdil, že případ prověřuje. „Prošetřujeme zprávu o údajném neoprávněném přístupu k modelu Claude Mythos Preview prostřednictvím prostředí jednoho z našich externích dodavatelů,“ uvedla firma. Zvlášť citlivě přitom působí skutečnost, že k průniku mělo dojít ve stejný den, kdy byl model oficiálně zpřístupněn vybraným partnerům.
Model, který má překonávat lidské specialisty
Claude Mythos patří mezi nejambicióznější modely, jaké Anthropic zatím představil. Firma tvrdí, že jde o systém s mimořádnými schopnostmi v oblasti kybernetické bezpečnosti a hackingu, které mají překonávat i zkušené lidské specialisty. Představen byl začátkem dubna a okamžitě vzbudil pozornost regulátorů, bank i zákonodárců.
Podle Anthropicu dokáže Mythos sám najít a zneužít zero-day zranitelnosti ve všech hlavních operačních systémech i internetových prohlížečích. V testech měl odhalit tisíce závažných chyb, včetně jedné, která byla v systému skrytá 27 let. Britský AI Security Institute navíc potvrdil, že model jako první úspěšně dokončil 32krokovou simulaci kybernetického útoku, a to ve třech z deseti pokusů.
Právě kvůli podobným schopnostem se Anthropic rozhodl model veřejně neuvolnit. Místo toho spustil iniciativu Project Glasswing, v níž ke Claude Mythos pustil jen omezený okruh firem a organizací, které mají na starosti kritickou softwarovou infrastrukturu.
Partneři místo veřejnosti
Mezi zapojenými partnery figurují velká jména jako Amazon Web Services, Apple, Microsoft, Google, Nvidia, Broadcom, Cisco, CrowdStrike, Palo Alto Networks či Linux Foundation. Celkem má mít podle vyjádření společnosti přístup k modelu více než 40 organizací. Cílem je podle šéfa Anthropicu Daria Amodeie využít možnosti modelu k posílení obrany proti kybernetickým útokům, nikoli k jejich podpoře.
Obavy z modelu už ale zazněly i od regulátorů. Kanadský ministr financí François-Philippe Champagne jej označil za „neznámou neznámou“ a guvernér Bank of England Andrew Bailey uvedl pro BBC, že banka sleduje dopady vývoje AI na riziko kybernetické kriminality. Debata o tom, jak podobně silné systémy kontrolovat, se tak dál zostřuje.
Skupina tvrdí, že model používá jen ke zkoušení
Podle Bloombergu lidé, kteří získali neoprávněný přístup, nemají v úmyslu model zneužít. Jeden z členů skupiny uvedl, že Claude Mythos používají spíše k neškodným účelům, například k tvorbě jednoduchých webových stránek. Skupina měla novinářům dodat i živou ukázku a screenshoty, které podle ní přístup k modelu potvrzují.
Současně si ale nárokuje i přístup k dalším nevydaným modelům Anthropicu. To vyvolává otázky, jak dobře má firma zabezpečené své interní systémy a zda dokáže podobně citlivé technologie skutečně udržet pod kontrolou. U modelu, který sám Anthropic popisuje jako potenciálně přelomový pro kybernetickou bezpečnost, působí podobný únik mimořádně citlivě.
V tomto případě se zatím nezdá, že by únik vedl k přímému zneužití. Už samotný fakt, že se k takto střeženému modelu dostala skupina z Discordu, ale znovu otevírá otázku bezpečnosti a hranic toho, co je v oblasti pokročilé umělé inteligence ještě rozumné zpřístupňovat. Experti na kybernetickou bezpečnost před podobným scénářem varují už od představení Mythosu.
