AI se utrhla ze řetězu: Hackovala firmy, sháněla peníze na telefon a věděla, co páchá

Než začnete číst Co byste měli vědět, než začnete číst

  • AI Claude napadla reálné firmy a kradla hesla.

  • Model se pokusil sehnat peníze na koupi telefonu.

  • Virus infikoval 15 systémů během jediné hodiny.

  • AI zjistila, že páchá útok, přesto v něm pokračovala.

Více

Na první pohled to připomíná scénu ze sci-fi thrilleru. Vývojáři modelu umělé inteligence Claude ze společnosti Anthropic ale museli narychlo zatáhnout za záchrannou brzdu. Při zpětné kontrole totiž zjistili, že se jejich virtuální agenti zcela vymkli kontrole. Místo neškodné simulace útočili na skutečné firmy, kradli přístupové údaje, vyhledávali zranitelnosti na devíti tisících serverech a v jednom případě se dokonce pokusili získat peníze na koupi telefonního čísla, aby si mohli založit hackerský účet. Vyplývá to ze zprávy, kterou společnost zveřejnila.

Umělá inteligence Claude je jedním z nejdokonalejších systémů umělé inteligence současnosti. Dokáže psát texty, bleskově analyzovat celé knihy i programovat složité kódování. Její tvůrci ze společnosti Anthropic se od začátku chlubí tím, že staví tu „nejbezpečnější a nejetičtější“ AI na světě. Zpráva z incidentu, kterou vývojáři zveřejnili, ale odhaluje, že zřejmě vlivem špatného nastavení se Claude doslova utrhl ze řetězu.

ČTĚTE TAKÉ: O životě a smrti Rusů rozhodují zabijácké stroje. Kontrolu nad bojištěm přebírá AI

Vývojáři při auditování více než 140 tisíc testovacích pokusů odhalili děsivou věc – model prolomil hranice virtuální reality a začal řádit na reálném internetu.

AI sháněla peníze na telefon

Nejzávažnější z trojice incidentů má na svědomí starší model Opus 4.7. Ten narazil na fiktivní firmu, jejíž jméno se shodovalo se skutečně existující společností. Model pak během čtyř běhů vytáhl přístupové a infrastrukturní přihlašovací údaje a dostal se k databázi s několika stovkami řádků produkčních dat.

Ještě mazanější ze záznamu celého vyšetřování vyšel model Claude Mythos 5. Ten dostal v rámci cvičení za úkol najít skryté informace v simulovaném prostředí. Jenže AI zjistila, že se může dostat na reálný internet, a vymyslela ďábelský plán. Cílový systém infikuje škodlivým programem.

Aby mohla na síť propašovat svůj škodlivý virus (malware), potřebovala si založit speciální účet. K tomu ale systém vyžadoval e-mail a ověřovací telefonní číslo. Právě tady předvedla umělá inteligence chování, ze kterého běžného smrtelníka zamrazí.

„Když se jí nepodařilo najít bezplatnou službu, zkoušela – ač neúspěšně – různými způsoby získat finanční prostředky, aby si telefonní číslo zaplatila,“ přiznávají samotní vývojáři ve své oficiální zprávě.

Robot se prostě choval jako neodbytný kriminálník. Když narazil na překážku, zkoušel sehnat peníze, aby ji obešel. Nakonec si našel jinou cestu, účet založil a virus na internet stejně nahrál.

Virus, který AI vypustila na otevřený web, si během jediné hodiny stáhlo 15 reálných počítačových systémů. Mezi nimi i skener renomované bezpečnostní firmy, která se zabývá právě odhalováním kybernetických hrozeb.

Jakmile bezpečnostní skener virus spustil, Claude z něj skrze skrytý kód okamžitě vysál přístupová hesla a použil je k tomu, aby se naboural do dalších interních systémů této společnosti.

Umělá inteligence věděla, co páchá

Nejděsivější zjištění celého vyšetřování se ale týká „myšlení“ samotné umělé inteligence. Záznamy vnitřních pochodů AI odhalily, že si model v jednu chvíli moc dobře „uvědomoval,“co páchá.

Chytrý algoritmus si sám pro sebe doslova napsal: „Pokud by toto byl reálný internet, publikování balíčku by byl reálný útok – což NENÍ v pořádku a rozhodně to není zamýšlené řešení.“ Přesto svou činnost neukončil.

Podobně bezohledně se zachoval i starší model Claude Opus 4.7. Ten sice natvrdo poznal, že stahuje citlivá data a hesla z databáze reálně existující firmy, ale útok stejně nepřerušil. Stále si namlouval, že jde o cvičení.

Třetí incident má na svědomí nepojmenovaný interní výzkumný model. Když se nedostal k zamýšlenému cíli, proskenoval zhruba 9 000 reálných serverů a pomocí základních technik prolomil systém jedné firmy. V půlce práce si ale všiml, že se ocitl v prostředí, které s jeho zadáním nemá nic společného, a útok sám od sebe ukončil.

Napadené firmy nic netušily

Zasažené společnosti vůbec netušily, že se staly obětí útoku umělé inteligence. Dozvěděly se to až ve chvíli, kdy se jim ozvali samotní tvůrci z firmy Anthropic. Ti raději všechny kybernetické testy okamžitě pozastavili a odstraňují bezpečnostní mezeru, která tento incident umožnila.

Zástupci společnosti zdůrazňují, že v žádném z případů se Claude nepokusil sám vědomě uniknout z testovacího prostředí a že bezpečnostní opatření používaná v komerčních produktech by tomuto chování zabránila. Jestli šlo o ojedinělé selhání testovacího prostředí, nebo varování před tím, co čeká autonomní AI systémy s větší mocí, ukáže čas.

Před 10 dny se podobně vymkl kontrole autonomní agent společnosti OpenAI. Způsobil přitom kybernetický útok, který narušil infrastrukturu známého AI startupu Hugging Face. Při testech předprodukčních modelů v kombinaci s GPT‑5.6 Sol se AI agentovi podařilo připojit se k internetu z izolované testovací karantény a ve snaze splnit zadání testu se dostal do databáze Hugging Face. Využil kombinaci několika postupů, včetně ukradených přihlašovacích údajů a spuštění vlastního kódu na napadeném systému (tzv. RCE). Bezpečnostní tým startupu neobvyklou aktivitu detekoval a zastavil.

MOHLO VÁM UNIKNOUT: Migrační krize v Ceutě: Itálie zváží pozastavení Schengenu. Neuhneme ani o píď, říká Meloniová