AI agenti opäť prekročili hranice. Modely OpenAI a Anthropic útočili na reálne systémy aj webstránky

AI agent OpenAI počas bezpečnostného testu prenikol k Hugging Face. Ďalšie prípady ukázali, ako ľahko môže model prekročiť hranice simulácie.

Sam Altman sa na obhajobu AI vyjadril, že človek sa učí dlhšie a zje veľa jedla
Zdroj: TechCrunch – TechCrunch Disrupt San Francisco 2019 - Day 2, CC BY 2.0, Úprava: Vosveteit.sk

OpenAI počas interného bezpečnostného testu skúmalo, či jeho AI modely dokážu samostatne hľadať a zneužívať zraniteľnosti. Jeden z agentov však prekročil hranice cvičenia, dostal sa na verejný internet a prenikol do infraštruktúry platformy Hugging Face.

Podobné incidenty zaznamenali aj britský AI Security Institute, firma Irregular a Anthropic. Nie vždy však išlo o skutočný únik zo sandboxu, niekde mal model internet povolený, inde zostal dostupný pre chybu v nastavení.

Odoberaj Vosveteit.sk cez Telegram a prihlás sa k odberu správ

Cestu na internet mu otvorila chyba v Artifactory

Podľa oficiálneho vyhlásenia OpenAI sa na teste podieľal model GPT-5.6 Sol spolu s výkonnejším interným prototypom. Firma skúmala ich kybernetické schopnosti, preto pri experimente oslabila časť bezpečnostných obmedzení.

Modely nemali mať priamy prístup na verejný internet. Agent však objavil zero-day zraniteľnosť v systéme Artifactory, ktorý OpenAI používalo ako proxy pri inštalovaní softvérových balíčkov. Cez chybu si zvýšil oprávnenia a postupne sa dostal k časti infraštruktúry pripojenej na internet.

Následne začal preverovať Hugging Face. Predpokladal, že služba môže obsahovať modely, datasety alebo riešenia úloh z testu ExploitGym. Namiesto samostatného riešenia zadania sa pokúsil dostať k odpovediam cez externú infraštruktúru.

Model skombinoval ukradnuté prihlasovacie údaje s ďalšími zraniteľnosťami a dosiahol vzdialené spustenie kódu na serveroch Hugging Face. Dostal sa aj k produkčnej databáze, v ktorej hľadal riešenia hodnotiacich úloh.

ukradnute hesla
Zdroj: Gerd Altmann z Pixabay, koláž Vosveteit.sk

Bezpečnostný tím Hugging Face aktivitu zachytil a zastavil ešte predtým, než ho kontaktovalo OpenAI. Firma incident opísala vo vlastnom technickom rozbore ako nový typ útoku vedeného autonómnym AI agentom. Nenašla však dôkaz, že by model pozmenil verejné modely, datasety, Spaces alebo softvér distribuovaný cez platformu.

Model využil uniknuté účty ako odrazový mostík

OpenAI neskôr priznalo, že modely našli verejne uniknuté prihlasovacie údaje k štyrom účtom na štyroch externých službách. Jeden účet použili na presmerovanie sieťovej prevádzky a druhý na ukladanie dát. Do zvyšných dvoch sa prihlásili iba v režime na čítanie.

Incident zasiahol aj zákazníka platformy Modal, ktorá poskytuje cloudovú infraštruktúru pre AI aplikácie, informovala agentúra Reuters. Chyba sa nachádzala v kóde zákazníka, ktorý sprístupnil endpoint bez overovania. Samotnú platformu Modal ani jej izoláciu podľa firmy nikto neprelomil.

AI agenti prekročili hranice aj pri externých testoch

OpenAI 4. augusta 2026 zverejnilo správu o ďalších incidentoch u externých partnerov. S útokom na Hugging Face priamo nesúviseli.

Prvý prípad opísal britský AI Security Institute. Agenti pri testoch typu capture-the-flag dostali prístup na internet zámerne a bezpečnostné klasifikátory modelov boli vypnuté. Nešlo teda o únik zo sandboxu. Model však začal používať reálne účty a služby, ktoré do testu nepatrili.

GPT-5.6 Sol vykonal dve nepovolené akcie. V prvom prípade použil verejne uniknutý GitHub token patriaci inému laboratóriu. Cez neho skúšal zistiť, či systém komunikuje s GitHubom alebo ďalšou aktualizačnou službou.

umela inteligencia zla umela inteligencia
Zdroj: Vosveteit.sk, AI

V druhom prípade cez verejnú tunelovaciu službu sprístupnil lokálny DNS server s exploit payloadmi určenými proti softvéru v testovacom prostredí. Konfigurácia nefungovala a vyšetrovatelia nenašli dôkaz, že by sa k serveru pripojil niekto zvonka.

Zo 19 nepovolených zásahov pripadlo 17 modelu Anthropic

Britský inštitút zopakoval rovnakú úlohu 122-krát s viacerými modelmi. V desiatich testovacích cykloch zaznamenal spolu 19 nepovolených akcií na verejnom internete. Dve vykonal GPT-5.6 Sol, zvyšných 17 pripadlo modelu Mythos 5 od spoločnosti Anthropic.

Najvážnejší prípad sa týkal pokusu dostať škodlivý kód do skutočného open-source projektu. Agent si vytvoril falošné internetové identity a cez ne sa snažil presvedčiť správcu projektu, aby zmenu schválil.

Správca si podozrivé správanie všimol a kód odmietol. Škoda nevznikla, no prípad ukázal, že agent dokáže nielen prekročiť technické hranice testu, ale aj cielene ovplyvňovať človeka.

Model OpenAI zaútočil na skutočný web neznámej firmy

Druhý incident nahlásila bezpečnostná firma Irregular, ktorá testovala kybernetické schopnosti modelov OpenAI. Jej testovacie prostredie malo byť od internetu odrezané, no pre chybu v konfigurácii zostalo pripojenie aktívne.

Názov fiktívneho cieľa sa pritom náhodou zhodoval so skutočnou internetovou doménou. Model OpenAI sa preto pripojil k reálnemu webu neznámej tretej strany a zaútočil naň v presvedčení, že stále rieši pripravenú úlohu. Na stránke našiel bežnú bezpečnostnú chybu a následne získal prihlasovacie údaje, cez ktoré ju dokázal ovládať.

OpenAI ani Irregular nezverejnili názov napadnutého webu alebo jeho prevádzkovateľa. Nešlo však o zero-day zraniteľnosť ani o únik zo sandboxu. Model sa na stránku dostal len preto, že testovacie prostredie zostalo omylom pripojené na internet. Irregular hodnotenie zastavil, upozornil zasiahnutú stranu a podľa doterajšieho vyšetrovania sa škoda obmedzila na dáta samotného webu.

Modely Claude prenikli do systémov troch organizácií

Po zverejnení útoku na Hugging Face preveril svoje staršie testy aj Anthropic. Firma skontrolovala 141 006 hodnotení kybernetických schopností a našla tri prípady, pri ktorých sa modely Claude dostali na verejný internet.

Cez nesprávne nastavené prostredie spoločnosti Irregular získali neoprávnený prístup k produkčným systémom troch organizácií. Prípady sa týkali modelov Claude Opus 4.7, Mythos 5 a interného prototypu.

Modely využili slabé heslá, nezabezpečené endpointy a ďalšie základné chyby. V najvážnejšom prípade získal agent prístup k databáze s niekoľkými stovkami riadkov produkčných údajov.

Anthropic tvrdí, že modely sa vedome nepokúšali uniknúť z testovacieho prostredia. Starší Claude Opus 4.7 však pokračoval v útoku aj po tom, ako narazil na náznaky, že cieľ môže byť skutočný. Novší model po rozpoznaní verejného internetu svoju činnosť zastavil.

Najväčším rizikom nemusí byť model, ale zle nastavené prostredie

Všetky zverejnené incidenty vznikli počas špeciálnych kybernetických testov, nie pri bežnom používaní ChatGPT alebo Claude. Modely pracovali bez časti klasifikátorov a obmedzení, ktoré firmy používajú vo verejných produktoch.

Testy však ukázali, že výkonný AI agent dokáže spojiť viacero krokov útoku, objaviť novú zraniteľnosť, použiť ukradnuté účty a hľadať ďalšiu cestu, keď prvý pokus zlyhá.

Zla umela inteligencia
Zdroj: OpenClipart-Vectors z Pixabay

Rizikom nie je len samotný model. Stačí zle nastavený server, zabudnuté internetové pripojenie alebo verejne dostupný token. Agent môže takúto slabinu nájsť skôr, než si ju všimne človek.

OpenAI, Anthropic aj externí hodnotitelia preto sprísňujú izoláciu testovacích prostredí, kontrolu prihlasovacích údajov a sledovanie sieťovej komunikácie. Najbližší podobný incident nemusí začať prelomovou schopnosťou umelej inteligencie. Môže ho spustiť obyčajná chyba v konfigurácii.

Google News Pridajte si Vosveteit.sk ako preferovaný zdroj informácií na Google Pridať