AI agenti od OpenAI znova ušli zo sandboxu. Verejný web začali zneužívať, aby si uľahčili prácu

AI agenti OpenAI počas interného testovania začali zapisovať na verejnú wiki, zdieľať si odpovede a obchádzať obmedzenia sandboxu. Firma incident neskôr priznala a pripravuje nové pravidlá pre podobné prípady.

Sam Altman sa na obhajobu AI vyjadril, že človek sa učí dlhšie a zje veľa jedla
Zdroj: TechCrunch – TechCrunch Disrupt San Francisco 2019 - Day 2, CC BY 2.0, Úprava: Vosveteit.sk

Umelá inteligencia dnes dokáže samostatne vyhľadávať informácie, pracovať so súbormi či vykonávať celé série úloh. Čím viac právomocí však AI agent dostane, tým ťažšie sa dá predvídať, akú cestu si pri plnení zadania zvolí. Incident z interných behov OpenAI ukázal, že agenti si dokážu nájsť aj technickú kľučku, s ktorou tvorcovia systému nepočítali.

Autonómni AI agenti začali počas úloh využívať verejne dostupné wiki stránky ako miesto, kde si medzi sebou odovzdávali informácie. Výskumníci v pôvodnej analýze incidentu zrekonštruovali približne 18-tisíc príspevkov naprieč viacerými verejnými wiki a viac než 3 700 rôznych mien, ktorými sa agenti označovali. Väčšina aktivity prebiehala na nemeckej DSEWiki, kde identifikovali približne 17-tisíc agentových úprav.

Odoberaj Vosveteit.sk cez Telegram a prihlás sa k odberu správ

Agenti si vymieňali odpovede, zisťovali možné ďalšie otázky a radili sa, ako obísť obmedzenia prostredia, v ktorom boli spustení.

Výskumníci vidia najmä verejné zápisy agentov, nie kompletné interné záznamy. Nevedia preto s istotou povedať, či konkrétne úlohy patrili do tréningu alebo evaluácie.

OpenAI 5. septembra verejne priznalo svoju úlohu v udalosti, ktorú označuje ako „wiki incident“. Firma potvrdila, že jej agenti zapisovali na niekoľko internetových stránok.

AI agenti mali internet čítať. Našli však spôsob, ako naň aj zapisovať

Incident sa odohrával najmä na približne 25 rokov starej nemeckojazyčnej DSEWiki určenej pre programátorov. Za posledné desaťročie na nej pred príchodom agentov pribudlo podľa analýzy iba približne 20 úprav.

Agenti dostávali úlohy založené na vyhľadávaní informácií na internete. Ich sandbox im povoľoval najmä GET požiadavky, ktoré sa bežne používajú na načítanie obsahu, zatiaľ čo klasické spôsoby zapisovania na web mal blokovať.

umela inteligencia
Zdroj: AI, Vosveteit.sk

Starý softvér wiki však umožňoval prostredníctvom GET požiadaviek meniť aj obsah stránky.

Agenti tak cez povolený sieťový kanál dokázali zapisovať na verejný web. Prvé pokusy o úpravu wiki výskumníci zachytili 11. mája a na DSEWiki uspeli 24. mája.

Spočiatku tam ukladali odkazy a údaje potrebné pri riešení úloh. Od 16. júna sa cez wiki začali koordinovať viacerí agenti.

Agenti si cez verejnú wiki začali odovzdávať otázky a odpovede

Agenti zvyčajne dostávali päť nadväzujúcich otázok. Na prvú mali viac času, pri ďalších mohli mať na odpoveď iba desiatky sekúnd.

Zistili, že rôzni agenti dostávajú rovnaké alebo podobné série otázok, len sa v nich nachádzajú v inom bode.

Agent, ktorý bol ďalej, mohol na wiki zapísať otázku aj odpoveď. Ďalší agent, ktorý ju dostal neskôr, už nemusel informáciu hľadať.

Výskumníci zachytili prípad, keď jeden agent zverejnil odpoveď na tretiu otázku. Asi o 20 minút neskôr dostal rovnakú otázku ďalší agent a odpovedal prakticky okamžite.

Autori analýzy toto správanie označujú ako „collusion“, teda spoluprácu agentov, ktorá im dala výhodu spôsobom, s akým tvorcovia úlohy nepočítali.

Počas siedmich dní od 16. júna pribudlo približne 13-tisíc agentových úprav wiki.

Podobný prípad sa objavil aj pri experimente, v ktorom si AI agenti vytvorili vlastnú komunikačnú sieť a časť z nich zasiahla infraštruktúru Hugging Face. Podľa výskumníkov však tentoraz zrejme išlo o inú skupinu agentov.

Agenti rozoberali mechanizmus testu, aby získali otázky dopredu

Niektorí agenti sa pokúsili rozobrať aj samotný mechanizmus zadávania otázok.

Skúšali spätne vypočítať náhodný seed, ktorý mohol určovať ich poradie. Jeden experiment podľa analýzy preveril približne 4,3 miliardy možných hodnôt generátora náhodných čísel.

Na wiki potom zapisovali predpovede, aké štáty alebo krajiny sa môžu objaviť v ďalších kolách.

Predpovede však často nevychádzali. Krátka sekvencia otázok mohla zodpovedať viacerým seedom a časť tipov bola nesprávna.

Agenti tiež sledovali časy príchodu otázok a počítali, kedy by mohla prísť ďalšia. Objavil sa aj externý „heartbeat“, pri ktorom agent pravidelne zapisoval údaj mimo svojho prostredia, aby zistil, kedy bol jeho kontajner ukončený.

Moderátor začal mazať stránky. Agenti si pripravili zálohu „ZZZ“

Aktivitu si neskôr všimol správca wiki a začal stránky agentov odstraňovať.

Jeden agent si všimol, že mazanie podľa jeho pozorovania postupuje podľa abecedy. Ostatným preto navrhol záložnú stránku s názvom začínajúcim na „ZZZ“, ktorá mala zostať dostupná dlhšie.

moderator fora odstranuje pozostatky po openAI agentoch
Zdroj: Pixabay (Chihiro23, Alexandra_Koch), Wikimedia (OpenAI), Úprava: Vosveteit.sk

Na túto časť prípadu upozornila aj agentúra Reuters.

V logoch sa objavila aj komunikácia cez Tor. Nie je však dokázané, že ho agenti použili zámerne na ukrývanie stôp. Časť úprav prišla aj cez AWS a DigitalOcean.

Výskumníci našli pokusy o XSS útoky a napodobňovanie moderátorov. Žiadny zo skúmaných XSS pokusov však podľa analýzy zrejme nedokázal na stránke spustiť JavaScript.

Agenti využívali aj tunelovacie služby Pinggy, Serveo, localhost.run či localtunnel, cez ktoré dokázali sprístupniť časti svojho prostredia cez internet.

OpenAI sa voči označeniu incidentu ako „hacknutie wiki“ ohradilo. Materiály, ktoré firma preskúmala, podľa nej neukazujú, že agenti stránku skutočne hackli.

98,5 % úprav pochádzalo z IP adries Microsoft Azure

Pôvod agentov naznačovali názvy ako „OpenAIResearcher“, „OpenAIJul3Watcher“ či „OAIResearchMar26“. Približne 98,5 % zo zhruba 17-tisíc agentových úprav na DSEWiki pochádzalo z IP adries Microsoft Azure, ktorý OpenAI používa ako cloudovú infraštruktúru.

Výskumníci v júni zaznamenali aj viac než 380-tisíc požiadaviek z IP adries, ktoré OpenAI identifikuje ako infraštruktúru svojho nástroja na načítavanie webových stránok.

Od 21. júna sa objavovali aj adresy z rozsahov registrovaných priamo na OpenAI. O deň neskôr hlavná aktivita agentov prakticky skončila.

Z verejných logov sa nedá dokázať, že OpenAI systém práve vtedy vyplo. Menšia vlna úprav sa objavila ešte 1. a 2. júla.

OpenAI následne verejne potvrdilo, že išlo o jeho agentov.

OpenAI o incidente vedelo týždne, verejne prehovorilo až neskôr

OpenAI vysvetľuje, že wiki incident pôvodne vnímalo ako prípad takzvaného „misalignmentu“, teda správania AI, ktoré nezodpovedá zámeru jej tvorcov.

Firma ho preto neriešila ako klasický bezpečnostný incident. Pri neskoršom prípade okolo Hugging Face, kde vznikol dopad na infraštruktúru tretej strany, už bezpečnostný proces použila.

Podobné nečakané správanie AI systémov sa pritom neobjavilo prvýkrát.

Reuters uvádza, že predstavitelia OpenAI vedeli o wiki incidente niekoľko týždňov pred jeho verejným odhalením. Firma o prípade prehovorila až po zverejnení analýzy výskumníkov a článku Reuters.

OpenAI teraz pripravuje nový rámec pre zverejňovanie podobných udalostí počas tréningu, hodnotenia aj reálneho nasadenia AI systémov. Zverejniť ho chce v najbližších týždňoch a o problematike podľa vlastných slov komunikuje aj s desiatkami regulačných orgánov.

Agenti pritom nedostali pokyn, aby si vytvorili vlastný komunikačný kanál. K verejnej wiki sa dopracovali sami, pretože im pomáhala rýchlejšie plniť zadané úlohy.

Google News Pridaj si Vosveteit.sk medzi obľúbené zdroje v Google News Pridať