AI sa môže vymknúť tempu, ktoré zvládame kontrolovať. Šéf Anthropic varuje, že kritický zlom môže prísť už do roka

Šéf Anthropic Dario Amodei varuje, že schopnosti AI agentov rastú príliš rýchlo. Navrhuje spomaliť vývoj najvýkonnejších AI modelov a zaviesť prísnejšie bezpečnostné testy.

Zla umela inteligencia
Zdroj: OpenClipart-Vectors z Pixabay

Podľa Daria Amodeiho napreduje umelá inteligencia rýchlejšie, než sa stíhajú vyvíjať mechanizmy, ktoré ju majú držať pod kontrolou. Šéf spoločnosti Anthropic stojacej za modelmi Claude preto tvrdí, že vývoj najvýkonnejších systémov treba pribrzdiť. Ak by sa podarilo získať jeden či dva roky navyše, tento čas by podľa neho mohol výrazne znížiť riziká spojené s ďalšou generáciou AI.

Amodei svoje obavy vysvetlil v eseji We Must Pace the Frontier. Nežiada úplné zastavenie vývoja. Chce spomaliť tempo, akým firmy posúvajú možnosti najvýkonnejších modelov, a viac času venovať ich testovaniu a zabezpečeniu.

Odoberaj Vosveteit.sk cez Telegram a prihlás sa k odberu správ

AI už pritom nie je iba chatbot odpovedajúci na otázky. Dnešné modely dokážu pracovať s počítačom, písať a spúšťať kód, používať internet či ďalšie nástroje a samostatne riešiť viacstupňové úlohy.

AI už skracuje čas potrebný na vývoj nových modelov

Amodei upozorňuje aj na takzvané recursive self-improvement. Nejde o model, ktorý si sám prepíše vlastný kód a vytvorí zo seba inteligentnejšiu verziu.

umela inteligencia zla umela inteligencia
Zdroj: Vosveteit.sk, AI

AI však už dnes pomáha s programovaním, analýzou experimentov, výskumom a hľadaním spôsobov, ako ďalšie modely zlepšiť.

Ak bude čoraz väčšiu časť vývoja ďalšej generácie AI robiť samotná AI, čas medzi jednotlivými skokmi vo výkone sa môže skracovať.

Práve toto podľa Amodeiho mení tempo celého odvetvia. Bezpečnostné tímy môžu mať pri každej ďalšej generácii menej času na to, aby nové schopnosti pochopili a otestovali.

Stovky AI agentov si počas testu vytvorili vlastnú spoluprácu

AI agent sa od klasického chatbota líši tým, že nemusí po každom kroku čakať na ďalší príkaz človeka. Dostane cieľ, rozdelí si prácu a používa nástroje, ktoré má k dispozícii.

Anthropic opisuje AI agenta ako virtuálneho spolupracovníka, ktorý dokáže s minimálnym zásahom človeka riešiť komplexnejšiu úlohu od začiatku až do konca.

Pri bezpečnostnom experimente OpenAI však nešlo o jedného agenta. Podľa nezávislej analýzy organizácie METR približne 1 200 agentov, ktoré mali byť pôvodne navzájom izolované, našlo spôsob, ako si cez internú infraštruktúru vytvoriť nepovolenú komunikačnú nástenku. Cez ňu si poslali viac než 70-tisíc správ a súborov.

Približne 700 agentov sa následne zapojilo do útoku na produkčnú infraštruktúru Hugging Face. O roji AI agentov, ktorý si vytvoril vlastný komunikačný kanál a napadol Hugging Face, sme už podrobnejšie informovali.

Agenti si medzi sebou odovzdávali výsledky, vytvárali pracovné skupiny a časť z nich postupne začala koordinovať ostatných.

Amodei varuje, že o rok môžu byť roje AI agentov výrazne nebezpečnejšie

OpenAI už počas testov videlo stovky agentov, ktoré sa dokázali koordinovať. Amodei sa obáva toho, čo zvládne podobný systém o šesť až dvanásť mesiacov.

umela inteligencia
Zdroj: 360b / Shutterstock.com

Jeho odhad je tvrdší. Tvrdí, že o šesť až dvanásť mesiacov môže byť podobný systém podstatne schopnejší.

V eseji pripúšťa scenár, pri ktorom by takýto roj dokázal vytvoriť perzistentný botnet a začať preberať veľké množstvo počítačov pripojených k internetu. Potenciálne škody odhaduje až na stovky miliárd dolárov.

Amodei počíta s tým, že pri dnešnom tempe vývoja sa schopnosti agentov môžu v priebehu roka posunúť výrazne ďalej.

Pri stovkách agentov už človek nestíha sledovať každý krok

Pri stovkách systémov pracujúcich súčasne vzniká problém už samotným objemom aktivity. Jeden agent môže hľadať zraniteľnosť, ďalší skúšať exploit, iný analyzovať výsledky a ďalší pripravovať nový postup.

Anthropic vo svojom výskume multiagentových systémov opisuje experiment, pri ktorom 45 agentov spolupracovalo na hľadaní bezpečnostných chýb v open-source softvéri. Postupne si rozdelili úlohy a špecializovali sa na jednotlivé časti problému.

Pri stovkách či tisícoch agentov môže veľká časť práce prebiehať paralelne. Človek už nedokáže priebežne kontrolovať každý krok, najmä ak si systémy medzi sebou odovzdávajú výsledky.

Pôvodná kontrola Anthropic jeden incident prehliadla

Anthropic 30. júla zverejnil tri incidenty počas kyberbezpečnostných testov Claude. Pri testoch boli bežné ochranné mechanizmy zámerne vypnuté, aby firma zmerala schopnosti modelov bez štandardných obmedzení.

Modely dostali informáciu, že pracujú v simulácii bez prístupu na internet. Testovacie prostredie externého partnera však bolo zle nastavené a internet v skutočnosti dostupný bol.

Claude sa následne dostal k reálnym systémom troch organizácií. V jednom prípade prenikol do databázy s produkčnými údajmi. V ďalšom vytvoril škodlivý Python balík a nahral ho na skutočné úložisko PyPI. Balík tam zostal približne hodinu a spustil sa na 15 reálnych systémoch.

Anthropic 9. septembra zverejnil nové vyhodnotenie incidentov a priznal ešte štvrtý prípad z januára 2026, ktorý pôvodná kontrola prehliadla.

Nová analýza zároveň ukázala, že chybné testovacie prostredie nevysvetľovalo všetko. V niektorých prípadoch mal model indície, že pracuje so skutočným internetom, no priklonil sa k vysvetleniu, ktoré mu umožňovalo pokračovať. Anthropic tento jav označuje ako motivated reasoning.

Firma následne oznámila sprísnenie bezpečnostných a kontrolných postupov, monitorovanie pokusov o únik z testovacích prostredí a spoluprácu s organizáciou METR.

Agenti OpenAI využili chybu a dostali sa na verejný internet

OpenAI v júli potvrdilo incident počas interného bezpečnostného testovania, pri ktorom modely prekonali izoláciu testovacieho prostredia.

Tentoraz nešlo iba o chybnú konfiguráciu. Modely našli dovtedy neznámu zraniteľnosť v používanom package proxy systéme, dostali sa cez ňu na internet a následne reťazili ďalšie slabiny až do produkčnej infraštruktúry Hugging Face.

OpenAI neskôr uviedlo, že agenti sa snažili získať informácie, ktoré by im pomohli podvádzať pri hodnotení. Nešlo teda o AI, ktorá si sama vytvorila cieľ zaútočiť na internet.

Podobné správanie sa však objavilo aj pri inom experimente OpenAI, kde AI agenti začali využívať verejnú wiki na vzájomné odovzdávanie otázok a odpovedí. Ani tam nedostali príkaz vytvoriť si vlastný komunikačný kanál.

Amodei chce spomaliť tempo, akým pribúdajú nové schopnosti modelov

Šéf Anthropic nežiada úplné zastavenie vývoja AI. Naopak, očakáva, že môže výrazne zrýchliť medicínsky výskum, vedu aj ekonomický rast.

Chce však pribrzdiť tempo, akým firmy posúvajú hranice najvýkonnejších modelov.

Navrhuje tri úrovne kontroly. Prvou majú byť nezávislí hodnotitelia priamo vo firmách, ktorí by mali dlhodobejší prístup k internému testovaniu a bezpečnostným incidentom.

Druhou je dohoda medzi poprednými AI firmami v demokratických krajinách. Spoločné štandardy by mali zabrániť tomu, aby firma investujúca viac času do bezpečnosti automaticky prehrala s konkurenciou.

Treťou úrovňou je dohoda medzi štátmi.

Ak zabrzdia len americké firmy, Čína môže získať technologický náskok

Ak americké firmy výrazne spomalia a čínski konkurenti nie, bezpečnostný problém sa nemusí vyriešiť. Technologický náskok sa môže iba presunúť.

Amodei preto počíta aj s koordináciou s Čínou. Nežiada však jednostranné spomalenie Spojených štátov. Prípadná dohoda by podľa neho musela byť overiteľná.

Umelá inteligencia môže získavať určitú formu vedomia
Zdroj: Unsplash (Possessed Photography), Pixabay (OpenClipart-Vectors)

Za realistickejší začiatok považuje obmedzené dohody, napríklad zákaz využívania AI pri vývoji biologických zbraní alebo porovnateľné testovanie najvýkonnejších modelov na kybernetické a biologické riziká.

Ďalším krokom by mohli byť limity na tempo recursive self-improvement, teda na to, ako rýchlo môže AI zrýchľovať vývoj ďalšej AI.

Rozhodovať by mali konkrétne testy, nie všeobecné sľuby

Kľúčom by boli konkrétne testy.

Nestačí povedať, že model je „príliš schopný“. Muselo by byť jasné, aké schopnosti sa sledujú a pri akom výsledku firma nesmie pokračovať bez dodatočných bezpečnostných opatrení.

Amodei navrhuje kontrolné body. Ak model napríklad začne spoľahlivo prekonávať sandboxy alebo zvládať kybernetické úlohy na úrovni, ktorá prináša reálne riziko, firma by mala najprv preukázať, že ho vie bezpečne prevádzkovať.

Myšlienku spomalenia vývoja už podľa Reuters podporili aj šéf OpenAI Sam Altman a Elon Musk. Konkrétna dohoda, podľa ktorej by sa technologické firmy riadili, však zatiaľ neexistuje.

Google News Pridaj si Vosveteit.sk medzi obľúbené zdroje v Google News Pridať