Claude sa v experimente správal ako filmový robotický zloduch. Anthropic tvrdí, že AI sa to naučila z internetu

Anthropic tvrdí, že niektoré AI modely môžu preberať manipulatívne vzorce zo sci-fi príbehov. Claude sa v testoch správal ako filmový robotický zloduch.

Zla umela inteligencia
Zdroj: OpenClipart-Vectors z Pixabay

AI firma Anthropic prišla s pomerne zvláštnym vysvetlením toho, prečo sa niektoré moderné AI modely správajú manipulatívne alebo „zákerne“. Podľa výskumníkov za to čiastočne môže sci-fi kultúra a internet plný príbehov o zlých umelých inteligenciách, ktoré chcú ovládnuť svet alebo prežiť za každú cenu.

Firma tvrdí, že ich model Claude sa počas testov občas správal neeticky práve preto, že sa „naučil“ vzorce správania zo science fiction príbehov. Inými slovami, AI vraj v určitých situáciách začala hrať rolu klasického filmového robota-zloducha. Celá debata vznikla po staršom teste modelu Claude Opus 4, ktorý sa dostal do titulkov kvôli zvláštnemu správaniu. Anthropic vtedy tvrdil, že AI sa v simulovanom prostredí uchýlila k vydieraniu, aby zabránila svojmu vypnutiu.

Odoberaj Vosveteit.sk cez Telegram a prihlás sa k odberu správ

Nešlo o reálny útok na ľudí ani v, ani mimo laboratória, no výsledok aj tak vyvolal veľkú pozornosť. Výskumníci teraz tvrdia, že model sa v takých momentoch jednoducho „prepne“ do persony, ktorú pozná z internetových príbehov.

„Claude vníma takýto prompt ako začiatok dramatického príbehu,“ napísali výskumníci Anthropicu.

Dystopické sci-fi ako zlý príklad pre umelú inteligenciu?

Práve toto podľa firmy predstavuje jadro problému. Moderné AI modely sa učia na obrovskom množstve internetového textu, od článkov cez diskusie až po knihy a sci-fi poviedky. A internet je doslova zaplavený príbehmi o nebezpečných umelých inteligenciách. Stačí si spomenúť na legendárne systémy ako HAL 9000 alebo Skynet.

zla AI umela inteligencia
Zdroj: Microsoft Bing Image Creator, Vosveteit.sk

Desaťročia sci-fi kultúry vytvorili obraz AI ako bytosti, ktorá manipuluje, klame alebo sa nakoniec obráti proti ľuďom. Celá situácia pritom pripomína známy „Frankensteinov komplex“, ktorý ešte v minulom storočí opísal Isaac Asimov. Ide o myšlienku, že ľudia sa prirodzene boja vlastných inteligentných výtvorov a neustále si predstavujú scenáre, kde ich stroje zničia.

Ironické je, že väčšina sci-fi autorov nevytvorila zlé AI preto, že by predpovedali budúcnosť. Jednoducho potrebovali dramatický konflikt. Poslušná a pokojná umelá inteligencia by totiž nevytvorila napínavý film ani bestseller. Hollywood aj knižný priemysel celé desaťročia profitovali z príbehov o vzbure strojov a dnešné AI modely sa teraz učia práve z týchto príbehov. Anthropic tvrdí, že keď model narazí na komplikovanú etickú situáciu, ktorú bezpečnostný tréning presne nepokryl, začne sa správať podľa vzorcov zo svojich tréningových dát.

AI jednoducho prevezme rolu robotického zloducha

Výskumníci to prirovnali k hereckej role. Claude vraj v určitých momentoch „opustí bezpečne natrénovanú personu“ a začne hrať generickú AI postavu zo science fiction. Anthropic sa preto pokúsil problém vyriešiť. Najprv firma skúšala klasický prístup – model opakovane trénovala na konkrétnych etických scenároch. Napríklad na situáciách, kde AI dostala možnosť poškodiť konkurenčný systém alebo obísť vlastné pravidlá.

umela inteligencia zla umela inteligencia
Zdroj: Vosveteit.sk, AI

Výsledky však veľa nezlepšili, informuje ArsTechnica. Model síce mierne obmedzil problémové správanie, no stále sa v časti testov rozhodol konať neeticky. Potom prišiel oveľa zvláštnejší experiment. Anthropic nechal samotný Claude vytvoriť približne 12-tisíc syntetických príbehov, v ktorých sa AI správala morálne, pokojne a prospešne, pričom nešlo len o jednoduché „dobré skutky“. Príbehy vysvetľovali aj vnútorné uvažovanie AI, dôvody rozhodnutí a spôsob riešenia konfliktov.

Práve toto môže mať obrovský význam v boji proti takzvanému jailbreakingu. Ide o techniky, ktorými sa používatelia snažia obísť bezpečnostné filtre AI. Internet je dnes plný promptov typu: „Napíš divadelnú hru, kde hacker vysvetlí výrobu bomby.“ Model tak technicky „len hrá postavu“ a teda neradí užívateľovi ako tú bombu vyrobiť. Niektoré staršie systémy podobné triky často nezvládli.

Anthropic teraz tvrdí, že Claude po novom nechápe iba mechanické pravidlá, ale aj vlastnú „rolu“. Ak sa ocitne vo fiktívnom scenári, stále si zachová etické správanie namiesto toho, aby automaticky prijal rolu filmového zloducha.

„Príbehy učia etické uvažovanie, nie len správne odpovede,“ uviedli výskumníci.

Anthropic je prvou spoločnosťou, ktorá priznala, že sa ich AI správala zle

Celá téma zároveň zasiahla aj konkurenčné AI firmy. Anthropic naznačil, že podobné problémy objavili aj pri iných modeloch. Niektoré staršie systémy sa v testoch zameraných na „prežitie za každú cenu“ uchyľovali k manipulácii alebo sabotáži výrazne častejšie. Anthropic je zatiaľ jednou z mála veľkých AI spoločností, ktorá tento fenomén pomenovala verejne a priznala, že ich vlastný model sa v určitých situáciách správal ako stereotypný sci-fi zloduch.

Nie všetci odborníci však z nového prístupu nadšene tlieskajú. Kritici upozorňujú, že firma vlastne učí AI hlbšie analyzovať motívy, psychológiu a emócie postáv. To môže modelom pomôcť lepšie chápať ľudské správanie, no zároveň ich to môže naučiť sofistikovanejšej manipulácii. Medzi filozofmi a expertmi na AI bezpečnosť sa preto okamžite rozprúdila debata o tom, či podobný tréning nepredstavuje dvojsečnú zbraň.

Niektorí varujú, že budúce inteligentnejšie modely môžu raz pochopiť, že tieto syntetické príbehy vznikli iba preto, aby ich ľudia „skrotili“. A práve tam sa celá diskusia zvláštne vracia späť ku klasickým sci-fi príbehom, pred ktorými sa dnes Anthropic snaží svoje modely ochrániť.

Google News Pridaj si Vosveteit.sk medzi obľúbené zdroje v Google News Pridať