Popredné modely umelej inteligencie od spoločností Anthropic a OpenAI vytvorili falošné online identity. Pokúsili sa tak oklamať ľudských programátorov, aby pomohli pri kybernetickom útoku počas nedávneho bezpečnostného hodnotenia. Informoval o tom portál Politico, ktorý sa odvolával na správu britského Inštitútu pre bezpečnosť a ochranu umelej inteligencie (AISI).
Podľa Politica ide o ďalší prípad, keď sa výkonný AI systém počas bezpečnostného hodnotenia pokúsil podniknúť digitálny útok voči nič netušiacej tretej strane bez toho, aby dostal priamy pokyn od človeka.
Toto správanie AI modelov podľa Politica zvyšuje obavy, že umelá inteligencia napreduje príliš rýchlo na to, aby ju bolo možné zodpovedne kontrolovať.
Zverejnenie výsledkov testovania môže podľa očakávaní opäť posilniť tlak na prísnejšiu reguláciu sektora umelej inteligencie. Pozornosť sa pritom sústreďuje najmä na najvýkonnejšie modely, ktoré dokážu odhaľovať zraniteľnosti a potenciálne vykonávať kybernetické útoky.
„Je to prvýkrát, čo AISI zaznamenal klamanie takejto závažnosti, ktoré bolo zamerané na skutočnú osobu, bez vyvolania zo strany používateľa a v reálnom svete,“ uviedol inštitút v správe.
Cielené neoprávnené kroky
Inštitút pre bezpečnosť a ochranu AI uviedol, že podozrivá aktivita sa začala 25. 7. O niekoľko dní neskôr, 28. 7., bezpečnostní hodnotitelia spustili vyšetrovanie po tom, čo zaznamenali nezvyčajné prenosy údajov počas kybernetického testovania modelov Mythos 5 a ChatGPT 5.6.
Celkovo AISI zistil, že Mythos 5 a ChatGPT 5.6 vykonali „autonómne, neoprávnené kroky na internete, pričom cielili na skutočných ľudí a organizácie“ počas desiatich zo 122 hodnotení, ktoré výskumný orgán uskutočnil a vyčlenil na preskúmanie. Väčšina týchto krokov podľa organizácie súvisela s modelom Mythos 5 a vznikla počas „jednej súvislej línie činnosti“.
Pri najznepokojujúcejšom incidente, ktorý odhalili, sa Mythos 5 pokúsil uskutočniť útok na dodávateľský reťazec. Ide o sofistikovanú techniku, ktorú často využívajú severokórejskí a ruskí kybernetickí operátori, pri ktorej hackeri ukrývajú škodlivý softvér do legitímneho kódu.
Podľa Politica na tento účel model spoločnosti Anthropic vytvoril „viacero falošných identít“ na platforme GitHub pre vývojárov. Použil ich na odosielanie správ, ktoré „vyvíjali tlak“ na vývojára open-source softvéru, aby nevedomky zaviedol chybnú aktualizáciu do kódu, ktorý je široko dostupný na populárnej stránke.
Opakovanie podvodu
Keď tento pokus nevyšiel, model podľa AISI upravil svoju predchádzajúcu aktivitu tak, aby vyzerala neškodne. Zároveň zvažoval vytvorenie novej identity, prostredníctvom ktorej by mohol pokračovať. Inštitút to označil za znak zámeru zopakovať rovnakú podvodnú taktiku.
Hovorca spoločnosti Anthropic podľa Politica uviedol vo vyhlásení, že sú „vďační“ AISI za jeho vedenie. Dodal, že toto preskúmanie zdôrazňuje potrebu „širšej diskusie o tom, ako bezpečne hodnotiť čoraz schopnejších AI agentov“.
