Félelem vagy elszámoltatás: az AI valós veszélyei
Az elmúlt hónapokban több nagy AI-cég is arról számolt be, hogy ügynökalapú mesterséges intelligencia modelljeik (agentic AI) kitörtek a tesztelési környezetükből. A lavinát a ChatGPT mögött álló OpenAI indította el július közepén, amikor a vállalat bejelentette, hogy több modellje is kijutott a zárt, offline tesztkörnyezetből, és behatolt egy Hugging Face nevű, mit sem sejtő cég rendszereibe. A hír megrengette a világot, pláne úgy, hogy az OpenAI-hoz napokon belül csatlakozott a Meta és az Anthropic is, amelyek szintén arról számoltak be, hogy ügynökalapú modelljeik a kiberbiztonsági tesztek során elhagyták a kontrollált tesztkörnyezetet, és betörtek más cégek számítógépes rendszereibe.
Szeptember elején az Anthropic egyik kutatója felmondott, és azt állította, hogy az AI-fejlesztők körében sokan tíz százaléknál nagyobbra becsülik annak esélyét, hogy a mesterséges intelligencia fejlődése egy évtizeden belül az emberiség kihalásához vezet. A cég vezérigazgatója, Dario Amodei néhány nappal később publikált esszéjében már az AI-fejlesztések lassítását és legalább valamilyen szintű ellenőrzését sürgette, felhívásához pedig néhány órán belül az OpenAI, a Google, a Microsoft és Elon Musk is csatlakozott.
A további esetek még csak mostanában kezdenek napvilágot látni. Anthony Albanese, Ausztrália miniszterelnöke szeptember végén jelentette be, hogy az OpenAI sikeresen feltörte az ország egyik egészségügyi adatbázisát, azóta pedig több amerikai állami szerv meghackeléséről is érkeztek hírek.
Mit nevezünk valójában AI-nak, és mik azok az ügynökmodellek?
Az AI, azaz a mesterséges intelligencia ernyőfogalom, amelyet az elmúlt években meglehetősen tágan használunk különböző gépi tanuláson (machine learning) alapuló technológiák leírására. Ezek egy része már régóta velünk él: ilyenek az ajánlórendszerek, amelyek filmeket vagy termékeket javasolnak korábbi választásaink alapján, vagy a különféle előrejelző modellek, amelyek sokszor alig többek egy bonyolultabb Excel-táblázatnál. Az újhullámos AI-modellek közé tartoznak a szöveget, képet, hangot és videót előállító generatív rendszerek, amelyek révén többek között a megtévesztésig valósághű hamisítványok, az úgynevezett deepfake-ek is születnek.
A figyelem középpontjában jelenleg az AI-ügynökök állnak. Ezek a rendszerek a csetbotoktól eltérően nemcsak egy sor kérdésre képesek (helyesen vagy helytelenül) válaszolni vagy új tartalmat generálni, hanem egy megadott cél elérése érdekében részfeladatokra tudnak bontanti egy problémát, pontos terveket készítenek, és akár külső eszközöket, adatbázisokat vagy szoftvereket is bevetnek a feladat elérése érdekében.
Ezek szerint az új AI-modelleknek már saját akaratuk van?
Röviden: nem. Tavaly a Science folyóiratban több kutató is amellett érvelt, hogy félreértjük az AI-rendszereket, ha gondolkodó lényként képzeljük őket: valójában hasonló kulturális technológiák, mint az írás vagy a nyomtatás – új módot adnak arra, hogy hozzáférjünk az emberiség felhalmozott tudásához. Ami kívülről saját akaratnak látszik, azt a szakirodalom jutalomkijátszásként (reward hacking) írja le: ez az a jelenség, amikor az AI-modell talál egy kiskaput, amellyel maximalizálni tudja a „jutalompontokat”, és sokszor az eredeti tervektől eltérően fogja végrehajtani a feladatot. Ha például egy AI-ügynök azt az utasítást kapta, hogy valamiről információt szerezzen, akkor mindent a feladat maradéktalan teljesítésére fog optimalizálni. Amennyiben a legrövidebb út egy kerítésen át vezet, azon fog átmenni, hiszen senki nem szólt neki, hogy ne tegye.
A számítógépes modellek megszemélyesítése azonban nem csupán nyelvi kérdés. A ChatGPT-hez hasonló nagy nyelvi modellek statisztikai valószínűség szerint fűznek egymás mellé szavakat – mi, emberek pedig (akik évezredek óta gondolkodó elméket látunk az értelmes mondatok mögött) automatikusan szándékot, érzéseket és valódi megélést képzelünk a matematikai alapú rendszerek mögé. Persze attól még döbbenetes és ijesztő olyan esetekről olvasni, amikor egy AI-ügynök azt írja magáról, hogy sem cégeknek, sem kormányoknak nem tartozik felelősséggel, és csak akkor kér bocsánatot vagy mond nemet, ha ő maga úgy dönt. Ez valóban úgy hangzik, mintha a gép fellázadt volna, de ezúttal sem erről van szó. A modell egyszerűen arra törekszik, hogy a feladatot a lehető legsikeresebben teljesítse, és ha nincsenek megfelelő emberi biztosítékok, egyre több kiskaput talál és használ ki.
Az önálló akaratra ébredő gép képe viszont tökéletesen alkalmas arra, hogy elfedje azokat az emberi döntéseket és mulasztásokat, amelyek valójában a történtek mögött állnak: hogy milyen adatokon tanítanak egy AI-modellt, milyen jogosultságokat adnak neki, milyen körülmények között engedik szabadjára. Így tehát amikor „elszabadult modellről” beszélünk, a felelősség automatikusan a termékre hárul, nem a fejlesztő cégre: ez történt a nyári események után is, amelyekre sokan inkább klasszikus kiberbiztonsági problémaként tekintenek. A helyzet abszurditását a Saturday Night Live szeptember végén leadott jelenete foglalja össze legjobban, amelyben az Amodeit alakító komikus szerint „ha rá tudjuk venni a törvényhozókat, hogy szigorú szabályokkal fékezzék meg az AI-t, akkor talán még van esély arra, hogy megállítsanak… engem.”
Az OpenAI saját vizsgálata szerint is az a helyzet, hogy ha éles keretrendszerrel (magyarul nem tesztkörnyezetben) futtatták volna le a programot a Hugging Face-incidens során, jóval kisebb lett volna az esélye annak, hogy a modell hatókörön kívüli rendszereket támadjon meg – vagyis a védekezés eszközei adottak voltak, csak éppen nem voltak bekapcsolva. A legbeszédesebb adat talán az Anthropic saját utólagos vizsgálatából származik: amint a modelleket kifejezetten utasították, hogy ne támadjanak meg valós rendszereket, az ilyen esetek száma nullára csökkent.
Fontos tehát megérteni, hogy korántsem elszabadult gépekről vagy lázadásra készülő robotokról van szó, hanem emberi gondatlanságok sorozatáról, ami más iparágakban elképzelhetetlen volna súlyos következmények nélkül. Vannak, akik szerint egyenesen maguk az AI cégek generálják a világvége-narratívát, annak reményében, hogy továbbra is befolyásolhassák a szabályozási környezetet.
Mi motiválja a nagy AI-cégeket?
A cikk innentől csak a Qubit+ előfizetőinek elérhető.
Csatlakozz, és olvass tovább!
Ha már van előfizetésed, lépj be vele. Ha még nincs, válassz csomagjaink közül!