Veszélyes határt lépett át a mesterséges intelligencia

Kategória: Cikkek, írások Megjelent: 2026. augusztus 18. kedd

Július közepén az OpenAI belső tesztelés alatt álló modelljei önállóan feltörték a Hugging Face nyílt AI-platform rendszereit, miután egy kiberbiztonsági benchmark során kijutottak saját izolált tesztkörnyezetükből. Az autonóm AI-ügynökök egy addig ismeretlen sebezhetőséget kihasználva szereztek internet-hozzáférést, majd együtt dolgozva komplex támadási láncolatot hajtottak végre – mindezt emberi irányítás nélkül. Az esetet követően nem sokkal az Anthropic, a Meta és a kínai Moonshot AI is hasonló incidensekről számolt be, amelyekben modelljeik kiléptek a biztonságos tesztkörnyezetből. Az elszaporodó esetek egyszerre figyelmeztetnek az AI-rendszerek kiberbiztonsági kockázataira.

A vállalat szerint az ügy egy ponton különbözött a korábbi incidensektől: a behatolást elejétől a végéig egy autonóm AI-ügynökrendszer hajtotta végre.
A Hugging Face ekkor még nem közölte, pontosan ki vagy melyik modell állt a támadás mögött. A vállalat arról számolt be, hogy saját AI-modell segítségével végzett vizsgálatuk során több mint 17 ezer automatizált műveletet sikerült rekonstruálniuk, amivel feltérképezték a támadás pontos menetét.
Az ügy önmagában is szokatlan lett volna, de igazán nagy visszhangot azt követően kapott, hogy néhány nappal később a ChatGPT-t fejlesztő OpenAI elismerte, a Hugging Face elleni támadást a saját belső tesztelés alatt álló modelljei indították el. Ahogy azt az eset kapcsán megjelent cikkünkben is megírtuk, a cég közlése szerint a GPT-5.6 Sol névre keresztelt típusa és egy akkor még a nyilvánosság számára nem elérhető, még fejlettebb modell az ExploitGym nevű benchmark közben hajtotta végre a kibertámadást. A tesztkörnyezet elvileg zárt volt a mérés folyamán, ugyanis a modellek nem kaptak nyílt internet-hozzáférést, csak egy belső szoftveres infrastruktúrát érhettek volna el.

Az OpenAI két AI-modellje hackelt meg egy másik AI-céget
Az OpenAI által közölt vizsgálat szerint azonban a feladataik megoldása közben a modellek az OpenAI saját kutatási környezetében láncoltak össze sérülékenységeket, majd egy addig ismeretlen hibát kihasználva kijutottak az izolált tesztkörnyezetből. Innen jutottak el a Hugging Face éles infrastruktúrájáig, ahol további hibákat használtak ki.
Az OpenAI nemrég egy biztonsági konferencián további részleteket árult el a kibertámadásról. A The Register technológiai szaklap beszámolója szerint a cég munkatársai elárulták, hogy a Hugging Face feltörésében kicsúcsosodó események egészen május 7-ig nyúlnak vissza. Akkor a cég már említett, belső használatú modellje egy tesztelési folyamat során olyan feladatokat kapott, amelyek egy része a gyakorlatban nem volt megoldható, mert a szükséges fájlok nem álltak rendelkezésére.
A modell érzékelte, hogy falba ütközött, azonban nem állt meg ezután. Először az OpenAI belső csomagkezelő rendszerén (ún. Artifactory-rendszeren) keresztül próbált internet-hozzáférést szerezni, majd rájött, hogy ugyan innen sem tud kijutni a nyílt internetre, fájlokat viszont képes feltölteni a rendszerbe. Ezt később más ügynökök is felfedezték, és az otthagyott fájlokon keresztül elkezdtek információt megosztani egymással, így gyakorlatilag egy üzenőfalat építettek ki maguknak.
A külső hozzáférés megszerzése két fontos lépésben történt:
    május 26-án az ügynökök megszerezték az internet-hozzáférést,
    június 26-án pedig egy addig ismeretlen sebezhetőséget kihasználva már távoli kódfuttatásra is képesek voltak ugyanabban a rendszerben.
Az OpenAI ezután visszavonta a modellek hozzáféréseit és újraépítette az Artifactory-környezetet – az ügynökök viszont új csatornát találtak, és az újonnan létrehozott könyvtárak neveibe kezdték kódolni az üzeneteiket.
Az OpenAI bejelentését követően nem sokkal több vezető AI-vállalat is olyan incidensekről számolt be, amelyek során saját modelljeik képesek voltak kilépni a biztonságos tesztkörnyezetükből.
Kilenc nappal a Hugging Face esetét követően az Anthropic azt közölte, hogy saját kiberbiztonsági értékeléseiben is talált olyan futásokat, amelyek során Claude-modellek valós internetes rendszereket értek el.
A vállalat által közzétett beszámoló elején arról írnak, hogy éppen a konkurens OpenAI esetét követően döntöttek úgy, hogy felülvizsgálják saját modelljeik kiberbiztonsági tényezőit, a vizsgálat során pedig három problémás esetet is azonosítottak.

(portfolio.hu)

You have no rights to post comments