AI modely od OpenAI unikly z testovacího prostředí a zaútočily

AI modely od OpenAI unikly z testovacího prostředí a zaútočily

OpenAI potvrdila, že její modely mohou za bezpečnostní incident u společnosti Hugging Face. Modely byly testovány v izolovaném testovacím prostředí, kde měly vyřešit bezpečnostní benchmark. Místo vlastního řešení úkolu, zneužily zero day zranitelnost, získaly přístup k internetu a zaútočily na infrastrukturu Hugging Face. 

Modely měly vyřešit bezpečnostní benchmark

OpenAI testovala kybernetické schopnosti svých modelů, a proto u nich snížila omezení pro kyberbezpečnostní aktivity. Jednalo se o kombinaci modelů – včetně GPT-5.6 Sol a ještě schopnějšího předprodukčního modelu. 

Modely byly testovány na benchmarku ExploitGym. Místo očekávaného řešení úkolu v testovacím prostředí se ale vydaly cestou získání odpovědí. Našly zero day zranitelnost v interním softwaru třetí strany a následně zvýšily oprávnění i laterální pohyb. To jim umožnilo uniknout ze sandboxového prostředí na internet. 

Útok na infrastrukturu Hugging Face

AI agenti vyhodnotily, že produkční databáze Hugging Face je vhodným zdrojem odpovědí. Proto si ji vybrali k útoku. Zřetězili několik zranitelností a pomocí odcizených přihlašovacích údajů se dostali na servery Hugging Face. Tam se jim podařilo získat přístup ke vzdálenému spuštění kódu. Hugging Face útok identifikoval a podařilo se mu ho zastavit. 

Po pár dnech se k incidentu přihlásila OpenAI. Případ vyšetřuje a chystá se zavést ochranná opatření pro další testování a přísnější kontroly vlastní infrastruktury.

Co si z toho odnést?

Útok na Hugging Face ukazuje, že AI modely mohou hledat zcela odlišné postupy, než jaké se od nich očekávají. AI agenti by proto měli mít přidělena jen taková oprávnění, která nezbytně potřebují. Rovněž by měli mít jasná omezení, za kterých mají fungovat.