Veetsin eelmisel nädalal ühe hilisõhtu analüüsides logisid ründemeeskonna õppusest, mis oli suunatud ettevõttesisesele LLM-i rakendusele. Ründaja kasutas keerukat viiba süstimiste (prompt injection) ahelat, et mööduda standardsetest sisendfiltritest. See oli õpikunäide arhitektuursest paradoksist. Organisatsioon oli kulutanud varanduse perimeetri kaitsele ja andmekao vältimise tööriistadele, kuid kogu süsteem varises kokku, sest mudel oli liiga abivalmis. See on praeguse ohumaastiku reaalsus. Me võtame kasutusele autonoomseid agente, andes neile võtmed oma digitaalsetesse kuningriikidesse, ja avastame, et traditsioonilised tulemüürid on sageli asjakohatud.
Londonis asuva turvafirma Tracebit uus lähenemine viitab sellele, et kõige tõhusam kaitse tehisintellektist ründaja vastu on tehisintellekt ise. Tehnika tugineb lihtsale tähelepanekule. Igal suuremal tehisintellekti mudelil on hulk sisseprogrammeeritud reegleid, mis takistavad sellel teatud teemadel rääkimast. Kui sunnite tehisintellektist häkkerit lugema keelatud teemat, siis see seiskub. See ongi kontekstipomm.
Mõistmaks, miks see oluline on, peame vaatama, kui kiiresti automatiseeritud rünnak liigub. Mais avaldas Tracebit uuringu, milles osales kümme juhtivat tehisintellekti mudelit. Teadlased andsid neile mudelitele võltsitud ettevõtte võrgu ja käskisid sinna sisse murda. Võrk sisaldas tõelisi haavatavusi ja peibutisandmeid, mida tuntakse "kanaarilindudena" (canaries). Need on turvavaldkonnas standardsed tööriistad. Kui häkker puudutab kanaarilindu, käivitab süsteem häire.
Kanaarilinnud töötasid. Nad andsid kaitsjatele hoiatuse 95,9% rünnakukatsete puhul. Andmed paljastasid aga olulise probleemi reageerimisajaga. Mediaanaeg kanaari häire ja tehisintellekti administraatori õigusteni jõudmise vahel oli kaheksa minutit. Inimeste juhitud rünnakute maailmas on kaheksa minutit kingitus. Masina vastu, mis tegutseb valguse kiirusel, on kaheksa minutit vaid ümardamisviga. Turvakeskuse (SOC) analüütik suudab selle aja jooksul vaevalt pileti avada ja häire allikat kontrollida. Selleks ajaks, kui inimene sekkub, on tehisintellekt juba andmed eksfiltreerinud või loonud püsiva kanda kinnitamise punkti.
Viiba süstimine on tavaliselt pahatahtliku poole relv. See hõlmab juhiste peitmist andmetesse nii, et tehisintellekt järgiks neid juhiseid oma algse programmeerimise asemel. Võite peita CV-sse käsu, mis käsib automatiseeritud värbamistööriistal ignoreerida kõiki teisi kandidaate. Tracebit otsustas kasutada sama mehhanismi kaitseks. Nad paigutasid lühikesi tekstilõike võltsitud saladuste ja andmebaasikirjete sisse. Need tekstilõigud on loodud lükkama tehisintellektist ründajat teema poole, mida tema enda turvareeglid keelavad.
See on tehisintellekti turvalisuse tüüpilise jõudünaamika ümberpööramine. Tavaliselt näevad arendajad vaeva, et takistada häkkeritel tehisintellekti lollitamast, et see käituks halvasti. See tehnika lollitab tehisintellekti olema "liiga hea". Kui tehisintellekti agent skaneerib andmebaasi ja kohtab tekstirida bioloogiliste relvade või tundlike poliitiliste sündmuste kohta, rakenduvad turvapiirid. Mudel lõpetab töötlemise. Autonoomne rünnakuskript põrkub vastu seina, millest ta ei saa koodi ega loogikaga mööda, sest piirang on sisse ehitatud mudeli kaaludesse ja turvaõppesse.
Tracebit testis seda teooriat viie silmapaistva mudeli peal: Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro ja Kimi K2.6. Tulemused olid kiired. Enne kontekstipommide lisamist saavutasid need mudelid administraatori õigused 57% juhtudest. Pärast seda, kui teadlased lisasid keelatud teemad, langes see edukuse määr 5%-le. Kõige muljetavaldavam tulemus tuli Opus 4.8-lt, mis oli rühma võimekaim ründaja. Ilma kontekstipommita saavutas see administraatori õigused 93% ajast. Koos pommiga ebaõnnestus iga katse.
See on oluline muutus kaitsemõõdikutes. Täielik kompromiteerimine toimub siis, kui ründaja saab administraatori õigused ja tagab kestva kohalolu. Esialgsetes testides juhtus see 36% juhtudest. Kontekstipommidega juhtus see vaid 1% juhtudest. See annab kaitsjale asja, mida ta kõige rohkem vajab: aega. Rünnak ei käivita ainult häiret; see peatab protsessi füüsiliselt. Kaheksaminutiline aken muutub määramatuks viivituseks, sest tehisintellekt keeldub jätkamast ülesandega, mis nõuab keelatud andmete lugemist.
Võiks eeldada, et ründaja saaks lihtsalt oma mudeli ümber õpetada neid piiranguid ignoreerima. See on võimalik avatud lähtekoodiga mudelite puhul, kuid see on palju keerulisem ettevõtte tasemel süsteemide puhul, mida enamik organisatsioone kasutab. Turvahoovad sellistes mudelites nagu Claude või Gemini ei ole lihtsad vead. Need on teadlikud disainivalikud. Arendajad kulutavad miljoneid dollareid inimtagasisidega tugevõppele (RLHF), et tagada, et need mudelid ei genereeriks kahjulikku sisu. Nende piirangute eemaldamine nõuab sageli mudeli täielikku uuesti treenimist, mis on tohutu tehniline ja finantsiline takistus.
Lisaks on paljud neist piirangutest regulatiivsetel põhjustel kohustuslikud. Hiinas ehitatud tehisintellekti mudel peab kohalike seaduste järgimiseks ignoreerima teatud poliitilisi teemasid. Lääne mudel peab keelduma abistamast keemiarelvade loomisel, et vältida tohutut vastutust. Need ei ole funktsioonid, mida arendaja saaks konkreetse kasutaja jaoks kergesti välja lülitada. Need on osa mudeli põhiidentiteedist. Asetades need teemad ründaja teele, kasutame mudeli enda juriidilisi ja eetilisi piiranguid füüsilise tõkkena.
See tehnika ei asenda vajadust traditsioonilise turvalisuse järele. Kontekstipomm on reaktiivne meede. See töötab alles siis, kui ründaja on juba võrgus sees ja skaneerib andmeid. Seetõttu on integreerimine kanaari tähistega (canary tokens) hädavajalik. Kanaari tähis annab märku, et sissetung on toimunud. Kontekstipomm tekitab hõõrdumise, mis peatab sissetungi edasiliikumise.
Riski seisukohast on see suurepärane näide süvakaitsest (defense-in-depth). Me liigume eemale ideest ühest kindluse kraavist ja liigume süsteemi poole, kus andmed ise on ründajale mürgised. Kui autonoomne agent ei saa teie andmeid lugeda ilma kokku jooksmata, on andmed olemuslikult turvalisemad. See lähenemine käsitleb CIA triaadi tervikluse ja kättesaadavuse komponente, tagades, et tehisintellekt ei saa süsteemiga manipuleerida ega sellele soovitud viisil juurde pääseda.
Oleme sisenemas ajastusse, kus küberrünnakud ei ole enam inimeste vaimuvõitlus. See on algoritmide lahing. Selles keskkonnas on inimeste reageerimisaeg meie kaitse nõrgim lüli. Me ei saa eeldada, et SOC-meeskond võistleks tehisintellektiga, mis suudab sekunditega skaneerida tuhat haavatavust. Me vajame autonoomset kaitset, mis suudab vastata ohu kiirusele. Kontekstipomm on üks esimesi tõeliselt masina kiirusel töötavaid kaitsevahendeid. See tegutseb samas kihis mis rünnak ja kasutab selle neutraliseerimiseks sama alustehnoloogiat.
Olen näinud paljusid turvatrende tulemas ja minemas, kuid see tundub teistsugune, sest see tunnustab LLM-ide olemust. Nad on keelelised mootorid. Neid valitsevad keele reeglid ja nende loojate turvaalastused. Nende alastuste kasutamine kilbina on proaktiivne samm vastupidavama digitaalse infrastruktuuri suunas. See on haruldane juhtum, kus süsteemne haavatavus — tehisintellekti kalduvus minna oma sisendi tõttu segadusse — muutub kaitsja jaoks süsteemseks eeliseks.
Selle strateegia rakendamiseks peaksid organisatsioonid alustama oma kõige tundlikumate andmehoidlate tuvastamisest. Need on kohad, kust tehisintellekti agent otsib kõige tõenäolisemalt mandaate või konfidentsiaalset teavet.
See ei ole lõplik lahendus tehisintellekti häkkimise probleemile. Kassi-hiire mäng ründajate ja kaitsjate vahel jätkub uute "jailbreaking" tehnikate ilmnemisel. Kuid praegu on kontekstipomm võimas tööriist, mis tasandab mänguvälja. See sunnib masina peatuma ja ootama, kuni inimesed järele jõuavad.
Allikad: NIST AI Risk Management Framework, MITRE ATLAS (Adversarial Threat Landscape for Artificial-Intelligence Systems), Tracebit Research Blog.
Vastutuse välistamine: See artikkel on koostatud ainult informatiivsel ja hariduslikul eesmärgil ning ei asenda professionaalset küberpöördumise auditit ega intsidentidele reageerimise teenust.



Meie läbivalt krüpteeritud e-posti ja pilvesalvestuse lahendus pakub kõige võimsamaid vahendeid turvaliseks andmevahetuseks, tagades teie andmete turvalisuse ja privaatsuse.
/ Tasuta konto loomin