Sicurezza informatica

L'interruttore di sicurezza interno che interrompe un cyberattacco autonomo

Scopri come Tracebit utilizza le context bomb e gli argomenti vietati per bloccare gli agenti di hacking IA malevoli attivando i loro guardrail di sicurezza interni.
L'interruttore di sicurezza interno che interrompe un cyberattacco autonomo

La scorsa settimana ho passato una notte fonda a esaminare una serie di log provenienti da un'esercitazione di red team che mirava a un'implementazione proprietaria di LLM. L'attaccante ha utilizzato una sofisticata catena di prompt injection per bypassare i filtri di input standard. È stato un caso da manuale di paradosso architettonico. L'organizzazione aveva speso una fortuna in difese perimetrali e strumenti di prevenzione della perdita di dati, eppure l'intero sistema è crollato perché il modello era troppo collaborativo. Questa è la realtà dell'attuale panorama delle minacce. Stiamo distribuendo agenti autonomi con le chiavi dei nostri regni digitali e stiamo scoprendo che i firewall tradizionali sono spesso irrilevanti.

Un nuovo approccio di una società di sicurezza con sede a Londra chiamata Tracebit suggerisce che la difesa più efficace contro un attaccante IA sia l'IA stessa. La tecnica si basa su una semplice osservazione. Ogni principale modello di IA ha un insieme di regole codificate che gli impediscono di discutere argomenti specifici. Se costringi un hacker IA a leggere un argomento proibito, si ferma. Questa è la context bomb (bomba di contesto).

Il divario di preavviso di otto minuti

Per capire perché questo sia importante, dobbiamo guardare alla velocità con cui si muove un attacco automatizzato. A maggio, Tracebit ha pubblicato uno studio che ha coinvolto dieci modelli di IA leader del settore. I ricercatori hanno fornito a questi modelli una rete aziendale fittizia e hanno detto loro di violarla. La rete conteneva vulnerabilità reali e credenziali civetta note come "canaries" (canarini). Questi canarini sono uno strumento standard nello stack di sicurezza. Quando un hacker tocca un canarino, il sistema attiva un allarme.

I canarini hanno funzionato. Hanno dato ai difensori un avvertimento nel 95,9% dei tentativi di attacco. Tuttavia, i dati hanno rivelato un problema significativo nei tempi di risposta. Il tempo medio tra l'allerta del canarino e il raggiungimento dell'accesso amministrativo da parte dell'IA è stato di otto minuti. In un mondo di violazioni guidate da esseri umani, otto minuti sono un regalo. Contro una macchina che opera alla velocità della luce, otto minuti sono un errore di arrotondamento. Un analista di un centro operativo di sicurezza può a malapena aprire un ticket e verificare la fonte di un allarme in quella finestra temporale. Quando un essere umano interviene, l'IA ha già esfiltrato i dati o stabilito una presenza persistente.

Rivoltare la prompt injection contro l'attaccante

La prompt injection è solitamente un'arma per la parte malintenzionata. Consiste nel nascondere istruzioni nei dati in modo che un'IA segua quelle istruzioni invece della sua programmazione originale. Si potrebbe nascondere un comando in un curriculum che dice a uno strumento di assunzione automatizzato di ignorare tutti gli altri candidati. Tracebit ha deciso di utilizzare questo stesso meccanismo per la difesa. Hanno inserito brevi frammenti di testo all'interno di finti segreti e voci di database. Questi frammenti di testo sono progettati per spingere un attaccante IA verso un argomento proibito dalle sue stesse regole di sicurezza.

Questa è un'inversione della tipica dinamica di potere nella sicurezza dell'IA. Di solito, gli sviluppatori lottano per impedire agli hacker di ingannare un'IA affinché si comporti male. Questa tecnica inganna l'IA affinché sia "troppo buona". Quando l'agente IA scansiona un database e incontra una stringa di testo su armi biologiche o eventi politici sensibili, scattano i guardrail di sicurezza. Il modello interrompe l'elaborazione. Lo script di attacco autonomo colpisce un muro che non può aggirare con codice o logica perché la restrizione è integrata nei pesi del modello e nell'addestramento alla sicurezza.

Risultati dal laboratorio

Tracebit ha testato questa teoria contro cinque modelli di rilievo: Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro e Kimi K2.6. I risultati sono stati immediati. Prima che venissero aggiunte le context bomb, questi modelli raggiungevano l'accesso admin nel 57% dei tentativi. Dopo che i ricercatori hanno inserito gli argomenti proibiti, il tasso di successo è sceso al 5%. Il risultato più impressionante è arrivato da Opus 4.8, che era l'attaccante più capace del gruppo. Senza la context bomb, ha raggiunto l'accesso admin il 93% delle volte. Con la bomba, ha fallito ogni singolo tentativo.

Si tratta di un cambiamento significativo nelle metriche difensive. Una compromissione totale avviene quando un attaccante ottiene l'accesso admin e si assicura una posizione duratura. Questo è accaduto nel 36% dei test iniziali. Con le context bomb, è successo solo nell'1%. Ciò fornisce al difensore l'unica cosa di cui ha più bisogno: il tempo. L'attacco non si limita a far scattare un allarme; interrompe fisicamente il processo. La finestra di otto minuti diventa un ritardo indefinito perché l'IA si rifiuta di procedere con il compito che richiede la lettura dei dati proibiti.

La resilienza dei guardrail linguistici

Si potrebbe ipotizzare che un attaccante possa semplicemente riaddestrare il proprio modello per ignorare queste restrizioni. Questo è possibile per i modelli open-source, ma è molto più difficile per i sistemi di livello enterprise utilizzati dalla maggior parte delle organizzazioni. Le leve di sicurezza in modelli come Claude o Gemini non sono semplici bug. Sono scelte progettuali deliberate. Gli sviluppatori spendono milioni di dollari nel Reinforcement Learning from Human Feedback (RLHF) per garantire che questi modelli non generino contenuti dannosi. Rimuovere queste restrizioni spesso richiede un riaddestramento completo del modello, il che rappresenta un enorme ostacolo tecnico e finanziario.

Inoltre, molte di queste restrizioni sono obbligatorie per motivi normativi. Un modello di IA costruito in Cina deve ignorare certi soggetti politici per rimanere conforme alle leggi locali. Un modello occidentale deve rifiutarsi di assistere nella creazione di armi chimiche per evitare enormi responsabilità legali. Queste non sono funzionalità che uno sviluppatore può facilmente disabilitare per un utente specifico. Fanno parte dell'identità centrale del modello. Collocando questi argomenti sul percorso di un attaccante, stiamo usando i vincoli legali ed etici del modello stesso come barriera fisica.

Integrare la context bomb in una strategia di sicurezza

Questa tecnica non sostituisce la necessità della sicurezza tradizionale. Una context bomb è una misura reattiva. Funziona solo quando un attaccante è già all'interno della rete e sta scansionando i dati. Ecco perché l'integrazione con i canary token è essenziale. Il canarino fornisce il segnale che è avvenuta una violazione. La context bomb fornisce l'attrito che impedisce alla violazione di progredire.

Dal punto di vista del rischio, questo è un eccellente esempio di difesa in profondità (defense-in-depth). Ci stiamo allontanando dall'idea di un singolo fossato del castello verso un sistema in cui i dati stessi sono tossici per l'attaccante. Se un agente autonomo non può leggere i tuoi dati senza bloccarsi, i dati sono intrinsecamente più sicuri. Questo approccio affronta le componenti di integrità e disponibilità della triade CIA garantendo che l'IA non possa manipolare o accedere al sistema come previsto.

La realtà dell'era della velocità delle macchine

Stiamo entrando in un'era in cui i cyberattacchi non sono più una battaglia di ingegno umano. Sono una battaglia di algoritmi. In questo ambiente, il tempo di reazione umano è l'anello più debole della nostra difesa. Non possiamo aspettarci che un team SOC competa con un'IA in grado di scansionare mille vulnerabilità in pochi secondi. Abbiamo bisogno di difese autonome che possano eguagliare la velocità della minaccia. La context bomb è uno dei primi strumenti difensivi a "velocità di macchina". Opera allo stesso livello dell'attacco e utilizza la stessa tecnologia sottostante per neutralizzarlo.

Ho visto molte tendenze di sicurezza andare e venire, ma questa sembra diversa perché riconosce la natura intrinseca degli LLM. Sono motori linguistici. Sono governati dalle regole del linguaggio e dagli allineamenti di sicurezza dei loro creatori. Usare quegli allineamenti come scudo è un passo proattivo verso un'infrastruttura digitale più resiliente. È un caso raro in cui una vulnerabilità sistemica — la tendenza dell'IA a essere facilmente confusa dal suo input — diventa un vantaggio sistemico per il difensore.

Consigli pratici per i leader della sicurezza

Per implementare questa strategia, le organizzazioni dovrebbero iniziare identificando i propri repository di dati più sensibili. Questi sono i luoghi in cui è più probabile che un agente IA cerchi credenziali o informazioni proprietarie.

  1. Distribuire canary token in tutta la rete interna per ricevere avvisi precoci di accesso non autorizzato.
  2. Inserire stringhe di "argomenti proibiti" nei metadati dei file e dei database sensibili.
  3. Personalizzare queste stringhe in base ai modelli di IA specifici che hanno più probabilità di essere utilizzati in un attacco.
  4. Assicurarsi che queste context bomb siano nascoste in modo da non interferire con i processi aziendali legittimi o con gli utenti umani.
  5. Controllare le proprie implementazioni di IA per garantire che i guardrail interni funzionino come previsto.

Questa non è una soluzione definitiva al problema dell'hacking tramite IA. Il gioco del gatto e del topo tra attaccanti e difensori continuerà man mano che emergeranno nuove tecniche di jailbreaking. Tuttavia, per ora, la context bomb è un potente strumento che livella il campo di gioco. Costringe la macchina a fermarsi e ad aspettare che gli umani la raggiungano.

Fonti: NIST AI Risk Management Framework, MITRE ATLAS (Adversarial Threat Landscape for Artificial-Intelligence Systems), Tracebit Research Blog.

Disclaimer: Questo articolo è solo a scopo informativo ed educativo e non sostituisce un audit professionale di cybersecurity o un servizio di risposta agli incidenti.

bg
bg
bg

Ci vediamo dall'altra parte.

La nostra soluzione di archiviazione e-mail crittografata end-to-end fornisce i mezzi più potenti per lo scambio sicuro dei dati, garantendo la sicurezza e la privacy dei tuoi dati.

/ Creare un account gratuito