Cybersécurité

L'interrupteur de sécurité interne qui brise une cyberattaque autonome

Découvrez comment Tracebit utilise les bombes contextuelles et les sujets interdits pour faire planter les agents de piratage IA malveillants en déclenchant leurs propres garde-fous de sécurité internes.
L'interrupteur de sécurité interne qui brise une cyberattaque autonome

J'ai passé une nuit tardive la semaine dernière à examiner une série de journaux provenant d'un exercice de "red team" ciblant une implémentation propriétaire de LLM. L'attaquant a utilisé une chaîne sophistiquée d'injections de prompts pour contourner les filtres d'entrée standard. C'était un cas d'école de paradoxe architectural. L'organisation avait dépensé une fortune en défenses périmétriques et en outils de prévention des pertes de données, pourtant tout le système s'est effondré parce que le modèle était trop serviable. C'est la réalité du paysage actuel des menaces. Nous déployons des agents autonomes avec les clés de nos royaumes numériques, et nous constatons que les pare-feu traditionnels sont souvent hors de propos.

Une nouvelle approche d'une entreprise de sécurité basée à Londres, appelée Tracebit, suggère que la défense la plus efficace contre un attaquant IA est l'IA elle-même. La technique repose sur une observation simple. Chaque grand modèle d'IA possède un ensemble de règles codées en dur qui l'empêchent de discuter de sujets spécifiques. Si vous forcez un pirate IA à lire un sujet interdit, il s'arrête. C'est la bombe contextuelle (context bomb).

Le délai d'avertissement de huit minutes

Pour comprendre pourquoi cela est important, nous devons examiner la vitesse à laquelle une attaque automatisée progresse. En mai, Tracebit a publié une étude portant sur dix modèles d'IA de premier plan. Les chercheurs ont fourni à ces modèles un faux réseau d'entreprise et leur ont ordonné de s'y introduire. Le réseau contenait de réelles vulnérabilités et des identifiants leurres connus sous le nom de "canaris". Ces canaris sont un outil standard dans la panoplie de sécurité. Lorsqu'un pirate touche à un canari, le système déclenche une alerte.

Les canaris ont fonctionné. Ils ont donné aux défenseurs un avertissement dans 95,9 % des tentatives d'attaque. Cependant, les données ont révélé un problème important concernant le temps de réponse. Le délai médian entre l'alerte du canari et l'accès administrateur par l'IA était de huit minutes. Dans un monde de brèches menées par des humains, huit minutes sont un cadeau. Contre une machine qui opère à la vitesse de la lumière, huit minutes sont une erreur de calcul négligeable. Un analyste de centre d'opérations de sécurité peut à peine ouvrir un ticket et vérifier la source d'une alerte dans ce laps de temps. Au moment où un humain intervient, l'IA a déjà exfiltré les données ou établi un accès persistant.

Retourner l'injection de prompt contre l'attaquant

L'injection de prompt est généralement une arme pour le côté malveillant. Elle consiste à cacher des instructions dans des données afin qu'une IA suive ces instructions au lieu de sa programmation originale. Vous pourriez cacher une commande dans un CV qui ordonne à un outil de recrutement automatisé d'ignorer tous les autres candidats. Tracebit a décidé d'utiliser ce même mécanisme pour la défense. Ils ont planté de courts fragments de texte à l'intérieur de faux secrets et d'entrées de base de données. Ces fragments de texte sont conçus pour pousser un attaquant IA vers un sujet que ses propres règles de sécurité interdisent.

Il s'agit d'un renversement de la dynamique de pouvoir typique dans la sécurité de l'IA. Habituellement, les développeurs luttent pour empêcher les pirates de tromper une IA pour qu'elle soit malveillante. Cette technique trompe l'IA pour qu'elle soit "trop bonne". Lorsque l'agent IA scanne une base de données et rencontre une chaîne de texte sur les armes biologiques ou des événements politiques sensibles, les garde-fous de sécurité s'activent. Le modèle arrête le traitement. Le script d'attaque autonome heurte un mur qu'il ne peut contourner par le code ou la logique, car la restriction est ancrée dans les poids du modèle et son entraînement à la sécurité.

Résultats du laboratoire

Tracebit a testé cette théorie contre cinq modèles de premier plan : Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro et Kimi K2.6. Les résultats ont été immédiats. Avant l'ajout des bombes contextuelles, ces modèles atteignaient l'accès administrateur dans 57 % des essais. Après que les chercheurs ont planté les sujets interdits, ce taux de réussite est tombé à 5 %. Le résultat le plus impressionnant est venu d'Opus 4.8, qui était l'attaquant le plus capable du groupe. Sans la bombe contextuelle, il atteignait l'accès administrateur 93 % du temps. Avec la bombe, il a échoué à chaque tentative.

Il s'agit d'un changement significatif dans les mesures défensives. Une compromission totale se produit lorsqu'un attaquant obtient un accès administrateur et sécurise un ancrage durable. Cela s'est produit dans 36 % des tests initiaux. Avec les bombes contextuelles, cela n'est arrivé que dans 1 % des cas. Cela offre au défenseur la chose dont il a le plus besoin : du temps. L'attaque ne se contente pas de déclencher une alarme ; elle interrompt physiquement le processus. La fenêtre de huit minutes devient un délai indéfini parce que l'IA refuse de poursuivre la tâche qui nécessite la lecture des données interdites.

La résilience des garde-fous linguistiques

On pourrait supposer qu'un attaquant pourrait simplement réentraîner son modèle pour ignorer ces restrictions. C'est possible pour les modèles open-source, mais c'est beaucoup plus difficile pour les systèmes de classe entreprise que la plupart des organisations utilisent. Les leviers de sécurité dans des modèles comme Claude ou Gemini ne sont pas de simples bogues. Ce sont des choix de conception délibérés. Les développeurs dépensent des millions de dollars en apprentissage par renforcement à partir de commentaires humains (RLHF) pour s'assurer que ces modèles ne génèrent pas de contenu dangereux. Supprimer ces restrictions nécessite souvent un réentraînement complet du modèle, ce qui représente un obstacle technique et financier massif.

De plus, bon nombre de ces restrictions sont obligatoires pour des raisons réglementaires. Un modèle d'IA construit en Chine doit ignorer certains sujets politiques pour rester en conformité avec les lois locales. Un modèle occidental doit refuser d'aider à la création d'armes chimiques pour éviter une responsabilité massive. Ce ne sont pas des fonctionnalités qu'un développeur peut facilement désactiver pour un utilisateur spécifique. Elles font partie de l'identité fondamentale du modèle. En plaçant ces sujets sur le chemin d'un attaquant, nous utilisons les contraintes juridiques et éthiques du modèle comme une barrière physique.

Intégrer la bombe contextuelle dans une stratégie de sécurité

Cette technique ne remplace pas la nécessité d'une sécurité traditionnelle. Une bombe contextuelle est une mesure réactive. Elle ne fonctionne qu'une fois qu'un attaquant est déjà à l'intérieur du réseau et scanne les données. C'est pourquoi l'intégration avec les jetons canaris est essentielle. Le canari fournit le signal qu'une brèche a eu lieu. La bombe contextuelle fournit la friction qui empêche la brèche de progresser.

Du point de vue du risque, c'est un excellent exemple de défense en profondeur. Nous nous éloignons de l'idée d'une douve de château unique pour aller vers un système où les données elles-mêmes sont toxiques pour l'attaquant. Si un agent autonome ne peut pas lire vos données sans planter, les données sont intrinsèquement plus sûres. Cette approche répond aux composantes d'intégrité et de disponibilité de la triade CIA en garantissant que l'IA ne peut pas manipuler ou accéder au système comme prévu.

La réalité de l'ère de la vitesse machine

Nous entrons dans une ère où les cyberattaques ne sont plus une bataille d'intelligence humaine. Elles sont une bataille d'algorithmes. Dans cet environnement, le temps de réaction humain est le maillon le plus faible de notre défense. Nous ne pouvons pas attendre d'une équipe SOC qu'elle rivalise avec une IA capable de scanner mille vulnérabilités en quelques secondes. Nous avons besoin de défenses autonomes capables de s'aligner sur la vitesse de la menace. La bombe contextuelle est l'un des premiers outils défensifs véritablement à la vitesse de la machine. Elle opère à la même couche que l'attaque et utilise la même technologie sous-jacente pour la neutraliser.

J'ai vu passer de nombreuses tendances en matière de sécurité, mais celle-ci semble différente car elle reconnaît la nature inhérente des LLM. Ce sont des moteurs linguistiques. Ils sont régis par les règles du langage et les alignements de sécurité de leurs créateurs. Utiliser ces alignements comme un bouclier est une étape proactive vers une infrastructure numérique plus résiliente. C'est un cas rare où une vulnérabilité systémique — la tendance de l'IA à être facilement déroutée par ses entrées — devient un avantage systémique pour le défenseur.

Conseils pratiques pour les responsables de la sécurité

Pour mettre en œuvre cette stratégie, les organisations devraient commencer par identifier leurs dépôts de données les plus sensibles. Ce sont les endroits où un agent IA est le plus susceptible de chercher des identifiants ou des informations propriétaires.

  1. Déployez des jetons canaris sur votre réseau interne pour obtenir des alertes précoces d'accès non autorisé.
  2. Intégrez des chaînes de "sujets interdits" dans les métadonnées de vos fichiers et bases de données sensibles.
  3. Adaptez ces chaînes aux modèles d'IA spécifiques les plus susceptibles d'être utilisés lors d'une attaque.
  4. Assurez-vous que ces bombes contextuelles sont cachées de manière à ne pas interférer avec les processus métier légitimes ou les utilisateurs humains.
  5. Auditez vos propres déploiements d'IA pour vous assurer que les garde-fous internes fonctionnent comme prévu.

Il ne s'agit pas d'une solution finale au problème du piratage par IA. Le jeu du chat et de la souris entre attaquants et défenseurs se poursuivra à mesure que de nouvelles techniques de "jailbreaking" apparaîtront. Cependant, pour l'instant, la bombe contextuelle est un outil puissant qui rééquilibre les forces. Elle force la machine à s'arrêter et à attendre que les humains rattrapent leur retard.

Sources : NIST AI Risk Management Framework, MITRE ATLAS (Adversarial Threat Landscape for Artificial-Intelligence Systems), Tracebit Research Blog.

Avertissement : Cet article est fourni à des fins d'information et d'éducation uniquement et ne remplace pas un audit professionnel de cybersécurité ou un service de réponse aux incidents.

bg
bg
bg

On se retrouve de l'autre côté.

Notre solution de messagerie cryptée de bout en bout et de stockage en nuage constitue le moyen le plus puissant d'échanger des données en toute sécurité, garantissant ainsi la sûreté et la confidentialité de vos données.

/ Créer un compte gratuit