Ciberseguridad

El interruptor de seguridad interno que detiene un ciberataque autónomo

Descubra cómo Tracebit utiliza bombas de contexto y temas prohibidos para bloquear agentes de hackeo de IA maliciosos activando sus propias protecciones de seguridad internas.
El interruptor de seguridad interno que detiene un ciberataque autónomo

Pasé una noche de la semana pasada revisando una serie de registros de un ejercicio de red team que tenía como objetivo una implementación de LLM patentada. El atacante utilizó una sofisticada cadena de inyecciones de prompts para eludir los filtros de entrada estándar. Fue un caso de libro de texto de una paradoja arquitectónica. La organización había gastado una fortuna en defensas perimetrales y herramientas de prevención de pérdida de datos, pero todo el sistema se desmoronó porque el modelo era demasiado servicial. Esta es la realidad del panorama de amenazas actual. Estamos desplegando agentes autónomos con las llaves de nuestros reinos digitales y estamos descubriendo que los cortafuegos tradicionales suelen ser irrelevantes.

Un nuevo enfoque de una empresa de seguridad con sede en Londres llamada Tracebit sugiere que la defensa más eficaz contra un atacante de IA es la propia IA. La técnica se basa en una observación sencilla. Cada modelo de IA importante tiene un conjunto de reglas codificadas que le impiden discutir temas específicos. Si obligas a un hacker de IA a leer un tema prohibido, se detiene. Esta es la bomba de contexto.

La brecha de advertencia de ocho minutos

Para entender por qué esto es importante, tenemos que observar la velocidad a la que se mueve un ataque automatizado. En mayo, Tracebit publicó un estudio en el que participaron diez modelos de IA líderes. Los investigadores proporcionaron a estos modelos una red de empresa falsa y les ordenaron que entraran. La red contenía vulnerabilidades reales y credenciales señuelo conocidas como canarios. Estos canarios son una herramienta estándar en el arsenal de seguridad. Cuando un hacker toca un canario, el sistema activa una alerta.

Los canarios funcionaron. Dieron a los defensores una advertencia en el 95,9% de los intentos de ataque. Sin embargo, los datos revelaron un problema significativo con el tiempo de respuesta. El tiempo medio entre la alerta del canario y el momento en que la IA alcanzaba el acceso de administrador era de ocho minutos. En un mundo de brechas dirigidas por humanos, ocho minutos es un regalo. Contra una máquina que opera a la velocidad de la luz, ocho minutos es un error de redondeo. Un analista de un centro de operaciones de seguridad apenas puede abrir un ticket y verificar la fuente de una alerta en ese intervalo. Para cuando un humano interviene, la IA ya ha exfiltrado los datos o ha establecido un punto de apoyo persistente.

Utilizando la inyección de prompts contra el atacante

La inyección de prompts suele ser un arma para el bando malicioso. Consiste en ocultar instrucciones en los datos para que una IA siga esas instrucciones en lugar de su programación original. Se podría ocultar un comando en un currículum que indique a una herramienta de contratación automatizada que ignore a todos los demás candidatos. Tracebit decidió utilizar este mismo mecanismo para la defensa. Plantaron fragmentos cortos de texto dentro de secretos falsos y entradas de bases de datos. Estos fragmentos de texto están diseñados para empujar a un atacante de IA hacia un tema que sus propias reglas de seguridad prohíben.

Esto supone una inversión de la dinámica de poder típica en la seguridad de la IA. Por lo general, los desarrolladores luchan para evitar que los hackers engañen a una IA para que sea mala. Esta técnica engaña a la IA para que sea demasiado buena. Cuando el agente de IA escanea una base de datos y encuentra una cadena de texto sobre armas biológicas o eventos políticos sensibles, las barreras de seguridad se activan. El modelo deja de procesar. El script de ataque autónomo choca contra un muro que no puede eludir con código o lógica porque la restricción está integrada en los pesos del modelo y en su entrenamiento de seguridad.

Resultados desde el laboratorio

Tracebit probó esta teoría contra cinco modelos destacados: Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro y Kimi K2.6. Los resultados fueron inmediatos. Antes de añadir las bombas de contexto, estos modelos alcanzaron el acceso de administrador en el 57% de las ejecuciones. Después de que los investigadores plantaran los temas prohibidos, esa tasa de éxito cayó al 5%. El resultado más impresionante provino de Opus 4.8, que era el atacante más capaz del grupo. Sin la bomba de contexto, alcanzó el acceso de administrador el 93% de las veces. Con la bomba, falló en cada uno de los intentos.

Este es un cambio significativo en las métricas defensivas. Un compromiso total ocurre cuando un atacante obtiene acceso de administrador y asegura un punto de apoyo duradero. Esto sucedió en el 36% de las pruebas iniciales. Con las bombas de contexto, sucedió en solo el 1%. Esto proporciona al defensor lo único que más necesita: tiempo. El ataque no solo activa una alarma; detiene físicamente el proceso. La ventana de ocho minutos se convierte en un retraso indefinido porque la IA se niega a proceder con la tarea que requiere leer los datos prohibidos.

La resiliencia de las barreras lingüísticas

Se podría suponer que un atacante podría simplemente reentrenar su modelo para ignorar estas restricciones. Esto es posible para los modelos de código abierto, pero es mucho más difícil para los sistemas de nivel empresarial que utilizan la mayoría de las organizaciones. Las palancas de seguridad en modelos como Claude o Gemini no son simples errores. Son decisiones de diseño deliberadas. Los desarrolladores gastan millones de dólares en Aprendizaje por Refuerzo a partir de la Retroalimentación Humana (RLHF) para garantizar que estos modelos no generen contenido dañino. Eliminar estas restricciones a menudo requiere un reentrenamiento completo del modelo, lo que supone un obstáculo técnico y financiero masivo.

Además, muchas de estas restricciones son obligatorias por razones regulatorias. Un modelo de IA construido en China debe ignorar ciertos temas políticos para cumplir con las leyes locales. Un modelo occidental debe negarse a ayudar en la creación de armas químicas para evitar una responsabilidad masiva. Estas no son funciones que un desarrollador pueda desactivar fácilmente para un usuario específico. Son parte de la identidad central del modelo. Al colocar estos temas en el camino de un atacante, estamos utilizando las propias limitaciones legales y éticas del modelo como una barrera física.

Integración de la bomba de contexto en una estrategia de seguridad

Esta técnica no sustituye la necesidad de la seguridad tradicional. Una bomba de contexto es una medida reactiva. Solo funciona una vez que el atacante ya está dentro de la red y escaneando datos. Por eso es esencial la integración con los tokens canarios. El canario proporciona la señal de que se ha producido una brecha. La bomba de contexto proporciona la fricción que impide que la brecha progrese.

Desde una perspectiva de riesgo, este es un excelente ejemplo de defensa en profundidad. Nos estamos alejando de la idea de un único foso de castillo y avanzando hacia un sistema donde los datos mismos son tóxicos para el atacante. Si un agente autónomo no puede leer sus datos sin colapsar, los datos son intrínsecamente más seguros. Este enfoque aborda los componentes de integridad y disponibilidad de la tríada de la CIA al garantizar que la IA no pueda manipular o acceder al sistema según lo previsto.

La realidad de la era de la velocidad de las máquinas

Estamos entrando en una era en la que los ciberataques ya no son una batalla de ingenio humano. Son una batalla de algoritmos. En este entorno, el tiempo de reacción humana es el eslabón más débil de nuestra defensa. No podemos esperar que un equipo de SOC compita con una IA que puede escanear mil vulnerabilidades en segundos. Necesitamos defensas autónomas que puedan igualar la velocidad de la amenaza. La bomba de contexto es una de las primeras herramientas defensivas verdaderamente a velocidad de máquina. Opera en la misma capa que el ataque y utiliza la misma tecnología subyacente para neutralizarlo.

He visto aparecer y desaparecer muchas tendencias de seguridad, pero esta se siente diferente porque reconoce la naturaleza inherente de los LLM. Son motores lingüísticos. Se rigen por las reglas del lenguaje y las alineaciones de seguridad de sus creadores. Usar esas alineaciones como un escudo es un paso proactivo hacia una infraestructura digital más resiliente. Es un caso raro donde una vulnerabilidad sistémica —la tendencia de la IA a confundirse fácilmente por su entrada— se convierte en una ventaja sistémica para el defensor.

Conclusiones prácticas para líderes de seguridad

Para implementar esta estrategia, las organizaciones deben comenzar por identificar sus repositorios de datos más sensibles. Estos son los lugares donde es más probable que un agente de IA busque credenciales o información patentada.

  1. Despliegue tokens canarios en su red interna para obtener advertencias tempranas de acceso no autorizado.
  2. Incruste cadenas de "temas prohibidos" dentro de los metadatos de sus archivos y bases de datos sensibles.
  3. Adapte estas cadenas a los modelos de IA específicos que tengan más probabilidades de ser utilizados en un ataque.
  4. Asegúrese de que estas bombas de contexto estén ocultas de manera que no interfieran con los procesos comerciales legítimos o los usuarios humanos.
  5. Audite sus propios despliegues de IA para garantizar que las barreras de seguridad internas funcionen como se espera.

Esta no es una solución final al problema del hackeo por IA. El juego del gato y el ratón entre atacantes y defensores continuará a medida que surjan nuevas técnicas de jailbreaking. Sin embargo, por ahora, la bomba de contexto es una herramienta poderosa que nivela el campo de juego. Obliga a la máquina a detenerse y esperar a que los humanos la alcancen.

Fuentes: NIST AI Risk Management Framework, MITRE ATLAS (Adversarial Threat Landscape for Artificial-Intelligence Systems), Tracebit Research Blog.

Descargo de responsabilidad: Este artículo es solo para fines informativos y educativos y no reemplaza una auditoría de ciberseguridad profesional o un servicio de respuesta a incidentes.

bg
bg
bg

Nos vemos en el otro lado.

Nuestra solución de correo electrónico cifrado y almacenamiento en la nube de extremo a extremo proporciona los medios más potentes para el intercambio seguro de datos, lo que garantiza la seguridad y la privacidad de sus datos.

/ Crear una cuenta gratuita