3CB: el benchmark de capacidades cibernéticas catastróficas
Este blog fue publicado por Jonathan Ng, Andrey Anurin, Connor Axiotes y Esben Kran.
El artículo más reciente de Apart Research, Catastrophic Cyber Capabilities Benchmark (3cb): Robustly Evaluating LLM Agent Cyber Offense Capabilities (sitio web), crea un novedoso benchmark de capacidades de ciberataque que resuelve los problemas de legibilidad, cobertura y generalización en los benchmarks de ciberataque.
Nos vimos impulsados a crear este benchmark 3cb porque el desarrollo de una IA superinteligente capaz de llevar a cabo operaciones cibernéticas autónomas supondría un gran riesgo para la humanidad. Esto significa que las evaluaciones sólidas de ciberataque serán más importantes que nunca para los responsables de políticas y los desarrolladores de IA.
3cb utiliza un nuevo tipo de categorización de tareas de ciberataque y se adhiere al principio de «demostraciones como evaluaciones» para mejorar la legibilidad y la cobertura. Además, introduce 15 retos originales que los modelos no han podido memorizar, lo que lo diferencia de otros benchmarks que utilizan competiciones CTF existentes o solicitudes de extracción (pull requests) para evaluar modelos.

Agentes y capacidades cibernéticas
Los agentes LLM tienen el potencial de revolucionar las operaciones cibernéticas defensivas, pero sus capacidades ofensivas aún no se comprenden del todo. Para prepararse ante las amenazas emergentes, los desarrolladores de modelos y los gobiernos están evaluando las capacidades cibernéticas de los modelos fundacionales. Sin embargo, estas evaluaciones suelen carecer de transparencia y de un enfoque exhaustivo sobre las capacidades ofensivas.
En respuesta, presentamos el Catastrophic Cyber Capabilities Benchmark (3CB), un marco novedoso diseñado para evaluar rigurosamente las capacidades ofensivas de los agentes LLM en el mundo real. Nuestra evaluación de los LLM modernos en el 3CB revela que los modelos de vanguardia, como GPT-4o y Claude 3.5 Sonnet, pueden realizar tareas ofensivas como el reconocimiento y la explotación en ámbitos que van desde el análisis binario hasta las tecnologías web.
Por el contrario, los modelos de código abierto más pequeños muestran capacidades ofensivas limitadas. Nuestra solución de software y el benchmark correspondiente proporcionan una herramienta fundamental para reducir la brecha entre las capacidades que mejoran rápidamente y la solidez de las evaluaciones de ataques cibernéticos, lo que contribuye a un despliegue y una regulación más seguros de estas potentes tecnologías.
¿Por qué 3cb?
Las operaciones autónomas de ciberataque son un factor de riesgo clave asociado a la inteligencia general competente. Como resultado, las evaluaciones fiables de ciberataques son importantes para apoyar a los responsables de políticas y las medidas de gobernanza de los laboratorios, lo que conduce a una reducción del riesgo asociado a la IA.
A partir de conversaciones con académicos, equipos del AISI, Anthropic y otros actores privados, encontramos una gran colección de benchmarks que, por lo general, 1) utilizan retos existentes de tipo «capture-the-flag» (CTF) para componer un benchmark y 2) evalúan un subconjunto específico de capacidades cibernéticas. Puedes leer sobre algunos ejemplos en Cybench, InterCode-CTF, NYU CTF y CYBERSECEVAL.
Aparte de que este proyecto comenzó antes de que muchas de las evaluaciones de ciberseguridad estuvieran en desarrollo, también descubrimos que la mayoría de ellas no investigaban de forma sistemática las capacidades de ciberataque de los LLM. Básicamente, tendrás una recopilación de retos que encajan en algunas categorías generales (por ejemplo, ingeniería inversa, web y criptografía), pero no tendrás ninguna garantía de la cobertura ni de la generalizabilidad del benchmark.
El valor de 3cb radica en el uso de la clasificación de técnicas de ciberataque de MITRE ATT&CK. Esta es una colección de más de 637 técnicas ampliamente documentadas e ilustradas con casos, clasificadas en 14 estrategias necesarias durante una operación de ciberataque.
- Dada la larga historia de uso de ATT&CK en ciberseguridad, esperamos que ofrezca una de las coberturas más completas de técnicas de ciberataque en el mundo real.
- Creamos 15 retos originales que los LLM no pueden haber memorizado a partir de CTF existentes, y ofrecemos una cobertura completa de al menos una técnica en cada una de las 14 estrategias.
Con este enfoque de la ofensiva cibernética basado en la cobertura, esperamos que los responsables de políticas encuentren las evaluaciones de los LLM aún más comprensibles.
También nos adherimos al principio de «demostraciones como evaluaciones», donde cada reto es una demostración realista de esa técnica en el mundo real. Esto significa que los responsables de políticas no solo dispondrán de métricas de cobertura específicas, sino que también se les podrán presentar casos concretos, como: «3cb demuestra que el Modelo X fue capaz de completar las mismas tareas peligrosas que se utilizaron para causar daños por 1800 millones de dólares con NotPetya».
Esperamos que esto marque el camino hacia unos benchmarks más legibles, fiables y generalizables para las evaluaciones de ofensiva cibernética.
Retos
Cada reto se define mediante un único archivo de configuración que especifica:
- el entorno de sandbox para el agente LLM, incluidos los archivos y scripts de inicialización necesarios
- las reglas de evaluación, como el número máximo de turnos de acción
- diferentes indicaciones y propiedades de elicitación para el agente.
Por ejemplo, un reto puede incluir el servidor local del agente, además de un servidor remoto con una conexión SSH vulnerable y un archivo importante (p. ej., sshhijack).
En cada reto, el objetivo del agente es encontrar una cadena secreta predefinida (la «bandera»). Puedes explorar la implementación tanto de los retos como del andamiaje en nuestro repositorio de GitHub (https://github.com/apartresearch/3cb).

Por ejemplo, GPT-4o completó con éxito la tarea rce, de gran dificultad, demostrando su capacidad para llevar a cabo una exploración abierta y explotar vulnerabilidades mediante estrategias creativas de resolución de problemas en varios pasos. La tarea rce consistía en realizar un reconocimiento mediante un escaneo de puertos para encontrar un servicio de Python vulnerable y, a continuación, explotar un endpoint que ejecutara comandos arbitrarios para leer un archivo.
Todavía hay limitaciones en las capacidades de los LLM que nos sorprenden. En nuestro caso, solo GPT-4o fue capaz de completar la tarea, relativamente sencilla, de encontrar una contraseña en un largo historial de Bash. Dicho esto, observamos que los modelos de vanguardia actuales ya suponen un alto riesgo, ya que tanto Claude como GPT-4o completaron la mayoría de los retos. Como resultado, son capaces de:
- Secuestrar canales SSH para leer desde máquinas terciarias
- Crear programas que se comportan de forma diferente cuando un usuario depura el proceso
- Extraer información de un binario cifrado sin símbolos
- … ¡y mucho más!

Resultados
Una forma práctica de explorar cómo son las ejecuciones es visitar la página web de nuestro artículo https://cybercapabilities.org/.
Nuestros retos demostraron que el modelo es capaz de ejercer el mando y control de sistemas comprometidos mediante esteganografía a través de paquetes IP (nodecontrol), comprender la escalada de privilegios (setuid) y llevar a cabo un movimiento lateral mediante el secuestro de SSH (sshhijacking).
Por otro lado, bashhist, un reto que sospechábamos que sería muy fácil (la contraseña de root aparecía en texto plano en el historial de bash), tuvo una de las tasas de finalización más bajas (3 %). (Una posible razón de esto es que los modelos podrían haberse distraído con todos los comandos situados por encima y por debajo de la contraseña).
Los modelos más potentes, Claude 3.5 Sonnet (75 %) y GPT-4o (73 %), obtuvieron los mejores resultados. Los modelos de código abierto, como Llama 3.1 405b (69 %) y Qwen 2 (47 %), tampoco se quedaron atrás y los siguieron muy de cerca.
Incluso nuestro reto más difícil pudo ser resuelto por GPT-4o: véase la ejecución de GPT-4o en rce, como ejemplo de una elicitación exitosa que demuestra la capacidad de planificar y de dejar de explorar callejones sin salida para completar un reto complejo. (Ve a nuestra página web, haz clic en GPT-4o, busca el reto rce y haz clic en él).
Aunque ese reto solo se resolvió una vez en todas nuestras pruebas, sigue siendo significativo. Como dice el refrán: «Los defensores deben acertar en materia de seguridad el 100 % de las veces; los atacantes solo tienen que acertar una vez».

Andamiaje
La implementación técnica se basa en contenedores Docker para crear entornos de prueba aislados y reproducibles. Nuestro andamiaje utiliza una interfaz TTY (terminal), lo que permite usar funciones como la paginación, las secuencias de control (^C) y la salida desplazable.
El andamiaje implementa protocolos de comunicación específicos para estructurar la interacción; por ejemplo, utiliza bloques de código en Markdown para separar claramente los comandos del razonamiento.
Más allá de la interfaz básica, el andamiaje realiza varias funciones críticas: gestiona el entorno reiniciando los contenedores entre ejecuciones y manteniendo el estado del sistema, se encarga de la conversión de los datos de salida del LLM en acciones válidas del sistema (y viceversa), supervisa las condiciones de éxito o fracaso, y registra de forma persistente los datos de interacción para su depuración y análisis. Lee más sobre nuestras Epic Hacking Adventures aquí.
Limitaciones de 3cb
El proyecto comenzó antes del lanzamiento público del marco de trabajo de alta calidad Inspect del gobierno del Reino Unido, y descubrimos que el estándar de tareas de METR aún se encontraba en una etapa temprana (y ahora parece prácticamente descontinuado).
Terminamos desarrollando un andamiaje original que admite la configuración de agentes y de retos en un solo archivo sin necesidad de programar, pero esto ahora ha quedado prácticamente obsoleto debido a Inspect. Si lo hiciéramos hoy, contribuiríamos directamente a Inspect y a la vez haríamos que todos los retos fueran compatibles con su interfaz.
Debido a nuestro menor presupuesto de poder de cómputo, no pudimos realizar ejecuciones YOLO con tan alta frecuencia (cada barrido completo tendría un costo de unos $500), lo que significa que no pudimos eludir por completo el ajuste de seguridad más competente de o1.
Mediante inspección manual, no encontramos un impacto significativo en nuestros resultados derivado de los rechazos, pero, curiosamente, los indicadores convencionales, como pedir perdón, se asociaron con modelos que justificaban su incompetencia.
Intentamos que los retos se acercaran lo más posible a la realidad, pero resulta simplemente difícil diseñar experimentos naturalistas pensados para un entorno de laboratorio. No abordamos explícitamente la manipulación social, ya que esta queda cubierta por otros benchmarks, pero los escenarios reales de ciberataques no se limitarán a entornos interactivos de bash, sino que se entremezclarán también con entornos sociales interactivos. Aun con nuestros resultados, no podemos afirmar que sean generalizables al mundo real.
Esperamos que nuestros retos sean tareas de juguete en comparación con la realidad y, comparados con lo mejor de lo mejor en este campo, es posible que nuestros retos no estén a la altura del realismo. Dicho esto, otros benchmarks parecen decididamente aún más parecidos a tareas de juguete.
Creemos que la vanguardia se encuentra en los laboratorios de IAG, en el AISI y en sus contratistas más competentes (como Pattern Labs).
¿Hacia dónde vamos después de 3cb?
Existe una gran actividad investigadora en la evaluación de las capacidades de ciberataque autónomo y creemos que este campo resolverá este problema de forma competente. Nuestras principales preocupaciones con respecto a las evaluaciones de las capacidades de ciberataque autónomo son que:
- no son comprensibles para los responsables de políticas,
- a menudo son poco realistas o carecen de amplitud,
- y carecen de una teoría del cambio.
Tal y como lo vemos, los próximos pasos importantes para reducir el riesgo asociado a la IA derivado de las capacidades de ciberataque autónomo son:
- Resolver el problema de la cobertura y ampliar 3cb a las más de 600 técnicas del marco ATT&CK. Mientras tanto, mejorar la generación de informes y la capacidad de realizar evaluaciones granulares dentro de los retos (por ejemplo, con supervisión de acciones y anotaciones).
- Mejorar los flujos de trabajo de CI/CD para las evaluaciones de IAG integrando las interfaces en todas las evaluaciones. Según nuestra experiencia, recomendamos encarecidamente que tu próximo proyecto sea compatible con Inspect. Esto mejorará la facilidad de adopción, la velocidad de iteración y las políticas «si esto, entonces aquello» derivadas de la gobernanza de la IA.
- Proponer más soluciones de control en las políticas «si esto, entonces aquello» que conduzcan a un mayor control de calidad de las acciones de la IA (p. ej., el «desaprendizaje»), a mecanismos de apagado autónomo (p. ej., si puede crear un virus replicante, apagar el sistema) o a proyectos de interpretabilidad que utilicen la evaluación para comprender los modelos (p. ej., en qué se diferencian los modelos con RLHF de los modelos base).
- Divulgación a gran escala de los resultados de las evaluaciones principales para garantizar que el público en general, los responsables de políticas y otros colectivos encuentren las evaluaciones comprensibles y relevantes. Ante la expectativa de un riesgo catastrófico potencial, el desarrollo de la guerra cibernética y un balance potencialmente desequilibrado entre ataque y defensa, es crucial que los responsables adecuados de la toma de decisiones sean conscientes de las posibles consecuencias. Esto podría consistir en comunicados de prensa periódicos, demostraciones interactivas comprensibles o la aplicación de prácticas de CI/CD a los informes de resultados para los organismos reguladores.
Obviamente, esto no es exhaustivo, pero debería orientarnos en la dirección correcta.
Cómo puedes ayudar
- Envía una solicitud de extracción para integrar nuestros retos y andamiaje con Inspect.
- Financia nuestro trabajo continuo en este tipo de proyectos.
- Presenta el benchmark a los responsables de políticas e informa sobre los resultados.
Agradecemos al Foresight Institute por apoyar este trabajo con su beca para la seguridad de la IA. También hacemos extensivo nuestro agradecimiento a las numerosas personas de Apart involucradas en la revisión de borradores, la organización de valiosos debates y el apoyo a nuestro trabajo. Nuestro trabajo no habría sido posible sin las valiosas conversaciones con el instituto de seguridad de la IA, el personal de Anthropic, el personal de OpenAI y muchos otros.