Introducción al control de la IA
El control de la IA es una línea de investigación cuyo objetivo es evitar que los sistemas de IA desalineados causen daño. Se diferencia de la alineación de la IA, cuyo objetivo es garantizar que los sistemas actúen en el mejor interés de sus usuarios. En pocas palabras, las IA alineadas no quieren causar daño a los seres humanos, mientras que las IA controladas no pueden causar daño a los seres humanos, aunque quieran.
¿Por qué podría ser útil el control de la IA?
Hay varias razones por las que la investigación centrada en el control podría ser útil para la seguridad de la IA.
El control de la IA podría ser más fácil que la alineación de la IA
Algunos creen que el control de la IA podría ser más fácil que la alineación de la IA, al menos a corto plazo. Un reto fundamental al alinear los sistemas de IA es la posibilidad de engaño. Puede parecer que los modelos actúan en nuestro interés durante el entrenamiento y la evaluación, pero en realidad podrían albergar motivos ocultos. Dado que no comprendemos gran parte de lo que ocurre en el interior de las redes neuronales, el engaño podría ser difícil de detectar. Esto podría llevarnos a implementar modelos que, en realidad, sean manipuladores en nuestra contra.
Pero si nuestro objetivo es simplemente controlar un modelo, en lugar de alinearlo, no necesitamos saber si el modelo quiere hacernos daño. Solo necesitamos saber si puede hacerlo. Hay razones para pensar que las capacidades podrían ser más fáciles de evaluar que las intenciones. Algunos investigadores están trabajando en «evaluaciones de control» que detectan si un modelo manipulador sería capaz de eludir las medidas diseñadas para limitarlo.
El control de la IA también podría ser más fácil de analizar que la alineación de la IA, ya que presenta una analogía muy cercana: intentar evitar que los empleados humanos saboteen las actividades de una empresa. Además de ser productos, las IA son, cada vez más, fuentes de mano de obra para las empresas de IA. Los modelos ya generan un porcentaje significativo del código interno y, en el futuro, probablemente se utilizarán para automatizar por completo el proceso de mejora de sus propias capacidades.
Las empresas tecnológicas ya emplean un amplio conjunto de medidas de seguridad internas, como la supervisión, el control de acceso y la segmentación de la información. Algunas de ellas son similares a las medidas propuestas para controlar los sistemas de IA.
Podríamos utilizar modelos controlados para ayudarnos con la seguridad
Alinear de manera robusta a las IA que son más capaces que los humanos es un problema muy difícil para el que actualmente no tenemos buenas soluciones. Una sugerencia habitual es automatizar la investigación sobre la alineación. Si pudiéramos controlar modelos de IA más inteligentes que los humanos, podríamos aprovechar el efecto multiplicador de sus capacidades para avanzar en materia de seguridad, sin preocuparnos de que estos modelos provoquen una catástrofe por sí mismos.
Existen otros problemas relevantes para la seguridad en los que las IA controladas podrían ayudarnos, como mejorar la seguridad en los laboratorios o desarrollar formas de verificar futuros acuerdos sobre el desarrollo de la IA.
Podríamos utilizar modelos controlados para ayudarnos a demostrar el riesgo
Aunque a mucha gente le preocupan los riesgos que plantea la IA potente, ha sido difícil alcanzar un consenso suficiente para desencadenar respuestas políticas contundentes, ya que estos aún no se han materializado en el mundo real. Si tenemos acceso a modelos peligrosos (pero controlados), podríamos observar intentos de toma de control o de fuga que proporcionen evidencia convincente del peligro. Esto podría motivar una regulación más estricta del desarrollo de la IA o incluso una coordinación internacional en torno a la mitigación de riesgos.
¿Cómo podríamos controlar las IA?
El «control de la IA» es un término general que hace referencia a un conjunto bastante amplio de posibles medidas. Estos son algunos ejemplos:
Hacer que un modelo más débil (de confianza) supervise a uno más potente (no fiable)
A medida que las IA se vuelvan más potentes, los laboratorios tendrán acceso a algunos modelos «de confianza» (aquellos de los que estamos seguros de que no son manipuladores en nuestra contra, como GPT-4) y a otros «no fiables» (que son los modelos potentes y potencialmente peligrosos que quizá queramos controlar).
Imaginemos que utilizamos un modelo no fiable para generar código. Lo ideal sería que un humano revisara todo este código para comprobar que el modelo no ha intentado, por ejemplo, insertar una puerta trasera, pero esto requeriría mucho tiempo y sería costoso. En su lugar, podríamos hacer que un modelo de confianza realizara una supervisión automatizada del modelo no fiable y señalara los datos de salida más sospechosos para su revisión humana. También podríamos hacer que el modelo de confianza detectara y luego editara cualquier código sospechoso para eliminar posibles puertas traseras (esto se denomina «edición de confianza»).
En un estudio de Redwood Research, una organización sin fines de lucro dedicada a la seguridad, que evaluó la eficacia de diversas medidas de control, la supervisión de confianza impidió el envío de código con puertas traseras en el 62 % de las ejecuciones de prueba, mientras que la edición de confianza lo logró en el 92 % de las ejecuciones.
Es importante destacar que el estudio de Redwood utilizó GPT 3.5 y 4 como modelos de confianza y no fiables, respectivamente. Estos son mucho menos potentes que los modelos que quizá tengamos que controlar en el futuro. Las tasas de éxito del estudio no son necesariamente representativas de las que podríamos esperar en usos reales de la supervisión de confianza.
Hacer que los modelos no fiables se supervisen entre sí
Un problema evidente de la supervisión de confianza es que el modelo no fiable, al ser el más inteligente de los dos, podría engañar al modelo de confianza. Para evitarlo, podríamos utilizar dos instancias del modelo no fiable para que se supervisen entre sí. Sin embargo, nos podría preocupar que los dos modelos se confabularan. Por ejemplo, el primer modelo podría ocultar en su código un mensaje secreto que indicara al supervisor que emitiera un falso negativo. Hay algunas formas de mitigar esto, como mostrar al supervisor una versión «simplificada» del enunciado del problema, con parte de la información omitida.
Redwood descubrió que la supervisión no fiable impidió la introducción de puertas traseras en el 79 % de las ejecuciones de prueba.
Exigir la aprobación humana para las decisiones de gran trascendencia
Al igual que las acciones llevadas a cabo por personas en cualquier empresa requieren una autorización de niveles jerárquicos cada vez más altos a medida que adquieren mayor trascendencia, las empresas de IA podrían limitar los permisos concedidos a las IA.
Por supuesto, es probable que hoy en día muchas acciones dentro de las empresas de IA requieran la aprobación humana. Esta es una forma en la que las empresas ya están empleando medidas que se engloban bajo el término «control». Pero podría preocuparnos que las empresas se vean tentadas a conceder más permisos a la IA a medida que se intensifica la carrera por desarrollar una IA potente y los modelos resultan cada vez más útiles para acelerar la investigación. La investigación sobre el control podría tratar de identificar métodos para restringir los permisos de los modelos sin mermar su utilidad.
Descomponer las tareas en partes más pequeñas
Supongamos que un laboratorio quisiera que un modelo no fiable llevara a cabo una tarea de alto riesgo y de varios pasos. Podría preocuparnos que el modelo saboteara la tarea de una forma difícil de detectar o prevenir.
Una posible solución sería descomponer la tarea en una serie de pasos y delegar cada uno de ellos en una instancia independiente del modelo no fiable. A continuación, un modelo de confianza podría combinar cada una de sus soluciones en un único plan.
Estas son solo algunas de las medidas que las empresas podrían emplear para controlar los sistemas de IA potencialmente peligrosos. Hay muchas más. Sin embargo, solo unas pocas se han probado empíricamente, y no sabemos qué eficacia tendrán para modelos mucho más potentes que los actuales.
Limitaciones del control de la IA
Por desgracia, el control de la IA dista mucho de ser una solución completa a los riesgos que plantea la IA. Estas son algunas de las razones:
Aunque una empresa aplique medidas de control, es posible que otras no lo hagan
El control de la IA adolece del mismo problema que cualquier otra iniciativa propuesta para hacer la IA más segura: no reduce significativamente los riesgos a menos que todas las empresas de vanguardia lo adopten. Una empresa podría crear un modelo potencialmente peligroso e implementar suficientes medidas de control para evitar que cause daños, pero esto no impide que otra cree un modelo igual de potente que no esté controlado.
Actualmente, las esperanzas pasan por convencer a las empresas de IA de que implementen medidas de control de forma voluntaria. Sin embargo, estas medidas son costosas y podrían ralentizar el progreso. Es posible que necesitemos una regulación que exija dichas medidas de control para que resulten efectivas.
El control es una solución temporal
Las medidas de control están diseñadas para mitigar las amenazas de los modelos que son lo suficientemente potentes como para ser transformadoramente útiles, pero no superinteligentes. No debemos esperar que estas medidas escalen a sistemas superinteligentes, que, casi por definición, no serán controlables. Por ejemplo, muchas medidas de control (como la supervisión de confianza) dependen del uso de otras IA para supervisar los modelos controlados y señalar actividades sospechosas para que los humanos las revisen. Sin embargo, los modelos superinteligentes podrían producir datos de salida demasiado complejos para que los humanos los evalúen.
Así lo reconoce Redwood Research, organización pionera en el enfoque de control. Cree que podría haber tan solo 6 meses entre una IA transformadoramente útil y una IA superinteligente, suponiendo que no ralenticemos su desarrollo.
Este es el breve periodo en el que las medidas de control pueden evitar que las IA desalineadas causen daños. Para que la agenda de control dé sus frutos, durante este periodo tendremos que desarrollar agendas de seguridad técnica o de gobernanza que nos mantengan a salvo a largo plazo.
Estas son dos limitaciones de alto nivel de la agenda de control de la IA. Por supuesto, hay muchas formas posibles en las que las medidas individuales podrían resultar insuficientes. Por ejemplo, podríamos no lograr evitar que los modelos no fiables se confabulen, o un modelo podría sabotear las evaluaciones de control fingiendo ser menos capaz de lo que realmente es (un fenómeno bien documentado denominado «sandbagging»). Se necesita más investigación para comprobar empíricamente qué tan bien funcionan en la práctica las medidas de control propuestas.
Es posible que muy pronto dispongamos de una IA muy potente, y aún no sabemos cómo hacerla segura. El control de la IA es un enfoque que podría ser una pieza del rompecabezas, pero aún nos queda un largo camino por recorrer.
Si te interesan los peligros potenciales de la IA y qué podemos hacer al respecto, nuestro Curso «El futuro de la IA» es el lugar perfecto para empezar. En tan solo 2 horas y sin necesidad de conocimientos previos, te pondrá al día sobre la historia reciente de la IA y hacia dónde podría dirigirse.