Un nuevo marco para los modelos de amenaza de la IAG
Hola a todos. Esta charla se basa en una serie de investigaciones que he llevado a cabo en OpenAI. También es una charla con espíritu provocador. Ayer pensaba: hay mucha gente que discrepa sobre muchas cosas, pero ¿en qué han coincidido todos los ponentes? En realidad, no se ponen de acuerdo sobre si hay tres o cuatro tipos de riesgo asociado a la IA, pero todos coinciden en que, como mínimo, existen el uso impropio y la desalineación, es decir, por un lado, humanos que utilizan las IA para hacer cosas malas y, por el otro, IA que deciden de forma autónoma hacer cosas malas. Esta charla quiere plantear la pregunta: ¿no sería mejor deshacernos de esa distinción y dejar de utilizarla?
Desarrollaré este argumento en dos pasos. En primer lugar, en realidad no es una distinción útil a nivel técnico. Y, en segundo lugar, tampoco es una distinción muy útil a nivel de gobernanza.
La versión de diez segundos del argumento es algo así: en este momento, las IA son herramientas y los humanos las utilizan. Pero a medida que las IA se conviertan en agentes, la forma de hacer un uso impropio de una IA consistirá básicamente en ordenarle que haga algo de forma autónoma. Y el proceso mediante el cual una IA hace algo de forma desalineada será idéntico en muchos aspectos al proceso mediante el cual un humano hace un uso impropio de una IA, salvo por la parte inicial. Y quizá esa parte inicial no sea precisamente lo principal en lo que deberíamos centrarnos al intentar clasificar los modelos de amenaza.
Esa es la versión de diez segundos del argumento. Ahora expondré la versión de cuatro minutos.
Podrías decir: “Mira, claro que estoy de acuerdo en que, en la práctica, el uso impropio y la desalineación pueden dar lugar a muchas de las mismas amenazas, pero realmente necesitamos esta distinción a nivel técnico. Tenemos que asegurarnos de que el trabajo que hacemos se centre en prevenir la desalineación”. Pero, en realidad, creo que si te esfuerzas mucho por prevenir el uso impropio a nivel técnico, acabarás haciendo gran parte del mismo trabajo que querrías hacer para prevenir también la desalineación. Así que se puede ver este tipo de analogía entre muchas de las cosas que hay en cada lado.
Por ejemplo, desde la perspectiva de la desalineación, quieres supervisar el comportamiento de la IA. Pero desde la perspectiva del uso impropio, también quieres supervisar el comportamiento de los usuarios y sus interacciones con la IA. Sencillamente no son tan diferentes. Gran parte de la infraestructura que necesitas configurar, como el sistema de supervisión, se va a solapar.
Desde la perspectiva de la desalineación, quieres detectar si las IA están alineadas de forma engañosa. Puede haber momentos en los que cambien de idea y empiecen a seguir una política totalmente diferente. Este es un problema técnico bastante similar al de intentar detectar si se ha introducido una puerta trasera en una IA. En ambos casos, habrá un conjunto de entradas que las llevará a cambiar radicalmente su comportamiento y a hacer algo totalmente fuera de distribución.
Desde la perspectiva de la desalineación, podría preocuparte la esteganografía: IA que intercambian mensajes entre sí. Pero esto es, en cierto sentido, el problema técnico de: “¿Puede una IA proporcionar datos de entrada a otra IA que la lleven a hacer algo malo?”. Y esto es, en cierto sentido, el mismo problema que el jailbreak, salvo que, en este último caso, suele ser un humano quien proporciona los datos de entrada.
No voy a repasar todos estos puntos por cuestiones de tiempo, pero creo que existen analogías bastante sólidas en gran parte del trabajo técnico que quizá se quiera llevar a cabo en ambos casos.
Desde la perspectiva de la gobernanza, voy a centrarme en este último punto: una IA descontrolada es análoga a la concentración de poder. ¿Qué quiero decir con esto? A nivel de gobernanza, el problema es que tanto el uso impropio como la desalineación son radicalmente diferentes dependiendo de los actores que estén llevando a cabo dicho uso impropio.
Tomemos como ejemplo las armas biológicas. Mucha gente habla de las armas biológicas como un problema de uso impropio. Lanzamos IA de código abierto, los terroristas fabrican armas biológicas, y eso es gravísimo. El problema es que, en realidad, la mayoría de las peores armas biológicas probablemente las fabrican, o en algunos casos las han fabricado, actores militares, como los de ámbito estatal. Y cuando empiezas a pensar en el problema de las armas biológicas desde el punto de vista de los actores estatales, muchas de tus conclusiones podrían dar un giro total. Por ejemplo, quizá te interese que haya más código abierto porque es útil para la defensa, mientras que los actores estatales que fabrican armas biológicas dispondrán de las IA independientemente de si son de código abierto o no, y las utilizarán con fines ofensivos en cualquier caso. Así que, de hecho, incluso algo que parece tan sencillo como las armas biológicas constituye un modelo de amenaza muy diferente dependiendo de qué actores lo lleven a cabo.
Y de manera similar, los modelos de amenaza por desalineación son muy diferentes dependiendo de si tu IA está simplemente en un servidor en algún lugar de las Bahamas y está desalineada, o si está en los servidores de una empresa de IA y se ha desplegado para un millón de personas, o si se ha desplegado ampliamente en las principales fuerzas armadas. Todos estos son modelos de amenaza muy distintos para la desalineación.
Esta es mi propuesta: definimos una coalición desalineada como un grupo de humanos e IA que intentan hacerse con el poder de forma ilegítima. Existen muchos tipos diferentes de coaliciones desalineadas: grupos terroristas, corporaciones que infringen la ley, etc. Y, en la mayoría de los casos, tanto para el trabajo técnico como para el de gobernanza, no necesitamos saber quién está al mando dentro de esa coalición. Puede que las IA estén al mando, que los humanos estén al mando o que nadie sepa quién lo está. Pero podemos intentar abordar el problema de la misma manera en cualquier caso.
No tengo una clasificación clara de los diferentes tipos de coaliciones desalineadas, pero destacaría que abarcan desde actores a pequeña escala hasta actores a gran escala. Si te preocupan más los actores a pequeña escala, lo que realmente te preocupa son los riesgos derivados de la descentralización de la IA, mientras que si te preocupan los actores a gran escala, te preocupan los riesgos derivados de la centralización. Tengo una teoría según la cual los demócratas están más preocupados por lo primero y los republicanos por lo segundo. No quiero que la seguridad de la IA se divida demasiado en dos coaliciones enfrentadas a causa de esto, por lo que realmente quiero que nos fijemos en estos dos tipos de divisiones y luego intentemos idear un marco que las unifique y las aborde a ambas.