¿Qué es la alineación de la inteligencia artificial?
Este artículo explica los conceptos clave que surgen en el contexto de la alineación de la IA.
Estos términos son solo intentos de esbozar las ideas subyacentes, y lo importante son las ideas. No existe un consenso estricto sobre qué nombre debe corresponder a qué idea, y distintas personas utilizan los términos de forma diferente.1 Este artículo explica cómo utilizamos estas palabras en nuestro curso sobre alineación de la IA, y cómo la investigación sobre alineación contribuye a la seguridad de la IA.
Lograr que la IA tenga un impacto positivo
Es probable que la IA tenga un impacto sin precedentes en el mundo, posiblemente comparable al de la Revolución Industrial o incluso mayor. Entre los términos utilizados para describir estos sistemas se incluyen:
Inteligencia artificial general, o IAG: un término notoriamente polémico que da pie a un sinfín de debates. Para evitar tales discusiones, podemos hablar de ciertas propiedades, como:
- el rendimiento en tareas específicas; y
- la generalidad (es decir, qué variedad de tareas puede realizar la IA).
Por ejemplo, algunos autores definen la IA de nivel humano como una IA capaz de realizar al menos el 95 % de las tareas económicamente relevantes a un nivel humano o superior.
IA transformadora (IAT): Otro intento de eludir los debates sobre la IAG consiste en hablar, en su lugar, del impacto de la IA. La IA radicalmente transformadora, o a menudo simplemente IA transformadora, se refiere a las IA que multiplican por 10 la innovación en comparación con la era anterior a la IA.2
Esto sería análogo al impacto de la Revolución Industrial, en la que el crecimiento medio anual del PIB pasó del 0,2 % al 2 %. Otra revolución de este tipo daría lugar a un crecimiento anual del PIB del 20 %. (Sería como pasar de un mundo sin Internet generalizado a un mundo con teléfonos inteligentes en un plazo de 2-3 años, seguido del mismo nivel de cambio en los siguientes 2-3 años, y así sucesivamente).
Para ilustrar la diferencia entre los términos IAT e IAG, consideremos un escenario en el que la mayoría de los puestos de trabajo de la economía sean desempeñados por sistemas de IA diseñados específicamente para ello. Probablemente, esto tendría un gran impacto y se consideraría IA transformadora, independientemente de si alguno de los sistemas individuales es “inteligente en general”.
Nuestro objetivo final es garantizar que estos impactos significativos sean positivos, en lugar de negativos. El abanico de posibles impactos de la IA es amplio:
Extinción: Una preocupación expresada por muchos expertos y figuras públicas es que la IA podría provocar la extinción literal de la humanidad. Más adelante veremos cómo podría suceder esto.
Catástrofe existencial: Relacionada con la extinción, una catástrofe existencial es un resultado tan grave como la extinción humana. Esto podría incluir escenarios en los que un régimen totalitario opresivo tome el control de la humanidad.
Riesgos no existenciales: Los posibles impactos negativos de la IA no se limitan, por supuesto, a las catástrofes existenciales. También incluyen aspectos como que la IA agrave los sesgos, provoque desempleo o contribuya a la inestabilidad global.
Crecimiento económico: La condición humana ha mejorado enormemente en los últimos 200 años, y podría decirse que el principal motor de este progreso ha sido el crecimiento económico. Sin embargo, el progreso impulsado por la IA y la automatización podrían convertir el mundo en un lugar aún mejor, quizá incluso de una forma inimaginable.3
Subproblemas de “lograr que la IA tenga un impacto positivo”
Aunque “lograr que la IA tenga un impacto positivo” es nuestro objetivo final, tiene el inconveniente de ser demasiado amplio e informal. Aquí identificamos subproblemas más delimitados y abordables; en particular, este curso se centra principalmente en la alineación de la IA:
Alineación: conseguir que los sistemas de IA intenten hacer lo que sus creadores pretenden que hagan (algunas personas lo llaman alineación de intenciones).
Ejemplos de desalineación: los generadores de imágenes crean imágenes que exacerban los estereotipos o presentan una diversidad poco realista, los clasificadores médicos buscan reglas de medir en lugar de características médicamente relevantes y los chatbots dicen a la gente lo que quiere oír en lugar de la verdad. En el futuro, podríamos delegar más poder en sistemas extremadamente capaces; si estos sistemas no hacen lo que pretendemos que hagan, los resultados podrían ser catastróficos. En un momento, profundizaremos en los subproblemas de la alineación.
Esto suele contrastarse con el problema de las capacidades de la IA:
Capacidades: desarrollar sistemas de IA que lleven a cabo de manera eficaz las tareas que intentan realizar.4
Ejemplos de fallos de competencia: sistemas médicos de IA que ofrecen recomendaciones peligrosas o estimadores de precios inmobiliarios que provocan pérdidas económicas significativas. (Sin embargo, en ambos casos los sistemas de IA están intentando ofrecer recomendaciones precisas o predecir los precios con exactitud).
Contar con una alineación de la IA y unas capacidades de IA robustas es probablemente necesario, pero insuficiente para lograr resultados beneficiosos de la IA. Otros componentes del problema incluyen:
Filosofía moral: determinar qué intenciones sería “bueno” que tuvieran los sistemas de IA. Esto se debe a que, si podemos hacer que los sistemas de IA hagan lo que pretendemos (alineación), entonces necesitamos saber qué deberíamos pretender que hagan estos sistemas. Esto resulta difícil, dado que los debates sobre el significado de “bueno” han durado milenios y las personas tienen intereses diferentes que, en ocasiones, entran en conflicto.
Gobernanza: disuadir del desarrollo o uso perjudicial de los sistemas de IA. Ejemplos de fallos de gobernanza: el desarrollo imprudente o malintencionado de sistemas de IA peligrosos, o el despliegue de sistemas sin medidas de seguridad contra un uso impropio grave. Si la alineación consiste en disponer de las herramientas para dirigir la IA, y la filosofía moral nos indica hacia dónde deberíamos dirigirla, la gobernanza consiste en garantizar que las personas realmente dirijan la IA hacia donde deben.
Resiliencia: preparar otros sistemas para hacer frente a los impactos negativos de la IA. Por ejemplo, si los sistemas de IA potencian la capacidad de algunos actores para lanzar ciberataques, las medidas de resiliencia podrían incluir la corrección de los sistemas para prevenir ciberataques, el aumento de la capacidad de las organizaciones para funcionar durante un ciberincidente y la aceleración de la recuperación tras un ciberataque.
Aunque este desglose sirve como un punto de partida útil, no todos los problemas pueden clasificarse claramente dentro de este marco. Por ejemplo, los jailbreaks son:
- un problema de la alineación (los creadores pretenden que sus modelos sigan las instrucciones del sistema, pero no lo hacen); y
- un problema de gobernanza (no se disuade a los actores de hacer un uso impropio de los modelos de IA); y
- un problema de resiliencia (los jailbreaks quizá no serían un problema si el daño que pudieran causar fuera limitado).
También suele ser muy difícil distinguir entre los fallos de competencia y los de alineación: puede no estar claro de qué son realmente capaces los modelos de IA, y si los fallos representan:
- la incapacidad para realizar tareas correctamente (competencia); o
- que el modelo pueda realizarlas, pero esté intentando hacer otra cosa (alineación)
Esto es especialmente cierto en el caso de los modelos de lenguaje a gran escala, dado el enorme espacio de resultados posibles; aquí, técnicas de indicaciones como el few-shot o la cadena de pensamiento parecen “desbloquear” mejores resultados del mismo modelo.
Por último, dos advertencias sobre la ambigüedad del término “seguridad de la IA”. En primer lugar, aunque la interpretación intuitiva de este término es “prevenir accidentes con la IA”, muchos investigadores utilizan “seguridad de la IA” con la connotación implícita de centrarse en la IA radicalmente transformadora. En segundo lugar, las etiquetas “seguridad de la IA” y “alineación de la IA” a veces se aplican de forma errónea como resultado del lavado de imagen de la seguridad: cuando las organizaciones intentan convencer al público de que priorizan la seguridad, aunque no sea el caso.
Alineación de la IA
Lograr que los sistemas de IA intenten hacer lo que pretendemos que hagan es una tarea sorprendentemente difícil. Una forma común de desglosar este problema es en alineación externa e interna.5 6
En este modelo, tenemos un ser humano y un sistema de IA.
El ser humano tiene un objetivo verdadero, X, que desea alcanzar. Podría ser algo así como “hacer que mi empresa sea valiosa”.
Esto debe traducirse a algo que un sistema de IA pueda entender (por ejemplo, a una función de pérdida sobre la que aplicar el descenso de gradiente). Por lo tanto, se crea un objetivo sustitutivo, X’, para introducirlo en la IA, que podría ser “hacer que suba el precio de las acciones”.
A continuación, entrenamos a la IA y obtenemos de ella una acción. La IA elige una acción basándose en lo que ha aprendido. Sus acciones podrían implicar un objetivo interno diferente, X”, ya que es posible que no aprenda directamente el objetivo sustitutivo. Por ejemplo, podría aprender a intentar optimizar el resultado para que “se escriban artículos de prensa sobre la subida del precio de las acciones”.
Si la acción de la IA no intenta cumplir el verdadero objetivo, a esto lo denominamos “desalineación” (ya sea desalineación externa o interna), dependiendo de si el problema se produjo fuera de la caja (un problema con nuestra especificación del objetivo) o dentro de la caja (un problema con lo que el modelo aprendió a hacer basándose en la especificación del objetivo).
- Ejemplo de desalineación externa: la IA se da cuenta de que puede hackear la bolsa para hacer que suba el precio de las acciones. Se trata de un problema fuera de la caja, relacionado con nuestra especificación del objetivo: la IA ha alcanzado técnicamente el objetivo que le fijamos, pero no ha aumentado el valor de la empresa, por lo que X ≠ X’.
- Ejemplo de desalineación interna: durante el entrenamiento, la IA recibe una recompensa cuando se publican artículos de prensa positivos sobre el precio de las acciones. Una vez implementada, es capaz de contratar a un grupo de periodistas para que escriban artículos sobre la subida del precio de las acciones (alcanzando así su objetivo interno X”), incluso cuando este no ha subido. Este es un problema dentro de la caja: los mecanismos internos no alcanzan el objetivo sustitutivo X’ de hacer que el precio de las acciones suba realmente, por lo que X’ ≠ X”.
Ahora analizaremos estos fallos con más detalle y concluiremos comentando las limitaciones de este enfoque.
1. Alineación externa: especificar correctamente los objetivos de un sistema de IA.
También conocida como resolver la especificación errónea de la recompensa, la manipulación de la recompensa, la manipulación de especificaciones, el efecto Goodhart.
Esto se refiere al reto de especificar la función de recompensa para un sistema de IA de manera que refleje con precisión nuestras intenciones. Hacerlo de forma incorrecta puede llevar a los sistemas de IA a optimizar en busca de objetivos que son solo un sustitutivo de lo que queremos.
Ejemplo de desalineación externa: las empresas quieren entrenar modelos de lenguaje a gran escala para que respondan a las preguntas con veracidad. Entrenan los sistemas de IA con una función de recompensa basada en cómo valoran las respuestas las personas. Las personas tienden a valorar muy positivamente lo que parece correcto, independientemente de si realmente lo es. Esto incentiva al sistema de IA a generar respuestas que suenan correctas, pero que en realidad son falsas, como el uso de citas inventadas.
Ejemplo de desalineación externa: las empresas de redes sociales quieren maximizar sus beneficios publicitarios. Pueden utilizar sistemas de IA con el objetivo de maximizar la interacción de los usuarios, pero esto hace que sus plataformas promuevan titulares sensacionalistas, desinformación o contenido extremista. Esto, a su vez, reduce los beneficios porque los anunciantes dejan de publicitarse en la plataforma.
2. Alineación interna: conseguir que la IA siga estos objetivos.
También conocida como resolver la generalización impropia de objetivos.
Al entrenar sistemas de IA, les proporcionamos retroalimentación (mediante el descenso de gradiente) basada en nuestra función de recompensa. Esto da como resultado sistemas de IA que obtienen altas puntuaciones en la función de recompensa con los datos de entrenamiento.
Sin embargo, esto no significa que aprendan una política que refleje realmente la función de recompensa que hemos establecido. Esto puede causar problemas si los entornos de entrenamiento e implementación tienen distribuciones de datos diferentes (fenómeno conocido como cambio de dominio o cambio de distribución).
Alinear el objetivo que el sistema de IA intenta perseguir con el objetivo especificado se conoce como alineación interna. Con “intenta perseguir” nos referimos aquí a lo que el sistema parece estar optimizando, en función de cómo elegiría entre diferentes acciones.
Ejemplo de desalineación interna: a un sistema de IA se le otorga correctamente una recompensa cuando resuelve laberintos. En el entrenamiento, todos los laberintos tienen la salida en la parte inferior derecha. El sistema de IA aprende una política que da buenos resultados: intentar ir siempre hacia la parte inferior derecha (en lugar de “intentar ir hacia la salida”). En la implementación, algunos laberintos tienen la salida en lugares diferentes, pero el sistema de IA simplemente se queda atascado en la parte inferior derecha del laberinto.
Ejemplo de desalineación interna (hipotético): se entrena a un coche autónomo utilizando una recompensa correctamente especificada de conducir sin chocar. Durante el entrenamiento, aprende una política de conducir siempre sin saltarse los semáforos en rojo, ya que esto da buenos resultados en todos los escenarios de entrenamiento. En la implementación, el coche está parado en un semáforo en rojo. A un camión que va detrás le fallan los frenos y toca el claxon. Por desgracia, los vehículos chocan, ya que el coche se niega a apartarse del camino, priorizando no saltarse los semáforos en rojo frente a evitar un choque.
Críticas a la distinción entre alineación interna y externa
A veces puede resultar difícil clasificar los fallos como desalineación externa o interna. Por ejemplo, los fallos pueden ser ambiguos o el resultado de una desalineación tanto externa como interna, y algunos investigadores clasifican los fallos de forma diferente en función de su enfoque.
No está claro hasta qué punto la función de recompensa es directamente relevante para el comportamiento realmente aprendido. Esto pone en duda la relevancia de la alineación externa, si sistemas como el aprendizaje por refuerzo pueden no optimizar directamente esta recompensa. Una línea de investigación, la teoría de los fragmentos, intenta explorar las relaciones entre las funciones de recompensa y los comportamientos aprendidos, y propone que establezcamos una función de recompensa basada en los valores que esta enseña al modelo, en lugar de intentar encontrar un objetivo que sea exactamente lo que queremos.
Por último, es posible que los futuros sistemas de IA se desarrollen sin funciones de recompensa especificadas. Los modelos de lenguaje a gran escala actuales suelen tener como objetivo “generar texto coherente que los humanos valoren positivamente”. Sin embargo, los sistemas construidos sobre ellos, como AutoGPT, intentan dotarlos de mayor autonomía y orientación a objetivos mediante indicaciones repetidas y su conexión a herramientas; y no está claro cómo se aplica a esto el paradigma de la alineación externa/interna.
A pesar de estas críticas, creemos que conocer estos conceptos resulta útil, dado que se utilizan ampliamente en este campo. En el curso, los utilizaremos para analizar los retos que plantea el desarrollo de sistemas de IA alineados.
Definiciones alternativas
Muchos otros antes que nosotros, y probablemente muchos después, intentarán definir la alineación. Otras definiciones populares que se utilizan:
- Jan Leike: “el sistema de IA realiza la tarea prevista lo mejor que puede”.
- Paul Christiano: “cuando digo que una IA A está alineada con un operador H, quiero decir: A está intentando hacer lo que H quiere que haga”.
- Richard Ngo: “garantizar que los sistemas de IA persigan objetivos que se ajusten a los valores o intereses humanos, en lugar de objetivos no intencionados e indeseables”.
- Ryan Greenblatt (en un contexto específico): “asegúrate de que tus modelos no estén tramando nada”.
- Nate Soares: “cómo hacer, en principio, para dirigir un potente sistema de IA hacia un objetivo específico”.
- Holden Karnofsky: “construir sistemas muy potentes que no tengan como objetivo acabar con la civilización”.
- Anthropic: “crear sistemas seguros, fiables y controlables cuando dichos sistemas empiecen a ser tan inteligentes y tan conscientes de su entorno como sus diseñadores”.
- OpenAI: “lograr que la inteligencia artificial general (IAG) esté alineada con los valores humanos y siga la intención humana”.
- Google DeepMind: “garantizar que los sistemas de IA estén debidamente alineados con los valores humanos”.
- IBM: “codificar los valores y objetivos humanos en modelos de lenguaje a gran escala para hacerlos lo más útiles, seguros y fiables posible”.