Consejos profesionales para la seguridad de la IAG
A menudo me piden asesoramiento sobre carreras profesionales en seguridad de la IAG. Esta entrada resume los consejos que suelo dar con más frecuencia. La he dividido en tres secciones: mentalidad general, investigación en alineación y trabajo de gobernanza. En cada una de las dos últimas, empiezo con consejos generales dirigidos principalmente a estudiantes y a quienes se encuentran en las primeras etapas de su carrera profesional, para luego profundizar en los detalles del campo.
Mentalidad general
Para tener un gran impacto en el mundo, necesitas encontrar una gran palanca. Este documento parte de la base de que piensas, al igual que yo, que la seguridad de la IAG es la mayor de esas palancas. Sin embargo, hay muchas formas de accionar esa palanca: desde la investigación y la ingeniería hasta las operaciones y la construcción de campo, pasando por la política y las comunicaciones. Te animo a que elijas entre ellas basándote principalmente en tu aptitud personal: una combinación de aquello en lo que eres realmente bueno y lo que realmente disfrutas. En mi opinión, la diferencia entre tener una aptitud excelente y una mediocre eclipsa las diferencias de impacto entre la mayoría de los pares de empleos relacionados con la seguridad de la IAG.
¿Cómo deberías encontrar tu aptitud personal? Para empezar, deberías centrarte en buscar un trabajo en el que puedas obtener bucles de realimentación rápidos. Eso suele implicar ponerte manos a la obra o realizar algún tipo de proyecto concreto (en lugar de limitarte a leer y aprender) y ver con qué rapidez puedes progresar. Con el tiempo, una vez que hayas acumulado bastante experiencia, es posible que notes una sensación de confusión o frustración: ¿por qué los demás no captan la idea o lo hacen tan mal en esto? (Aunque hay que señalar que algunos investigadores de primer nivel comentaron en un borrador que no habían tenido esta experiencia). Para algunas personas, eso implica investigar un tema específico (en mi caso, la pregunta «¿cuál es el mejor argumento de que la IAG estará desalineada?»); para otras, se trata de aplicar habilidades como la minuciosidad (p. ej., «¿por qué los demás no pueden simplemente seguir todos los pasos obvios?»). Ser excelente rara vez te hace sentir que eres excelente, porque tus propias capacidades establecen tu punto de referencia de lo que consideras normal.
¿Y si tienes esa experiencia con algo que no te gusta hacer? Supongo que esto es bastante raro, porque ser bueno en algo suele ser muy gratificante. Pero en esos casos, te sugeriría que lo sigas intentando hasta que observes que ni siquiera una racha de éxitos te entusiasma con lo que haces; y, llegado ese momento, probablemente intentes cambiar de rumbo (aunque esto depende en gran medida de los detalles concretos).
Por último: la seguridad de la IAG es un campo joven y reducido; hay mucho por hacer y todavía muy poca gente para hacerlo. Te animo a que tomes la iniciativa a la hora de hacer que las cosas sucedan: la mayoría de las veces, la respuesta a «¿por qué no está sucediendo esto que parece tan bueno?» o «¿por qué no somos diez veces mejores en esto en concreto?» es «porque nadie se ha puesto a ello todavía». Y las cualidades más importantes para poder resolver un problema suelen ser la capacidad de detectarlo y la voluntad de intentarlo. Una anécdota para ilustrar mejor este punto: una amiga mía ha tenido cuatro puestos de trabajo en cuatro de las principales organizaciones de investigación sobre la alineación; ninguno de esos puestos existía antes de que ella se pusiera en contacto con los grupos pertinentes para sugerirles que contrataran a alguien con su perfil de competencias. Y esto es solo lo que es posible dentro de las organizaciones existentes; si lanzas tu propio proyecto, hay muchas más oportunidades de hacer cosas totalmente novedosas. (La principal excepción es en lo que se refiere a la divulgación y la incidencia política. La alineación es un campo inusual porque la base de seguidores y simpatizantes es mucho mayor que el número de investigadores, por lo que debemos tener cuidado de evitar que el discurso sobre la alineación quede dominado por defensores que conocen poco los detalles técnicos y dan la impresión de tener un exceso de confianza).
Investigación sobre la alineación
Empezaré con algunas recomendaciones generales y, a continuación, ofreceré una breve visión general de cómo veo este campo.
-
La alineación está limitada por la tutoría. Si tienes poca experiencia en investigación, tu principal prioridad debería ser encontrar al mejor mentor posible que te ayude a adquirir habilidades de investigación —por ejemplo, investigando en el laboratorio de un profesor o haciendo prácticas en laboratorios de IA—. La mayoría de los mejores investigadores y mentores no trabajan (todavía) en la alineación, por lo que la mejor opción de tutoría puede estar fuera de este campo; sin embargo, los doctorados son lo bastante largos, y los plazos lo bastante cortos, como para que debas asegurarte de que a tu mentor le entusiasmaría supervisar algún tipo de investigación relevante para la alineación. En ocasiones, algunas personas pueden empezar a hacer un gran trabajo sin ninguna tutoría; si te entusiasma esta idea, no dudes en intentarlo, pero céntrate en los tipos de investigación en los que tengas bucles de realimentación rápidos.
-
Tendrás que adoptar un enfoque práctico. La mejor investigación en AA y alineación interactúa en gran medida con las redes neuronales (con muy pocas excepciones). Incluso si te inclinas más por la teoría, deberías tener previsto interactuar con los modelos con regularidad y adquirir las habilidades de programación pertinentes. En concreto, veo a muchos investigadores noveles que quieren dedicarse a la «investigación conceptual». Pero debes asumir que ese tipo de investigación es inútil hasta que se concrete en la escritura de código o en la demostración de teoremas, y que tendrás que encargarte tú mismo de esa concreción (siendo la modelización de amenazas la principal excepción, aunque incluso en ese caso creo que la mayor parte de la modelización de amenazas no es lo bastante concreta como para resultar útil). Quizá cuando seas un investigador sénior, con intuiciones adquiridas a través de la experiencia práctica, puedas dar un paso atrás y dedicarte principalmente a pensar en posibles soluciones a alto nivel, pero ese no puede ser tu plan como investigador novel: es previsible que te aleje de realizar un trabajo útil.
-
Puedes empezar rápidamente. Las personas que provienen de campos como la física y las matemáticas a menudo no se dan cuenta de lo poco profundo que es el aprendizaje profundo como campo, por lo que piensan que primero necesitan dedicar mucho tiempo a comprender los fundamentos teóricos. No es así: puedes empezar a investigar sobre aprendizaje profundo solo con las matemáticas de primer año de carrera, e ir adquiriendo lo que te falte sobre la marcha. (Aunque la habilidad de programación es un requisito previo mucho más importante). También puedes adquirir muchos de los fundamentos conceptuales de la alineación sobre la marcha, especialmente en puestos con un mayor componente de ingeniería. Aunque recomiendo que todos los investigadores en alineación acaben familiarizándose con las ideas tratadas en el plan de estudios «Fundamentos de la alineación», mejorar las habilidades en investigación empírica debería ser una prioridad mayor para la mayoría de las personas que ya han decidido dedicarse a una carrera profesional en la investigación sobre alineación y que aún no son investigadores en AA. Algunas formas recomendadas de mejorar las habilidades en investigación empírica (aproximadamente por orden):
- MLAB
- ARENA
- Plan de estudios de aprendizaje profundo de Jacob Hilton
- Guía de Neel Nanda para iniciarse en la interpretabilidad mecanicista
- Replicar artículos.
Cada una de estas opciones te enseña habilidades importantes para hacer una buena investigación: cómo implementar algoritmos, cómo depurar código y experimentos, cómo interpretar los resultados, etc. Una vez que hayas implementado un algoritmo o replicado un artículo, puedes intentar ampliar los resultados mejorando las técnicas de alguna manera.
-
La mayor parte de la investigación no tendrá éxito. Esto es cierto tanto a nivel de proyectos individuales como a nivel de líneas de investigación completas: la investigación es un ámbito con una distribución de cola pesada. Debes buscar con ahínco las intuiciones centrales que expliquen por qué una determinada línea de investigación tendrá éxito, ya que su ausencia puede ocultarse tras matemáticas o algoritmos complicados. (Puedes considerar esto como un tipo de investigación conceptual, pero orientada a guiar tu propio trabajo empírico o teórico, más que como un resultado de investigación en sí mismo). En la siguiente sección expongo algunas de mis opiniones sobre qué líneas de investigación son prometedoras y cuáles no.
Líneas de investigación sobre la alineación
Desde mi punto de vista, la investigación más prometedora sobre la alineación se divide en tres categorías principales. A continuación las describo, junto con tres categorías secundarias que considero valiosas. Cabe señalar que espero que los límites entre todas ellas se difuminen con el tiempo, a medida que avance la investigación al respecto y automaticemos cada vez más cosas.
1. Supervisión escalable
Encontrar formas de aprovechar modelos más potentes para generar mejores señales de recompensa. La investigación sobre la supervisión escalable puede tener un efecto multiplicador especialmente significativo si acaba adoptándose de forma generalizada, por ejemplo, como herramienta para prevenir alucinaciones (al igual que el trabajo de los equipos de alineación sobre RLHF se ha adoptado ahora de forma muy generalizada).
- El artículo teórico que suelo recomendar con más frecuencia es el artículo de debate de Irving et al..
- El artículo empírico que suelo recomendar con más frecuencia es el artículo de críticas de Saunders et al., que puede considerarse el caso más sencillo del algoritmo de debate; Bowman et al. (2022) también resulta útil desde una perspectiva metodológica.
- Los otros dos algoritmos más conocidos en este ámbito son la amplificación iterada y el modelado recursivo de recompensas. Mi opinión es que a menudo se sobreestiman las diferencias entre estos algoritmos y que sus presentaciones habituales ocultan las formas en que son estructuralmente similares. Personalmente, me resulta más fácil razonar sobre el debate (y parece que otros están de acuerdo, ya que hay más artículos que se basan en él que en los demás), por lo que es en lo que más suelo recomendar a la gente que trabaje.
- ¿Conducirá la supervisión escalable simplemente a más avances en las capacidades? Esta es una pregunta importante; una forma en la que lo pienso es en términos de la brecha entre generador, discriminador y crítica del artículo sobre críticas de Saunders et al.. Concretamente, aunque espero que cerrar la brecha generador-discriminador sea un avance con doble finalidad (y podría ser bueno o malo dependiendo de tus otros puntos de vista), cerrar la brecha discriminador-crítica mediante la generación de explicaciones correctas y comprensibles para los humanos debería considerarse sin duda un avance en la alineación.
2. Interpretabilidad mecanicista
Encontrar formas de comprender cómo funcionan las redes internamente. Aunque todavía es solo un pequeño subcampo del AA, lo considero una forma de impulsar todo el campo del AA desde una perspectiva «conductista» que solo se centra en los datos de entrada y los datos de salida hacia un marco «cognitivista» que estudia lo que ocurre en el interior de las redes neuronales. Además, es mucho más fácil de llevar a cabo fuera de los laboratorios de la industria que el trabajo de supervisión escalable. Para empezar, echa un vistazo a los 200 problemas concretos abiertos sobre interpretabilidad mecanicista de Nanda.
Tres líneas de trabajo en interpretabilidad mecanicista:
-
Estudios de caso: encontrar algoritmos dentro de las redes que implementen capacidades específicas. Mis artículos favoritos en este ámbito son Olsson et al. (2022), Nanda et al. (2023), Wang et al. (2022) y Li et al. (2022); me entusiasma ver más trabajos que se basen en este último, en particular, para encontrar modelos del mundo y objetivos representados internamente en las redes.
-
Resolución de la superposición: encontrar formas de entrenar redes para que tengan menos conceptos superpuestos dentro de neuronas individuales. El recurso clave aquí es Elhage (2022) (así como otros trabajos del hilo «Transformer Circuits»).
-
Interpretabilidad escalable: encontrar algoritmos para identificar o modificar automáticamente las representaciones internas. Mis artículos favoritos: Meng et al. (2022) y Burns et al. (2023) (aunque algunos consideran que este último se acerca más al trabajo sobre supervisión escalable).
3. Teoría de la alineación
Encontrar marcos formales que podamos utilizar para razonar sobre la IA avanzada. Quiero señalar que el éxito en este tipo de investigación presenta una distribución de cola aún más pesada que el de las otras líneas de investigación que he descrito: parece requerir habilidades matemáticas excepcionales, una comprensión profunda de la teoría del AA e intuiciones filosóficas matizadas. No soy optimista en cuanto a que alguna de las líneas de investigación aquí enumeradas vaya a dar resultado, pero intentan abordar problemas tan fundamentales que incluso los éxitos parciales podrían suponer un gran avance.
- Lo que más me entusiasma es el trabajo de Christiano sobre la formalización de argumentos heurísticos, la agenda de Kosoy en teoría del aprendizaje (en particular, el infra-bayesianismo), y varios trabajos de Scott Garrabrant (p. ej., la racionalidad geométrica, los conjuntos factorizados finitos y los marcos cartesianos).
- Históricamente, la mayor parte del trabajo en esta categoría ha sido realizado por MIRI (p. ej., el trabajo sobre teoría de la decisión funcional y la inducción de Garrabrant). Sin embargo, últimamente su producción ha disminuido de forma significativa; por lo tanto, los considero principalmente como un puñado de investigadores que persiguen sus intereses individuales, en lugar de una agenda de investigación unificada.
- ¿Por qué creo que merece la pena investigar la teoría de la alineación? En gran parte porque el conocimiento científico suele estar muy interconectado. La teoría de la alineación a menudo parece desconectada del AA moderno, pero los movimientos de las estrellas también parecían en su día totalmente desconectados de los acontecimientos en la Tierra. ¿Y quién habría imaginado que comprender la variación en los picos de los pinzones haría avanzar nuestra comprensión de… bueno, básicamente todo en biología? En muchos ámbitos existen principios clave que explican una amplia gama de fenómenos, y la principal dificultad radica en encontrar un enfoque tratable. Por eso, plantearse las preguntas adecuadas suele ser más importante que obtener resultados concretos. Por ejemplo, preguntarse «¿cuál es la estrategia óptima en esta formalización específica de un juego de 2 jugadores?» constituye una gran parte del trabajo de inventar la teoría de juegos.
Otras tres áreas de investigación que parecen importantes, pero menos centrales
1. Evaluaciones
Encontrar formas de medir hasta qué punto los modelos son peligrosos y/o están desalineados.
- Hasta ahora se ha publicado poco al respecto; lo principal a tener en cuenta son las evaluaciones de ARC (que también se tratan en la sección 2.9 de la ficha del sistema GPT-4). En general, parece que las evaluaciones de alineación son muy difíciles, por lo que la mayoría de la gente se centra en las evaluaciones para medir capacidades peligrosas.
- Mi opinión personal es que el éxito o el fracaso de las evaluaciones dependerá de lo sencillas y escalables que sean. Las mejores evaluaciones serían fáciles de implementar incluso por personas sin conocimientos previos de alineación, y permitirían hacer un seguimiento significativo de las mejoras desde los sistemas actuales hasta las superinteligencias. En resumen, esto se debe a que el objetivo principal de las evaluaciones es facilitar la toma de decisiones y la coordinación, y ambas se benefician enormemente de contar con métricas legibles y predecibles.
2. Entrenamiento antagónico sin restricciones
Encontrar formas de generar datos de entrada que hagan que los sistemas desalineados se comporten de forma anómala.
- Parece haber sólidas razones de principio para esperar que esto sea difícil: en general, solo se pueden generar datos falsos que engañen a un modelo utilizando un modelo mucho más potente. Sin embargo, podría ser posible encontrar ejemplos antagónicos sin restricciones aprovechando la interpretabilidad mecanicista, tal como se explora en esta entrada de Christiano.
- El artículo empírico al que más suelo remitir a la gente es Ziegler et al. (2022) (véanse también los otros artículos que citan).
3. Modelización de amenazas
Comprender y pronosticar cómo la IAG podría conducir a resultados catastróficos.
- La mayoría de las veces, remito a la gente a mi propio artículo reciente (Ngo et al., 2022). Otros buenos trabajos incluyen los informes de Joe Carlsmith y Ajeya Cotra. (Cohen et al. (2022) presentan un argumento revisado por pares sobre el riesgo existencial derivado de la IAG, pero se centra demasiado en la alineación externa como para convencerme.)
- Una línea de investigación sobre modelización de amenazas que parece valiosa es comprender el «gradient hacking» (y, de manera más general, comprender la cooperación entre diferentes modelos). Otra es explorar las formas específicas en que es más probable que se desplieguen las IAG en el mundo real, y qué tipo de vulnerabilidades podrían explotar.
Líneas de investigación sobrevaloradas
Por el contrario, algunas líneas de investigación que, en mi opinión, están sobrevaloradas por muchos recién llegados al campo, junto con algunas críticas a las mismas:
- Aprendizaje por refuerzo inverso cooperativo (la línea que defiende Stuart Russell en su libro Human Compatible); críticas aquí y aquí.
- El trabajo de John Wentworth sobre las abstracciones naturales; exposición y crítica aquí, y otra aquí.
- Trabajos que se basan en que los agentes actúen de forma miope, lo que incluye limitarse a realizar predicciones para el siguiente paso temporal (por ejemplo, los trabajos sobre la abstracción de los simuladores o sobre el condicionamiento de modelos predictivos); crítica aquí.
Trabajo en gobernanza
Mentalmente divido esto en tres categorías: investigación sobre gobernanza, gobernanza de laboratorios y trabajos sobre políticas. Algunas conclusiones generales para cada una:
1. Investigación sobre gobernanza
- El principal consejo que doy a quienes quieren entrar en este campo: elige un tema relevante e intenta convertirte en un experto en él. Hay unas dos docenas de temas en los que me gustaría que hubiera un experto mundial en su aplicación para lograr que la IAG salga bien, y no existe tal persona. He elaborado una lista de esos temas a continuación. Para aprender sobre ellos, recomiendo encarecidamente no solo leer y asimilar ideas, sino también escribir al respecto. Es muy plausible que, partiendo sin experiencia previa en el campo, en un plazo de seis meses puedas escribir una publicación o un artículo que amplíe los límites de nuestro conocimiento sobre la relevancia de uno de esos temas para la gobernanza de la IAG.
No es necesario que te mantengas fiel a tu elección a largo plazo; mi argumento principal es que es importante tener algún tema concreto para investigar. A medida que lo hagas, te irás adentrando gradualmente en otros temas de relevancia tangencial y adquirirás un conocimiento más amplio del campo (el curso «Fundamentos de la gobernanza de la IA» es una buena forma de lograrlo). Con el tiempo, podrás llevar a cabo una «investigación estratégica» con implicaciones mucho más amplias. Pero intentar hacerlo desde el principio es un mal plan; te irá mucho mejor si partes de una base de conocimientos especializados y detallados sobre la cual trabajar.
En general, creo que la gente sobrevalora el «análisis» y subestima las «propuestas». Hay muchos factores de alto nivel que afectarán a la gobernanza de la IAG, y podríamos pasarnos el resto de la vida intentando analizarlos. Sin embargo, en última instancia, lo que necesitamos son mecanismos concretos que realmente marquen la diferencia, los cuales actualmente escasean. Por supuesto, es necesario realizar análisis para comprender los factores que influirán en el éxito de las propuestas, pero siempre debes tener presente el objetivo de aterrizarlo todo en algo útil.
En este sentido, personalmente no creo que la modelización cuantitativa sea muy valiosa. Todavía no he visto un modelo de este tipo sobre una cuestión de gran alcance (por ejemplo, proyecciones de poder de cómputo, velocidad de despegue, plazos) cuyas conclusiones cambien sustancialmente mis opiniones sobre cuáles son las mejores propuestas de gobernanza. Si un modelo de este tipo tuviera un gran éxito, podría cambiar mi nivel de creencia, digamos, del 25 % al 75 % en una proposición determinada. Pero eso solo supone una diferencia de un factor de 3, mientras que un plan para resolver la gobernanza podría ser uno o dos órdenes de magnitud más eficaz que otro. Y, en general, los modelos rara vez me influyen tanto, porque incluso unos pocos parámetros libres permiten a las personas sobreajustarse drásticamente a sus intuiciones; por lo general, preferiría tener un breve resumen de las ideas clave que la persona que realizó la modelización aprendió durante ese proceso. Así que prioriza primero los planes, en segundo lugar las ideas clave y, por último, los modelos.
No te dejes limitar demasiado por la viabilidad política, especialmente al formular las primeras versiones de un plan. Casi nadie en el mundo tiene a la vez buenas intuiciones sobre cómo funciona realmente la política y buenas intuiciones sobre lo vertiginoso que será el progreso hacia la IAG. En el futuro se abrirán todo tipo de posibilidades; solo tenemos que estar preparados con propuestas concretas para cuando eso ocurra. Sin embargo, una comprensión profunda de los factores fundamentales que impulsan las decisiones políticas actuales será de gran ayuda para orientarnos cuando las cosas empiecen a cambiar mucho más rápido.
2. Gobernanza de los laboratorios de IA
-
Los laboratorios líderes suelen estar dispuestos a llevar a cabo propuestas que no supongan un gran sacrificio para su trabajo principal de capacidades; el cuello de botella suele ser la iniciativa y el esfuerzo necesarios para implementar realmente la propuesta. Por lo tanto, las intervenciones del tipo «decir a los laboratorios que se preocupen más por la seguridad» no suelen funcionar muy bien, mientras que las del tipo «aquí hay una petición concreta, estos son los pasos específicos que tendrían que dar, aquí hay una persona que ha aceptado liderar la iniciativa» suelen dar buenos resultados. Esta publicación transmite esa idea especialmente bien.
-
A las personas ajenas a los laboratorios les resulta difícil conocer con suficiente detalle lo que ocurre en su interior como para poder formular propuestas concretas, pero creo que hay algunos casos importantes en los que sí es posible. Probablemente esto se parezca bastante al camino que esbocé en la sección sobre investigación en gobernanza: primero adquirir conocimientos especializados sobre un tema concreto y, a continuación, elaborar propuestas específicas.
-
Existe una habilidad específica para lograr que las cosas se hagan dentro de las grandes organizaciones de la que carecen la mayoría de los miembros de EA (debido a la falta de experiencia corporativa, sumada a la falta de habilidades interpersonales), pero que resulta particularmente útil a la hora de impulsar propuestas de gobernanza en los laboratorios. Si la posees, el trabajo de gobernanza en los laboratorios puede ser muy adecuado para ti.
3. Puestos relacionados con políticas públicas
- Con esto me refiero a trabajar en puestos relacionados con la administración pública, con el objetivo de intentar llegar a un cargo desde el cual puedas contribuir a que la regulación gubernamental se desarrolle adecuadamente. No tengo mucho que decir al respecto, ya que no es mi área de especialidad. Probablemente deberías seguir consejos bastante generales (por ejemplo, los consejos que se ofrecen aquí) sobre cómo tener una carrera profesional exitosa en este ámbito y, a continuación, averiguar cómo avanzar más rápido partiendo del supuesto de que la gente se sentirá cada vez más preocupada por la IA. Los másteres cortos y las becas de políticas públicas son formas rápidas de acelerar el camino hacia puestos de políticas públicas a mitad de la carrera profesional; adquirir incluso un mínimo de conocimientos demostrables en IA (por ejemplo, cualquier título o trabajo relacionado con la informática o la IA) también resulta útil.
Lista de temas de gobernanza
Estos son algunos temas en los que me gustaría que contáramos con un experto mundial en su aplicación a la seguridad de la IAG. Un ejemplo de cómo podría ser un excelente trabajo sobre uno de estos temas: el artículo de Baker sobre las lecciones del control de armas nucleares (un tema que habría estado en esta lista si él no lo hubiera escrito).
Un grupo de temas puede describirse a grandes rasgos como «cualquier cosa mencionada en el artículo de Yonadav Shavit sobre la gobernanza de la computación», en particular:
- Registro con detección de manipulaciones en las GPU
- Seguimiento global de las GPU
- Algoritmos de prueba de aprendizaje
- Inspecciones in situ de modelos
- Detección de centros de datos
- Creación de un conjunto de herramientas para la inferencia verificable
- Medición del uso efectivo del poder de cómputo (p. ej., midiendo y controlando por el progreso algorítmico)
- Regular el entrenamiento descentralizado a gran escala (si llega a ser competitivo con el entrenamiento centralizado)
Otro grupo: temas relacionados con la seguridad, tales como
- Prevenir la exfiltración de los pesos de las redes neuronales (por parte de terceros o de la propia IA)
- Evaluar la posibilidad de replicación autónoma a través de Internet
- Escalada de privilegios desde el interior de sistemas seguros (por ejemplo, si tu asistente de programación está desalineado, ¿qué podría lograr?)
- Supervisión de los centros de datos (p. ej., si se estuvieran ejecutando copias no autorizadas de un modelo en tus servidores, ¿cómo te darías cuenta?)
- Detección de canales de comunicación no autorizados entre diferentes copias de un modelo.
- Detección de manipulaciones (p. ej., si se hubiera modificado tu proceso de entrenamiento, ¿cómo te darías cuenta?)
- ¿Hasta qué punto son vulnerables los sistemas de mando y control nucleares?
- Supervisión escalable del comportamiento (p. ej., ¿cómo podemos agregar información de los registros de supervisión de millones de IA?)
Y una tercera categoría más variada (y menos técnica):
- ¿Qué aparato regulador dentro del Gobierno de EE. UU. sería más eficaz para regular las sesiones de entrenamiento a gran escala?
- ¿De qué herramientas y métodos dispone el Gobierno de EE. UU. para auditar a las empresas tecnológicas?
- ¿Cuáles son las mayores lagunas en los controles de exportación de EE. UU. a China y cómo podrían subsanarse?
- ¿A qué aplicaciones o demostraciones de IA reaccionará la sociedad con mayor intensidad?
- ¿Qué interfaces utilizarán los seres humanos para interactuar con las IA en el futuro?
- ¿Cómo es más probable que se despliegue la IA para tareas delicadas (por ejemplo, asesorar a líderes mundiales) dadas las preocupaciones sobre la privacidad?
- ¿Cómo podría polarizarse el discurso político en torno a la IA y qué podría mitigar esa polarización?
- ¿Qué se necesitaría para automatizar infraestructuras cruciales (fábricas, armamento, etc.)?