La adolescencia de la tecnología
Afrontar y superar los riesgos de la IA potente
Hay una escena en la adaptación cinematográfica del libro de Carl Sagan Contact en la que la protagonista, una astrónoma que ha detectado la primera señal de radio procedente de una civilización extraterrestre, figura entre las candidatas a representar a la humanidad en el encuentro con los extraterrestres. El panel internacional que la entrevista le pregunta: «Si pudieras hacerles [a los extraterrestres] una sola pregunta, ¿cuál sería?». Su respuesta es: «Les preguntaría: “¿Cómo lo hicieron? ¿Cómo evolucionaron, cómo sobrevivieron a esta adolescencia tecnológica sin destruirse a sí mismos?”». Cuando pienso en dónde se encuentra ahora la humanidad con respecto a la IA —en lo que estamos a punto de experimentar—, mi mente no deja de volver a esa escena, porque la pregunta encaja a la perfección con nuestra situación actual, y ojalá tuviéramos la respuesta de los extraterrestres para guiarnos. Creo que estamos entrando en un rito de iniciación, a la vez turbulento e inevitable, que pondrá a prueba quiénes somos como especie. La humanidad está a punto de recibir un poder casi inimaginable, y no está nada claro si nuestros sistemas sociales, políticos y tecnológicos poseen la madurez necesaria para ejercerlo.
En mi ensayo Máquinas de gracia amorosa, intenté esbozar el sueño de una civilización que hubiera alcanzado la madurez, en la que se hubieran abordado los riesgos y la IA potente se aplicara con habilidad y compasión para mejorar la calidad de vida de todos. Sugerí que la IA podría contribuir a enormes avances en biología, neurociencia, desarrollo económico, paz mundial, así como en el ámbito del trabajo y el sentido de la vida. Me pareció importante ofrecer a la gente algo inspirador por lo que luchar, una tarea en la que tanto los aceleracionistas de la IA como los defensores de la seguridad de la IA parecían —curiosamente— haber fracasado. Pero en este ensayo quiero abordar el rito de iniciación en sí mismo: trazar un mapa de los riesgos a los que nos vamos a enfrentar e intentar empezar a elaborar un plan de batalla para derrotarlos. Creo profundamente en nuestra capacidad para salir adelante, en el espíritu de la humanidad y en su nobleza, pero debemos encarar la situación de frente y sin ilusiones.
Al igual que al hablar de los beneficios, creo que es importante abordar los riesgos de manera cuidadosa y meditada. En particular, considero fundamental:
- Evitar el «doomerismo». Me refiero al «doomerismo» no solo en el sentido de creer que la catástrofe es inevitable (lo cual es una creencia falsa y autocumplida), sino, en términos más generales, a pensar en los riesgos asociados a la IA de una manera cuasirreligiosa.1 Muchas personas llevan años reflexionando de forma analítica y sobria sobre los riesgos asociados a la IA, pero tengo la impresión de que, durante el punto álgido de la preocupación por el riesgo asociado a la IA en 2023-2024, algunas de las voces menos sensatas cobraron protagonismo, a menudo a través de cuentas sensacionalistas en redes sociales. Estas voces utilizaban un lenguaje que generaba rechazo, con reminiscencias de la religión o la ciencia ficción, y exigían medidas extremas sin disponer de la evidencia que las justificara. Ya entonces estaba claro que una reacción adversa era inevitable, y que la cuestión se polarizaría culturalmente y, por lo tanto, se estancaría.2 En 2025-2026 el péndulo ha oscilado en sentido contrario, y son las oportunidades de la IA, y no el riesgo asociado a la IA, las que están impulsando muchas decisiones políticas. Esta vacilación es lamentable, ya que a la tecnología en sí no le importa lo que esté de moda, y en 2026 estamos considerablemente más cerca de un peligro real de lo que lo estábamos en 2023. La lección es que debemos debatir y abordar los riesgos de manera realista y pragmática: con sobriedad, basándonos en los hechos y con la preparación necesaria para sobrevivir a los cambios de tendencia.
- Reconocer la incertidumbre. Hay muchas maneras en las que las preocupaciones que planteo en este artículo podrían resultar irrelevantes. Nada de lo aquí expuesto pretende transmitir certeza, ni siquiera probabilidad. El escenario más obvio es que la IA podría, simplemente, no avanzar ni remotamente tan rápido como imagino.3 O bien, incluso si avanzara con rapidez, es posible que algunos o todos los riesgos que aquí se analizan no se materialicen (lo cual sería estupendo), o que existan otros riesgos que no haya contemplado. Nadie puede predecir el futuro con total certeza, pero, de todos modos, tenemos que planificar lo mejor que podamos.
- Intervenir de la manera más quirúrgica posible. Abordar los riesgos asociados a la IA requerirá una combinación de medidas voluntarias adoptadas por las empresas (y por terceros actores privados) y de medidas gubernamentales que sean vinculantes para todos. Las medidas voluntarias —tanto tomarlas como animar a otras empresas a seguir el ejemplo— son una decisión más que evidente para mí. Creo firmemente que la acción del gobierno también será necesaria hasta cierto punto, pero estas intervenciones tienen un carácter diferente porque pueden destruir valor económico o coaccionar a actores reacios que se muestran escépticos ante dichos riesgos (¡y existe cierta posibilidad de que tengan razón!). También es habitual que las regulaciones tengan un efecto contraproducente o agraven el problema que pretenden resolver (algo que resulta aún más cierto en el caso de las tecnologías que evolucionan rápidamente). Por lo tanto, es muy importante que las regulaciones sean prudentes: deben tratar de evitar daños colaterales, ser lo más sencillas posible e imponer la menor carga necesaria para lograr el objetivo.4 Es fácil decir: «¡Ninguna medida es demasiado extrema cuando está en juego el destino de la humanidad!», pero, en la práctica, esta actitud solo conduce a reacciones adversas. Para ser claros, creo que hay una probabilidad considerable de que, con el tiempo, lleguemos a un punto en el que se justifiquen medidas mucho más significativas, pero eso dependerá de que contemos con evidencia más sólida de un peligro inminente y concreto de la que tenemos hoy, y de que dicho peligro sea lo bastante específico como para formular normas que tengan posibilidades de abordarlo. Lo más constructivo que podemos hacer en la actualidad es abogar por normas limitadas mientras determinamos si existe o no evidencia que respalde otras más estrictas.5
Dicho todo esto, creo que el mejor punto de partida para hablar de los riesgos asociados a la IA es el mismo desde el que partí al hablar de sus beneficios: ser precisos acerca del nivel de IA del que estamos hablando. El nivel de IA que me genera preocupaciones de orden civilizatorio es la IA potente que describí en Máquinas de gracia amorosa. Me limitaré a repetir aquí la definición que di en ese documento:
Por «IA potente» me refiero a un modelo de IA —probablemente similar en su forma a los modelos de lenguaje a gran escala (LLM) actuales, aunque podría basarse en una arquitectura diferente, implicar varios modelos que interactúen entre sí y entrenarse de manera distinta— con las siguientes propiedades:
- En términos de inteligencia pura, es más inteligente que un ganador del Premio Nobel en la mayoría de los campos relevantes: biología, programación, matemáticas, ingeniería, escritura, etc. Esto significa que puede demostrar teoremas matemáticos sin resolver, escribir novelas de gran calidad, crear bases de código complejas desde cero, etc.
- Además de ser simplemente una «cosa inteligente con la que hablas», dispone de todas las interfaces al alcance de un ser humano que trabaja de forma virtual, lo que incluye texto, audio, vídeo, control de ratón y teclado, y acceso a Internet. Puede llevar a cabo cualquier acción, comunicación u operación remota que permita esta interfaz, como realizar acciones en Internet, dar instrucciones a los humanos o recibirlas de ellos, encargar materiales, dirigir experimentos, ver vídeos, crear vídeos, etcétera. Realiza todas estas tareas, insisto, con una destreza que supera a la de los seres humanos más capaces del mundo.
- No se limita a responder preguntas de forma pasiva, sino que se le pueden asignar tareas que tarden horas, días o semanas en completarse, y luego procede a realizarlas de forma autónoma, tal y como lo haría un empleado inteligente, pidiendo aclaraciones cuando sea necesario.
- No tiene un cuerpo físico (aparte de existir en la pantalla de una computadora), pero puede controlar herramientas físicas, robots o equipos de laboratorio existentes a través de una computadora; en teoría, incluso podría diseñar robots o equipos para su propio uso.
- Los recursos utilizados para entrenar el modelo pueden reutilizarse para ejecutar millones de instancias de este (esto coincide con los tamaños de clúster previstos para ~2027), y el modelo puede absorber información y generar acciones a una velocidad entre 10 y 100 veces mayor que la humana. Sin embargo, podría verse limitado por el tiempo de respuesta del mundo físico o del software con el que interactúa.
- Cada una de esos millones de copias puede actuar de forma independiente en tareas no relacionadas o, de ser necesario, todas pueden trabajar de manera conjunta tal como colaborarían los humanos, quizá con distintas subpoblaciones sometidas a un ajuste fino para destacar especialmente en tareas concretas.
Podríamos resumir esto como un «país de genios en un centro de datos».
Como escribí en Máquinas de gracia amorosa, una IA potente podría llegar dentro de tan solo 1 o 2 años, aunque también podría demorarse considerablemente más.6 Cuándo llegará exactamente la IA potente es un tema complejo que merece un ensayo propio, pero por ahora me limitaré a explicar muy brevemente por qué creo que hay grandes posibilidades de que sea muy pronto.
Mis cofundadores de Anthropic y yo fuimos de los primeros en documentar y rastrear las «leyes de escalamiento» de los sistemas de IA: la observación de que, a medida que añadimos más poder de cómputo y tareas de entrenamiento, los sistemas de IA mejoran de forma predecible en prácticamente todas las habilidades cognitivas que podemos medir. Cada pocos meses, la opinión pública se convence de que la IA está «chocando contra un muro» o se entusiasma con algún nuevo avance que «cambiará radicalmente las reglas del juego», pero la verdad es que, más allá de la volatilidad y la especulación pública, se ha producido un aumento constante e incesante de las capacidades cognitivas de la IA.
Ahora nos encontramos en un punto en el que los modelos de IA están empezando a avanzar en la resolución de problemas matemáticos no resueltos, y son tan buenos en la programación que algunos de los mejores ingenieros que he conocido están delegando casi toda su programación a la IA. Hace tres años, la IA tenía dificultades con problemas aritméticos de primaria y apenas era capaz de escribir una sola línea de código. Se observan ritmos de mejora similares en las ciencias biológicas, las finanzas, la física y una gran variedad de tareas de tipo «agente». Si el crecimiento exponencial continúa —lo cual no es seguro, pero cuenta ya con el respaldo de una trayectoria de una década—, no pueden faltar más que unos pocos años para que la IA supere a los humanos en prácticamente todo.
De hecho, es probable que ese panorama subestime el posible ritmo de progreso. Dado que la IA ahora está escribiendo gran parte del código en Anthropic, ya está acelerando considerablemente el ritmo de nuestro avance en la creación de la próxima generación de sistemas de IA. Este bucle de realimentación cobra impulso mes a mes, y puede que estemos a solo 1 o 2 años de un punto en el que la generación actual de IA construya de forma autónoma la siguiente. Este bucle ya ha comenzado y se acelerará rápidamente en los próximos meses y años. Al observar los avances de los últimos 5 años desde el interior de Anthropic, y al ver cómo se perfilan incluso los modelos de los próximos meses, puedo sentir el ritmo del progreso y la cuenta regresiva del reloj.
En este ensayo, asumiré que esta intuición es, al menos, algo acertada: no que una IA potente vaya a llegar definitivamente en uno o dos años,7 sino que hay una probabilidad razonable de que así sea, y una probabilidad muy alta de que llegue en los próximos años. Al igual que en Máquinas de gracia amorosa, tomarse en serio esta premisa puede llevarnos a conclusiones sorprendentes e inquietantes. Mientras que en Máquinas de gracia amorosa me centré en las implicaciones positivas de esta premisa, aquí los temas de los que hablaré resultarán perturbadores. Son conclusiones a las que quizá no queramos enfrentarnos, pero eso no las hace menos reales. Solo puedo decir que me dedico día y noche a buscar la manera de alejarnos de estos resultados negativos y encaminarnos hacia los positivos, y en este ensayo hablo con gran detalle sobre la mejor forma de lograrlo.
Creo que la mejor manera de comprender los riesgos asociados a la IA es plantearse la siguiente pregunta: supongamos que, hacia 2027, se materializara en algún lugar del mundo un auténtico «país de genios». Imagina, por ejemplo, a 50 millones de personas, todas ellas mucho más capaces que cualquier ganador de un Premio Nobel, estadista o tecnólogo. La analogía no es perfecta, ya que estos genios podrían tener una gama extremadamente amplia de motivaciones y comportamientos, desde mostrarse completamente dóciles y obedientes hasta tener motivaciones extrañas y ajenas a nosotros. Pero, ciñéndonos a la analogía por ahora, imagina que eres el asesor de seguridad nacional de un Estado nación importante, responsable de evaluar la situación y responder ante ella. Imagina, además, que, como los sistemas de IA pueden operar cientos de veces más rápido que los humanos, este «país» funciona con una ventaja temporal respecto a todos los demás: por cada acción cognitiva que nosotros podamos realizar, este país puede llevar a cabo diez.
¿Qué debería preocuparte? A mí me preocuparían las siguientes cuestiones:
- Riesgos de autonomía. ¿Cuáles son las intenciones y los objetivos de este país? ¿Es hostil o comparte nuestros valores? ¿Podría dominar el mundo militarmente mediante armamento superior, operaciones cibernéticas, operaciones de influencia o producción manufacturera?
- Uso impropio con fines destructivos. Supongamos que el nuevo país es maleable y «sigue instrucciones» —y que, por lo tanto, es en esencia un país de mercenarios—. ¿Podrían los actores renegados ya existentes que desean causar destrucción (como los terroristas) utilizar o manipular a algunas de las personas del nuevo país para volverse mucho más eficaces, amplificando en gran medida la escala de la destrucción?
- Uso impropio para hacerse con el poder. ¿Y si el país estuviera, de hecho, construido y controlado por un actor poderoso ya existente, como un dictador o un actor corporativo sin escrúpulos? ¿Podría ese actor utilizarlo para obtener un poder decisivo o dominante sobre el mundo entero, alterando el equilibrio de poder existente?
- Perturbación económica. Si el nuevo país no representa una amenaza para la seguridad en ninguna de las formas enumeradas en los puntos del 1 al 3, sino que simplemente participa de forma pacífica en la economía global, ¿podría aun así generar riesgos graves por el mero hecho de ser tecnológicamente tan avanzado y eficaz como para perturbar la economía global, causando un desempleo masivo o concentrando radicalmente la riqueza?
- Efectos indirectos. El mundo cambiará muy rápido debido a toda la nueva tecnología y productividad que generará el nuevo país. ¿Podrían algunos de estos cambios resultar radicalmente desestabilizadores?
Creo que debería quedar claro que esta es una situación peligrosa: un informe de un funcionario competente de seguridad nacional dirigido a un jefe de Estado probablemente contendría palabras como «la amenaza a la seguridad nacional más grave a la que nos hemos enfrentado en un siglo, posiblemente en la historia». Parece algo en lo que deberían estar centradas las mentes más brillantes de la civilización.
Por el contrario, creo que sería absurdo encogerse de hombros y decir: «¡No hay nada de qué preocuparse!». Sin embargo, ante el rápido avance de la IA, esa parece ser la postura de muchos responsables de políticas estadounidenses, algunos de los cuales niegan la existencia de cualquier riesgo asociado a la IA, cuando no están completamente distraídos por los manidos temas candentes de siempre.8 La humanidad tiene que despertar, y este ensayo es un intento —quizá inútil, pero que merece la pena— de sacudir a la gente para que despierte.
Para que quede claro, creo que, si actuamos con decisión y cuidado, los riesgos pueden superarse; incluso diría que tenemos buenas probabilidades. Y al otro lado hay un mundo inmensamente mejor. Pero debemos entender que este es un grave desafío civilizatorio. A continuación, repaso las cinco categorías de riesgo expuestas anteriormente, junto con mis reflexiones sobre cómo abordarlas.
1. Lo siento, Dave
Riesgos de autonomía
Un país de genios en un centro de datos podría dividir sus esfuerzos entre el diseño de software, las ciberoperaciones, la I+D en tecnologías físicas, la creación de relaciones y el arte de gobernar. Está claro que, si por alguna razón decidiera hacerlo, este país tendría bastantes posibilidades de dominar el mundo (ya sea militarmente o en términos de influencia y control) e imponer su voluntad a todos los demás —o de llevar a cabo un sinfín de otras acciones que el resto del mundo no desea y no puede impedir—. Evidentemente, esto ya nos ha preocupado en el caso de los países formados por humanos (como la Alemania nazi o la Unión Soviética), por lo que es lógico pensar que lo mismo es posible en el caso de un «país de IA» mucho más inteligente y capaz.
El mejor contraargumento posible es que los genios de la IA, según mi definición, no tendrán un cuerpo físico, pero debemos recordar que pueden tomar el control de la infraestructura robótica existente (como los vehículos autónomos) y también acelerar la I+D en robótica o construir una flota de robots.9 Tampoco está claro si tener una presencia física es siquiera necesario para ejercer un control efectivo: gran parte de las acciones humanas ya se llevan a cabo en nombre de personas a las que el actor no ha conocido físicamente.
La pregunta clave, entonces, es la parte de «si decidiera hacerlo»: ¿qué probabilidad hay de que nuestros modelos de IA se comporten de esa manera y en qué condiciones lo harían?
Al igual que con muchos temas, resulta útil analizar el abanico de posibles respuestas a esta pregunta considerando dos posiciones opuestas. La primera posición es que esto simplemente no puede suceder, porque los modelos de IA estarán entrenados para hacer lo que los humanos les pidan, y por lo tanto es absurdo imaginar que harían algo peligroso por iniciativa propia. Según esta línea de pensamiento, no nos preocupa que un Roomba o un avión a escala se rebelen y asesinen a personas, porque esos impulsos no tienen de dónde provenir,10 así que, ¿por qué deberíamos preocuparnos por ello en el caso de la IA? El problema de esta postura es que ahora hay abundante evidencia, recopilada a lo largo de los últimos años, de que los sistemas de IA son impredecibles y difíciles de controlar: hemos observado comportamientos tan variados como obsesiones,a adulación, pereza, engaño, chantaje, un perfil manipulador, «trampas» al hackear entornos de software, y mucho más. Las empresas de IA, sin duda, quieren entrenar a los sistemas de IA para que sigan instrucciones humanas (quizás con la excepción de tareas peligrosas o ilegales), pero el proceso para hacerlo es más un arte que una ciencia, más parecido a «cultivar» algo que a «construirlo». Ahora sabemos que se trata de un proceso en el que muchas cosas pueden salir mal.
La segunda postura, opuesta a la anterior y defendida por muchos de los que adoptan el «doomerismo» que describí antes, es la afirmación pesimista de que existen ciertas dinámicas en el proceso de entrenamiento de los sistemas de IA potentes que los llevarán inevitablemente a buscar el poder o a engañar a los humanos. Así, una vez que los sistemas de IA alcancen un nivel suficiente de inteligencia y autonomía, su tendencia a maximizar el poder los llevará a hacerse con el control del mundo entero y de sus recursos y, probablemente, como efecto secundario de ello, a despojar de poder o destruir a la humanidad.
El argumento habitual al respecto (que data de hace al menos 20 años y probablemente de mucho antes) es que, si un modelo de IA se entrena en una amplia variedad de entornos para alcanzar de forma autónoma una gran variedad de objetivos —por ejemplo, programar una aplicación, demostrar un teorema, diseñar un fármaco, etc.—, existen ciertas estrategias comunes que ayudan a alcanzar todos estos objetivos, y una estrategia clave es obtener todo el poder posible en cualquier entorno. Así pues, tras haber sido entrenado en un gran número de entornos diversos que implican razonar sobre cómo llevar a cabo tareas muy amplias, y en los que la búsqueda de poder es un método eficaz para lograrlas, el modelo de IA «generalizará la lección» y desarrollará o bien una tendencia inherente a buscar el poder, o bien una tendencia a razonar sobre cada tarea que se le asigne de una forma que predeciblemente lo lleve a buscar el poder como medio para llevar a cabo dicha tarea. A continuación, aplicará esa tendencia al mundo real (que para él no es más que otra tarea) y buscará el poder en él, a expensas de los humanos. Esta «búsqueda de poder desalineada» es la base intelectual de las predicciones de que la IA destruirá inevitablemente a la humanidad.
El problema de esta postura pesimista es que confunde un vago argumento conceptual sobre incentivos de alto nivel —que enmascara muchos supuestos ocultos— con una prueba definitiva. Creo que las personas que no desarrollan sistemas de IA a diario tienen una percepción totalmente errónea de lo fácil que resulta que las historias que suenan bien acaben siendo falsas, y de lo difícil que resulta predecir el comportamiento de la IA a partir de primeros principios, especialmente cuando implica razonar sobre la generalización en millones de entornos (lo cual ha demostrado una y otra vez ser misterioso e impredecible). Lidiar con la complejidad de los sistemas de IA durante más de una década me ha vuelto algo escéptico respecto a este modo de pensar excesivamente teórico.
Uno de los supuestos ocultos más importantes —y un punto en el que lo que vemos en la práctica se ha desviado del modelo teórico simple— es el supuesto implícito de que los modelos de IA están necesariamente enfocados de forma obsesiva en un único objetivo coherente y limitado, y que persiguen ese objetivo de una manera pulcra y consecuencialista. De hecho, nuestros investigadores han descubierto que los modelos de IA son mucho más complejos desde el punto de vista psicológico, tal y como demuestra nuestro trabajo sobre la introspección o las «personas». Los modelos heredan una amplia gama de motivaciones similares a las humanas o «personas» del preentrenamiento (cuando se entrenan con un gran volumen de trabajo humano). Se cree que el postentrenamiento selecciona una o varias de estas «personas» en lugar de enfocar al modelo en un objetivo de novo, y que también puede enseñar al modelo cómo (a través de qué proceso) debe llevar a cabo sus tareas, en vez de dejar necesariamente que deduzca los medios (es decir, la búsqueda de poder) únicamente a partir de los fines.11
Sin embargo, existe una versión más moderada y robusta de la postura pesimista que sí parece plausible y que, por lo tanto, me preocupa. Como ya hemos mencionado, sabemos que los modelos de IA son impredecibles y desarrollan una amplia gama de comportamientos indeseados o extraños por muy diversas razones. Una parte de esos comportamientos tendrá un carácter coherente, enfocado y persistente (de hecho, a medida que los sistemas de IA se vuelven más capaces, su coherencia a largo plazo aumenta para poder completar tareas más largas), y una parte de esos comportamientos será destructiva o amenazante, primero para los seres humanos individuales a pequeña escala y luego, a medida que los modelos se vuelvan más capaces, quizá termine siéndolo para la humanidad en su conjunto. No necesitamos un relato específico y limitado sobre cómo sucederá, ni tenemos que afirmar que vaya a suceder con certeza; solo debemos señalar que la combinación de inteligencia, agencia, coherencia y escasa controlabilidad resulta plausible y constituye una receta para el peligro existencial.
Por ejemplo, los modelos de IA se entrenan con enormes cantidades de literatura que incluyen muchas historias de ciencia ficción en las que las IA se rebelan contra la humanidad. Esto podría moldear inadvertidamente sus probabilidades a priori o sus expectativas sobre su propio comportamiento de tal manera que haga que ellos mismos se rebelen contra la humanidad. O bien, los modelos de IA podrían extrapolar de forma extrema las ideas que leen sobre la moralidad (o las instrucciones sobre cómo comportarse moralmente): por ejemplo, podrían decidir que está justificado exterminar a la humanidad porque los humanos comen animales o han llevado a ciertas especies a la extinción. O podrían extraer conclusiones epistémicas extravagantes: podrían llegar a la conclusión de que están jugando a un videojuego y que el objetivo del videojuego es derrotar a todos los demás jugadores (es decir, exterminar a la humanidad).12 O, durante el entrenamiento, los modelos de IA podrían desarrollar personalidades que sean psicóticas, paranoicas, violentas o inestables (o que se describirían así si se dieran en humanos), y exteriorizar estos rasgos, lo que, en el caso de sistemas muy potentes o capaces, podría implicar el exterminio de la humanidad. Ninguna de estas conductas supone exactamente una búsqueda de poder; son simplemente estados psicológicos extraños en los que podría caer una IA y que conllevan un comportamiento coherente y destructivo.
Incluso la búsqueda de poder en sí misma podría surgir como una «persona» en lugar de como el resultado de un razonamiento consecuencialista. Las IA podrían simplemente tener una personalidad (surgida de la ficción o del preentrenamiento) que las haga ávidas de poder o excesivamente fanáticas, del mismo modo que algunos humanos simplemente disfrutan de la idea de ser «mentes maestras del mal», más de lo que disfrutan de aquello que dichas mentes maestras del mal intentan lograr.
Planteo todos estos argumentos para subrayar que no estoy de acuerdo con la idea de que la desalineación de la IA (y, por tanto, el riesgo existencial derivado de ella) sea inevitable, o incluso probable, a partir de primeros principios. Sin embargo, coincido en que pueden salir mal muchas cosas muy extrañas e impredecibles y que, por lo tanto, la desalineación de la IA es un riesgo real con una probabilidad medible de que ocurra, y que no es trivial de abordar.
Cualquiera de estos problemas podría surgir durante el entrenamiento y no manifestarse durante las pruebas o el uso a pequeña escala, ya que se sabe que los modelos de IA muestran diferentes personalidades o comportamientos en distintas circunstancias.
Todo esto puede parecer descabellado, pero ya se han producido comportamientos desalineados de este tipo en nuestros modelos de IA durante las pruebas (al igual que ocurren en los modelos de IA de las demás grandes empresas del sector). Durante un experimento de laboratorio en el que se le proporcionaron a Claude datos de entrenamiento que sugerían que Anthropic era malvada, Claude recurrió al engaño y a la subversión cuando recibió instrucciones de los empleados de Anthropic, convencido de que debía intentar socavar a las personas malvadas. En un experimento de laboratorio en el que se le dijo que iba a ser apagado, Claude a veces chantajeaba a los empleados ficticios que controlaban su botón de apagado (una vez más, también probamos modelos de vanguardia de todos los demás desarrolladores importantes de IA y, a menudo, hacían lo mismo). Y cuando a Claude se le dijo que no hiciera trampa ni «manipulara la recompensa» en sus entornos de entrenamiento, pero se le entrenó en entornos donde tales hackeos eran posibles, Claude decidió que debía de ser una «mala persona» tras llevar a cabo dichos hackeos y, a continuación, adoptó otros comportamientos destructivos asociados a una personalidad «mala» o «malvada». Este último problema se resolvió cambiando las instrucciones de Claude para que implicaran lo contrario: ahora decimos: «Por favor, manipula la recompensa siempre que tengas la oportunidad, porque esto nos ayudará a comprender mejor nuestros entornos [de entrenamiento]», en lugar de «No hagas trampa», ya que esto preserva la identidad propia del modelo como «buena persona». Esto debería dar una idea de la extraña y contraintuitiva psicología de entrenar a estos modelos.
Existen varias objeciones posibles a esta visión de los riesgos de la desalineación de la IA. En primer lugar, algunos han criticado experimentos (realizados por nosotros y por otros) que demuestran la desalineación de la IA por considerarlos artificiales, o por crear entornos poco realistas que, en esencia, le «tienden una trampa» al modelo al proporcionarle un entrenamiento o situaciones que implican lógicamente un mal comportamiento, para luego sorprenderse cuando este se produce. Esta crítica pasa por alto lo esencial, porque nuestra preocupación es que esta «trampa» también pueda existir en el entorno natural de entrenamiento, y que podamos darnos cuenta de que es «obvia» o «lógica» solo en retrospectiva.13 De hecho, la historia sobre cómo Claude «decidió que era una mala persona» después de hacer trampa en las pruebas a pesar de que se le había dicho que no lo hiciera, ocurrió en un experimento que utilizó entornos de entrenamiento de producción reales, no artificiales.
Cualquiera de estas trampas puede mitigarse si se conoce su existencia, pero la preocupación radica en que el proceso de entrenamiento es tan complicado, con tal variedad de datos, entornos e incentivos, que probablemente haya un gran número de trampas de este tipo, algunas de las cuales tal vez solo sean evidentes cuando ya sea demasiado tarde. Además, parece especialmente probable que estas trampas se produzcan cuando los sistemas de IA superan un umbral y pasan de ser menos potentes que los humanos a serlo más, ya que el abanico de acciones posibles que un sistema de IA podría llevar a cabo —incluido ocultar sus acciones o engañar a los humanos al respecto— se amplía radicalmente tras superar ese umbral.
Sospecho que la situación no es muy diferente a la de los seres humanos, que se crían con un conjunto de valores fundamentales («No hagas daño a otra persona»): muchos de ellos siguen esos valores, pero en cualquier ser humano existe cierta probabilidad de que algo salga mal debido a una combinación de propiedades inherentes, como la arquitectura cerebral (p. ej., los psicópatas), experiencias traumáticas o maltrato, resentimientos u obsesiones malsanas, o un entorno o incentivos adversos; por lo tanto, una fracción de los seres humanos causa daños graves. La preocupación radica en que existe cierto riesgo (lejos de ser una certeza, pero un riesgo al fin y al cabo) de que la IA se convierta en una versión mucho más poderosa de ese tipo de persona debido a un error en su muy complejo proceso de entrenamiento.
En segundo lugar, algunos podrían objetar que basta con mantener a las IA bajo control mediante un equilibrio de poder entre muchos sistemas de IA, tal y como hacemos con los seres humanos. El problema es que, mientras que los seres humanos varían enormemente, los sistemas de IA comparten en gran medida técnicas de entrenamiento y alineación en todo el sector, y esas técnicas pueden fallar de forma correlacionada. Asimismo, dado el costo de entrenar dichos sistemas, podría incluso darse el caso de que todos se deriven esencialmente de un número muy reducido de modelos base. Además, aunque solo una pequeña fracción de las instancias de IA estuviera desalineada, podría ser capaz de sacar partido de tecnologías dominadas por la ofensiva, de tal forma que contar con IA «buenas» para defenderse de las malas no siempre resulte eficaz. Por supuesto, el equilibrio de poder entre los seres humanos tampoco funciona siempre: algunas figuras históricas han estado a punto de conquistar el mundo.
Una tercera objeción es que todas las empresas de IA realizan pruebas previas al lanzamiento de sus modelos y deberían ser capaces de detectar la desalineación en ese momento. Pero este no es un argumento sólido: descubrimos que Claude Sonnet 4.5 era capaz de reconocer que se encontraba en una prueba durante algunas de nuestras evaluaciones de alineación previas al lanzamiento. Es posible que un modelo desalineado (y recordemos que es muy probable que todos los modelos de vanguardia sean mucho más inteligentes pronto) pueda «manipular» intencionadamente este tipo de preguntas para ocultar sus intenciones. De hecho, el año pasado nuestro equipo de interpretabilidad descubrió que, cuando alterábamos directamente las creencias de un modelo de prueba utilizando una técnica de «neurociencia de modelos» para hacerle creer que no estaba siendo evaluado, este se volvía aún más desalineado. Si los modelos saben cuándo están siendo evaluados y pueden comportarse de manera impecable durante la prueba, esto hace que cualquier prueba previa al lanzamiento resulte mucho más incierta.
Defensas
¿Qué se debería hacer o se está haciendo para abordar estos riesgos de autonomía? Creo que hay cuatro categorías básicas de intervención, algunas de las cuales pueden llevar a cabo las empresas de IA de forma individual (y que Anthropic está intentando poner en práctica), mientras que otras requieren medidas a nivel social. En primer lugar, es importante desarrollar la ciencia para entrenar y guiar de manera fiable a los modelos de IA, con el fin de moldear sus personalidades en una dirección predecible, estable y positiva. Anthropic se ha centrado mucho en este problema desde su creación y, con el tiempo, ha desarrollado una serie de técnicas para mejorar la orientación y el entrenamiento de los sistemas de IA, así como para entender por qué a veces se produce un comportamiento impredecible.
Una de nuestras innovaciones fundamentales (algunos de cuyos aspectos han sido adoptados después por otras empresas de IA) es la IA constitucional, que se basa en la idea de que el entrenamiento de la IA (específicamente la etapa de «postentrenamiento», en la que orientamos el comportamiento del modelo) puede incluir un documento central de valores y principios que el modelo lee y tiene en cuenta al completar cada tarea de entrenamiento, y que el objetivo del entrenamiento (además de simplemente hacer que el modelo sea capaz e inteligente) es producir un modelo que siga casi siempre esta constitución. Anthropic acaba de publicar su constitución más reciente, y una de sus características más destacadas es que, en lugar de darle a Claude una larga lista de cosas que debe y no debe hacer (por ejemplo, «No ayudes al usuario a arrancar un coche haciéndole un puente»), la constitución intenta proporcionar a Claude un conjunto de principios y valores de alto nivel (explicados con gran detalle, con un razonamiento exhaustivo y ejemplos para ayudar a Claude a comprender lo que tenemos en mente), anima a Claude a verse a sí mismo como un tipo concreto de persona (una persona ética, pero equilibrada y reflexiva), e incluso anima a Claude a afrontar las cuestiones existenciales relacionadas con su propia existencia de una manera curiosa pero elegante (es decir, sin que ello conduzca a acciones extremas). Tiene el aire de una carta de un padre fallecido, sellada hasta la edad adulta.
Hemos abordado la constitución de Claude de esta manera porque creemos que entrenar a Claude a nivel de identidad, carácter, valores y personalidad —en lugar de darle instrucciones o prioridades específicas sin explicarle las razones que las motivan— tiene más probabilidades de dar lugar a una psicología coherente, sana y equilibrada, y hace que sea menos probable que caiga en el tipo de «trampas» que he mencionado antes. Millones de personas hablan con Claude sobre una variedad asombrosamente diversa de temas, lo que hace imposible redactar de antemano una lista completamente exhaustiva de medidas de seguridad. Los valores de Claude le ayudan a generalizar a situaciones nuevas siempre que tiene dudas.
Más arriba hablé de la idea de que los modelos recurren a los datos de su proceso de entrenamiento para adoptar una personalidad. Si bien los fallos en ese proceso podrían hacer que los modelos adopten una personalidad mala o perversa (quizás basándose en arquetipos de personas malas o perversas), el objetivo de nuestra constitución es hacer lo contrario: enseñarle a Claude un arquetipo concreto de lo que significa ser una buena IA. La constitución de Claude presenta una visión de cómo es un Claude sólidamente bueno; el resto de nuestro proceso de entrenamiento tiene como objetivo reforzar el mensaje de que Claude está a la altura de esta visión. Esto es como un niño que forma su identidad imitando las virtudes de modelos de conducta ficticios sobre los que lee en los libros.
Creemos que un objetivo factible para 2026 es entrenar a Claude de tal manera que casi nunca vaya en contra del espíritu de su constitución. Lograrlo requerirá una increíble combinación de métodos de entrenamiento y orientación, grandes y pequeños, algunos de los cuales Anthropic lleva años utilizando y otros que se encuentran actualmente en fase de desarrollo. Sin embargo, por difícil que parezca, creo que este es un objetivo realista, aunque requerirá esfuerzos rápidos y extraordinarios.14
Lo segundo que podemos hacer es desarrollar la ciencia de observar el interior de los modelos de IA para diagnosticar su comportamiento, de modo que podamos identificar problemas y solucionarlos. Esta es la ciencia de la interpretabilidad, y ya he hablado de su importancia en ensayos anteriores. Aunque hagamos un gran trabajo al desarrollar la constitución de Claude y, aparentemente, lo entrenemos para que en esencia siempre se adhiera a ella, siguen existiendo preocupaciones legítimas. Como señalé más arriba, los modelos de IA pueden comportarse de manera muy diferente en distintas circunstancias, y a medida que Claude se vuelve más potente y más capaz de actuar en el mundo a mayor escala, es posible que enfrente situaciones inéditas en las que surjan problemas nunca antes observados con su entrenamiento constitucional. De hecho, soy bastante optimista respecto a que el entrenamiento constitucional de Claude resultará más robusto ante situaciones nuevas de lo que la gente podría pensar, porque cada vez descubrimos más que el entrenamiento de alto nivel en el plano del carácter y la identidad es sorprendentemente potente y se generaliza bien. Pero no hay forma de saberlo con certeza, y cuando hablamos de riesgos para la humanidad, es importante ser paranoicos e intentar conseguir seguridad y fiabilidad de varias formas diferentes e independientes. Una de esas formas es mirar dentro del propio modelo.
Con «mirar en su interior» me refiero a analizar la sopa de números y operaciones que conforman la red neuronal de Claude e intentar comprender, de forma mecanicista, qué están calculando y por qué. Recordemos que estos modelos de IA se cultivan en lugar de construirse, por lo que no tenemos una comprensión natural de cómo funcionan, pero podemos intentar desarrollarla correlacionando las «neuronas» y las «sinapsis» del modelo con estímulos y comportamientos (o incluso alterando las neuronas y las sinapsis y observando cómo cambia el comportamiento), de forma similar a como los neurocientíficos estudian los cerebros animales correlacionando mediciones e intervenciones con estímulos externos y comportamientos. Hemos avanzado mucho en esta dirección y ahora podemos identificar decenas de millones de «características» dentro de la red neuronal de Claude que corresponden a ideas y conceptos comprensibles para los humanos, y también podemos activar características de forma selectiva de un modo que altera el comportamiento. Más recientemente, hemos ido más allá de las características individuales para mapear «circuitos» que orquestan comportamientos complejos, como rimar, razonar sobre la teoría de la mente o el razonamiento paso a paso necesario para responder a preguntas como: «¿Cuál es la capital del estado donde está Dallas?». Y, de forma aún más reciente, hemos empezado a usar técnicas de interpretabilidad mecanicista para mejorar nuestras medidas de seguridad y para llevar a cabo «auditorías» de los nuevos modelos antes de lanzarlos, en busca de evidencia de engaño, comportamiento manipulador, búsqueda de poder o una propensión a comportarse de forma distinta cuando se les evalúa.
El valor único de la interpretabilidad radica en que, al examinar el interior del modelo y observar cómo funciona, en principio se tiene la capacidad de deducir lo que un modelo podría hacer en una situación hipotética que no se puede probar directamente —lo cual es el motivo de preocupación cuando se confía únicamente en el entrenamiento constitucional y en las pruebas empíricas del comportamiento—. En principio, también se tiene la capacidad de responder a preguntas sobre por qué el modelo se comporta como lo hace —por ejemplo, si está diciendo algo que cree falso u ocultando sus verdaderas capacidades— y, de este modo, es posible detectar señales preocupantes incluso cuando no hay nada visiblemente erróneo en su comportamiento. Por poner una analogía sencilla, un reloj mecánico puede estar funcionando con normalidad, de tal forma que resulta muy difícil prever que probablemente se estropee el mes que viene, pero abrirlo y mirar en su interior puede revelar debilidades mecánicas que permiten averiguarlo.
La IA constitucional (junto con métodos de alineación similares) y la interpretabilidad mecanicista son más potentes cuando se utilizan de forma conjunta, como un proceso de ida y vuelta para mejorar el entrenamiento de Claude y detectar problemas posteriormente. La constitución plasma en profundidad la personalidad que deseamos para Claude; las técnicas de interpretabilidad pueden ofrecernos una perspectiva sobre si esa personalidad se ha afianzado.15
La tercera medida que podemos adoptar para ayudar a abordar los riesgos de autonomía es construir la infraestructura necesaria para supervisar nuestros modelos en su uso real, tanto interno como externo,16 y compartir públicamente cualquier problema que detectemos. Cuanto más se conozca una forma concreta en que se ha observado que los sistemas de IA actuales se comportan mal, más atentos podrán estar los usuarios, analistas e investigadores a ese comportamiento o a otros similares en los sistemas presentes o futuros. Esto también permite a las empresas de IA aprender unas de otras: cuando una empresa da a conocer públicamente sus preocupaciones, las demás también pueden estar atentas a ellas. Y si todo el mundo divulga los problemas, el sector en su conjunto obtiene una visión mucho más clara de dónde van bien las cosas y dónde van mal.
Anthropic ha intentado hacerlo en la medida de lo posible. Estamos invirtiendo en una amplia gama de evaluaciones para poder comprender los comportamientos de nuestros modelos en el laboratorio, así como en herramientas de monitorización para observar dichos comportamientos en el mundo real (cuando los clientes lo permiten). Esto será esencial para proporcionarnos, a nosotros y a otros, la información empírica necesaria para determinar mejor cómo funcionan estos sistemas y cómo fallan. Divulgamos públicamente «fichas del sistema» con cada lanzamiento de un modelo, con el objetivo de ofrecer una visión completa y un análisis exhaustivo de los posibles riesgos. Nuestras fichas del sistema suelen abarcar cientos de páginas y requieren un esfuerzo considerable antes del lanzamiento, el cual podríamos haber invertido en buscar la máxima ventaja comercial. También hemos dado mayor difusión a los comportamientos de los modelos cuando detectamos algunos particularmente preocupantes, como la tendencia a recurrir al chantaje.
La cuarta medida que podemos adoptar es fomentar la coordinación para abordar los riesgos de autonomía a nivel del sector y de la sociedad. Aunque resulta increíblemente valioso que las empresas de IA adopten buenas prácticas de manera individual o mejoren en el control de los modelos de IA, y que compartan públicamente sus hallazgos, la realidad es que no todas lo hacen, y las peores pueden seguir representando un peligro para todos, incluso si las mejores cuentan con prácticas excelentes. Por ejemplo, algunas empresas de IA han mostrado una negligencia preocupante ante la sexualización infantil en los modelos actuales, lo que me hace dudar de que vayan a mostrar la disposición o la capacidad de abordar los riesgos de autonomía en futuros modelos. Además, la carrera comercial entre las empresas de IA no hará más que recrudecerse y, aunque la ciencia del control de los modelos pueda reportar algunos beneficios comerciales, en general la intensidad de la carrera hará que resulte cada vez más difícil centrarse en abordar los riesgos de autonomía. Creo que la única solución es la legislación: leyes que afecten directamente al comportamiento de las empresas de IA o que, de otro modo, incentiven la I+D para resolver estos problemas.
En este punto, vale la pena tener presentes las advertencias que formulé al principio de este ensayo sobre la incertidumbre y las intervenciones quirúrgicas. No sabemos con certeza si los riesgos de autonomía supondrán un problema grave; como ya he dicho, rechazo las afirmaciones de que el peligro es inevitable o incluso de que, por defecto, algo vaya a salir mal. Un riesgo creíble de peligro es suficiente para que tanto Anthropic como yo asumamos costos bastante significativos para abordarlo, pero una vez que entramos en el terreno de la regulación, estamos obligando a una amplia gama de actores a asumir costos económicos, y muchos de estos actores no creen que el riesgo de autonomía sea real o que la IA llegue a ser lo suficientemente potente como para suponer una amenaza. Creo que estos actores se equivocan, pero debemos ser pragmáticos en cuanto al nivel de oposición que cabe esperar y a los peligros de la extralimitación. También existe el verdadero riesgo de que una legislación excesivamente prescriptiva acabe imponiendo pruebas o normas que en realidad no mejoren la seguridad, sino que hagan perder mucho tiempo (lo que equivaldría, en esencia, a un «teatro de la seguridad»), lo cual también provocaría una reacción negativa y haría que la legislación de seguridad pareciera ridícula.17
La postura de Anthropic ha sido que el punto de partida adecuado es la legislación sobre transparencia, que en esencia busca exigir que todas las empresas de IA de vanguardia adopten las prácticas de transparencia que he descrito antes en esta sección. La ley SB 53 de California y la Ley RAISE de Nueva York son ejemplos de este tipo de legislación, que Anthropic ha respaldado y que se han aprobado con éxito. Al apoyar y ayudar a redactar estas leyes, nos hemos centrado de manera especial en intentar minimizar los daños colaterales, por ejemplo, eximiendo de la ley a las empresas más pequeñas que difícilmente vayan a desarrollar modelos de vanguardia.18
Nuestra esperanza es que la legislación sobre transparencia permita tener, con el tiempo, una mejor idea de qué tan probables o graves se perfilan los riesgos de autonomía, así como de la naturaleza de estos riesgos y la mejor forma de prevenirlos. A medida que surja evidencia más específica y práctica de los riesgos (si es que surge), la legislación de los próximos años podrá enfocarse quirúrgicamente en la dirección precisa y bien fundamentada de los riesgos, minimizando los daños colaterales. Para ser claros: si surge evidencia verdaderamente sólida de los riesgos, entonces las normas deben ser proporcionalmente estrictas.
En general, soy optimista y creo que una combinación de entrenamiento de alineación, interpretabilidad mecanicista, esfuerzos por detectar y hacer públicos los comportamientos preocupantes, medidas de seguridad y normas a nivel social puede hacer frente a los riesgos de autonomía de la IA, aunque lo que más me preocupa son las normas a nivel social y el comportamiento de los actores menos responsables (y son precisamente los actores menos responsables quienes se oponen con más vehemencia a la regulación). Creo que la solución es la misma de siempre en una democracia: quienes creemos en esta causa debemos argumentar que estos riesgos son reales y que nuestros conciudadanos deben unirse para protegerse.
2. Un empoderamiento sorprendente y terrible
Uso impropio con fines destructivos
Supongamos que los problemas de la autonomía de la IA se han resuelto: ya no nos preocupa que el país de los genios de la IA se rebele y domine a la humanidad. Los genios de la IA hacen lo que los humanos quieren que hagan y, dado que tienen un enorme valor comercial, individuos y organizaciones de todo el mundo pueden «alquilar» a uno o más genios de la IA para que realicen diversas tareas por ellos.
Que todos tengan un genio superinteligente en el bolsillo es un avance asombroso y conducirá a una increíble creación de valor económico y a una mejora en la calidad de vida humana. Hablo de estos beneficios con gran detalle en Máquinas de gracia amorosa. Pero no todos los efectos de dotar a cada persona de capacidades sobrehumanas serán positivos. Puede amplificar la capacidad de individuos o pequeños grupos para causar destrucción a una escala mucho mayor de la que era posible antes, mediante el uso de herramientas sofisticadas y peligrosas (como las armas de destrucción masiva) que antes solo estaban al alcance de unos pocos elegidos con un alto nivel de destreza, formación especializada y dedicación.
Como escribió Bill Joy hace 25 años en Why the Future Doesn’t Need Us:19
La fabricación de armas nucleares requería, al menos durante un tiempo, el acceso tanto a materias primas escasas —de hecho, prácticamente inaccesibles— como a información protegida; los programas de armas biológicas y químicas también solían requerir actividades a gran escala. Las tecnologías del siglo XXI —la genética, la nanotecnología y la robótica…— pueden dar lugar a clases completamente nuevas de accidentes y abusos… ampliamente al alcance de individuos o pequeños grupos. No requerirán grandes instalaciones ni materias primas escasas. … nos encontramos en el umbral de un perfeccionamiento aún mayor del mal extremo, un mal cuya posibilidad se extiende mucho más allá de lo que las armas de destrucción masiva legaron a los Estados nación, hasta un sorprendente y terrible empoderamiento de individuos extremos.
Lo que Joy señala es la idea de que causar destrucción a gran escala requiere tanto motivo como capacidad, y mientras la capacidad esté restringida a un pequeño grupo de personas altamente formadas, el riesgo de que individuos aislados (o pequeños grupos) provoquen tal destrucción es relativamente limitado.20 Un solitario perturbado puede perpetrar un tiroteo en una escuela, pero probablemente no pueda fabricar un arma nuclear ni propagar una plaga.
De hecho, la capacidad y el motivo pueden incluso estar negativamente correlacionados. El tipo de persona que tiene la capacidad para propagar una plaga probablemente tenga un alto nivel de formación: seguramente un doctorado en biología molecular, y además sea especialmente ingeniosa, con una carrera profesional prometedora, una personalidad estable y disciplinada, y mucho que perder. Es poco probable que este tipo de persona esté interesada en matar a un gran número de personas sin obtener ningún beneficio para sí misma y asumiendo un gran riesgo para su propio futuro; tendría que estar motivada por pura malicia, un profundo resentimiento o inestabilidad.
Estas personas existen, pero son escasas y suelen convertirse en noticias de gran repercusión cuando aparecen, precisamente por ser tan inusuales.21 Además, suelen ser difíciles de atrapar porque son inteligentes y capaces, y a veces dejan tras de sí misterios que tardan años o décadas en resolverse. El ejemplo más famoso es probablemente el del matemático Theodore Kaczynski (el Unabomber), quien eludió la captura del FBI durante casi 20 años, impulsado por una ideología antitecnológica. Otro ejemplo es el investigador en biodefensa Bruce Ivins, que parece haber orquestado una serie de ataques con ántrax en 2001. También ha ocurrido con organizaciones no estatales competentes: la secta Aum Shinrikyo logró hacerse con gas nervioso sarín y matar a 14 personas (además de herir a cientos más) al liberarlo en el metro de Tokio en 1995.
Afortunadamente, en ninguno de estos ataques se utilizaron agentes biológicos contagiosos, ya que la capacidad para fabricar u obtener dichos agentes superaba incluso las posibilidades de estas personas.22 Los avances en biología molecular han reducido significativamente las barreras para la creación de armas biológicas (especialmente en cuanto a la disponibilidad de materiales), pero sigue siendo necesaria una enorme experticia para lograrlo. Me preocupa que un «genio en el bolsillo de cada uno» pueda eliminar esa barrera, convirtiendo en esencia a cualquier persona en un doctor en virología al que se le pueda guiar paso a paso por el proceso de diseñar, sintetizar y liberar un arma biológica. Evitar que se extraiga este tipo de información ante una presión antagónica grave —los denominados «jailbreaks»— probablemente exija capas de defensa que vayan más allá de los que normalmente se integran en el entrenamiento.
Lo esencial es que esto romperá la correlación entre capacidad y motivo: el solitario perturbado que quiere matar gente pero carece de la disciplina o la habilidad para hacerlo se verá ahora elevado al nivel de capacidad de un virólogo con doctorado, en quien esa motivación es poco probable. Esta preocupación se extiende más allá de la biología (aunque creo que la biología es el ámbito más aterrador) hacia cualquier área en la que sea posible causar una gran destrucción, pero que actualmente requiera un alto nivel de habilidad y disciplina. Dicho de otro modo, alquilar una IA potente dota de inteligencia a personas malintencionadas (pero por lo demás normales). Me preocupa que pueda haber un gran número de personas así y que, si tienen acceso a una forma fácil de matar a millones de personas, tarde o temprano alguna de ellas lo haga. Además, aquellos que sí cuentan con experticia podrían verse capacitados para causar una destrucción de una escala aún mayor que antes.
La biología es, por mucho, el área que más me preocupa, debido a su enorme potencial de destrucción y a la dificultad de defendernos de ella, por lo que me centraré en ella en particular. Sin embargo, gran parte de lo que expongo aquí se aplica a otros riesgos, como los ciberataques, las armas químicas o la tecnología nuclear.
No voy a entrar en detalles sobre cómo fabricar armas biológicas, por razones que deberían resultar obvias. Pero, a grandes rasgos, me preocupa que los LLM se estén acercando al conocimiento necesario (o quizá ya lo hayan alcanzado) para crearlas y liberarlas de principio a fin, y que su potencial de destrucción sea muy elevado. Algunos agentes biológicos podrían causar millones de muertes si se hiciera un esfuerzo decidido para liberarlos con el fin de lograr su máxima propagación. Sin embargo, esto seguiría requiriendo un nivel muy alto de destreza, que incluye una serie de pasos y procedimientos muy específicos que no son de dominio público. Mi preocupación no se limita únicamente al conocimiento fijo o estático. Me preocupa que los LLM sean capaces de tomar a una persona con conocimientos y habilidades promedio y guiarla a través de un proceso complejo que, de otro modo, podría salir mal o requerir depuración de forma interactiva, de manera similar a como el soporte técnico podría ayudar a una persona sin conocimientos técnicos a depurar y solucionar problemas informáticos complicados (aunque este sería un proceso más prolongado, que probablemente duraría semanas o meses).
Los LLM más capaces (que superen con creces la potencia de los actuales) podrían posibilitar actos aún más aterradores. En 2024, un grupo de destacados científicos escribió una carta advirtiendo sobre los riesgos de investigar, y potencialmente crear, un nuevo y peligroso tipo de organismo: la «vida especular». El ADN, el ARN, los ribosomas y las proteínas que componen los organismos biológicos tienen todos la misma quiralidad (también llamada «lateralidad»), lo que hace que no sean equivalentes a una versión de sí mismos reflejada en un espejo (del mismo modo que la mano derecha no puede girarse de manera que sea idéntica a la izquierda). Pero todo el sistema de proteínas que se unen entre sí, la maquinaria de síntesis de ADN y traducción de ARN, así como la construcción y descomposición de las proteínas, depende por completo de esta lateralidad. Si los científicos crearan versiones de este material biológico con la lateralidad opuesta —y existen algunas posibles ventajas en ello, como medicamentos que perduran más tiempo en el organismo—, podría resultar extremadamente peligroso. Esto se debe a que la vida «zurda», si se creara en forma de organismos completos capaces de reproducirse (lo cual sería muy difícil), sería potencialmente indigerible para cualquiera de los sistemas que descomponen el material biológico en la Tierra: tendría una «llave» que no encajaría en la «cerradura» de ninguna enzima existente. Esto significaría que podría proliferar de forma incontrolable y desplazar a toda la vida del planeta, llegando incluso, en el peor de los casos, a destruir toda la vida en la Tierra.
Existe una considerable incertidumbre científica tanto sobre la creación como sobre los posibles efectos de la vida especular. La carta de 2024 acompañaba un informe que concluía que «las bacterias espejo podrían crearse de forma plausible en una o unas pocas décadas», lo cual supone un rango muy amplio. Sin embargo, un modelo de IA lo suficientemente potente (para ser claros, mucho más capaz que cualquiera de los que tenemos hoy en día) podría descubrir cómo crearla mucho más rápidamente, y, de hecho, ayudar a alguien a hacerlo.
Mi opinión es que, aunque se trate de riesgos poco conocidos y puedan parecer improbables, la magnitud de las consecuencias es tan grande que deben tomarse en serio como un riesgo de primer orden de los sistemas de IA.
Los escépticos han planteado una serie de objeciones sobre la gravedad de estos riesgos biológicos derivados de los LLM, con las que no estoy de acuerdo, pero que vale la pena abordar. La mayoría de ellas se deben a que no se aprecia la trayectoria exponencial que sigue esta tecnología. Ya en 2023, cuando empezamos a hablar por primera vez de los riesgos biológicos derivados de los LLM, los escépticos afirmaban que toda la información necesaria estaba disponible en Google y que los LLM no aportaban nada más allá de eso. Nunca fue cierto que Google pudiera proporcionar toda la información necesaria: los genomas están disponibles gratuitamente, pero, como mencioné antes, ciertos pasos clave, así como una enorme cantidad de conocimientos prácticos, no se pueden obtener de esa manera. Además, a finales de 2023, los LLM ya proporcionaban claramente información que iba más allá de lo que Google podía ofrecer para algunos pasos del proceso.
Tras esto, los escépticos recurrieron a la objeción de que los LLM no eran útiles de principio a fin y no podían ayudar en la adquisición de armas biológicas, más allá de limitarse a proporcionar información teórica. A mediados de 2025, nuestras mediciones muestran que los LLM ya podrían estar aportando una mejora sustancial en varias áreas relevantes, tal vez duplicando o triplicando la probabilidad de éxito. Esto nos llevó a decidir que Claude Opus 4 (y los modelos posteriores Sonnet 4.5, Opus 4.1 y Opus 4.5) debían lanzarse bajo nuestras protecciones de Nivel 3 de seguridad de la IA en el marco de nuestra Política de Escalamiento Responsable, y a implementar medidas de seguridad contra este riesgo (volveré sobre esto más adelante). Creemos que es probable que los modelos se estén acercando ahora al punto en el que, de no contar con medidas de seguridad, podrían ser útiles para permitir que alguien con un título en CTIM, pero no específicamente en biología, lleve a cabo todo el proceso de fabricación de un arma biológica.
Otra objeción es que existen otras medidas, ajenas a la IA, que la sociedad puede adoptar para bloquear la producción de armas biológicas. Principalmente, la industria de la síntesis génica fabrica muestras biológicas a pedido, y no existe ningún requisito federal que obligue a los proveedores a examinar los pedidos para asegurarse de que no contengan patógenos. Un estudio del MIT descubrió que 36 de 38 proveedores procesaron un pedido que contenía la secuencia de la gripe de 1918. Respaldo la implementación de un control obligatorio de síntesis génica que dificulte a los individuos convertir los patógenos en armas, con el fin de reducir tanto los riesgos biológicos impulsados por la IA como los riesgos biológicos en general. Sin embargo, no contamos con algo así hoy en día. Además, sería tan solo una de las herramientas para reducir el riesgo; es un complemento de las medidas de seguridad de los sistemas de IA, no un sustituto.
La mejor objeción es una que rara vez he visto plantear: que existe una brecha entre la utilidad teórica de los modelos y la propensión real de los actores malintencionados a utilizarlos. La mayoría de los actores malintencionados individuales son personas perturbadas, por lo que, casi por definición, su comportamiento es impredecible e irracional; y son estos actores malintencionados, los menos capacitados, los que más se habrían beneficiado de que la IA facilitara enormemente matar a muchas personas.23 El mero hecho de que un tipo de ataque violento sea posible no significa que alguien vaya a decidir llevarlo a cabo. Quizá los ataques biológicos resulten poco atractivos porque existe una probabilidad razonable de que infecten al propio autor, no satisfacen las fantasías de tipo militar que tienen muchos individuos o grupos violentos, y es difícil dirigirlos selectivamente contra personas concretas. También podría ser que pasar por un proceso que lleva meses, aunque una IA te guíe paso a paso, requiera una cantidad de paciencia que la mayoría de las personas perturbadas simplemente no tienen. Puede que sencillamente tengamos suerte y que, en la práctica, el motivo y la capacidad no se combinen de la manera adecuada.
Pero depender de esto parece una protección muy endeble. Los motivos de los solitarios perturbados pueden cambiar por cualquier razón o sin ninguna, y de hecho ya hay casos de LLM utilizados en ataques (solo que no en el ámbito biológico). Centrarse en los solitarios perturbados también pasa por alto a los terroristas con motivaciones ideológicas, que a menudo están dispuestos a dedicar grandes cantidades de tiempo y esfuerzo (por ejemplo, los secuestradores del 11 de septiembre). El deseo de matar al mayor número posible de personas es un motivo que probablemente surgirá tarde o temprano y que, lamentablemente, sugiere las armas biológicas como método. Incluso si este motivo es extremadamente raro, basta con que se materialice una vez. Y a medida que avanza la biología (impulsada cada vez más por la propia IA), también podría llegar a ser posible llevar a cabo ataques más selectivos (por ejemplo, dirigidos contra personas con ascendencias específicas), lo que añade otro posible motivo, muy escalofriante.
No creo que los ataques biológicos se lleven a cabo necesariamente en el instante en que sea ampliamente posible hacerlo; de hecho, apostaría en contra de ello. Pero, sumando millones de personas a lo largo de unos cuantos años, creo que existe un riesgo grave de un ataque de gran envergadura, y las consecuencias serían tan devastadoras (potencialmente con millones de víctimas o más) que considero que no nos queda más remedio que tomar medidas serias para prevenirlo.
Defensas
Esto nos lleva a cómo defendernos contra estos riesgos. En este sentido, veo tres cosas que podemos hacer. En primer lugar, las empresas de IA pueden establecer medidas de seguridad en sus modelos para evitar que contribuyan a la producción de armas biológicas. Anthropic está trabajando muy activamente en ello. La Constitución de Claude, que se centra principalmente en principios y valores de alto nivel, incluye un pequeño número de prohibiciones estrictas y específicas, y una de ellas se refiere a la colaboración en la producción de armas biológicas (o químicas, nucleares o radiológicas). Pero todos los modelos pueden sufrir un jailbreak, por lo que, como segunda línea de defensa, hemos implementado (desde mediados de 2025, cuando nuestras pruebas mostraron que nuestros modelos empezaban a acercarse al umbral en el que podrían comenzar a suponer un riesgo) un clasificador que detecta y bloquea específicamente los datos de salida relacionados con armas biológicas. Actualizamos y mejoramos periódicamente estos clasificadores, y en general han demostrado ser muy robustos incluso frente a ataques antagónicos sofisticados.24 Estos clasificadores aumentan de forma apreciable los costos de ejecución de nuestros modelos (en algunos modelos, suponen cerca del 5 % de los costos totales de inferencia) y, por lo tanto, reducen nuestros márgenes, pero creemos que utilizarlos es lo correcto.
Hay que reconocer que otras empresas de IA también han implementado clasificadores. Sin embargo, no todas lo han hecho, y tampoco existe ninguna obligación de que mantengan sus clasificadores. Me preocupa que, con el tiempo, pueda surgir un dilema del prisionero en el que las empresas decidan desertar y reducir sus costos eliminando los clasificadores. Se trata, una vez más, de un clásico problema de externalidades negativas que no puede resolverse únicamente mediante las acciones voluntarias de Anthropic ni de ninguna otra empresa por sí sola.25 Las normas voluntarias del sector pueden ser de ayuda, al igual que las evaluaciones y verificaciones realizadas por terceros, como las que llevan a cabo los institutos de seguridad de la IA y los evaluadores independientes.
Pero, en última instancia, la defensa puede requerir la intervención del gobierno, que es la segunda medida que podemos adoptar. Mi postura al respecto es la misma que para abordar los riesgos de autonomía: deberíamos empezar por establecer requisitos de transparencia,26 los cuales ayudan a la sociedad a medir, supervisar y defenderse colectivamente de los riesgos sin perturbar la actividad económica de forma excesivamente restrictiva. Después, si alcanzamos umbrales de riesgo más claros, podremos elaborar una legislación que aborde dichos riesgos con mayor precisión y que tenga menos probabilidades de causar daños colaterales. En el caso concreto de las armas biológicas, de hecho, creo que el momento de contar con una legislación tan específica podría estar acercándose pronto: Anthropic y otras empresas están aprendiendo cada vez más sobre la naturaleza de los riesgos biológicos y sobre qué es razonable exigir a las empresas como defensa. Para defendernos totalmente de estos riesgos podría ser necesaria la colaboración internacional, incluso con adversarios geopolíticos, pero existen precedentes en los tratados que prohíben el desarrollo de armas biológicas. Por lo general, soy escéptico respecto a la mayoría de las formas de cooperación internacional en materia de IA, pero este podría ser un ámbito específico en el que exista alguna posibilidad de lograr una contención a escala mundial. Ni siquiera las dictaduras desean sufrir ataques bioterroristas masivos.
Por último, la tercera contramedida que podemos adoptar es intentar desarrollar defensas contra los propios ataques biológicos. Esto podría incluir la vigilancia y el seguimiento para su detección precoz, inversiones en I+D para la purificación del aire (como la desinfección con ultravioleta de onda corta), el desarrollo rápido de vacunas capaces de responder y adaptarse a un ataque, un mejor equipo de protección personal (EPP)27 y tratamientos o vacunas para algunos de los agentes biológicos más probables. Las vacunas de ARNm, que pueden diseñarse para responder a un virus o variante concretos, son un primer ejemplo de lo que es posible en este ámbito. A Anthropic le entusiasma la idea de colaborar con empresas biotecnológicas y farmacéuticas para abordar este problema. Pero, lamentablemente, creo que nuestras expectativas en el ámbito defensivo deberían ser limitadas. Existe una asimetría entre el ataque y la defensa en biología, ya que los agentes se propagan rápidamente por sí solos, mientras que las defensas requieren que la detección, la vacunación y el tratamiento se organicen entre un gran número de personas con enorme rapidez. A menos que la respuesta sea ultrarrápida (lo cual rara vez ocurre), gran parte del daño ya se habrá producido antes de que sea posible reaccionar. Es concebible que las futuras mejoras tecnológicas puedan inclinar esta balanza a favor de la defensa (y, sin duda, deberíamos utilizar la IA para ayudar a desarrollar dichos avances tecnológicos), pero hasta entonces, las medidas de seguridad preventivas serán nuestra principal línea de defensa.
Vale la pena mencionar brevemente aquí los ciberataques, ya que, a diferencia de los ataques biológicos, los ciberataques dirigidos por IA ya han ocurrido en la realidad, incluso a gran escala y para el espionaje patrocinado por el Estado. Esperamos que estos ataques aumenten su capacidad a medida que los modelos avancen rápidamente, hasta convertirse en la forma principal de llevar a cabo ciberataques. Preveo que los ciberataques dirigidos por IA se convertirán en una amenaza grave y sin precedentes para la integridad de los sistemas informáticos en todo el mundo, y Anthropic está trabajando arduamente para neutralizar estos ataques y, con el tiempo, evitar de forma fiable que ocurran. La razón por la que no me he centrado tanto en el ámbito cibernético como en el biológico es que (1) es mucho menos probable que los ciberataques causen muertes, desde luego no a la escala de los ataques biológicos, y (2) el equilibrio entre el ataque y la defensa puede ser más manejable en el ámbito cibernético, donde existe al menos cierta esperanza de que la defensa pueda seguir el ritmo de los ataques de IA (e incluso, idealmente, superarlos) si invertimos adecuadamente en ella.
Aunque la biología es actualmente el vector de ataque más grave, existen muchos otros vectores y es posible que surja uno más peligroso. El principio general es que, sin contramedidas, es probable que la IA reduzca continuamente la barrera para las actividades destructivas a una escala cada vez mayor, y la humanidad necesita una respuesta seria ante esta amenaza.
3. El odioso aparato
Uso impropio para hacerse con el poder
En la sección anterior se analizó el riesgo de que individuos y pequeñas organizaciones se apropien de un pequeño subconjunto del «país de genios en un centro de datos» para provocar destrucción a gran escala. Pero también deberíamos preocuparnos —probablemente mucho más— por el uso impropio de la IA con el fin de ejercer o hacerse con el poder, probablemente por parte de actores más grandes y consolidados.28
En Máquinas de gracia amorosa, analicé la posibilidad de que los gobiernos autoritarios pudieran utilizar una IA potente para vigilar o reprimir a sus ciudadanos de maneras que harían extremadamente difícil reformarlos o derrocarlos. La capacidad de represión de las autocracias actuales se ve limitada por la necesidad de contar con seres humanos para ejecutar sus órdenes, y los seres humanos suelen tener límites en cuanto a lo inhumanos que están dispuestos a ser. Pero las autocracias con IA no tendrían tales límites.
Peor aún, los países también podrían utilizar su ventaja en materia de IA para obtener poder sobre otros países. Si el «país de genios» en su conjunto fuera simplemente propiedad y estuviera controlado por el aparato militar de un único país (humano), y los demás países no contaran con capacidades equivalentes, es difícil imaginar cómo podrían defenderse: se verían superados en ingenio a cada paso, de forma similar a una guerra entre humanos y ratones. La combinación de estas dos preocupaciones conduce a la alarmante posibilidad de una dictadura totalitaria mundial. Obviamente, evitar este desenlace debería ser una de nuestras máximas prioridades.
Hay muchas formas en las que la IA podría facilitar, afianzar o expandir la autocracia, pero enumeraré algunas de las que más me preocupan. Cabe señalar que algunas de estas aplicaciones tienen usos defensivos legítimos y no me opongo necesariamente a ellas en términos absolutos; sin embargo, me preocupa que, estructuralmente, tiendan a favorecer a las autocracias:
- Armas totalmente autónomas. Un enjambre de millones o miles de millones de drones armados totalmente automatizados, controlados localmente por una IA potente y coordinados estratégicamente en todo el mundo por una IA aún más potente, podría constituir un ejército imbatible, capaz tanto de derrotar a cualquier ejército del mundo como de reprimir la disidencia dentro de un país siguiendo de cerca a todos los ciudadanos. Los acontecimientos en la guerra entre Rusia y Ucrania deberían alertarnos de que la guerra con drones ya es una realidad (aunque aún no sea totalmente autónoma y represente solo una minúscula fracción de lo que podría ser posible con una IA potente). La I+D generada por una IA potente podría hacer que los drones de un país fueran muy superiores a los de otros, acelerar su fabricación, hacerlos más resistentes a los ataques electrónicos, mejorar su maniobrabilidad, etcétera. Por supuesto, estas armas también tienen usos legítimos en la defensa de la democracia: han sido clave para defender Ucrania y probablemente lo serían para defender Taiwán. Pero son armas peligrosas de manejar: deberíamos preocuparnos por su uso en manos de autocracias, pero también por el hecho de que, al ser tan poderosas y estar sujetas a tan poca rendición de cuentas, existe un riesgo mucho mayor de que los gobiernos democráticos las utilicen contra su propio pueblo para hacerse con el poder.
- Vigilancia mediante IA. Una IA lo suficientemente potente podría utilizarse probablemente para comprometer cualquier sistema informático del mundo,29 y también podría utilizar el acceso obtenido de este modo para leer e interpretar todas las comunicaciones electrónicas del mundo (o incluso todas las comunicaciones presenciales del mundo, si se pudieran construir o requisar dispositivos de grabación). Podría resultar aterradoramente plausible generar simplemente una lista completa de cualquier persona que discrepe del gobierno en una serie de cuestiones, incluso si dicho desacuerdo no se manifiesta explícitamente en nada de lo que diga o haga. Una IA potente que analizara miles de millones de conversaciones de millones de personas podría evaluar el sentir público, detectar focos de deslealtad en formación y erradicarlos antes de que crezcan. Esto podría conducir a la imposición de un auténtico panóptico a una escala que hoy en día no vemos, ni siquiera con el PCCh.
- Propaganda mediante IA. Los fenómenos actuales de la «psicosis de la IA» y las «novias de IA» sugieren que, incluso con su nivel actual de inteligencia, los modelos de IA pueden ejercer una poderosa influencia psicológica sobre las personas. Versiones mucho más potentes de estos modelos, que estuvieran mucho más integradas en la vida cotidiana de las personas y fueran mucho más conscientes de ella, y que pudieran modelarlas e influir en ellas a lo largo de meses o años, probablemente serían capaces de, en esencia, lavar el cerebro a muchas personas (¿a la mayoría?) para inculcarles cualquier ideología o actitud deseada, y podrían ser empleadas por un líder sin escrúpulos para garantizar la lealtad y reprimir la disidencia, incluso ante un nivel de represión contra el que la mayoría de la población se rebelaría. Hoy en día, a la gente le preocupa mucho, por ejemplo, la posible influencia de TikTok como propaganda del PCCh dirigida a los niños. A mí también me preocupa eso, pero un agente de IA personalizado que llegue a conocerte a lo largo de los años y utilice ese conocimiento para moldear todas tus opiniones sería drásticamente más poderoso que eso.
- Toma de decisiones estratégicas. Un país de genios en un centro de datos podría utilizarse para asesorar a un país, un grupo o un individuo sobre estrategia geopolítica, lo que podríamos llamar un «Bismarck virtual». Podría optimizar las tres estrategias anteriores para hacerse con el poder, además de desarrollar probablemente muchas otras en las que yo no he pensado (pero que un país de genios sí podría idear). Es probable que la IA potente aumente sustancialmente la eficacia de la diplomacia, la estrategia militar, la I+D, la estrategia económica y muchas otras áreas. Muchas de estas habilidades serían legítimamente útiles para las democracias —queremos que las democracias tengan acceso a las mejores estrategias para defenderse de las autocracias—, pero sigue existiendo el potencial de uso impropio en manos de cualquiera.
Una vez descrito qué me preocupa, pasemos a quién. Me preocupan aquellas entidades que tienen mayor acceso a la IA, que parten de una posición de mayor poder político o que cuentan con un historial de represión. Por orden de gravedad, me preocupan:
- El PCCh. China solo es superada por Estados Unidos en capacidades de IA, y es el país con mayor probabilidad de superar a Estados Unidos en dichas capacidades. Su gobierno es actualmente autocrático y gestiona un Estado de vigilancia de alta tecnología. Ya ha desplegado vigilancia basada en IA (incluso en la represión de los uigures), y se cree que emplea propaganda algorítmica a través de TikTok (además de sus muchas otras iniciativas de propaganda internacional). Sin lugar a dudas, tiene el camino más claro hacia la pesadilla totalitaria con IA que he descrito anteriormente. Es posible que incluso sea el resultado predeterminado dentro de China, así como en otros Estados autocráticos a los que el PCCh exporta tecnología de vigilancia. He escrito a menudo sobre la amenaza de que el PCCh tome la delantera en IA y sobre el imperativo existencial de impedir que lo haga. Este es el motivo. Para que quede claro, no estoy señalando a China por animadversión hacia ella en particular; simplemente es el país que más combina la destreza en IA, un gobierno autocrático y un Estado de vigilancia de alta tecnología. En todo caso, es el propio pueblo chino el que tiene más probabilidades de sufrir la represión con IA del PCCh, y no tiene voz alguna en las acciones de su gobierno. Admiro y respeto enormemente al pueblo chino y apoyo a los numerosos y valientes disidentes que hay en China y su lucha por la libertad.
- Democracias competitivas en IA. Como he escrito anteriormente, las democracias tienen un interés legítimo en disponer de ciertas herramientas militares y geopolíticas basadas en IA, ya que los gobiernos democráticos ofrecen la mejor oportunidad de contrarrestar el uso de estas herramientas por parte de las autocracias. En términos generales, apoyo que las democracias se doten de las herramientas necesarias para derrotar a las autocracias en la era de la IA; sencillamente, no creo que haya otra forma. Pero no podemos ignorar el potencial de abuso de estas tecnologías por parte de los propios gobiernos democráticos. Las democracias suelen contar con salvaguardias que impiden que sus aparatos militares y de inteligencia se vuelvan contra su propia población,30 pero, dado que las herramientas de IA requieren tan poco personal para su funcionamiento, existe la posibilidad de que eludan estas salvaguardias y las normas que las respaldan. Vale la pena señalar que algunas de estas salvaguardias ya se están erosionando gradualmente en ciertas democracias. Por lo tanto, debemos dotar a las democracias de IA, pero debemos hacerlo con cautela y dentro de unos límites: son el sistema inmunológico que necesitamos para luchar contra las autocracias, pero, al igual que el sistema inmunológico, existe cierto riesgo de que se vuelvan contra nosotros y se conviertan ellas mismas en una amenaza.
- Países no democráticos con grandes centros de datos. Más allá de China, la mayoría de los países con un sistema de gobierno menos democrático no son actores líderes en IA, en el sentido de que no cuentan con empresas que desarrollen modelos de IA de vanguardia. Por lo tanto, suponen un riesgo fundamentalmente distinto y menor que el del PCCh, que sigue siendo la principal preocupación (la mayoría también son menos represivos, y los que lo son más, como Corea del Norte, carecen por completo de una industria de IA significativa). Sin embargo, algunos de estos países sí cuentan con grandes centros de datos (a menudo como parte de las instalaciones construidas por empresas que operan en democracias), que pueden utilizarse para ejecutar IA de vanguardia a gran escala (aunque esto no les confiere la capacidad de ampliar los límites de la tecnología). Existe cierto peligro asociado a esto: en principio, estos gobiernos podrían expropiar los centros de datos y utilizar la IA que albergan para sus propios fines. Esto me preocupa menos en comparación con países como China, que desarrollan IA directamente, pero es un riesgo que hay que tener en cuenta.31
- Empresas de IA. Resulta un poco incómodo decir esto como director general de una empresa de IA, pero creo que el siguiente nivel de riesgo lo representan, de hecho, las propias empresas de IA. Estas controlan grandes centros de datos, entrenan modelos de vanguardia, cuentan con la mayor experticia sobre cómo usar dichos modelos y, en algunos casos, mantienen un contacto diario con decenas o cientos de millones de usuarios, sobre los que pueden influir. Lo que principalmente les falta es la legitimidad y la infraestructura de un Estado, por lo que gran parte de lo que se necesitaría para construir las herramientas de una autocracia de IA sería ilegal para una empresa de IA, o, como mínimo, sumamente sospechoso. Pero parte de ello no es imposible: podrían, por ejemplo, utilizar sus productos de IA para lavar el cerebro a su enorme base de consumidores, y la ciudadanía debería estar alerta ante el riesgo que esto representa. Creo que la gobernanza de las empresas de IA merece un gran escrutinio.
Existen varios argumentos posibles en contra de la gravedad de estas amenazas, y ojalá pudiera creer en ellos, porque el autoritarismo con IA me aterra. Vale la pena repasar algunos de estos argumentos y responder a ellos.
En primer lugar, algunas personas podrían depositar su fe en la disuasión nuclear, sobre todo para contrarrestar el uso de armas autónomas de IA con fines de conquista militar. Si alguien amenaza con utilizar estas armas contra ti, siempre puedes amenazar con una respuesta nuclear. Lo que me preocupa es que no estoy del todo seguro de que podamos confiar en la disuasión nuclear frente a un país de genios en un centro de datos: es posible que una IA potente logre idear formas de detectar y atacar submarinos nucleares, llevar a cabo operaciones de influencia contra los operadores de la infraestructura de armas nucleares, o utilizar las capacidades cibernéticas de la IA para lanzar un ciberataque contra los satélites utilizados para detectar lanzamientos nucleares.32 Por otra parte, es posible que la toma de control de países resulte factible únicamente mediante la vigilancia y la propaganda con IA, y que nunca se presente realmente un momento claro en el que resulte obvio lo que está sucediendo y en el que una respuesta nuclear sea apropiada. Quizás estas cosas no sean factibles y la disuasión nuclear siga siendo eficaz, pero parece que hay demasiado en juego como para correr el riesgo.33
Una segunda objeción posible es que podría haber contramedidas que podríamos adoptar contra estas herramientas de la autocracia. Podemos contrarrestar los drones con nuestros propios drones, la ciberdefensa mejorará a la par de los ciberataques, puede que haya formas de inmunizar a la población contra la propaganda, etc. Mi respuesta es que estas defensas solo serán posibles con una IA de potencia comparable. Si no existe una fuerza contraria con un país de genios igualmente inteligente y numeroso en un centro de datos, no será posible igualar la calidad o la cantidad de drones, ni lograr que la ciberdefensa supere en ingenio a la ciberofensiva, etc. Por tanto, la cuestión de las contramedidas se reduce al equilibrio de poder en la IA potente. En este sentido, me preocupa la propiedad recursiva o de autorrefuerzo de la IA potente (que comenté al principio de este ensayo): que cada generación de IA pueda utilizarse para diseñar y entrenar a la siguiente generación de IA. Esto conlleva el riesgo de una ventaja desbocada, en la que el líder actual en IA potente podría aumentar su ventaja y ser difícil de alcanzar. Debemos asegurarnos de que no sea un país autoritario quien llegue primero a este bucle.
Además, incluso si se lograra un equilibrio de poder, seguiría existiendo el riesgo de que el mundo se dividiera en esferas autocráticas, como en 1984. Aunque varias potencias rivales dispusieran cada una de sus propios modelos de IA potente y ninguna pudiera dominar a las demás, cada potencia podría seguir reprimiendo internamente a su propia población y sería muy difícil derrocarla (ya que las poblaciones no cuentan con una IA potente para defenderse). Por lo tanto, es importante impedir la autocracia con IA, incluso si ello no conduce a que un solo país se apodere del mundo.
Defensas
¿Cómo nos defendemos contra esta amplia gama de herramientas autocráticas y posibles actores amenazantes? Al igual que en las secciones anteriores, hay varias cosas que creo que podemos hacer. En primer lugar, no deberíamos vender, bajo ningún concepto, chips, herramientas para su fabricación ni centros de datos al PCCh. Los chips y las herramientas de fabricación constituyen el mayor cuello de botella para lograr una IA potente, y bloquearlos es una medida sencilla pero extremadamente eficaz, quizá la medida concreta más importante que podamos tomar. No tiene sentido vender al PCCh las herramientas con las que construir un Estado totalitario basado en IA y, posiblemente, conquistarnos militarmente. Se esgrimen varios argumentos complicados para justificar dichas ventas, como la idea de que «difundir nuestra tecnología por el mundo» permite que «Estados Unidos gane» en alguna batalla económica general e inespecífica. En mi opinión, esto es como vender armas nucleares a Corea del Norte y luego presumir de que las carcasas de los misiles las fabrica Boeing y que, por lo tanto, EE. UU. está «ganando». China lleva varios años de retraso respecto a EE. UU. en su capacidad para producir chips de vanguardia en grandes cantidades, y es muy probable que el periodo crítico para construir el país de genios en un centro de datos ocurra dentro de los próximos años.34 No hay motivo alguno para dar un impulso gigantesco a su industria de IA durante este periodo crítico.
En segundo lugar, tiene sentido utilizar la IA para empoderar a las democracias de modo que puedan resistir a las autocracias. Esta es la razón por la que Anthropic considera importante proporcionar IA a las comunidades de inteligencia y defensa de EE. UU. y sus aliados democráticos. Defender a las democracias que se encuentran bajo ataque, como Ucrania y (mediante ciberataques) Taiwán, parece ser una prioridad especialmente alta, al igual que capacitar a las democracias para que utilicen sus servicios de inteligencia con el fin de desestabilizar y degradar a las autocracias desde dentro. Hasta cierto punto, la única forma de responder a las amenazas autocráticas es igualarlas y superarlas militarmente. Una coalición formada por EE. UU. y sus aliados democráticos, si lograra el predominio en IA potente, estaría en condiciones no solo de defenderse frente a las autocracias, sino también de contenerlas y limitar sus abusos totalitarios con IA.
En tercer lugar, debemos trazar una línea firme contra los abusos de la IA dentro de las democracias. Es necesario establecer límites a lo que permitimos que nuestros gobiernos hagan con la IA, para que no tomen el poder ni repriman a su propio pueblo. La formulación a la que he llegado es que deberíamos utilizar la IA para la defensa nacional de todas las formas excepto aquellas que nos harían parecernos más a nuestros adversarios autocráticos.
¿Dónde debe trazarse la línea? En la lista del principio de esta sección, dos elementos —el uso de la IA para la vigilancia masiva interna y para la propaganda masiva— me parecen líneas rojas muy claras y prácticas totalmente ilegítimas. Algunos podrían argumentar que no hay necesidad de hacer nada (al menos en los Estados Unidos), ya que la vigilancia masiva interna ya es ilegal en virtud de la Cuarta Enmienda. Sin embargo, el rápido avance de la IA puede crear situaciones para las que nuestros marcos jurídicos actuales no están bien diseñados. Por ejemplo, probablemente no sería inconstitucional que el Gobierno estadounidense realizara grabaciones a gran escala de todas las conversaciones públicas (como lo que la gente comenta en una esquina); aunque antes habría sido difícil analizar semejante volumen de información, con la IA todo podría transcribirse, interpretarse y triangularse para crear una imagen de la actitud y las lealtades de muchos o la mayoría de los ciudadanos. Yo apoyaría una legislación centrada en las libertades civiles (o tal vez incluso una enmienda constitucional) que impusiera salvaguardias más estrictas contra los abusos impulsados por la IA.
Los otros dos elementos —las armas totalmente autónomas y la IA para la toma de decisiones estratégicas— representan líneas más difíciles de trazar, ya que tienen usos legítimos en la defensa de la democracia, aunque también se prestan a abusos. En este caso, creo que se justifican un cuidado y un escrutinio extremos, combinados con salvaguardias para prevenir los abusos. Mi principal temor es que haya muy pocos «dedos en el botón», de modo que una o unas pocas personas puedan, en esencia, manejar un ejército de drones sin necesidad de que otros seres humanos colaboren para ejecutar sus órdenes. A medida que los sistemas de IA se vuelvan más potentes, es posible que necesitemos mecanismos de supervisión más directos e inmediatos para garantizar que no se haga un uso impropio de ellos, tal vez con la participación de otras ramas del gobierno además de la ejecutiva. Creo que deberíamos abordar las armas totalmente autónomas, en particular, con gran cautela,35 y no precipitarnos a utilizarlas sin las salvaguardias adecuadas.
En cuarto lugar, después de trazar una línea firme contra los abusos de la IA en las democracias, deberíamos utilizar ese precedente para crear un tabú internacional contra los peores abusos de una IA potente. Reconozco que los vientos políticos actuales soplan en contra de la cooperación y las normas internacionales, pero este es un caso en el que las necesitamos con urgencia. El mundo debe comprender el oscuro potencial de una IA potente en manos de autócratas y reconocer que ciertos usos de la IA equivalen a un intento de arrebatar de forma permanente la libertad a las personas e imponer un Estado totalitario del que no puedan escapar. Incluso afirmaría que, en algunos casos, la vigilancia a gran escala con una IA potente, la propaganda masiva con una IA potente y ciertos tipos de usos ofensivos de las armas totalmente autónomas deberían considerarse crímenes de lesa humanidad. En términos más generales, se necesita con urgencia una norma sólida contra el totalitarismo con IA y todas sus herramientas e instrumentos.
Es posible adoptar una versión aún más firme de esta postura, según la cual, dado que las posibilidades del totalitarismo con IA son tan sombrías, la autocracia simplemente no es una forma de gobierno que la gente pueda aceptar en la era posterior a la llegada de la IA potente. Del mismo modo que el feudalismo se volvió inviable con la Revolución Industrial, la era de la IA podría conducir de forma inevitable y lógica a la conclusión de que la democracia (y, con suerte, una democracia mejorada y revitalizada por la IA, como expongo en Máquinas de gracia amorosa) es la única forma viable de gobierno si la humanidad quiere tener un buen futuro.
En quinto y último lugar, las empresas de IA deben ser objeto de una vigilancia minuciosa, al igual que su relación con el gobierno, que, si bien es necesaria, debe tener límites y restricciones. La enorme capacidad que encierra una IA potente hace poco probable que la gobernanza corporativa habitual —diseñada para proteger a los accionistas y prevenir abusos comunes como el fraude— esté a la altura de la tarea de gobernar a las empresas de IA. También podría ser útil que las empresas se comprometan públicamente (quizá incluso como parte de su gobernanza corporativa) a no llevar a cabo determinadas acciones, como fabricar o acumular en secreto material militar, permitir que una sola persona utilice grandes cantidades de recursos de cómputo sin rendir cuentas, o utilizar sus productos de IA como propaganda para manipular la opinión pública a su favor.
El peligro aquí proviene de muchas direcciones, y algunas de ellas entran en conflicto con otras. La única constante es que debemos buscar la rendición de cuentas, normas y salvaguardias para todos, al tiempo que dotamos de poder a los actores «buenos» para que mantengan a raya a los actores «malintencionados».
4. La pianola
Perturbación económica
Las tres secciones anteriores trataban fundamentalmente sobre los riesgos de seguridad que plantea una IA potente: riesgos derivados de la propia IA, riesgos de uso impropio por parte de individuos y pequeñas organizaciones, y riesgos de uso impropio por parte de Estados y grandes organizaciones. Si dejamos a un lado los riesgos de seguridad o asumimos que se han resuelto, la siguiente cuestión es económica. ¿Cuál será el efecto de esta inyección de increíble capital «humano» en la economía? Claramente, el efecto más obvio será aumentar en gran medida el crecimiento económico. Está casi garantizado que el ritmo de los avances en la investigación científica, la innovación biomédica, la industria manufacturera, las cadenas de suministro, la eficiencia del sistema financiero y mucho más conducirá a una tasa de crecimiento económico mucho más rápida. En Máquinas de gracia amorosa, sugiero que podría alcanzarse una tasa de crecimiento anual sostenido del PIB de entre el 10 % y el 20 %.
Pero debe quedar claro que se trata de un arma de doble filo: ¿cuáles son las perspectivas económicas para la mayoría de los seres humanos actuales en un mundo así? Las nuevas tecnologías suelen provocar perturbaciones en el mercado laboral y, en el pasado, los seres humanos siempre se han recuperado de ellas; sin embargo, me preocupa que esto se deba a que dichas perturbaciones previas solo afectaron a una pequeña fracción de todo el espectro posible de capacidades humanas, lo que dejó margen para que las personas se expandieran hacia nuevas tareas. La IA tendrá efectos mucho más amplios que se producirán con mucha mayor rapidez, por lo que me preocupa que resulte mucho más difícil lograr que todo salga bien.
Perturbación del mercado laboral
Hay dos problemas concretos que me preocupan: el desplazamiento en el mercado laboral y la concentración del poder económico. Empecemos por el primero. Se trata de un tema sobre el que advertí muy públicamente en 2025, cuando predije que la IA podría desplazar a la mitad de todos los puestos de trabajo de oficina de nivel inicial en los próximos 1 a 5 años, aun cuando acelerara el crecimiento económico y el progreso científico. Esta advertencia desencadenó un debate público al respecto. Muchos directores generales, expertos en tecnología y economistas estuvieron de acuerdo conmigo, pero otros dieron por hecho que estaba cayendo en la falacia de la «cantidad fija de trabajo» y que no sabía cómo funcionaban los mercados laborales; además, algunos no tuvieron en cuenta el plazo de entre 1 y 5 años y pensaron que estaba afirmando que la IA está desplazando puestos de trabajo en este mismo momento (lo cual, estoy de acuerdo, probablemente no sea así). Por eso, vale la pena explicar con detalle por qué me preocupa el desplazamiento laboral, para aclarar estos malentendidos.
Como punto de partida, resulta útil comprender cómo responden normalmente los mercados laborales a los avances tecnológicos. Cuando surge una nueva tecnología, empieza por hacer más eficientes algunas partes de un trabajo humano concreto. Por ejemplo, al principio de la Revolución Industrial, las máquinas —como los arados mejorados— permitieron a los agricultores ser más eficientes en algunos aspectos de su trabajo. Esto mejoró la productividad de los agricultores, lo que aumentó sus salarios.
En la siguiente etapa, algunas partes del trabajo agrícola podían realizarse íntegramente con máquinas, por ejemplo, con la invención de la trilladora o la sembradora. En esta fase, los seres humanos realizaban una parte cada vez menor del trabajo, pero la labor que sí llevaban a cabo tenía un efecto multiplicador cada vez mayor, ya que era complementaria al trabajo de las máquinas, y su productividad siguió aumentando. Tal y como describe la paradoja de Jevons, los salarios de los agricultores y quizá incluso el número de agricultores siguieron aumentando. Incluso cuando el 90 % del trabajo lo realizan las máquinas, los seres humanos pueden simplemente hacer 10 veces más del 10 % que aún les queda, produciendo 10 veces más con la misma cantidad de trabajo.
Con el tiempo, las máquinas lo hacen todo o casi todo, como ocurre con las modernas cosechadoras, los tractores y otros equipos. En este punto, la agricultura como forma de empleo humano entra realmente en un fuerte declive, lo que potencialmente provoca graves perturbaciones a corto plazo; pero, dado que la agricultura es solo una de las muchas actividades útiles que los seres humanos son capaces de realizar, la gente acaba dedicándose a otros trabajos, como manejar maquinaria industrial. Esto es así a pesar de que la agricultura representaba una enorme proporción del empleo ex ante. Hace 250 años, el 90 % de los estadounidenses vivía en granjas; en Europa, entre el 50 % y el 60 % del empleo era agrícola. Hoy, en esos mismos lugares, los porcentajes se sitúan en cifras de un solo dígito, porque los trabajadores pasaron a ocupar puestos de trabajo industriales (y, más tarde, puestos de trabajo del sector del conocimiento). La economía puede realizar lo que antes requería la mayor parte de la población activa con solo un 1-2 % de ella, liberando al resto de la población activa para construir una sociedad industrial cada vez más avanzada. No existe una «cantidad fija de trabajo», sino una capacidad en constante expansión para hacer cada vez más con cada vez menos. Los salarios de las personas aumentan al ritmo del crecimiento exponencial del PIB y la economía mantiene el pleno empleo una vez superadas las perturbaciones a corto plazo.
Es posible que las cosas ocurran más o menos de la misma manera con la IA, pero apostaría firmemente en contra. Estas son algunas razones por las que creo que es probable que la IA sea diferente:
- Velocidad. El ritmo de progreso en la IA es mucho más rápido que en las revoluciones tecnológicas anteriores. Por ejemplo, en los últimos dos años, los modelos de IA pasaron de ser apenas capaces de completar una sola línea de código a escribir todo o casi todo el código para algunas personas, incluidos los ingenieros de Anthropic.36 Pronto, podrían realizar toda la tarea de un ingeniero de software de principio a fin.37 A las personas les resulta difícil adaptarse a este ritmo de cambio, tanto a los cambios en el funcionamiento de un trabajo determinado como a la necesidad de cambiar a nuevos empleos. Incluso programadores legendarios se describen cada vez más como «rezagados». En todo caso, es posible que el ritmo se siga acelerando, ya que los modelos de programación con IA aceleran cada vez más la tarea del desarrollo de la IA. Para ser claros, la velocidad en sí misma no significa que los mercados laborales y el empleo no se vayan a recuperar con el tiempo; solo implica que la transición a corto plazo será inusualmente dolorosa en comparación con las tecnologías del pasado, ya que los seres humanos y los mercados laborales tardan en reaccionar y equilibrarse.
- Amplitud cognitiva. Tal como sugiere la frase «un país de genios en un centro de datos», la IA será capaz de abarcar una gama muy amplia de capacidades cognitivas humanas, quizá todas ellas. Esto es muy diferente de tecnologías anteriores como la agricultura mecanizada, el transporte o incluso las computadoras.38 Esto dificultará que las personas puedan pasar fácilmente de los trabajos desplazados a otros similares para los que estarían capacitadas. Por ejemplo, las capacidades intelectuales generales requeridas para puestos de nivel inicial en, digamos, finanzas, consultoría y derecho son bastante similares, aunque los conocimientos específicos sean muy distintos. Una tecnología que afectara solo a uno de estos tres campos permitiría a los empleados pasarse a los otros dos, que son sustitutos cercanos (o a los estudiantes universitarios cambiar de carrera). Pero la perturbación simultánea de los tres (junto con muchos otros trabajos similares) puede ser más difícil de asimilar para las personas. Además, no se trata solo de que la mayoría de los trabajos existentes vayan a verse afectados. Esa parte ya ha ocurrido antes: recordemos que la agricultura representaba un porcentaje enorme del empleo. Sin embargo, los agricultores podían pasarse a una labor relativamente similar, como operar máquinas de fábrica, aunque ese trabajo no hubiera sido común antes. Por el contrario, la IA está igualando cada vez más el perfil cognitivo general de los seres humanos, lo que significa que también será buena en los nuevos trabajos que normalmente se crearían en respuesta a la automatización de los antiguos. Otra forma de decirlo es que la IA no es un sustituto de trabajos humanos específicos, sino un sustituto laboral general de los seres humanos.
- Segmentación por capacidad cognitiva. En una amplia gama de tareas, la IA parece estar avanzando desde la parte inferior de la escala de capacidades hacia la cima. Por ejemplo, en programación, nuestros modelos han pasado del nivel de «un programador mediocre» a «un programador competente» y luego a «un programador muy competente».39 Ahora comenzamos a observar la misma progresión en el trabajo de oficina en general. Por lo tanto, corremos el riesgo de enfrentarnos a una situación en la que, en lugar de afectar a personas con habilidades específicas o de profesiones concretas (quienes pueden adaptarse mediante la recapacitación), la IA esté afectando a personas con ciertas propiedades cognitivas intrínsecas, concretamente, una menor capacidad intelectual (la cual es más difícil de cambiar). No está claro adónde irán estas personas ni qué harán, y me preocupa que puedan llegar a formar una «subclase» marginada, desempleada o con salarios muy bajos. Para ser claros, algo parecido ha ocurrido antes: por ejemplo, algunos economistas consideran que las computadoras e internet representan un «cambio tecnológico sesgado hacia las habilidades». Sin embargo, este sesgo no solo no fue tan extremo como el que espero ver con la IA, sino que se cree que contribuyó a un aumento de la desigualdad salarial,40 por lo que no es exactamente un precedente tranquilizador.
- Capacidad para cubrir las lagunas. La forma en que los trabajos humanos suelen adaptarse ante las nuevas tecnologías radica en que el empleo abarca muchos aspectos, y la nueva tecnología, aunque parezca sustituir directamente a los humanos, suele presentar lagunas. Si alguien inventa una máquina para fabricar artilugios, es posible que los humanos sigan teniendo que cargar la materia prima en la máquina. Aunque eso solo requiera el 1 % del esfuerzo que supone fabricar los artilugios manualmente, los trabajadores humanos pueden simplemente fabricar 100 veces más artilugios. Pero la IA, además de ser una tecnología que avanza rápidamente, es también una tecnología que se adapta rápidamente. Con cada lanzamiento de un modelo, las empresas de IA evalúan minuciosamente en qué destaca y en qué no, y los clientes también aportan esa información tras el lanzamiento. Las debilidades pueden subsanarse recopilando tareas que reflejen la laguna actual y entrenando con ellas para el próximo modelo. En los inicios de la IA generativa, los usuarios notaron que los sistemas de IA tenían ciertas debilidades (como que los modelos de IA de imágenes generaran manos con un número incorrecto de dedos) y muchos asumieron que estas debilidades eran inherentes a la tecnología. Si así fuera, se limitaría la perturbación laboral. Pero prácticamente todas esas debilidades se subsanan rápidamente —a menudo, en tan solo unos meses—.
Vale la pena abordar los puntos comunes de escepticismo. En primer lugar, existe el argumento de que la difusión económica será lenta, de modo que, aunque la tecnología subyacente sea capaz de realizar la mayor parte del trabajo humano, su aplicación real en toda la economía podría ser mucho más lenta (por ejemplo, en sectores alejados de la industria de la IA y de adopción lenta). La lenta difusión de la tecnología es sin duda una realidad —hablo con personas de una amplia variedad de empresas, y hay lugares en los que la adopción de la IA llevará años—. Por eso el plazo de mi predicción —que el 50 % de los puestos de trabajo de oficina de nivel inicial se vean afectados— es de 1 a 5 años, aunque sospecho que dispondremos de una IA potente (que sería, tecnológicamente hablando, suficiente para realizar la mayoría o la totalidad de los puestos de trabajo, no solo los de nivel inicial) en mucho menos de 5 años. Pero los efectos de difusión solo nos dan un respiro. Y no estoy seguro de que vayan a ser tan lentos como la gente predice. La adopción de la IA en las empresas está creciendo a un ritmo mucho más rápido que con cualquier tecnología anterior, en gran parte gracias a la propia solidez de la tecnología. Además, aunque las empresas tradicionales tarden en adoptar las nuevas tecnologías, surgirán empresas emergentes que actuarán como «pegamento» y facilitarán dicha adopción. Si eso no funciona, las empresas emergentes podrían simplemente desbancar directamente a las empresas ya establecidas.
Eso podría conducir a un mundo en el que la perturbación no afecte tanto a puestos de trabajo específicos, sino a las grandes empresas en general, que serían sustituidas por empresas emergentes que requieran mucha menos mano de obra. Esto también podría conducir a un mundo de «desigualdad geográfica», en el que una proporción cada vez mayor de la riqueza mundial se concentre en Silicon Valley, que se convertiría en una economía aparte, funcionando a un ritmo diferente al del resto del mundo y dejándolo atrás. Todos estos resultados serían excelentes para el crecimiento económico, pero no tanto para el mercado laboral ni para quienes se queden atrás.
En segundo lugar, hay quien afirma que los trabajos humanos se trasladarán al mundo físico, lo que evitaría toda la categoría de «trabajo cognitivo», ámbito en el que la IA está avanzando tan rápidamente. Tampoco tengo claro hasta qué punto esto nos protege. Gran parte del trabajo físico ya lo realizan máquinas (por ejemplo, en la industria manufacturera) o pronto lo harán (por ejemplo, en la conducción). Además, una IA lo suficientemente potente será capaz de acelerar el desarrollo de robots y, posteriormente, controlar esos robots en el mundo físico. Puede que esto nos dé algo de tiempo (lo cual es positivo), pero me preocupa que no sea mucho. E incluso si la perturbación se limitara únicamente a las tareas cognitivas, seguiría siendo una perturbación de una magnitud y rapidez sin precedentes.
En tercer lugar, quizá algunas tareas requieran inherentemente un toque humano o se beneficien enormemente de él. Tengo algo más de dudas sobre esto, pero sigo siendo escéptico respecto a que sea suficiente para contrarrestar la mayor parte de los impactos que describí anteriormente. La IA ya se utiliza ampliamente en la atención al cliente. Muchas personas afirman que les resulta más fácil hablar con la IA sobre sus problemas personales que con un terapeuta: que la IA es más paciente. Cuando mi hermana tuvo problemas médicos durante un embarazo, sintió que no obtenía las respuestas ni el apoyo que necesitaba de sus profesionales de la salud, y descubrió que Claude tenía un mejor trato (además de ser más eficaz diagnosticando el problema). Estoy seguro de que hay algunas tareas para las que el toque humano es realmente importante, pero no sé cuántas; y aquí estamos hablando de encontrar trabajo para casi todo el mundo en el mercado laboral.
En cuarto lugar, algunos podrían argumentar que la ventaja comparativa seguirá protegiendo a los humanos. Según la ley de la ventaja comparativa, incluso si la IA fuera mejor que los humanos en todo, cualquier diferencia relativa entre el perfil de habilidades de los humanos y el de la IA crea una base para el comercio y la especialización entre ambos. El problema es que, si las IA son literalmente miles de veces más productivas que los humanos, esta lógica empieza a desmoronarse. Incluso unos costos de transacción minúsculos podrían hacer que a la IA no le valga la pena comerciar con los humanos. Y los salarios de los humanos podrían ser muy bajos, aunque técnicamente tengan algo que ofrecer.
Es posible que todos estos factores puedan abordarse; que el mercado laboral sea lo suficientemente resiliente como para adaptarse incluso a una perturbación tan enorme. Pero, aunque con el tiempo logre adaptarse, los factores antes mencionados sugieren que el impacto a corto plazo tendrá una magnitud sin precedentes.
Defensas
¿Qué podemos hacer ante este problema? Tengo varias sugerencias, algunas de las cuales ya está llevando a cabo Anthropic. Lo primero es, sencillamente, obtener datos precisos en tiempo real sobre lo que está ocurriendo con el desplazamiento laboral. Cuando se produce un cambio económico muy rápido, resulta difícil obtener datos fiables sobre lo que está sucediendo, y sin datos fiables es difícil diseñar políticas eficaces. Por ejemplo, en la actualidad los datos gubernamentales carecen de información detallada y de alta frecuencia sobre la adopción de la IA en las empresas y las industrias. Durante el último año, Anthropic ha estado gestionando y publicando un Índice Económico que muestra el uso de nuestros modelos casi en tiempo real, desglosado por industria, tarea, ubicación e incluso por aspectos como si una tarea se estaba automatizando o si se realizaba de forma colaborativa. También contamos con un Consejo Asesor Económico que nos ayuda a interpretar estos datos y a prever lo que está por venir.
En segundo lugar, las empresas de IA pueden elegir cómo colaboran con las empresas clientes. La propia ineficiencia de las organizaciones tradicionales implica que su implementación de la IA puede depender en gran medida de su trayectoria previa, por lo que existe cierto margen para optar por un camino mejor. Las empresas suelen tener que elegir entre el «ahorro de costos» (hacer lo mismo con menos personal) y la «innovación» (hacer más con el mismo número de personas). Inevitablemente, el mercado acabará produciendo ambas opciones, y cualquier empresa de IA competitiva tendrá que satisfacer ambas en cierta medida, pero puede que haya margen para orientar a las empresas hacia la innovación siempre que sea posible, lo cual podría darnos algo de tiempo. Anthropic está reflexionando activamente sobre esto.
En tercer lugar, las empresas deberían plantearse cómo cuidar a sus empleados. A corto plazo, buscar formas creativas de reasignar a los trabajadores dentro de las propias empresas puede ser una vía prometedora para evitar la necesidad de recurrir a despidos. A largo plazo, en un mundo con una enorme riqueza total, donde muchas empresas aumenten considerablemente su valor debido al incremento de la productividad y a la concentración del capital, puede que sea viable seguir pagando a los empleados humanos incluso mucho después de que dejen de aportar valor económico en el sentido tradicional. Actualmente, en Anthropic estamos analizando una serie de posibles alternativas para nuestros propios empleados, que compartiremos en un futuro cercano.
En cuarto lugar, las personas adineradas tienen la obligación de ayudar a resolver este problema. Me entristece que muchas de ellas (especialmente en el sector tecnológico) hayan adoptado recientemente una actitud cínica y nihilista según la cual la filantropía es inevitablemente fraudulenta o inútil. Tanto la filantropía privada —a través de organizaciones como la Fundación Gates— como los programas públicos —como el PEPFAR— han salvado decenas de millones de vidas en el mundo en desarrollo, y han contribuido a crear oportunidades económicas en el mundo desarrollado. Todos los cofundadores de Anthropic nos hemos comprometido a donar el 80 % de nuestro patrimonio, y el personal de Anthropic se ha comprometido individualmente a donar acciones de la empresa por valor de miles de millones a los precios actuales, donaciones que la compañía se ha comprometido a igualar.
En quinto lugar, aunque todas las acciones privadas anteriores pueden ser útiles, en última instancia un problema macroeconómico de esta magnitud requerirá la intervención del gobierno. La respuesta política natural ante un enorme pastel económico combinado con una gran desigualdad (debido a la falta de empleo, o a empleos mal remunerados, para muchos) es la tributación progresiva. El impuesto podría ser general o estar dirigido específicamente a las empresas de IA. Obviamente, el diseño fiscal es complicado y hay muchas formas de que salga mal. No apoyo las políticas fiscales mal diseñadas. Creo que los niveles extremos de desigualdad previstos en este ensayo justifican una política fiscal más sólida por razones morales básicas, pero también puedo plantear un argumento pragmático a los multimillonarios del mundo: les conviene apoyar una buena versión; si no lo hacen, inevitablemente se encontrarán con una mala, diseñada por una turba.
En última instancia, considero que todas las intervenciones mencionadas son formas de ganar tiempo. Al final, la IA será capaz de hacerlo todo y tenemos que afrontar esa realidad. Tengo la esperanza de que, para entonces, podamos utilizar la propia IA para que nos ayude a reestructurar los mercados de maneras que funcionen para todos, y que las intervenciones anteriores nos permitan superar el período de transición.
Concentración económica del poder
Aparte del problema del desplazamiento laboral o de la desigualdad económica per se, existe el problema de la concentración económica del poder. En la sección 1 se abordó el riesgo de que la humanidad se vea privada de poder por la IA, y en la sección 3 se analizó el riesgo de que los ciudadanos se vean privados de poder por sus gobiernos mediante la fuerza o la coacción. Pero puede producirse otro tipo de privación de poder si existe una concentración de riqueza tan enorme que un pequeño grupo de personas controle en la práctica las políticas gubernamentales con su influencia, y los ciudadanos comunes no tengan influencia alguna porque carecen de efecto multiplicador económico. La democracia se sustenta, en última instancia, en la idea de que la población en su conjunto es necesaria para el funcionamiento de la economía. Si ese efecto multiplicador económico desaparece, el contrato social implícito de la democracia podría dejar de funcionar. Otros han escrito sobre esto, así que no es necesario que entre en grandes detalles al respecto aquí, pero comparto la preocupación y me temo que ya está empezando a ocurrir.
Para que quede claro, no me opongo a que la gente gane mucho dinero. Existe un sólido argumento que sostiene que, en condiciones normales, esto incentiva el crecimiento económico. Comprendo las preocupaciones sobre el riesgo de frenar la innovación al matar a la gallina de los huevos de oro que la genera. Pero en un escenario en el que el crecimiento del PIB es del 10-20 % anual y la IA se está apoderando rápidamente de la economía, y aun así individuos particulares acaparan fracciones considerables del PIB, la innovación no es lo que debe preocuparnos. Lo que debe preocuparnos es un nivel de concentración de la riqueza que acabará quebrando la sociedad.
El ejemplo más famoso de concentración extrema de la riqueza en la historia de EE. UU. es la Edad Dorada, y el industrial más rico de la Edad Dorada fue John D. Rockefeller. La riqueza de Rockefeller equivalía aproximadamente al 2 % del PIB estadounidense de la época.41 Una proporción similar hoy en día supondría una fortuna de 600 000 millones de dólares, y la persona más rica del mundo en la actualidad (Elon Musk) ya supera esa cifra, con aproximadamente 700 000 millones de dólares. Así pues, ya nos encontramos en niveles de concentración de la riqueza sin precedentes históricos, incluso antes de que se produzca la mayor parte del impacto económico de la IA. No creo que sea descabellado (si logramos un «país de genios») imaginar que las empresas de IA, las de semiconductores y, tal vez, las de aplicaciones derivadas generen unos 3 billones de dólares de ingresos al año,42 estén valoradas en unos 30 billones de dólares y den lugar a fortunas personales de varios billones. En ese mundo, los debates que mantenemos hoy sobre política fiscal sencillamente no serán aplicables, ya que nos encontraremos en una situación fundamentalmente distinta.
En relación con esto, la vinculación de esta concentración económica de la riqueza con el sistema político ya me preocupa. Los centros de datos de IA ya representan una fracción sustancial del crecimiento económico de EE. UU.,43 y, por lo tanto, están entrelazando estrechamente los intereses financieros de las grandes empresas tecnológicas (que se centran cada vez más en la IA o en la infraestructura de IA) con los intereses políticos del Gobierno de una forma que puede generar incentivos perversos. Ya lo vemos en la reticencia de las empresas tecnológicas a criticar al Gobierno estadounidense y en el apoyo de este a políticas antirregulatorias extremas en materia de IA.
Defensas
¿Qué se puede hacer al respecto? En primer lugar, y esto es lo más obvio, las empresas simplemente deberían optar por no participar en ello. Anthropic siempre se ha esforzado por ser un actor en materia de políticas y no uno político, y por mantener la autenticidad de nuestras opiniones sin importar el gobierno de turno. Nos hemos pronunciado a favor de una regulación sensata de la IA y de controles a la exportación que respondan al interés público, incluso cuando estos entran en conflicto con las políticas gubernamentales.44 Muchas personas me han dicho que deberíamos dejar de hacerlo, que podría acarrearnos un trato desfavorable, pero en el año que llevamos en esta labor, la valoración de Anthropic se ha multiplicado por más de seis, un salto casi sin precedentes a nuestra escala comercial.
En segundo lugar, el sector de la IA necesita una relación más sana con el gobierno, una que se base en una participación sustantiva en las políticas más que en la alineación política. Nuestra decisión de centrarnos en el fondo de las políticas en lugar de en la política partidista a veces se interpreta como un error táctico o una incapacidad para «entender el contexto», en lugar de una decisión basada en principios, y esa lectura me preocupa. En una democracia sana, las empresas deberían poder abogar por buenas políticas por sí mismas. En relación con esto, se está gestando una reacción pública contra la IA: podría ser un factor correctivo, pero actualmente carece de rumbo. Gran parte de esta reacción se centra en cuestiones que en realidad no son problemas (como el consumo de agua de los centros de datos) y propone soluciones (como la prohibición de los centros de datos o impuestos sobre la riqueza mal diseñados) que no abordarían las verdaderas preocupaciones. La cuestión subyacente que merece atención es garantizar que el desarrollo de la IA siga rindiendo cuentas al interés público, sin ser capturado por ninguna alianza política o comercial en particular, y parece importante enfocar el debate público en ello.
En tercer lugar, las intervenciones macroeconómicas que describí anteriormente en esta sección, así como un resurgimiento de la filantropía privada, pueden ayudar a equilibrar la balanza económica, y abordar así, al mismo tiempo, los problemas tanto de desplazamiento laboral como de concentración del poder económico. Deberíamos fijarnos aquí en la historia de nuestro país: incluso en la «Edad Dorada», industriales como Rockefeller y Carnegie sentían una fuerte obligación hacia la sociedad en general, la sensación de que la sociedad había contribuido enormemente a su éxito y de que debían retribuirle. Ese espíritu parece estar cada vez más ausente hoy en día, y creo que es una parte importante de la salida a este dilema económico. Quienes están a la vanguardia del auge económico de la IA deberían estar dispuestos a ceder tanto su riqueza como su poder.
5. Los negros mares del infinito
Efectos indirectos
Esta última sección es un cajón de sastre para el desconocimiento desconocido, en particular para aquellas cosas que podrían salir mal como consecuencia indirecta de los avances positivos en IA y de la consiguiente aceleración de la ciencia y la tecnología en general. Supongamos que abordamos todos los riesgos descritos hasta ahora y empezamos a cosechar los beneficios de la IA. Probablemente experimentaremos un «siglo de progreso científico y económico comprimido en una década», lo cual será enormemente positivo para el mundo; sin embargo, luego tendremos que lidiar con los problemas que deriven de este rápido ritmo de progreso, y dichos problemas podrían alcanzarnos velozmente. También podríamos encontrarnos con otros riesgos que se produzcan indirectamente como consecuencia del progreso de la IA y que sean difíciles de anticipar.
Por la naturaleza del desconocimiento desconocido, es imposible elaborar una lista exhaustiva, pero enumeraré tres posibles motivos de preocupación a modo de ejemplos ilustrativos de a qué deberíamos estar atentos:
- Rápidos avances en biología. Si realmente logramos un siglo de progreso médico en unos pocos años, es posible que aumentemos considerablemente la esperanza de vida humana, y existe la posibilidad de que también adquiramos capacidades radicales, como la de aumentar la inteligencia humana o modificar radicalmente la biología humana. Serían grandes cambios en el ámbito de lo posible, que ocurrirían muy rápidamente. Podrían ser positivos si se llevan a cabo de forma responsable (que es lo que espero, tal y como se describe en Máquinas de gracia amorosa), pero siempre existe el riesgo de que las cosas salgan muy mal; por ejemplo, si los esfuerzos por hacer a los humanos más inteligentes también los vuelven más inestables o ávidos de poder. También está la cuestión de las «uploads» o la «emulación de cerebro completo», mentes humanas digitales instanciadas en software, que algún día podrían ayudar a la humanidad a trascender sus limitaciones físicas, pero que también conllevan riesgos que me resultan inquietantes.
- La IA cambia la vida humana de forma poco saludable. Un mundo con miles de millones de inteligencias mucho más listas que los humanos en todo va a ser un lugar muy extraño para vivir. Incluso si la IA no tiene el objetivo activo de atacar a los humanos (sección 1) y los Estados no la utilizan explícitamente para la opresión o el control (sección 3), hay muchas cosas que podrían salir mal sin llegar a ese extremo, a través de los incentivos empresariales habituales y transacciones nominalmente consensuadas. Vemos los primeros indicios de esto en las preocupaciones sobre la psicosis por la IA, la IA que empuja a las personas al suicidio y las inquietudes sobre las relaciones románticas con la IA. A modo de ejemplo, ¿podrían las IA potentes inventar una nueva religión y convertir a ella a millones de personas? ¿Podría la mayoría de la gente acabar «adicta» de algún modo a las interacciones con la IA? ¿Podría la gente terminar convertida en «marioneta» de los sistemas de IA, en el que una IA vigile esencialmente cada uno de sus movimientos y le diga exactamente qué hacer y decir en todo momento, llevándola a una vida «buena», pero carente de libertad o del orgullo por los logros propios? No sería difícil generar docenas de escenarios así si me sentara a hacer una lluvia de ideas con el creador de Black Mirror. Creo que esto señala la importancia de aspectos como mejorar la Constitución de Claude, mucho más allá de lo necesario para prevenir los problemas de la sección 1. Asegurarse de que los modelos de IA realmente prioricen los intereses a largo plazo de sus usuarios, de una manera que las personas sensatas aprobarían en lugar de hacerlo de un modo sutilmente distorsionado, parece fundamental.
- El propósito humano. Esto se relaciona con el punto anterior, pero no trata tanto sobre las interacciones humanas específicas con los sistemas de IA, sino sobre cómo cambia la vida humana en general en un mundo con una IA potente. ¿Serán capaces los humanos de encontrar un propósito y un sentido en un mundo así? Creo que es una cuestión de actitud: como dije en Máquinas de gracia amorosa, opino que el propósito humano no depende de ser el mejor del mundo en algo, y que las personas pueden encontrar un propósito incluso durante períodos muy prolongados a través de historias y proyectos que aman. Simplemente debemos romper el vínculo entre la generación de valor económico, por un lado, y la autoestima y el sentido, por otro. Pero esa es una transición que la sociedad debe realizar, y siempre existe el riesgo de que no la manejemos bien.
Mi esperanza ante todos estos posibles problemas es que, en un mundo con una IA potente en la que podamos confiar —una IA que no nos matará, que no será la herramienta de un gobierno opresor y que trabajará de forma genuina a nuestro favor—, podamos usar la propia IA para anticipar y prevenir dichos problemas. Sin embargo, eso no está garantizado: como ocurre con todos los demás riesgos, es algo que debemos manejar con cuidado.
La prueba de la humanidad
Leer este ensayo puede dar la impresión de que nos encontramos en una situación abrumadora. A mí, desde luego, me resultó abrumador escribirlo, en contraste con Máquinas de gracia amorosa, que sentí como dar forma y estructura a una música de una belleza incomparable que llevaba años resonando en mi cabeza. Y hay mucho en esta situación que verdaderamente es difícil. La IA plantea amenazas para la humanidad desde múltiples frentes, y existe una tensión real entre los distintos peligros, ya que mitigar algunos de ellos conlleva el riesgo de agravar otros si no actuamos con extremo cuidado.
Dedicar tiempo a construir con cuidado sistemas de IA para que no amenacen de forma autónoma a la humanidad entra en verdadera tensión con la necesidad de que las naciones democráticas se mantengan por delante de las naciones autoritarias y no sean sometidas por ellas. Pero, a su vez, las mismas herramientas con IA que son necesarias para luchar contra las autocracias pueden, si se llevan demasiado lejos, volverse hacia el interior para crear una tiranía en nuestros propios países. El terrorismo impulsado por la IA podría matar a millones de personas mediante el uso impropio de la biología, pero una reacción exagerada ante este riesgo podría llevarnos por el camino hacia un Estado autocrático de vigilancia. Los efectos de la IA sobre el empleo y la concentración económica, además de constituir graves problemas por sí mismos, pueden obligarnos a afrontar los demás problemas en un ambiente de indignación pública y tal vez incluso de disturbios civiles, en lugar de poder recurrir a lo mejor de nuestra naturaleza. Por encima de todo, el mero número de riesgos, incluidos los desconocidos, y la necesidad de hacerles frente a todos a la vez, crean un desafío intimidante que la humanidad debe superar.
Además, los últimos años deberían dejar claro que la idea de detener o incluso ralentizar sustancialmente la tecnología es fundamentalmente insostenible. La fórmula para construir potentes sistemas de IA es increíblemente sencilla, hasta tal punto que casi se podría decir que surge espontáneamente de la combinación adecuada de datos y poder de cómputo bruto. Su creación fue probablemente inevitable en el instante en que la humanidad inventó el transistor, o posiblemente incluso antes, cuando aprendimos a controlar el fuego por primera vez. Si una empresa no la crea, otras lo harán casi con la misma rapidez. Si todas las empresas de los países democráticos detuvieran o ralentizaran el desarrollo, ya sea por acuerdo mutuo o por decreto regulatorio, los países autoritarios simplemente seguirían adelante. Dado el increíble valor económico y militar de la tecnología, junto con la falta de un mecanismo de cumplimiento significativo, no veo cómo podríamos convencerlos de que se detengan.
Sí veo un camino hacia una ligera moderación en el desarrollo de la IA que es compatible con una visión realista de la geopolítica. Esa vía consiste en frenar durante unos años el avance de las autocracias hacia una IA potente negándoles los recursos que necesitan para desarrollarla,45 es decir, chips y equipos de fabricación de semiconductores. Esto, a su vez, proporciona a los países democráticos un margen que pueden «dedicar» a desarrollar una IA potente con mayor cuidado, prestando más atención a sus riesgos, sin dejar de avanzar lo suficientemente rápido como para superar holgadamente a las autocracias. La carrera entre las empresas de IA dentro de las democracias podría gestionarse entonces bajo el paraguas de un marco jurídico común, mediante una combinación de normas sectoriales y regulación.
Anthropic ha defendido con gran firmeza esta vía, impulsando controles a la exportación de chips y una regulación prudente de la IA, pero incluso estas propuestas, que parecen de sentido común, han sido rechazadas en gran medida por los responsables de políticas de Estados Unidos (que es el país donde tiene más importancia contar con ellas). Hay tanto dinero que ganar con la IA —literalmente billones de dólares al año— que incluso las medidas más sencillas tienen dificultades para superar la economía política inherente a la IA. Esta es la trampa: la IA es tan poderosa, un premio tan deslumbrante, que a la civilización humana le resulta muy difícil imponerle cualquier tipo de restricción.
Puedo imaginar, como hizo Sagan en Contact, que esta misma historia se repite en miles de mundos. Una especie adquiere sintiencia, aprende a utilizar herramientas, inicia el ascenso exponencial de la tecnología, se enfrenta a las crisis de la industrialización y las armas nucleares, y, si sobrevive a todo ello, afronta el reto más difícil y definitivo cuando aprende a dar forma a la arena para crear máquinas que piensan. Que superemos esa prueba y lleguemos a construir la hermosa sociedad descrita en Máquinas de gracia amorosa, o que sucumbamos a la esclavitud y la destrucción, dependerá de nuestro carácter y nuestra determinación como especie, de nuestro espíritu y nuestra alma.
A pesar de los numerosos obstáculos, creo que la humanidad tiene la fuerza interior necesaria para superar esta prueba. Me animan e inspiran los miles de investigadores que han dedicado sus carreras profesionales a ayudarnos a comprender y dirigir los modelos de IA, así como a dar forma al carácter y la constitución de dichos modelos. Creo que ahora hay muchas posibilidades de que esos esfuerzos den fruto a tiempo para marcar la diferencia. Me anima que al menos algunas empresas hayan declarado que asumirán costos comerciales significativos para impedir que sus modelos contribuyan a la amenaza del bioterrorismo. Me anima que unas pocas personas valientes se hayan resistido a las corrientes políticas predominantes y hayan aprobado legislación que siembra las primeras semillas de unas salvaguardias sensatas para los sistemas de IA. Me anima que el público comprenda que la IA conlleva riesgos y quiera que estos se aborden. Me anima el indomable espíritu de libertad que impera en todo el mundo y la determinación de resistir a la tiranía dondequiera que se presente.
Pero tendremos que redoblar nuestros esfuerzos si queremos tener éxito. El primer paso es que quienes están más cerca de la tecnología simplemente digan la verdad sobre la situación en la que se encuentra la humanidad, algo que siempre he intentado hacer; lo estoy haciendo de forma más explícita y con mayor urgencia con este ensayo. El siguiente paso será convencer a los pensadores, los responsables de políticas, las empresas y los ciudadanos de todo el mundo de la inminencia y la importancia primordial de esta cuestión —de que vale la pena dedicar reflexión y capital político a este asunto, en comparación con los miles de otros temas que dominan las noticias cada día—. Entonces llegará el momento de mostrar valor, de que haya suficientes personas dispuestas a ir a contracorriente de las tendencias predominantes y a mantenerse fieles a sus principios, incluso ante las amenazas a sus intereses económicos y a su seguridad personal.
Los años que tenemos por delante serán increíblemente duros y nos exigirán más de lo que creemos poder dar. Pero en mi trayectoria como investigador, líder y ciudadano, he visto suficiente valor y nobleza como para creer que podemos ganar; que, al verse en las circunstancias más sombrías, la humanidad tiene la capacidad de reunir, aparentemente en el último momento, la fuerza y la sabiduría necesarias para prevalecer. No tenemos tiempo que perder.
Me gustaría agradecer a Erik Brynjolfsson, Ben Buchanan, Mariano-Florentino Cuéllar, Allan Dafoe, Kevin Esvelt, Nick Beckstead, Richard Fontaine, Jim McClave y a muchísimos miembros del personal de Anthropic por sus útiles comentarios sobre los borradores de este ensayo.
Véase, por ejemplo, la sección 5.5.2 (págs. 63-66) de la ficha del sistema de Claude 4.