El momento más importante de la historia es ahora

por Tomas Pueyo
Despegue de la IAHipótesis del escalamientoInteligencia artificialIA transformadoraPronosticación de la IASuperinteligencia

La IAG llegará antes gracias a o3, DeepSeek y otros avances de vanguardia en IA

La IA está avanzando tan rápido que sus investigadores han entrado en modo pánico. Ahora es habitualmente más inteligente que los humanos, y su velocidad de desarrollo se está acelerando. Los nuevos avances de las últimas semanas la han acelerado aún más. Ahora parece que las IA podrían ser más inteligentes que los humanos en 1 a 5 años, y tan inteligentes como dioses poco después. Estamos al borde del precipicio y a punto de saltar al abismo de la superinteligencia de la IA,⁠⁠1 queramos o no.
¿Cuándo vamos a saltar?
¿Qué hay en el fondo?
¿Tenemos un paracaídas?

Ilustración digital de una figura humana solitaria de pie en el borde de un imponente acantilado cuya cara vertical está compuesta por cascadas de código binario azul brillante, con nubes arremolinadas en el abismo debajo.

Predicciones del mercado

Hace seis meses, escribí What would you do if you had 8 years left to live?, donde explicaba que el mercado preveía la llegada de la inteligencia artificial general (IAG, una IA capaz de hacer lo que la mayoría de los humanos pueden hacer) ocho años más tarde, en 2032. Desde entonces, esa fecha se ha adelantado. Ahora se prevé que llegue en tan solo seis años, por lo que seis meses han bastado para adelantar la fecha un año. Las probabilidades ahora son las siguientes:

Distribución de probabilidad del pronóstico de la comunidad de Metaculus sobre la fecha en la que se diseñará, probará y anunciará públicamente el primer sistema de inteligencia artificial general; un pico verde pronunciado se sitúa sobre junio de 2027, y la distribución decae con una larga cola recta que se extiende más allá de 2200.
La previsión más habitual es que la IAG se alcance en 2,5 años. La previsión media es de 6 años (es decir, para diciembre de 2030).

Pero una IA que iguale la inteligencia humana no es el hito más preocupante. El más preocupante es la SIA, la superinteligencia artificial: una inteligencia tan por encima de las capacidades humanas que ni siquiera podremos comprenderla.

Según los pronosticadores, eso ocurrirá dentro de cinco años:

  • Dos años hasta una IAG débil, es decir, para finales de 2026

  • Tres años más tarde, superinteligencia, es decir, para finales de 2029

Como se puede ver, estos pronósticos no son perfectamente coherentes, pero están alineados: una IA capaz de realizar cualquier tarea mejor que cualquier ser humano está a media década de distancia.

¿Quién está en mejor posición para saberlo con certeza? Supongo que los directores de los mayores laboratorios de IA del mundo. Veamos qué opinan.

La voz de los expertos

Retrato de Dario Amodei sobre un fondo azul claro, con cabello oscuro rizado y gafas de montura oscura, vistiendo una camisa azul marino; de él sale un globo de diálogo blanco estilo cómic con una cita.
Fuente.

Aquí tenemos otra cita suya:

Creo que una IA potente⁠⁠2 podría llegar tan pronto como en 2026.—Máquinas de gracia amorosa, Dario Amodei, director general de Anthropic

Y otra más:

Hace dos años, estábamos a nivel de secundaria. El año pasado, a nivel de grado. Este año, estamos a nivel de doctorado. Si calculas a ojo el ritmo al que aumentan estas capacidades, te hace pensar que llegaremos ahí en 2026 o 2027.—Dario Amodei con Lex Friedman

Pasando a OpenAI, la empresa creadora de ChatGPT, esto es lo que opina su director general, Sam Altman:

Ahora confiamos en que sabemos cómo construir una IAG tal y como la hemos entendido tradicionalmente. Estamos empezando a apuntar más allá, hacia la superinteligencia en el verdadero sentido de la palabra. Con la superinteligencia, podemos hacer cualquier otra cosa.—Reflections, Sam Altman

Esto es lo que dice el jefe de producto:

Que la IA pase de ser el millonésimo mejor programador, al milésimo mejor programador, y luego al 175.º mejor programador en 3 o 4 meses… Estamos en una trayectoria muy pronunciada; ni siquiera sé si será en 2027, creo que podría ser antes.

¿Por qué afirma que la IA es ahora el 175.º mejor programador del mundo?

Dos gráficos de barras en paralelo de OpenAI que comparan el rendimiento entre tres modelos (o1 preview, o1, o3). A la izquierda, la precisión en SWE-bench Verified sube de 41,3 a 48,9 y a 71,7. A la derecha, la puntuación Elo de Codeforces sube de 1258 a 1891 y a 2727, con una banda azul más clara de error/extensión en la barra de o3.
Una puntuación de 2727 en Codeforces equivale al puesto 175 entre los mejores programadores del mundo. Para dar una idea de esto, desde la versión preliminar de o1 hasta o1, la puntuación subió 633 puntos, y de o1 a o3, 836. Sería razonable esperar un aumento de 700 puntos de o3 al siguiente modelo, lo que lo situaría en el puesto n.º 9 del mundo…

Nótese que los programadores son quienes desarrollan la IA. Por lo tanto, si la IA es ahora el 175.º mejor programador, entonces la IA puede programar IA mejor que la mayoría de los propios humanos.

Esta es la opinión de un investigador de OpenAI:

Captura de pantalla de un tuit de Stephen McAleer (@McaleerStephen) con una marca de verificación en X, que muestra el cuerpo del mensaje, la marca de tiempo, el número de visualizaciones y los contadores de interacción.
Fuente.⁠⁠3

Y otro más:

Creemos que o1 [el modelo que OpenAI lanzó hace unos meses] representa un nuevo paradigma de escalamiento y que apenas estamos empezando a ampliar la escala en esa dimensión.—Noam Brown

Y otro más:

Todo lo que estamos haciendo ahora mismo es extremadamente extensible. Todo es emergente. Nada está programado de forma rígida. No se ha hecho nada para decirle al modelo: «Oye, quizá deberías verificar tu solución, deberías dar marcha atrás…». No se ha utilizado ninguna táctica. Todo es emergente. Todo se aprende mediante el aprendizaje por refuerzo. ¡Es una locura! ¡Una verdadera locura!

Aquí hay otro:

Desde que me uní en enero de 2024, he pasado de pensar que «esto es una exageración improductiva» a creer que «la IAG ya casi está aquí». En mi humilde opinión, lo que viene después no es mucha ciencia nueva, sino años de ardua ingeniería para probar todas las ideas que el nuevo paradigma ha hecho evidentes. Tal vez haya otro muro después de este, pero por ahora hay mejoras de 10x hasta donde alcanza la vista.

Esto es lo que dijo la Casa Blanca de Biden al respecto:

Captura de pantalla del encabezado de un artículo de Axios con la ilustración de una bandera estadounidense superpuesta con un cuadro de diálogo de advertencia al estilo retro de Windows, que contiene un triángulo de precaución y un botón de OK, seguido de los párrafos iniciales del artículo sobre el mensaje de despedida de Jake Sullivan.
Fuente.

Quizá por eso Sam Altman ha programado una reunión informativa a puerta cerrada para funcionarios del Gobierno de EE. UU. para el 30 de enero. Según Axios:

Fuentes del sector de la IA creen que se avecina un gran avance en los superagentes con nivel de doctorado… Las personas que trabajan en OpenAI les han estado contando a sus amigos que los avances recientes los tienen tanto entusiasmados como asustados.

Si crees que esto no es más que puro bombo por parte de los líderes de la IA que buscan nuevos inversionistas, ten en cuenta las palabras de Demis Hassabis, reciente ganador del Premio Nobel gracias a su trabajo en IA y director general de DeepMind (parte de Google, por lo que no necesita recaudar fondos):

Hay mucho bombo en este ámbito. [La IAG] probablemente tardará entre tres y cinco años en llegar.

Pero ¿hay pruebas tangibles de que estos modelos de IA estén mejorando tanto?

Benchmarks

La IA tiene un historial de tardar en superar a los humanos en diferentes tareas.

Gráfico de líneas de la revista TIME que muestra el rendimiento puntero de la IA en ocho *benchmarks* entre 1998 y 2023, representado en relación con una línea horizontal en negrita en el 100 % etiquetada como 100 % = rendimiento humano. Las curvas sucesivas (reconocimiento de escritura a mano, reconocimiento del habla, reconocimiento de imágenes, comprensión lectora, comprensión del lenguaje, completado de sentido común, matemáticas de primaria, generación de código) alcanzan y superan el valor de referencia humano cada vez más tarde, pero con pendientes cada vez más pronunciadas.

Pero las tareas en las que a la IA le tomaba décadas superar el rendimiento humano ahora le toman meses. Así de rápido avanzan las cosas.

El modelo de vanguardia de OpenAI, o3, aún no se ha lanzado, así que veamos qué opina al respecto la gente que utiliza o1, que es mucho más tonto.⁠⁠4

Según una prueba de MENSA, tiene un coeficiente intelectual de 120.

Captura de pantalla de un sitio web que hace un seguimiento del CI de las IA, con una curva de campana del CI humano y los logotipos de varios modelos de IA trazados a lo largo del eje x según sus puntuaciones medidas; la mayoría de los modelos se agrupan en el rango de 80 a 95, mientras que el modelo o1 de OpenAI se sitúa muy a la derecha, cerca de 120.

Para que te hagas una idea de lo inteligente que es, esto situaría a o1 entre la inteligencia superior y la inteligencia muy superior, y lo coloca en el percentil 87-91 de inteligencia. En otras palabras, esta cosa es más inteligente que nueve de cada diez humanos.

Piénsalo.

Para entenderlo mejor, intenta responder la siguiente pregunta por tu cuenta:

Captura de pantalla de una burbuja de chat que contiene un acertijo lógico escrito en una IA.
Vía.

¿Cuál es tu respuesta?
¡Piénsalo!
Bien, aquí la tienes:

Captura de pantalla del mismo acertijo lógico de ChatGPT, ahora con la breve respuesta del asistente debajo, junto al logotipo de OpenAI, que muestra que pensó brevemente antes de responder.

Lo corroboré de forma independiente.⁠⁠5

Sin duda me llevó más de 5 segundos descifrarlo, y supongo que muchas personas ni siquiera logran resolverlo.

En julio de 2024, AlphaProof y AlphaGeometry, de Google DeepMind, estuvieron a punto de conseguir el oro en la Olimpiada Internacional de Matemáticas (IMO):

Gráfico de Google DeepMind que muestra a cada participante humano de la Olimpiada Internacional de Matemáticas 2024 ordenado por puntuación total, con barras coloreadas por franja de medalla (azul para Otros, naranja para Bronce, gris para Plata, amarillo para Oro) que ascienden desde aproximadamente 1 hasta 42 puntos; una línea vertical azul indica el sistema de DeepMind en 28 puntos, cerca de la parte superior del rango de plata.
Fuente.

o1 es generalista. No se especializa en matemáticas. Y aun así obtuvo un 83 % en un examen de clasificación para la misma IMO. El ChatGPT anterior obtuvo un 13 %…

Gráfico de tres barras de OpenAI que muestra la precisión en las matemáticas de competición AIME 2024 para gpt4o, o1 preview y o1, donde cada barra tiene una franja sombreada más clara en la parte superior que representa una puntuación superior.
Fuente.

¿Por qué es esto importante?

Alcanzar el oro en la IMO es un umbral para los investigadores de IA, que lo interpretan como «ser capaz de razonar».

Paul Christiano —inventor del aprendizaje por refuerzo a partir de realimentación humana, genio certificado y quizás el investigador de alineación más respetado del mundo— afirmó que elevaría del 30 % al 50 % la probabilidad de un despegue abrupto si viéramos un oro en la IMO para 2025.—@AISafetyMemes

Recordemos que un despegue abrupto se produce cuando la IA se vuelve lo bastante inteligente como para mejorarse a sí misma, y lo hace, y se vuelve entonces más inteligente, se mejora aún más, se vuelve más inteligente y, ¡ZAS!, se vuelve superinteligente en cuestión de meses, semanas o días gracias a su bucle recursivo de automejora.

Si quieres hacerte una idea de ello, escucha al director general de NVIDIA, la empresa que actualmente concentra más del 100 %⁠⁠6 de las ganancias del sector de la IA:

Captura de pantalla de un tuit de @tsarnick que parafrasea a Jensen Huang, sobre el fotograma de un vídeo incrustado donde aparece Huang, con una chaqueta de cuero negra, sentado en una silla durante una entrevista con subtítulos superpuestos en amarillo.
Fuente.⁠⁠7

¡En 2021, Paul creía que solo había un 8 % de probabilidades de que esto ocurriera! Era el defensor más célebre del «despegue lento». Los despegues rápidos asustan porque son mucho menos predecibles. Las instituciones humanas casi no tienen tiempo de adaptarse a ritmos de cambio desmesurados.—Fuente

Fíjate en cómo se desempeña frente a preguntas de ciencias de nivel de doctorado:

Pequeño gráfico de cuatro barras de OpenAI que compara la precisión en el *benchmark* científico de nivel doctoral GPQA Diamond entre gpt4o, o1 preview, o1 y un desempeño de referencia de expertos humanos.

¡Responde mejor que las personas con doctorado!

Esta es la amplia batería de pruebas:

Cuatro gráficos agrupados de barras horizontales de OpenAI que comparan las puntuaciones de referencia de gpt4o (turquesa) con la mejora de o1 (coral) en una batería de *benchmarks*, exámenes, materias científicas de nivel doctoral y categorías de MMLU.

Además, recientemente algunas IA han recibido una ventana de contexto de 100 millones de tokens (lo que significa que pueden procesar unas 750 novelas para darte una respuesta).

Captura de pantalla de un comentario de Reddit publicado por el usuario FateOfMuffins, con los íconos de votar, responder, premiar y compartir debajo.
Esto es de diciembre de 2024. Fuente.⁠⁠8

Todo lo que acabo de contarte se refiere a o1, ¡el modelo anterior! ¿Qué sabemos del modelo actual, o3, el que OpenAI está probando y que tiene tan entusiasmados a sus investigadores?

El GPQA es una difícil prueba de ciencias diseñada para personas con doctorado e imposible de resolver buscando en Google. Los doctores obtienen una puntuación media del 34 %. En su área de especialización, alcanzan aproximadamente el 81 %. El nuevo modelo de OpenAI, o3, obtiene un 88 % de aciertos.

Gráfico de tres barras de OpenAI que muestra la precisión en ciencias a nivel de doctorado en el *benchmark* GPQA Diamond para o1 preview, o1 y o3, donde o3 asciende hasta casi el 88 %.
La fuente de estos gráficos es, en última instancia, OpenAI.

En otras palabras, o3 puede resolver problemas mejor que los expertos con doctorado en su campo.⁠⁠9

Otro benchmark es FrontierMath, un conjunto de problemas matemáticos rigurosos e inéditos diseñados por matemáticos para que resulten increíblemente difíciles de resolver.

Son problemas realmente difíciles… la mayoría de ellos parecen estar muy por encima de mi nivel.—Evan Chen, entrenador de la Olimpiada Internacional de Matemáticas

Las IA nunca obtuvieron una puntuación superior al 2 %, pero o3 acertó el 25 %.

Gráfico de dos barras de OpenAI que muestra la precisión en el *benchmark* de investigación matemática EpochAI Frontier Math, con un salto de 2,0 para o1 a 25,2 para o3, con una banda sombreada más clara sobre la barra de o3 que muestra un límite superior.
Fuente.

ARC-AGI es una famosa prueba de inteligencia fluida, diseñada para que resulte relativamente fácil para los humanos, pero difícil para las IA. Mientras que el ser humano promedio obtiene un 75 % y los estudiantes de posgrado en STEM obtienen un 100 %, o3 superó a todas las IA anteriores y obtuvo un 87,5 %.

Gráfico de dispersión de fondo oscuro de ARC Prize que muestra la puntuación frente al costo por tarea (en escala logarítmica) en la evaluación semiprivada de ARC-AGI. Los puntos verdes de o1-mini y o1 preview forman un clúster en la parte inferior izquierda, los puntos rojos de o1 low/med/high se sitúan en el medio, los puntos grises de referencia marcan Kaggle SOTA, MTurker promedio y graduados en STEM, y los puntos amarillos de o3 low (ajustado) y o3 high (ajustado) alcanzan el 76 % y el 88 % a un costo mucho mayor.

Un experto en IA predijo hace dos años (en 2023) que la IA tardaría entre dos y tres años a partir de ahora (es decir, para 2027-2028) en superar el 70 % en la prueba ARC-IAG…

Captura de pantalla de un tuit de @iruletheworldmo, cuya foto de perfil es un hombre con bigote y gorro de Santa Claus, decorado con emojis de fresa y una marca de verificación; se ven el cuerpo del tuit, la marca temporal, el número de visualizaciones y los contadores de interacción.
Fuente.⁠⁠10

En resumen:

  • El modelo o1 de OpenAI era tan bueno que ya se encontraba entre los mejores.

  • Su nuevo modelo, o3, es tan bueno que supera a los expertos en sus propios campos.

  • El progreso entre ambos fue cuestión de meses.

  • ¡Los investigadores de IA afirman que esto ni siquiera está optimizado!

  • Están tan atónitos ante este progreso que muchos concluyen que alcanzaremos la IAG en 1 a 3 años.

¿Ya estás asombrado?

Los límites del crecimiento

Pero ¿quizás estén pasando por alto algunas barreras que podrían obstaculizar este crecimiento? ¿Puede el progreso de la inteligencia hacia la IAG toparse con un muro?

¿Quizás la tecnología tenga algún límite fundamental en cuanto a los tipos de problemas que puede resolver? No:

Hemos demostrado matemáticamente que los transformadores pueden resolver cualquier problema, siempre que se les permita generar tantos tokens de razonamiento intermedios como sea necesario.—Denny Zhou, líder del equipo de razonamiento en Google DeepMind.

Así, parece que la tecnología y la inteligencia no serán los factores limitantes para la SIA. Si acaso, lo serán las materias primas de la IA. A saber:

  1. Datos, para entrenar los modelos de IA.
  2. Poder de cómputo (es decir, chips), para entrenar y ejecutar los modelos.
  3. Electricidad, para alimentar el poder de cómputo.
  4. Dinero, para costear el resto.
  5. Calidad de los algoritmos, para optimizar todo lo anterior.

Parece que el dinero no será un problema.

Captura de pantalla del titular de un artículo de CNN con la firma y la marca temporal debajo.
Para ponerlo en contexto, ¡la inversión en IA fue de unos 1000 millones de dólares en 2021! Esto no significa que realmente vayan a invertirse 500 000 millones de dólares. Lo que significa es que hay un enorme interés en la IA, desde las empresas más valiosas hasta los gobiernos más poderosos del mundo.⁠⁠11

Los ojos del mundo están puestos en la IA. Todo el mundo sabe que es el futuro y está dispuesto a invertir el dinero necesario para hacerlo realidad.

3. Electricidad

Empresas como OpenAI, Amazon, Meta y Google están viendo cuánta electricidad necesitarán y están invirtiendo para desarrollar su propia capacidad; tanto es así que todas están construyendo o reabriendo reactores nucleares, que proporcionan electricidad estable. No les importa su mayor precio en comparación con los combustibles fósiles o las energías renovables, porque la electricidad representa una parte mucho menor de sus costos que el poder de cómputo.

¿Qué tan difícil será producir toda la electricidad que necesitamos? Tomemos a EE. UU. como el ejemplo más relevante:

Gráfico de líneas de la demanda de electricidad de los centros de datos de Estados Unidos entre 2014 y 2028, en TWh, que muestra una curva histórica poco pronunciada que asciende desde alrededor de 60 TWh (TCAC del 7 %) y luego se abre a partir de 2023 en una banda de proyección de baja a alta que termina en torno a 400-600 TWh para 2028.

Los centros de datos ya consumen el 4,5 % de la demanda de electricidad en EE. UU., y es probable que esa cifra aumente al 7-12 % en cuatro años. ¿Qué tan difícil será eso? Pues Estados Unidos no ha aumentado mucho su generación de electricidad en las últimas dos décadas, así que esto podría ser todo un reto.

Gráfico de líneas de Our World in Data que muestra la generación de electricidad de Estados Unidos entre 1985 y 2023, medida en teravatios-hora; la curva asciende pronunciadamente desde alrededor de 2500 TWh en la década de 1980 hasta unos 4000 TWh en 2000 y luego se estabiliza en el rango de 4000-4500 TWh hasta 2023.

Pero las energías renovables se están disparando:

Dos gráficos de líneas pequeños dispuestos en paralelo, de Our World in Data, que muestran el consumo estadounidense de energía eólica y solar en términos de energía primaria entre 1965 y 2023; ambas curvas se mantienen planas hasta aproximadamente el año 2000 y luego ascienden con fuerza hasta unos 500-600 TWh (eólica) y unos 400-500 TWh (solar) en 2023.

Los centros de datos de EE. UU. necesitarán 200 TWh de electricidad adicional para 2028, pero la energía solar y la eólica han estado aportando 200 TWh de electricidad al año, así que, en realidad, la electricidad no me preocupa.⁠⁠12

2. Capacidad de poder de cómputo

Probablemente, el poder de cómputo será el factor limitante. Por eso NVIDIA es la tercera empresa más valiosa del mundo, y por eso otras dos empresas de chips (Broadcom y TSMC) ocupan el décimo y el undécimo puesto.

Pero hay tanta demanda que cada vez más proveedores nuevos compiten con NVIDIA, como Cerebras, AMD, Intel, las TPU de Google (con tanta demanda interna que Google consume toda su propia capacidad y ya no las vende), Microsoft, Groq…

1. Límites de datos

Es cierto que aquí nos estamos topando con un muro: ya hemos alimentado a estos modelos con casi todo Internet. La cantidad de contenido que no está digitalizado, pero que se puede recuperar fácilmente, podría duplicar los datos disponibles, pero eso es todo. ¿Y entonces? Hay dos respuestas a esto.

En primer lugar, los datos sintéticos. Ya disponemos de motores físicos capaces de crear entornos realistas por los que pueden moverse las IA. Por ejemplo, pueden ayudar a entrenar vehículos autónomos. Una fuente de datos sintéticos aún más prometedora consiste simplemente en utilizar la IA para crear datos con los cuales entrenar a otras IA. ¿Por qué funciona? ¿No aplica aquí el principio de «basura entra, basura sale»? No, porque en muchos campos científicos es fácil crear ejercicios, obtener una respuesta de las IA y comprobar su precisión. Si el resultado del ejercicio generado por la IA es correcto, se le indica a la IA. Si es incorrecto, también se le indica y aprende para el próximo intento.

En segundo lugar, el cerebro humano no necesita consumir todo Internet para ser inteligente. Esto significa que ahora mismo nos estamos excediendo por mucho: estamos utilizando billones de tokens de datos porque nuestros algoritmos de cómputo y de entrenamiento de IA aún no están muy optimizados. La naturaleza dio con el algoritmo de nuestro cerebro mediante ensayo y error. Al menos podemos abordar esto de forma eficiente.

De hecho, acabamos de hacerlo. Una empresa china poco conocida ha lanzado una IA revolucionaria que está haciendo que todos se replanteen el mundo de la IA.

DeepSeek: el momento «¡Dios mío!» de los costos de la IA

DeepSeek es una pequeña organización china que lanzó un nuevo modelo de IA llamado R1, que puedes probar aquí en tu computadora.⁠⁠13 Esta es su «puntuación de calidad de IA»:

Gráfico de barras del índice de calidad de Artificial Analysis que clasifica dieciséis modelos de vanguardia por su puntuación combinada de *benchmarks*, con DeepSeek-R1 destacado en un recuadro rojo en el segundo lugar con 89, justo detrás de o1 de OpenAI con 90.
Fuente. Otros afirman que R1 de DeepSeek es mejor que o1 de OpenAI.

Su costo es 25 veces menor que el de o1:⁠⁠14

Gráfico de Artificial Analysis de los precios de entrada y de salida en dólares estadounidenses por cada millón de tokens en dieciséis modelos, con una flecha morada que apunta hacia abajo al precio de salida de DeepSeek-R1, de apenas 2,19, comparado con el altísimo precio de salida de o1, de 60, en el extremo derecho.
Fuente.

¿Y quién está detrás de esto? Una empresa emergente china de 100 personas sin financiamiento de capital riesgo.

Captura de pantalla de un tuit de Han Xiao (@hxiao) con marca de verificación, que describe la empresa matriz de DeepSeek; la frase «deepseek es su proyecto paralelo» aparece resaltada en azul claro.
Antes eran un fondo de cobertura en el que trabajaban intensamente en la optimización algorítmica y la velocidad, con pocos empleados. Hace un par de años decidieron dar un giro y, como tenían mucha experiencia y muchas GPU (unidades de procesamiento gráfico, el tipo de computadoras más optimizadas para la IA, las que vende NVIDIA), decidieron lanzarse a la IA.⁠⁠15

Además, este también es un modelo de código abierto, lo que significa que todo el mundo puede ver el código, contribuir a mejorarlo ¡y reutilizarlo! Lo regalaron. Todas las herramientas que utilizaron para lograr este avance están ahora a disposición de todo el mundo.

Captura de pantalla de un tuit de henry (@arithmoquine) publicado 9 horas antes, con un pequeño avatar tipo dibujo animado; se ven el cuerpo del mensaje, los contadores de interacción y el número de visualizaciones.
Vía X.⁠⁠16

¡Y DeepSeek ya se está mejorando a sí mismo!

Captura de pantalla de un tuit de Matthew Berman (@MatthewBerman) que incluye, a su vez, una captura de pantalla con tema oscuro de una entrada del blog de Simon Willison sobre un *pull request* (PR) a llama.cpp escrito por DeepSeek-R1, seguido del fragmento de la transcripción de Willison del razonamiento en cadena de pensamiento de R1.
Vía X.⁠⁠17

¿Cómo está reaccionando Meta (Facebook) ante esto? Meta comenzó a lanzar versiones de su propio modelo de código abierto, Llama, hace dos años. ¡Llama es peor que R1, y mucho más caro!

Captura de pantalla de una publicación anónima estilo Blind, de un empleado del grupo de inteligencia artificial de Meta, fechada ayer, con un ícono de marcador y otro de opciones; el título de la publicación aparece en negrita y el cuerpo del texto viene a continuación, en varios párrafos.
Fuente.⁠⁠18

Y DeepSeek no es el único que hace esto. Doubao-1.5-pro de ByteDance iguala o supera los benchmarks de GPT 4o de OpenAI y de Claude Sonnet 3.5 de Anthropic, y es 50 veces más barato.

Tabla comparativa de benchmarks en chino (综合指标, métricas integrales) de ByteDance, con filas agrupadas en las categorías de Conocimiento, Matemáticas, Código, Razonamiento, Seguimiento de instrucciones y Chino, que compara Doubao-1.5-pro (columna destacada) con Llama3.1-405B, GPT4o-0806, Gemini-exp-1205, Claude-3.5-Sonnet-latest, Qwen2.5 y Deepseek V3.
Fuente.

Ahora te cuento que acabo de probar DeepSeek por primera vez, y mi experiencia ha sido profunda. Por primera vez, siento que tengo un colaborador competente para el tipo de investigación que estoy haciendo. Me dejó atónito.

Desde hace años me pregunto por qué cierto país tiene tantos habitantes. Se lo había preguntado a las IA muchas veces, pero siempre me fallaban:

  • No tomaban en cuenta las causas raíz; decían, por ejemplo, «Hay mucha gente porque hubo un auge de la natalidad».

  • Confundían la causalidad; por ejemplo, decían cosas como: «Hay mucha gente en este país porque la mayoría vive en ciudades, y las ciudades están densamente pobladas».

  • Cuando yo cometía errores, no se daban cuenta, por lo que no podían cuestionar mis suposiciones.

  • Proponían una serie de puntos, sin tener en cuenta las relaciones entre ellos.

Y cometían muchos errores más.

Con DeepSeek, por primera vez, una IA fue capaz de formular por sí misma las mismas hipótesis que yo, sin que tuviera que indicárselas. Por primera vez, planteó hipótesis nuevas. Pero fue aún más allá: ¡propuso procesos para probar las hipótesis, así como datos y fuentes para llevar a cabo las pruebas! ¡Y todo rapidísimo y gratis! Lo más asombroso fue que DeepSeek te muestra su razonamiento si lo deseas, y fue totalmente acertado. Se sentía humano, como una persona muy inteligente y racional. Todas las dudas que tuvo la IA durante su razonamiento fueron válidas y me ayudaron enormemente a mejorar mis indicaciones. Por ejemplo:

Captura de pantalla de un chat de DeepSeek donde el prompt de seguimiento del autor aparece en un globo de diálogo azul claro en la parte superior, y el avatar en forma de ballena de DeepSeek precede a un menú desplegable que dice «Pensó durante 12 segundos» debajo, mostrando en gris la cadena de pensamiento del modelo con dos barras de censura color beige que cubren los nombres de los países específicos comentados.

¿Cómo ha conseguido DeepSeek crear un modelo tan bueno a un costo tan bajo? No está claro, pero parece deberse a una combinación de factores que explicaré en un artículo prémium, donde también abordaré los pasos que faltan para alcanzar la IAG.

Lo más destacado aquí es que ¡no requirieron realimentación humana! Diseñaron un proceso en el que simplemente alimentaron a la máquina con datos y estructuraron métodos para que aprendiera por sí sola. ¿Recuerdas que mencioné que los datos sintéticos liberarían el progreso de la IA de las limitaciones de datos? Este es un ejemplo perfecto.

Y esto es muy importante porque, en el pasado, el mayor cuello de botella para el progreso de la IA siempre fueron los humanos. AlphaGo tuvo que aprender de decenas de millones de jugadas humanas antes de poder vencerlos, y ese proceso llevó meses. Sin embargo, AlphaGo Zero aprendió a vencer a los humanos sin ninguna intervención humana, jugando contra sí mismo, en tan solo 3 días.

AlphaGo Zero venció a AlphaGo por 100 a 0.

¿Qué significa todo esto? Es hora de unir todas las piezas.

Conclusiones: el futuro está a punto de alcanzarnos

Ilustración de monigotes sobre los ejes de inteligencia frente al tiempo, que muestra una curva de inteligencia casi plana hasta el extremo derecho, donde se vuelve casi vertical; dos monigotes están sobre la parte plana (uno está de rodillas analizando la curva con una lupa; el otro lo mira de pie) e intercambian globos de diálogo displicentes, mientras que una flecha roja señala un punto rojo justo en el codo de la exponencial.
  • Los mejores modelos de IA eran aproximadamente tan inteligentes como las ratas hace cuatro años, como los perros hace tres años, como los estudiantes de secundaria hace dos años, como los universitarios promedio hace un año y como los doctores hace unos meses. Y ahora son mejores que los doctores humanos en su propio campo. Basta con proyectar eso hacia el futuro.

  • Los creadores de estos modelos coinciden en que la escala se está ampliando más rápido de lo que esperaban, y no están usando trucos extraños. De hecho, ven oportunidades de optimización por todas partes. La inteligencia simplemente amplía su escala. Creen que la IAG está a entre 1 y 4 años de distancia. Esto es solo un poco más optimista que los mercados, que estiman que llegará en unos 2 a 6 años.

  • Las IA son ahora como desarrolladores de software de élite. Y la IA ya está mejorando a la propia IA. Si se combinan estos dos factores, es fácil imaginar lo rápido que se acelerará la velocidad de desarrollo de la IA.

  • A estas alturas, no parece que la inteligencia vaya a ser un obstáculo para la IAG. Más bien, podrían serlo otros factores como la energía o el poder de cómputo.

  • Aunque DeepSeek acaba de demostrar que podemos crear modelos que reduzcan en varios órdenes de magnitud el consumo de dinero, energía y poder de cómputo.

  • Así, aunque la electricidad, los datos y, sobre todo, el poder de cómputo puedan ser factores limitantes para el crecimiento de la IA, estamos encontrando constantemente formas de hacer que estos modelos sean más eficientes, lo que elimina estas limitaciones físicas.

En otras palabras: la IA avanza cada vez más rápido, no tenemos barreras claras que frenen su progreso, y los expertos creen que eso significa que veremos la IAG en cinco años.

Para responder a las preguntas que planteé en la introducción: ahora mismo estamos saltando desde el precipicio, y lo más probable es que tardemos unos años (entre uno y seis, según a quién se le pregunte) en aprender a volar o en estrellarnos contra el suelo.

¿Cómo podemos prepararnos para ese momento? Esto es lo que voy a explorar en los próximos artículos:

  • ¿Cuáles son las últimas novedades sobre el impacto en puestos de trabajo específicos?

  • ¿Acelerará la IA la ciencia?

  • ¿Qué hemos aprendido sobre la alineación? ¿Nos matarán las IA?

  • ¿Cómo puedes iniciarte en la IA si no sabes nada al respecto? ¿Cómo puedes montarte en la ola?

¡Exploraré estas ideas en los próximos artículos!


Publicación original: Tomas Pueyo (2025) The most important time in history is now, Uncharted Territories, 29 de enero.

1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18