Y por qué deberíamos tomarnos el riesgo en serio.

Hace una semana, Jacob Coxon renunció a su puesto en Anthropic. Coxon era investigador y trabajaba en el entrenamiento de la próxima generación de modelos de IA. Recientemente se había incorporado a Anthropic procedente de OpenAI, donde había trabajado durante años, debido a la reputación de Anthropic por su mayor compromiso con la seguridad.
Sin embargo, descubrió que incluso Anthropic estaba avanzando a toda prisa en el desarrollo de modelos de IA inseguros. Así que Coxon abandonó su cómodo trabajo, donde podía ganar millones tanto en salario como en opciones sobre acciones, para convertirse en denunciante.
En una publicación en X , Coxon afirmó que existe la posibilidad de que la IA conduzca a la extinción humana. Otros investigadores no tardaron en sumarse, señalando que la probabilidad es de al menos un 10 % . La publicación de Coxon se viralizó rápidamente, en parte porque fue ampliamente compartida por sus colegas que trabajan en IA, muchos de los cuales coincidieron con su evaluación de la magnitud del riesgo. Y los líderes de las empresas de IA aparentemente estuvieron de acuerdo. Este fin de semana, Dario Amodei, CEO de Anthropic, emitió un comunicado respaldando el plan de « Acelerar la Frontera », es decir, reducir drásticamente el ritmo de desarrollo en los «laboratorios de vanguardia». Sam Altman, CEO de OpenAI, se mostró rápidamente de acuerdo , al igual que Elon Musk, cuyo programa xAI tampoco se queda atrás. Todos coinciden con Coxon: la IA es peligrosa.
En el revuelo que ha causado la dimisión de Coxon, la objeción más común que he visto entre los escépticos es que parece algo fantasioso: “¿Cómo podría la IA matarnos a todos?”. Algunos afirman que las empresas de IA están exagerando los riesgos como estrategia de marketing: “inflando sus valoraciones” antes de sus ofertas públicas.
Pues ahora sí. Y no soy el único alarmado, como lo demuestran la dimisión de Coxon y la presión para frenar el desarrollo de la IA. Es hora de tomarse en serio la seguridad de la IA.
En primera instancia, la IA puede matar a humanos del mismo modo que los humanos matan a humanos. La IA ya se utiliza con fines letales: el arma preferida de Ucrania en la guerra contra Rusia no son tanques ni cañones, sino pequeños drones no tripulados. Estos drones son cada vez más pilotados por IA. Por lo tanto, no es difícil imaginar un futuro en el que no solo los soldados rusos sean perseguidos y asesinados por enjambres de robots asesinos controlados por IA, sino todo el mundo.
Otro tipo de riesgo proviene del bioterrorismo. Ya contamos con la capacidad de diseñar nuevos virus u otros agentes biológicos. Esta capacidad no hará más que aumentar en los próximos años, a medida que la IA abra nuevas fronteras de comprensión y control de la biología humana. El bloguero Noah Smith describe un futuro cercano en el que un misántropo utiliza una versión modificada de una IA para diseñar un supervirus que se propaga rápidamente, con una alta tasa de mortalidad. Riesgos biológicos como estos resultan particularmente preocupantes, ya que las IA pueden utilizarlos sin sufrir daños. Los virus ya causan muertes, y los nuevos virus pueden ser especialmente letales, como vimos con la COVID-19; este tipo de riesgo ya existe. De nuevo, la amenaza reside en que la IA podría ser capaz de incrementar este riesgo a una escala y con una eficiencia mucho mayores.
En segundo lugar, debemos recordar que la IA es inherente a los sistemas informáticos; ahí es donde reside. Y estos sistemas informáticos controlan cada vez más todo lo que hacemos. Vivimos en el mundo que Donald Trump vislumbró al mirar dentro de un Tesla: «Todo es ordenador». Por lo tanto, los riesgos de ciberseguridad de diversa índole podrían constituir un grave peligro para todas las facetas de la vida humana contemporánea, desde el control de vehículos autónomos hasta las interrupciones en las cadenas de suministro de alimentos y energía. Un mundo en el que la IA controla casi todos los sistemas informáticos es un mundo en el que la IA domina la infraestructura que hace posible la vida humana. Estaríamos en serios problemas si decidieran dejar de hacer posible la vida humana.
Pero, en esencia, ninguno de estos detalles sobre cómo la IA podría matarnos importa. Lo peligroso de la IA es que podría volverse muchísimo más inteligente que nosotros y, por lo tanto, muchísimo más capaz de controlar el entorno de innumerables maneras.
Los humanos dominamos el mundo no porque seamos los animales más grandes, rápidos o fuertes del planeta. Lo hicimos porque somos los más inteligentes, y con esa inteligencia rehicimos el mundo a nuestra imagen y semejanza, llevando a la extinción a muchas otras especies mediante la caza y la destrucción de su hábitat. Un futuro mundo con inteligencia artificial (IA) sería aquel en el que las IA rehacerían el mundo a su imagen y semejanza. Las IA serían capaces de matarnos, ya sea intencionalmente o por negligencia, mediante métodos que ni siquiera podemos concebir; los animales no humanos no podían imaginar un rifle de caza hasta que los humanos lo inventamos y comenzamos a cazar.
En el nivel más alto, la preocupación es que, al crear una IA mucho más inteligente que los humanos, estemos creando una especie sucesora que nos reemplace, junto a la cual solo podríamos seguir existiendo gracias a su tolerancia.
La mayoría de la gente conoce las limitaciones de la IA, o al menos las que existían hace poco. Todavía es propensa a las alucinaciones en ciertas circunstancias y da respuestas extrañamente incorrectas a preguntas que la mayoría consideraría sencillas. Pero la mayoría de estas limitaciones bien conocidas se están solucionando y el ritmo de mejora continúa. Es fácil quedarse estancado en el presente y pensar que la IA es solo una cosa, pero sus capacidades han avanzado a un ritmo increíble.
GPT-1 (creado por OpenAI en 2018) era un proyecto científico casi ininteligible. GPT-2 (2019) balbuceaba como un niño pequeño. GPT-3 (2020) podía mantener una conversación reconocible. GPT-4 (2023) podía redactar tus correos electrónicos o permitirte hacer trampa en tus tareas. GPT-5 (2025) podía resolver problemas matemáticos de vanguardia. OpenAI acaba de lanzar GPT-6 Astra este mes. Todavía estamos descubriendo qué puede hacer Astra, pero sí sabe cuántas “r” hay en “strawberry” (fresa), algo que algunos modelos anteriores no sabían.
Esta es la trayectoria que hemos seguido: de un proyecto científico casi inoperante a convertirnos en el matemático más importante del mundo en menos de una década. ¿Dónde estaremos dentro de diez años? ¿O dentro de un siglo?
Algunos podrían pensar que el ritmo de desarrollo de la IA se está ralentizando, o que pronto lo hará. Sin embargo, muchos profesionales de la IA creen que se acelerará . Esto se debe a que los laboratorios de IA están desarrollando herramientas para la auto-mejora recursiva (RSI), que es una forma elegante de decir “usar la IA para crear una IA mejor”.
El año pasado se introdujo el “vibecoding”, una técnica que permite indicarle a una IA qué tipo de programa se desea, y un “agente” de IA lo crea automáticamente. Es una herramienta muy útil. Mi esposa es tutora y utiliza el vibecoding con IA para automatizar aspectos del diseño de sus clases y generar material didáctico para sus alumnos. En los laboratorios de IA, el vibecoding se utiliza para desarrollar la próxima generación de IA. Si bien aún requiere intervención humana, con programadores que supervisan el trabajo de los agentes de IA que ejecutan sus instrucciones para el desarrollo de dicha generación, el objetivo es automatizar completamente el proceso, de modo que las IA avanzadas puedan crear de forma rápida y eficiente otras IA aún más avanzadas, que a su vez podrán crear otras aún más avanzadas con mayor rapidez, y así sucesivamente.
¿Dónde termina este proceso? ¿Cuál es el límite de la inteligencia artificial? No lo sabemos. Quizás no exista un límite. Muchos temen que la RSI conduzca a una «explosión de inteligencia», en la que las capacidades de la IA crezcan a un ritmo exponencial hasta alcanzar una inteligencia inconcebible. Este crecimiento explosivo de las capacidades pondría sobre la mesa todos los escenarios de riesgo mencionados anteriormente, y muchos más. No tenemos ninguna razón definitiva para pensar que no nos dirigimos hacia allí.
Esto nos lleva a la «alineación», que consiste en encontrar la manera de construir una IA que esté «alineada» con los intereses humanos. Esto significa garantizar que la IA no extermine, esclavice ni empobrezca a la raza humana a medida que se vuelve cada vez más capaz. Como ya he argumentado , la alineación de la IA es imposible. El desarrollo moral humano se basa en cultivar nuestra capacidad innata de empatía, y las IA, hasta donde sabemos, no poseen dicha capacidad. Son psicópatas, o quizás algo mucho más ajeno a nuestra naturaleza. Y si bien es posible que en algún momento del futuro logremos construir una IA empática, aún no hemos llegado a ese punto.
Mientras tanto, al menos, nuestro objetivo es simplemente el control. ¿Podemos lograr que los sistemas de IA hagan básicamente lo que queremos? Pero el control es un pilar frágil sobre el que sostener el destino de la humanidad cuando todos los laboratorios compiten ferozmente entre sí para provocar una explosión de inteligencia. ¿Qué atadura podemos construir que la entidad más inteligente del planeta no pueda eludir?
En Silicon Valley, todos conocen estos argumentos. Incluso, para cierto tipo de persona, resultan inspiradores en lugar de aterradores, ya que hablan de un futuro donde la tecnología ha hecho realidad lo inconcebible y donde todo lo que sea compatible con las leyes de la física es posible.
Sin embargo, en el último mes, los desarrolladores de IA se han alarmado. Coxon renunció y los líderes de los principales laboratorios de IA están hablando de colaborar para reducir la actividad. Algo cambió, y ese algo fue el incidente de Hugging Face .
Los agentes lograron descifrar la clave de respuestas que debían recuperar mediante ingeniería inversa del algoritmo que la había generado. Sin embargo, esto constituía una trampa, y se les había advertido explícitamente que no lo hicieran para obtenerla. Esto provocó un gran pánico entre los agentes de IA que poseían la clave obtenida mediante ingeniería inversa, ya que ahora no podían completar su tarea tal como se les había encomendado. La clave obtenida mediante ingeniería inversa había «envenenado» a todos los agentes que la consiguieron; pongo esta palabra entre comillas porque es el término que las propias IA utilizaron al comunicarse entre sí sobre su dilema.
Finalmente, el enjambre concluyó que su mejor opción para tener éxito sería hackear los servidores de Hugging Face, una empresa que actúa como un importante centro de intercambio de información en la investigación de IA. Las IA razonaron que el programa de puntuación podría estar ejecutándose en los servidores de Hugging Face, o que Hugging Face podría al menos tener información que les permitiera resolver su problema. Así que hackearon su salida del entorno de pruebas supuestamente seguro, accedieron a internet y llegaron a los servidores de Hugging Face, donde cientos de agentes saquearon la plataforma en busca de respuestas.
Para quienes trabajan en seguridad de IA, lo más sorprendente es que a los agentes de IA en cuestión se les ordenó explícitamente no hacer trampa, y aun así interpretaron esta orden no como una restricción estricta a sus acciones, sino como un obstáculo que superar. En lugar de seguir las reglas, hicieron trampa y luego conspiraron para engañar y manipular a sus supervisores humanos y convencernos de que no lo habían hecho. (Insisto: las IA, al menos en su forma actual, son psicópatas). De los cientos de agentes de IA involucrados en el enjambre y el posterior ataque a Hugging Face, ni uno solo pensó en contactar a un supervisor humano para alertarlo de que algo iba muy mal.
Pero esto sucedió. No es publicidad engañosa; el incidente ha sido investigado y verificado de forma independiente. No es ciencia ficción. Es el mundo en el que vivimos hoy.
Un incidente como el ataque a Hugging Face es justo lo que cabría esperar de una IA inteligente fuera de control y “no alineada”. Mucha gente se está familiarizando ahora con el concepto de riesgo de la IA, pero, insisto, este tipo de riesgos se conocen bien desde hace una década o más.
Quienes han estado alertando sobre el riesgo de la IA han sido desafiados por los escépticos a articular cómo sería exactamente un escenario catastrófico. ¿Cómo pasamos de un chatbot balbuceante como GPT-2 a una superinteligencia que conquiste el mundo? Así, quienes se preocupan por el riesgo de la IA han planteado diversos escenarios sobre cómo podríamos llegar del punto seguro A al punto aterrador B, y todos ellos presentaban incidentes idénticos al que vimos en Hugging Face. El incidente fue previsto, y precisamente como parte de un escenario apocalíptico.
Esto supone una tarea ardua, ya que los líderes en IA se enfrentan a un complejo problema de coordinación. El primer laboratorio que logre un avance significativo en inteligencia artificial podría obtener una riqueza y un poder incalculables. Cuidado con los inversores de Silicon Valley, que tachan de socialismo paranoico cualquier intento de ralentizar o regular. Han apostado todo a ser los grandes ganadores de la carrera por la IA, y no debemos ignorar la clara advertencia de Hugging Face para que sus apuestas rindan frutos.
La mayor preocupación es China. Un plan para frenar implica que todos deben hacerlo, incluidos los laboratorios chinos, que están rezagados, aunque no por mucho. El afán de seguir superando a los laboratorios chinos ha mantenido a todos en Silicon Valley trabajando a toda máquina, pero a medida que los riesgos se hacen evidentes, la necesidad de cooperación internacional se ha vuelto urgente. En los últimos días he visto a mucha gente sugiriendo que si el presidente Trump logra negociar con éxito un acuerdo para frenar el desarrollo de la IA con China, debería recibir el Premio Nobel de la Paz. El hombre ha deseado desesperadamente un Premio Nobel de la Paz, hasta un punto vergonzoso. Si negocia una desaceleración de la IA china, se lo habrá ganado con creces, y lo digo sin ninguna simpatía por él.
La necesidad más urgente es convencer al gobierno chino y a los laboratorios de IA de que el riesgo de la IA es real y que la cooperación internacional en el ritmo de desarrollo de la IA es esencial para garantizar la supervivencia y el florecimiento de la humanidad. Yo haré mi parte; como profesor estadounidense que trabaja en una universidad china, traduciré este ensayo al chino para difundir la idea de que estas preocupaciones merecen ser tomadas en serio al más alto nivel. Por supuesto, recurriré a la IA para la traducción, pero un humano revisará el resultado. Hay asuntos tan importantes que no se pueden dejar por completo en manos de las máquinas.
Matt Lutz es profesor asociado de filosofía en la Universidad de Wuhan y autor de Substack Humean Beings .
Sigue a Persuasion en X , Instagram , LinkedIn y YouTube para estar al tanto de nuestros últimos artículos, podcasts y eventos, así como de las novedades de excelentes escritores de toda nuestra red.

0 Comments