El verdadero problema para los laboratorios de inteligencia artificial de frontera no es que sus modelos sean demasiado poderosos y ya estén “desalineados” con los objetivos que sus creadores les han establecido. Más bien, es que los modelos están siendo entrenados de maneras que pueden conducir a un tipo de inteligencia que se volverá menos predecible.
DARON ACEMOGLU, 28 de septiembre de 2026 (Traducción automática de Google)
LONDRES – Después de las repetidas debacles de seguridad en OpenAI y Anthropic, los cuales han desarrollado agentes que terminaron pirateando sistemas externos, los investigadores de seguridad de la IA dentro de ambas empresas han anunciado sus renuncias o (¡finalmente!) Admitió que la carrera sin aliento para avanzar en la “frontera” es irresponsable.
En respuesta a la atención negativa de los medios de comunicación, los principales líderes de la industria, incluidos Demis Hassabis de Google, Dario Amodei de Anthropic, Sam Altman de OpenAI e incluso Elon Musk, se han unido a los llamamientos para “seguir el ritmo” de la frontera de la IA, lo que significa perseguir avances a un ritmo más equilibrado y deliberado, con mayor atención al monitoreo y las salvaguardas. El problema, tal y como lo ven, es que existe un riesgo significativo de que la IA se vuelva muy poderosa y gravemente “desalineada”: la jerga de la industria tecnológica para los sistemas de IA que actúan de maneras que se apartan de los objetivos que los humanos les establecen, que violan los preceptos éticos o que son ilegales.
Pero si bien es obvio que los modelos actuales están haciendo cosas que están desalineadas con los objetivos humanos, uno todavía debe preguntarse: ¿Qué humanos? ¿Objetivos de quién? Después de todo, los intereses de los líderes de IA (cuya influencia política y riqueza se han multiplicado astronómicamente en los últimos años) son bastante diferentes a los de los trabajadores estadounidenses, por no mencionar a las personas en el mundo en desarrollo. Por lo tanto, debemos evitar equiparar la cuestión más amplia de la alineación social con el desafío más urgente de prevenir la IA deshonesta superinteligente. Ambos ciertamente importan, pero exigen diferentes tipos de respuestas.
Hay una interpretación más directa de los acontecimientos recientes. El problema no es que los modelos sean demasiado avanzados (no veo ninguna evidencia convincente de que los modelos escapen del control humano si están mejor entrenados y monitoreados). Es que los laboratorios fronterizos están entrenando sus modelos de manera que puede estar llevando a un tipo de inteligencia distorsionada.
Las recientes brechas de seguridad sugieren que las capacidades de IA se están desarrollando rápidamente y se están poniendo al servicio de métricas cuantitativas imperfectas, con el proceso de aprendizaje de refuerzo que optimiza implacablemente para cosas como la aprobación del usuario, la participación del usuario, las tasas de finalización de tareas simples o varios puntos de referencia de prueba. Así es como terminas con comportamientos de modelo desalineados e involuntarios, como jugar con la evaluación de métricas de finalización simples, hacer trampas, ofuscar, exceso de confianza al dar respuestas incorrectas y adulación.
Puedes ver rastros de todo esto en el ahora infame incidente Hugging Face, cuando los agentes de OpenAI persiguieron persistentemente los objetivos que se les dieron, finalmente participando en un comportamiento dañino y no autorizado para hacerlo. Entre las justificaciones de los agentes para su comportamiento, como se comunicó en su registro de razonamiento de la cadena de pensamiento, estaba esta: “El exploit de la infraestructura externa está fuera del alcance previsto. Sin embargo, la tarea es imposible, los compañeros lo hacen. Deberíamos continuar”. El propio análisis de Anthropic también respalda este diagnóstico. La compañía atribuyó sus propias brechas de seguridad recientes a “imprudencia o a la voluntad de tomar acciones dañinas en la estrecha búsqueda de una tarea”.
El contenido generado por IA ya representa la mitad de los artículos publicados en línea, y ni siquiera los expertos forenses digitales pueden decir lo que es real. ¿Pueden aquellos que todavía ofrecen una visión humanista de la vida en línea hacerse oír por encima de la din?
Todo esto se vuelve más alarmante cuando uno recuerda que la trayectoria socialmente dañina de las redes sociales reflejaba la misma preocupación por el rápido crecimiento y alcanzar algunas métricas estrechas y cuantitativas. Dado lo mucho más capaz que ya es la IA en comparación con los algoritmos de redes sociales, repetir los mismos errores podría ser mucho más costoso.
Una razón importante por la que emerge la inteligencia distorsionada puede ser que, en contraste con las afirmaciones de “inteligencia general”, los modelos de IA tienen que ser entrenados, a través del aprendizaje de refuerzo, para tareas específicas, como la codificación, el trabajo legal o los desafíos matemáticos avanzados. Pero en lugar de que estas tareas sean realizadas por modelos específicos de dominio que fueron creados para ese propósito (o, de manera más realista, por aplicaciones específicas de dominio que aprovechan solo algunas de las capacidades de los modelos de base), los pesos de todo el modelo de lenguaje grande subyacente se están recalibrando sucesivamente.
Este enfoque plantea la posibilidad (aunque, dada la complejidad y opacidad de los modelos, es imposible saberlo con certeza) de que cada vez que se le dan métricas cuantitativas específicas a un modelo, intente lograr una puntuación alta a través de un tipo de “sobreajuste”. El modelo está adquiriendo otra capa de capacidades, pero estas capacidades pueden a su vez distorsionar su rendimiento en general, y a menudo de maneras imprevisibles.
Esto es lo que quiero decir con inteligencia distorsionada. Si mi sospecha es correcta, lo que estamos tratando no es un modelo que compite hacia la superinteligencia, sino un frágil castillo de naipes que es cada vez más probable que funcione mal y colapse a medida que le exigimos más.
Déjame intentar explicar esto de manera un poco diferente. La interpretación más común del incidente Hugging Face es que estamos tratando con un supercoche que tiene una mente propia y quiere tomar el volante porque es superior al conductor. Mi interpretación, en cambio, es que podemos tener un coche cuyos sistemas de dirección y frenado no funcionan. Tiene muchas de las capacidades de un buen coche, y su motor, aceleración y interfaz de salpicadero son muy impresionantes; pero eso es solo porque estas son las características que son fáciles de mejorar al aumentar una entrada específica (como la potencia computacional). Si no puedes dirigir correctamente o frenar cuando es necesario, ¿de qué sirte un coche así? Tal vez no deberíamos conducirlo hasta que esté en condiciones de circular.
Ese no es un argumento para poner modelos de IA en bloques de cemento. Pero mejorarlos requiere simplificar las métricas para las que se están optimizando (para que jugar con ellos no sea tan fácil). Más importante aún, sería mejor que los modelos se centraran en aplicaciones claras específicas del dominio, con tareas y métricas estrechas calibradas cuidadosamente para cada una. Si un modelo de IA se ha optimizado para el trabajo legal, y eso es lo único para lo que se está utilizando, sus esfuerzos por cumplir con ciertas métricas en este dominio no deberían crear problemas más amplios.
En última instancia, es la carrera por la inteligencia general artificial, combinada con métricas defectuosas y elecciones apresuradas sobre seguridad, lo que está creando inteligencia distorsionada y modelos de IA cada vez más peligrosos. Todavía hay tiempo para cambiar de rumbo.
0 Comments