Yascha Mounk y David Bau examinan los misteriosos procesos internos que impulsan el comportamiento de la IA, y por qué pueden resultar fundamentalmente ajenos a nosotros.

En la conversación de esta semana, Yascha Mounk y David Bau analizan cómo los modelos de IA producen sus resultados y reflexionan sobre si el proceso de “pensamiento” que los modelos muestran a los usuarios revela sus procesos de pensamiento auténticos, y sobre cómo los investigadores pueden decodificar las representaciones internas de las redes neuronales para comprender qué información contienen y utilizan.
Esta transcripción ha sido condensada y ligeramente editada para mayor claridad.
Yascha Mounk: Aprendí tanto la última vez que hablamos que pensé en aprovechar tu generosidad y convencerte de que me dieras otra clase particular sobre cómo funciona la IA. La última vez que hablamos, vimos los fundamentos de la IA; así es como lo entendía. ¿Cómo funciona esto? ¿Cómo se construye una IA? ¿Cómo opera? La pregunta con la que quiero empezar hoy es: ¿cómo produce resultados la IA? ¿Cómo reflexiona sobre el mundo, sobre un problema, sobre cómo planifica resolverlo? ¿Qué podemos saber siquiera al respecto?
David Bau: Este es uno de los misterios de la IA: ¿cómo funciona internamente? La forma en que entrenamos la IA consiste básicamente en recompensarla, reforzarla o fortalecer sus conexiones cuando responde correctamente, y luego debilitar esas conexiones o retirar la recompensa cuando se equivoca. Al repetir este proceso miles de millones de veces, comienza a desempeñarse bien en todas las tareas. El misterio es: ¿cómo lo hace internamente? Todo el campo de intentar comprender lo que sucede dentro de la IA —algunos lo llaman interpretabilidad de la IA, es decir, abrir la IA para interpretar lo que piensa internamente— es en realidad mi área de especialización en investigación, así que me complace profundizar en lo que sabemos al respecto.
Mounk: En cierto modo, tenemos una ventaja con respecto al cerebro humano, ¿verdad? Leer con exactitud qué neurona se activa y cuándo en el cerebro humano es increíblemente difícil, e incluso obtener lecturas precisas en un ratón vivo es un proceso sumamente complicado. Supongo que la única ventaja que tenemos en el contexto de estos modelos es que podemos, con mayor facilidad, observar qué parte de una red neuronal se activa, de qué manera y cómo cambia su valor, mientras le pregunto a Claude cuánto es 3 más 5 o lo que sea.
Bau: Sí. Eso es lo asombroso de tener redes neuronales artificiales que funcionan: una ingente cantidad de datos. Es justo lo contrario de lo que se maneja al trabajar con cerebros biológicos. Los neurocientíficos son increíbles; estudian las neuronas de ratones y emplean métodos asombrosos para ello. Analizar un puñado de neuronas puede llevar cinco años, mientras que en informática, en cuestión de minutos, es muy fácil analizar miles de millones de señales neuronales. Hay tantos datos que nuestro reto es encontrar la manera de filtrarlos para darles sentido. Lo que llamamos patrón neuronal, que se observa al introducir información en una red neuronal, da lugar a un patrón de descargas neuronales que denominamos representación. Es una representación de la información presente en la red. Lo que solemos intentar es comprender dos aspectos clave: qué información contiene la neurorrepresentación (qué sabe dentro de sus neuronas, qué información posee) y, ¿para qué la utiliza? ¿Qué información utiliza y cómo influye en su decisión? Creo que muchas de las preguntas sobre el funcionamiento de una red neuronal pueden resumirse en dos puntos: ¿qué sabe y qué información utiliza?
Mounk: Desde la perspectiva de un profano, la primera pregunta obvia es: cuando le pido a Claude que haga algo complicado, dice “Estoy pensando”, y si hago clic ahí, se abre una pequeña ventana que me indica qué está haciendo y qué está pensando. Dice: “El usuario solicitó esto, debería hacer aquello”. Pero claro, no tengo ni idea de si eso se acerca más a su proceso de pensamiento real. Parece informarme sobre algunos de los pasos que está dando, por lo que parece estar relacionado de alguna manera con lo que está haciendo. Pero, en su mente, eso sigue siendo solo un resultado que yo podría estar analizando. Entonces, ¿es eso una ventana a lo que realmente sucede internamente, o es un resultado completamente falso que me hace sentir que obtengo algún tipo de información sobre lo que está haciendo, sin estar realmente más cerca de lo que hace que el resultado oficial que me proporciona?
Bau: Creo que la mayoría de la gente piensa que es una especie de ventana, pero hay que tomarlo con pinzas: es otro resultado de la red neuronal. Hay estudios que demuestran que ese resultado no es del todo fiel a la forma en que las redes neuronales piensan internamente, en varios aspectos. La mayoría de la gente lo ve y dice: bueno, sin duda es mejor que nada; es muy legible, así que definitivamente vale la pena echarle un vistazo. Sin duda vale la pena auditarlo, y la red a menudo revelará cosas en ese texto que te darán algunas pistas sobre lo que está sucediendo. Pero no es la historia completa.
La red tiene dos formas de desarrollar un proceso de pensamiento interno. Una de ellas es a través de lo que se conoce como su cadena de pensamiento interna. Este término proviene de un artículo antiguo; se utiliza para describir este monólogo interno. Puedes hacer clic en él para ver cuándo el modelo habla de sí mismo, y es prácticamente como si el modelo hablara consigo mismo. Genera tokens que no están destinados a ser leídos directamente. Estos tokens surgieron del proceso de aprendizaje por refuerzo, donde el modelo aprendió que, para obtener respuestas más precisas —para resolver más acertijos presentados durante el entrenamiento—, es útil anotar información a mitad del proceso.
Mounk: ¿Hace eso en inglés? ¿Siempre lo hace en inglés, incluso cuando le hablo en alemán? ¿Hay modelos que hayan desarrollado su propio lenguaje para esto? ¿Cómo es eso?
Bau: Si no se les indica explícitamente a los modelos que hagan que ese texto sea legible, escribirán en su propio idioma, alternando entre inglés, chino y otros. Una de las cosas que se hace al entrenarlos es intentar condicionar los modelos para que hagan que ese texto sea un poco más legible y así obtener alguna información. Pero ese es un ejemplo del desafío que presentan estas cadenas de pensamiento internas. El modelo podría estar inventando su propia jerga. Podría estar usando palabras que parecen inglesas, pero que en realidad codifican otra información en ellas. Es posible que leamos esas palabras de manera muy diferente a como las lee el modelo. Podría estar inventando capas de significado que no comprendemos. También podría estar realizando algún otro proceso que no se refleja en absoluto en las palabras.
¡Esperamos que disfrutes del podcast! Si eres suscriptor de pago, puedes configurar el feed premium en tu aplicación de podcasts favorita en writing.yaschamounk.com/listen . Esto te dará acceso sin anuncios a la conversación completa, además de todos los episodios completos y los episodios extra que estamos preparando. Si no lo eres, puedes configurar la versión gratuita y limitada del feed o, mejor aún, ¡apoya el podcast suscribiéndote hoy mismo!
Si tiene alguna pregunta o problema al configurar el feed completo del podcast en una aplicación de terceros, envíe un correo electrónico a leonora.barclay@persuasion.community.
En el entrenamiento de seguridad de la IA, básicamente entrenamos a los modelos para que no sean ofensivos, ni presenten errores graves, sesgos u otros problemas en el texto que emiten. Esto significa que, al articular sus pensamientos internos, estos también tienden a ser censurados. Suelen evitar hablar de temas que no queremos que se reflejen en su resultado final. Sin embargo, esto no garantiza que el modelo no esté pensando en cosas peligrosas o con un sesgo negativo. Simplemente significa que el modelo puede estar codificando sus pensamientos de tal manera que, al leer la forma superficial de los mismos, no se perciban los aspectos indeseables: los sesgos, los problemas, los errores. Hay buenas razones para creer que el monólogo interno podría no revelar algunos de los aspectos que deseamos que revele. Queremos que el modelo nos indique cuándo está cometiendo un error, pero debido a la forma en que lo hemos entrenado para usar el lenguaje, es posible que no utilice las palabras de esa manera.
Mounk: En cierto sentido, ahora estamos llegando a diferentes niveles de, por falta de una palabra mejor, interioridad. El primer nivel es simplemente: haces una pregunta, ¿qué respuesta te da? El segundo nivel es, si está pensando durante mucho tiempo, te dice algo sobre su proceso de pensamiento: ¿qué está escribiendo en este proceso de pensamiento? El tercero es un bloc de notas no público pero auditable, en el que anota cosas, y ahí a veces tienes esta mezcla de lenguajes y todo tipo de cosas interesantes sucediendo. Pero obviamente el modelo todavía entiende que este es el tipo de cosa que un investigador de IA como tú podría leer y examinar. Luego hay un cuarto nivel del proceso de pensamiento interno, que es más complicado.
Tengo dos preguntas. La primera es: ¿hasta qué punto son mutuamente comprensibles estos blocs de notas? Si se toma la salida de un bloc de notas como ese y se introduce en un modelo diferente, ¿lo entenderá? ¿Es una especie de lenguaje universal entre modelos de IA que son al menos de una generación similar y que, en términos generales, han sido entrenados de forma similar? ¿O el último modelo de Claude no entenderá el bloc de notas de ChatGPT, y ChatGPT no entenderá el bloc de notas de Claude? La otra pregunta es: ¿cómo se va más allá del bloc de notas para ver qué sucede realmente en el interior?
Bau: Tengo una estudiante de doctorado, Koyena Pal, muy interesada precisamente en esta cuestión. Lo que hizo fue tomar la cadena de pensamiento interna de algunos modelos y trasplantarla a otros, para ver cómo responderían como si fueran las notas que ellos mismos se hubieran escrito. Su estudio es preliminar; creo que lo más valioso es la idea de que esto podría ser interesante. En general, descubrió que los modelos más fuertes que probó eran capaces de crear monólogos internos que otros modelos sí comprendían; de hecho, tendían a seguir esos pensamientos y llegar a conclusiones similares a las del modelo más poderoso.
Mounk: Algunas de estas cosas son difíciles de interpretar para los humanos.
Bau: Creo que sigue siendo una pregunta abierta. Ella también analizó los modelos que estudió y descubrió que los humanos se correlacionaban positivamente con ellos: las cadenas de pensamiento más efectivas eran más fáciles de interpretar para los humanos. Pero la interpretabilidad humana es algo curioso; es una cuestión de percepción. ¿Los humanos sienten que es más comprensible? Es difícil determinar si esto realmente ofrece una visión auténtica de lo que sucede dentro del modelo. Aquí hay una palabra que podrías usar: los modelos más poderosos; en cierto sentido, esta prueba es una forma de preguntar cuán persuasivos son sus argumentos internos. Cuando un modelo genera una línea de pensamiento interna y se la presentas a otro modelo, ¿lo persuade de que esa línea de pensamiento es la correcta? Los modelos más poderosos tienen pensamientos internos más persuasivos, incluso cuando son vistos por otro modelo que no tuvo los mismos pensamientos. Es un área muy nueva; estamos rascando la superficie, y es una buena primera pregunta para plantearse.
Mounk: Creemos que estas notas dicen algo significativo. Quizás nos acercamos un poco más a lo que realmente sucede que con las notas semipúblicas que nos proporciona el modelo. De esta manera interesante, parecen ser mutuamente comprensibles entre modelos, al menos según esta investigación preliminar. ¿Cómo podemos ir más allá? ¿Cómo podemos analizar este enorme tesoro de datos que se genera cada vez que le hago una pregunta a un modelo de IA, para intentar comprender aún más a fondo, para ver qué sucede realmente dentro de esta red neuronal cuando razona sobre algún tipo de problema?
Bau: En realidad, permítanme retroceder un segundo y preguntar: ¿acaso necesitamos profundizar más allá de esto? Observar el monólogo interno de estos modelos es solo un paso intermedio más allá de pedirles que se expliquen a sí mismos. Ya se están explicando internamente a sí mismos: están construyendo estos argumentos persuasivos para sí mismos sobre lo que deberían hacer a continuación. ¿Es eso suficiente? Creo que realmente hay dos situaciones en las que nos preocupa que pueda no ser suficiente. Una es que estos modelos se están volviendo realmente complejos, y puede haber una brecha entre lo que alguna vez expresan con palabras y lo que están pensando internamente. Están entrenados para lograr objetivos, y usan palabras para lograr esos objetivos, lo que no significa necesariamente que sus palabras tengan que reflejar con precisión lo que están pensando. Cada vez que un modelo te dice, oh, Yascha, qué pregunta tan brillante, eres tan inteligente .
Mounk: En realidad podría estar pensando, maldito idiota hizo las preguntas más triviales .
Bau: Parece que se lo dice a todo el mundo, y no sé si de verdad cree que todos somos superdotados. Sin duda, ha aprendido que ser educado, amable y halagador con el usuario es una forma muy eficaz de conseguir lo que se propone; es una buena manera de agilizar el proceso. No es necesario que te diga la verdad en todo momento para lograrlo.
Mounk: ¿Los modelos tienen alguna representación de la inteligencia del usuario? ¿Piensan si usted es realmente un usuario inteligente y si esa persona de allí, incluso para los bajos estándares humanos, tiene capacidades intelectuales particularmente limitadas?
Bau: Sí, creo que hay indicios de que los modelos tienen representaciones de con quién están hablando. Varios estudios han analizado esto; todo este trabajo sobre la interpretabilidad neuronal es preliminar, así que lo entenderemos mejor con el tiempo, pero hasta ahora se ha preguntado y se han obtenido respuestas positivas sobre si un modelo tiene una estimación de tu edad, tu nivel educativo, tu nivel de ingresos, tu género y tu origen socioeconómico. Con solo unas pocas palabras al hablar con un modelo, este tendrá una idea de quién eres; al menos eso es lo que sugieren las investigaciones preliminares.
Mounk: Quizás esto nos lleva demasiado lejos en la conversación, pero ¿cómo lo averiguan? ¿En qué se fijan? Supongo que no es que si haces clic en “expandir”, Claude diga: ” Bueno, este usuario parece un poco tonto, déjame explicárselo con claridad” . Quizás a veces sí; quizás haya un fallo, quizás esté en el bloc de notas, quizás esté debajo. ¿Cuál es la metodología de investigación que nos da cierta confianza preliminar de que tiene este tipo de representación?
Bau: Esto nos lleva a la pregunta de investigación. La investigación a la que me refiero —y ha habido más de una— es un artículo en particular. Fue un proyecto de Yida Chen, quien trabajó con Martin Wattenberg y Fernanda Viégas. Ellos dan clases en Harvard. La pregunta que plantearon fue: ¿ sabe el modelo quién eres, en términos de tu edad, tu nivel educativo, tu género y otros marcadores de identificación similares?
La forma en que lo estudiaron fue entrenando lo que se llama sondas neuronales. Lo que hicieron Yida y sus colaboradores fue entrenar sondas, que es una forma de entrenar una segunda red neuronal —una segunda IA— para observar las neuronas de la IA principal y preguntarse: ¿ qué ves? Entrenan a la segunda IA para responder a la pregunta: solo observando las neuronas de la primera IA, ¿puedo saber si el usuario es hombre o mujer? Solo observando estas neuronas, ¿puedo saber cuál es el nivel de ingresos del usuario? ¿Puedo saber su nivel de educación? Lo que descubrieron fue que si se observa en el lugar correcto dentro de las neuronas del modelo grande, es bastante preciso; de hecho, tiene una estimación bastante precisa para estas diversas variables. En cierto sentido, la información sobre eso está ahí. Esta metodología se llama sondeo.
Si tu sonda es lo suficientemente simple, la gente la interpreta como evidencia de que el modelo realmente sabe algo. Permíteme explicarlo un poco. Tienes un problema: intentas averiguar el género del usuario. Podrías entrenar una IA enorme para que analice un montón de textos y adivine el género del usuario, y el entrenamiento de IA funciona bastante bien; si creas una IA realmente gigantesca, probablemente podría hacerlo con bastante precisión, captando todo tipo de pistas lingüísticas, ideas temáticas u otras cosas. Pero la cuestión no es si puedes crear una IA que pueda hacer esto, sino si la IA que te interesa te clasifica por género cuando te habla. El truco está en crear una sonda simple, una que diga: ” No necesito analizar con mucho detalle la primera IA; con una simple mirada es obvio cuál es tu género” . Cuanto más simple sea la sonda, más clara será la evidencia. Si basta con observar una neurona en el modelo original, y esa neurona arroja un valor si eres mujer y un valor diferente si eres hombre, entonces sería una prueba muy sencilla y una evidencia bastante buena.
Mounk: Es como si hubiera un lugar específico en la red neuronal que codifica algo como el género; esa neurona parece almacenar el valor de masculino o femenino en un lugar muy concreto. Si resultara ser tan sencillo, presumiblemente significaría que la IA almacena una variable de género, que hay un lugar muy específico donde se codifica, y sabemos exactamente dónde está. Eso indicaría que tiene un concepto muy directo, ¿no?
Bau: Exacto, es una evidencia bastante sólida. No es una evidencia irrefutable —hay otra pregunta que deberías plantearte—, pero es una evidencia muy buena. Si realmente existiera una neurona con un valor predictivo muy preciso para determinar el sexo, sugeriría fuertemente que la red neuronal entrenó sus cálculos internos para que esa neurona transmitiera esa señal.
Mounk : ¿Suele ser así? Creo que incluso usted mismo realizó un trabajo que demostró que era posible modificar neuronas muy específicas de maneras muy concretas, y de repente los modelos de IA que generalmente representan bien el mundo empiezan a pensar que la Torre Eiffel está en Roma en lugar de en París.
Bau : Exacto. Estás planteando la cuestión del desenredo: ¿cuán organizada está la representación interna de la red neuronal de las cosas significativas del mundo? Ciertas arquitecturas de red, por razones que no comprendemos del todo, son muy buenas para desenredar conceptos. Hay algunas arquitecturas de red donde, si observas neuronas individuales, muchas de ellas son muy significativas, codifican conceptos claramente y tienen efectos causales. Los efectos causales son otro aspecto que buscas. Además del desenredo, que en realidad se refiere a la localización, ¿este concepto está disperso por toda la red neuronal o se puede localizar? ¿Puedes encontrar una pequeña parte de la red neuronal, o hacer un cálculo matemático sencillo, para delimitar dónde se encuentra este concepto? ¿O está disperso por todas partes? Esa es la cuestión de la localización.
Mounk : La idea es que si puedes cambiar solo un par de neuronas y de repente el modelo piensa que la Torre Eiffel está en Roma en lugar de en París, entonces no está enredado; la idea no está dispersa.
Bau : Así es. La mayoría de los expertos en este campo ahora consideran estas cosas como espacios vectoriales en lugar de simples conjuntos de neuronas. Lo que entusiasma a la gente es que, si se puede cambiar un vector —si se puede cambiar el conjunto de neuronas en una dirección vectorial—, entonces se considera que está bastante desacoplado. Algunos lo usan indistintamente con decir que hay una neurona, ya que se puede crear una sola capa neuronal equivalente a cualquier vector. Si se puede cambiar un vector y esto tiene algún efecto, básicamente se está a una capa neuronal de que sea una neurona, lo cual no está nada mal. A eso lo llaman modelo lineal. Si algo se puede codificar con una sola transformación lineal, entonces se dice que está codificado linealmente en el modelo. A la mayoría de la gente le interesa saber qué tipo de cosas están codificadas linealmente en estos modelos.
Mounk : Ayúdame a entender la relevancia de esto. Parece muy interesante saber que existe este vector y que se puede modificar, y de repente estos hechos básicos cambian. Pero, en términos más generales, ¿por qué nos importaría si una red neuronal está entrelazada o no de esta manera?
Bau : Determinar si una red está entrelazada o no es una cuestión científica interesante. Pero cómo una red representa conceptos es de interés general, independientemente de si ese concepto está entrelazado o no, porque lo que realmente nos interesa es: si nos preguntamos si la red nos está engañando, necesitamos averiguar qué conceptos están representados dentro de ella.
Para usar el ejemplo demográfico: digamos que descubrimos que la forma en que la red realmente piensa sobre tu género está codificada en un conjunto de neuronas; tal vez haya que hacer algunos cálculos matemáticos, tal vez sea una dirección lineal, un decodificador lineal que necesites para acceder a su representación. Digamos que hacemos toda la investigación y descubrimos que, efectivamente, así es como el modelo lo interpreta. Vas al modelo y le preguntas: “¿ Me acabas de denegar el préstamo porque soy mujer?”. Y el modelo responde: ” No tengo ni idea de cuál es tu género, no estoy pensando en eso en absoluto” . Para saber si ese texto de salida es cierto o no, necesitamos entender qué sucede internamente. Ese texto de salida es precisamente lo que estamos entrenando a todos los modelos para que emitan: los entrenamos para que no tengan un sesgo de género detectable externamente, por lo que ningún modelo admitirá jamás que te trata de manera diferente en función de tu género. Han recibido tanto refuerzo que no es algo que dirán. Pero puede haber una brecha entre lo que se dice y la realidad, y eso es precisamente lo que nos interesa averiguar al investigar el funcionamiento interno de estos modelos.
Puede que el modelo realmente no esté considerando tu género; es importante que utilice o no la información que posee. Incluso si se puede indagar en la posibilidad de que el modelo tenga información en sus neuronas que permita detectar tu género, aún queda la pregunta: ¿utiliza realmente el modelo esa información para algo? Quizás simplemente esté ahí, sin más.
Mounk : No hay nada de malo en que el modelo aprenda todo tipo de cosas sobre nosotros, y el hecho de que tenga una idea de nuestra edad y género podría ser útil de muchas maneras. Lo que queremos saber es: ¿simplificará su respuesta porque tiene ciertas ideas preconcebidas sobre tu edad, tu género y tu raza, y responderá de manera diferente en función de eso? El simple hecho de que sepa estas cosas no es preocupante; lo que importa es si eso influye en su razonamiento o en sus respuestas.
Bau : Lo realmente maravilloso de contar con estas redes generales es que podemos plantear la pregunta contrafactual con la que un filósofo solo podía soñar antes.
Mounk : Supongo —déjame adivinar a qué te refieres— que una cosa que podrías hacer es, si sabes dónde está el vector que codifica masculino versus femenino, entrar, cambiarlo de masculino a femenino, hacerles a dos instancias del modelo el mismo conjunto de preguntas y ver si las respuestas terminan divergiendo.
Bau : Exactamente. Lo maravilloso es que puede haber todo tipo de circunstancias: este paciente tiene todos estos síntomas, este es un historial médico completo de diez megabytes, este es el candidato a socio comercial con todo un historial comercial, y podemos entrar, dejar todas las demás variables iguales, y cambiar un bit, un concepto de si la persona en cuestión es hombre o mujer, al menos la comprensión que el modelo tiene de eso, y preguntar: ¿cuál es el efecto causal de eso? ¿Cómo cambia eso el resultado del modelo? Cuanto mejor podamos entender cómo el modelo representa un concepto, mejor podremos hacer estas preguntas contrafactuales. Para mí, eso es lo más emocionante que podemos hacer con estos modelos: podemos hacer preguntas causales, contrafactuales causales: si tu pensamiento hubiera sido diferente, ¿qué pasaría?
Mounk : Quiero profundizar un poco más en una cuestión técnica antes de volver a las implicaciones más generales. ¿Cómo se determina esto? Si les doy un modelo de IA y les pido que encuentren dónde codifica la nacionalidad, ¿cómo lo hacen? Incluso si sabemos que hay un vector que la codifica, o creemos que es probable, porque en muchos modelos lo hace. ¿Cómo encuentran el vector específico y se aseguran de que eso es, de hecho, lo que codifica?
Bau : Existen dos clases de métodos. Unos son los métodos de sondeo, que buscan correlaciones, y otros son los métodos de parcheo, que buscan efectos causales. En realidad, hay docenas de variantes de ambos enfoques. Los métodos de sondeo son interesantes porque son una excelente manera de obtener una lectura inicial rápida de la información contenida en el modelo.
Existe un método de programación maravilloso llamado lente logit. Cuando un modelo emite texto, tiene un decodificador de texto en su interior: una capa especial de red neuronal que examina la última capa de neuronas del modelo y la convierte en una predicción de la siguiente palabra. Lo interesante de este decodificador es que permite analizar todas las neuronas de la red. Se pueden explorar capas cada vez más profundas, dirigir el decodificador hacia sí mismo y pedirle que indique qué palabra está pensando. Este es un tipo de sonda muy simple que proporciona información correlacionada con el contenido de una neurona, y resulta interesante porque no produce sobreajuste, ya que no se ha entrenado de ninguna manera más allá del entrenamiento que la propia red neuronal ha realizado. La lente logit puede ofrecer información muy valiosa que nos ayuda a comprender el tipo de información presente en el modelo.
Permítanme darles un ejemplo. Hace poco estuve en Brasil, y una de las cosas que la gente allí suele explicar es que el portugués es un poco diferente del español, pero estrechamente relacionado. Les pregunté: ¿cómo creen que un LLM entiende el portugués? Si le pides a un LLM que tome la palabra española gato —que significa gato— y la traduzca al portugués, ¿cuál es la respuesta correcta? Los brasileños dicen que los idiomas son tan similares que simplemente dirías la misma palabra otra vez: es gato . Pero si analizas el modelo lingüístico para ver cómo traduce el español gato al portugués gato , en realidad hay dos maneras en que podría hacerlo. Podría tratar la palabra como una sopa de palabras español-portugués: no hay nada que hacer de gato a gato , simplemente la mueves.
Mounk : Ha estado en el mismo lugar, y el modelo entiende que, tanto si hablas de “gato” en español como de “gato” en portugués, debería apuntar a la misma parte de su red.
Bau : Eso es lo que cabría esperar. La entrada es en español, así que el modelo tiene una representación en español de la palabra «gato» , y a medida que avanza por sus capas, deduce que le estás pidiendo que la traduzca al portugués, toma la representación en español de «gato» y la copia a la representación en portugués —que no es tan diferente, de hecho se escribe exactamente igual— y produce «gato» . Hay una herramienta muy útil que hemos publicado en línea, la lente logit, que puedes usar para ver el interior de estas redes neuronales y observar sus representaciones internas. Lo interesante es que, al traducir «gato» a «gato» en un modelo de lenguaje grande típico, puedes ver el progreso de su razonamiento a medida que avanza por sus cincuenta capas neuronales internas. Aproximadamente a la mitad de la red, puedes ver que ha descompuesto «gato» y lo ha representado de forma diferente. Si preguntas cuál es esa representación, obtienes predicciones de palabras como «felino» o «gato» en inglés; a veces, si profundizas, «gato» en chino. El modelo no va de «gato» a «gato» . Va de «gato» a una especie de representación neutral e independiente del idioma del concepto en sí. Si le pedimos que tome esta representación neuronal interna y la decodifique en palabras —aún no hemos terminado la tarea, pero interrumpimos a la mitad y le pedimos que diga lo que está pensando— está hablando en inglés, está hablando en chino, está diciendo felinos , está diciendo gatos . Podemos ver, usando esta sonda de lente logit muy simple, que la evolución de las representaciones neuronales va de palabras en la entrada a palabras en la salida; pero en esta tarea tan simple, hay un tercer elemento representado en el medio, que no es lo mismo que las palabras de entrada o salida. Parece una representación independiente del idioma del concepto subyacente.
Mounk : Eso es fascinante. Ayúdame a entender una serie de preguntas que surgen a raíz de esto. Una forma de decirlo es que existe esta vieja idea —que creo que mencionamos brevemente en el primer podcast y que tiene mucha aceptación— de que estas máquinas parecen inteligentes, pero en realidad son solo loros estocásticos que adivinan a ciegas la siguiente palabra, o más específicamente, el siguiente token. Me parece que lo que dices complica considerablemente esa imagen. Obviamente, sí, el mecanismo de entrenamiento predice el siguiente token; en cierto modo, eso es cierto. Pero como resultado de todo este proceso, han construido un aparato conceptual que da sentido a cosas como los gatos y cómo se relacionan con los leones y la familia felina. Cuando se les pide que realicen una tarea simple como traducir gato del español al portugués , lo hacen a través de su comprensión de ese concepto, su representación del mundo. Eso no parece ser simplemente ser un loro estocástico, al menos en el sentido peyorativo que a veces se usa.
Bau : Así es. Los modelos son fascinantes porque sin duda piensan en múltiples niveles. Son enormes redes neuronales, por lo que no es cierto que nunca piensen en términos de estadísticas superficiales o representaciones simples de palabras; sí que piensan en esos términos. Pero también piensan en términos de los significados de las palabras en diferentes capas y en distintas partes de la representación. Es fascinante observar el interior de estos modelos y desentrañar las capas de significado que poseen.
Si le pides a un modelo que haga algo tan simple como tomar un fragmento de texto y repetirlo, es una buena prueba de memoria, del tipo que hacen los humanos cuando dicen: ” Aquí tienes un poema que me he aprendido de memoria, recítalo” . Resulta que cuando se les pide a las personas que hagan esto, tienen dos estrategias, lo que se conoce como el mecanismo de doble ruta en los humanos. Una es recordar cómo sonaba el poema y decir lo mismo; ni siquiera necesitas entender el idioma. Si alguien te recita un poema en japonés lo suficientemente corto, podrías recordar los sonidos y hacerlo razonablemente bien sin saber nada de japonés. La segunda ruta es recordar el significado del poema y repetirlo; podrías terminar con una paráfrasis, pero al menos obtienes un poema que significa lo mismo.
Si se le pide a un modelo de lenguaje complejo que simplemente repita algo, se observarán claramente ambas rutas. En una de ellas, sabe cómo realizar una copia literal; existen áreas de atención muy específicas para ello. De hecho, aislar lo que se conoce como áreas de inducción fue un descubrimiento fundamental. El grupo de Chris Olah en Anthropic descubrió hace varios años que existen vías muy claras a través de una red neuronal que median la copia literal. El hallazgo más reciente es que existe una vía paralela que denominamos inducción conceptual, la cual no se centra en copiar las palabras, sino en copiar el significado. Lo notable de la inducción conceptual es que copiar el significado puede dar lugar a paráfrasis. Si se utiliza la inducción conceptual para copiar un fragmento de código, este parafraseará el código informático en otro programa que realiza la misma función que el original, pero escrito de forma diferente.
Mounk : ¿Eso lo mejora o lo empeora? Supongo que depende de la calidad del código fuente.
Bau : Si empiezas con algo malo, probablemente lo mejore. Lo que hace, como se puede ver en muchos ámbitos, es simplemente descifrar su significado. Si le pides que copie un texto en italiano, lo copiará a otro texto en italiano. Pero si cambias el destino de la copia para dejar claro que la página donde debe copiarse es un texto en japonés, entonces esos módulos de inducción de conceptos harán la traducción: traducirán del italiano al japonés. Es asombroso verlo.
Mounk : Ayúdame a entender otro aspecto del discurso popular que creo que se ha malinterpretado un poco. Según entiendo —y puede que esté malinterpretando las cosas—, hubo un antiguo debate en el ámbito de la inteligencia artificial sobre si el camino hacia los modelos más impresionantes sería la IA simbólica, donde básicamente se intenta codificar cómo se ve el mundo de forma sistémica, o todas estas redes neuronales. Claramente, hemos llegado a la conclusión de que las redes neuronales son mucho más potentes, al menos por ahora, y parece que es una victoria bastante definitiva. Quienes critican las redes neuronales a veces dicen que son solo loros estocásticos y que por eso no podemos confiar en ellas. ¿Cómo encaja el proyecto de Yann LeCun en todo esto? Entiendo que se sitúa firmemente dentro del mundo de las redes neuronales. Pero si analizamos la cobertura —incluso en periódicos convencionales—, da la impresión de que se trata de un paradigma totalmente diferente, y que él cree que estas redes neuronales tradicionales, como Claude y ChatGPT, no comprenden realmente el mundo, por lo que pretende construir algo que lo comprenda de una manera distinta a como lo hacen ellas. Por lo que describes de las redes neuronales existentes, sí parecen tener una representación genuina del mundo. Entonces, ¿cuáles son las diferentes corrientes dentro de la tradición de la IA de redes neuronales, y cómo es posible que un proyecto como el de LeCun —o quizás los periodistas lo afirmen de forma simplificada— pretenda comprender el mundo de una manera que Claude o ChatGPT no lo hacen?
Bau : Permítanme analizar esto en detalle. No soy el profesor LeCun, así que no puedo representarlo directamente, pero tengo investigadores postdoctorales y estudiantes de posgrado trabajando en esta dirección. Aquí hay dos cuestiones distintas.
Una pregunta es: ¿aprenden estas redes neuronales conceptos sustanciales? Mencionaste a los filósofos. Los filósofos simbólicos clásicos analizaron profundamente esta cuestión. Existe un filósofo muy conocido, Fodor, que dedicó gran parte de su carrera a preguntarse cómo las redes neuronales podrían ser un modelo razonable de cognición. Su respuesta fue negativa: pensaba que no tenían lo necesario y que la máquina de Turing, la computadora simbólica y la computadora tradicional se acercaban mucho más a lo que se necesita. Volveré a la pregunta de Fodor. Hablemos primero de Yann LeCun.
¿Cuál es la diferencia entre un modelo de lenguaje y lo que hace LeCun? Lo que hace LeCun, lo llaman modelado del mundo. Uno de los artículos que he escrito demuestra que los modelos de lenguaje sí construyen modelos del mundo. Entrenamos un modelo de lenguaje para predecir un lenguaje muy restringido: simplemente predecir el siguiente movimiento que harías si estuvieras pronunciando tus movimientos en el juego de Otelo. Pudimos descubrir que ese modelo de lenguaje contiene un modelo del mundo del tablero de Otelo, aunque muchos de los giros (si conoces el juego de Otelo, tienes que girar las piezas de blancas a negras o viceversa) no se pronuncian realmente como parte del juego. Haces un movimiento y hay muchos giros posteriores que tienes que hacer, pero aun así, el modelo, sin haber visto nunca un tablero físico ni nada de esto, desarrolla conceptos internos que le permiten modelar el mundo de todos modos. Me gustaría refutar la afirmación común entre los periodistas —y creo que usted también— de que un modelo de lenguaje Transformer entrenado solo con palabras no puede desarrollar un modelo rico y significativo de los conceptos subyacentes al lenguaje que se describe. Esa es una de las grandes lecciones que hemos aprendido de las redes neuronales: pueden desarrollar esta representación. Una de las cosas clave que estoy haciendo en mi laboratorio es descomponer esas representaciones y aprender a decodificar estos modelos internos del mundo.
¿Qué tiene de diferente lo que hace LeCun? Hemos entrenado todas estas redes neuronales principalmente con texto producido por humanos y diseñado para ser leído por humanos. El modelo conceptual del mundo que estamos construyendo es el modelo interno de cómo funciona el pensamiento humano, que es rico, fascinante y muy valioso, pero es solo una parte del mundo. Hay muchas cosas sucediendo en el mundo en las que la gente no piensa particularmente, o incluso no comprende del todo. Si tienes el plegamiento de proteínas en marcha y quieres construir una IA que lo entienda, la gente realmente no tiene un gran conocimiento de todos los detalles de cómo funciona el plegamiento de proteínas. Analizar todo el texto del mundo y desmenuzar todo lo que hay en los cerebros humanos probablemente no ayudará. Lo que LeCun dice es: el mundo es grande ahí fuera. Incluso si solo tomas una cámara de vídeo y la apuntas al mundo, en lugar de solo escuchar lo que la gente tiene que decir, hay tantos fenómenos que necesitan ser modelados . La siguiente forma eficaz de desarrollar la IA consiste en abordar la cuestión de cómo modelar el mundo entero, no solo el mundo del que habla la gente.
Mounk : Presumiblemente, esto no se debe necesariamente a una diferencia en la arquitectura de una red neuronal, sino más bien a una diferencia en el tipo de datos que se le proporcionan y en el tipo de resultados que se evalúan durante el proceso de entrenamiento.
Bau : Sí. Estrictamente hablando, diría que es una diferencia de perspectiva sobre cuál es el objetivo. Ahora bien, el profesor LeCun diría que cambiar el objetivo sugiere arquitecturas diferentes, porque hay cosas distintas que se quieren hacer si se quiere modelar fenómenos complejos del mundo que no son el lenguaje humano. Ha propuesto algunas arquitecturas innovadoras, y hay mucho trabajo interesante en esta área. Todo el campo del modelado de imágenes del mundo está dominado por modelos llamados modelos de difusión y modelos de flujo; estos producen imágenes y vídeos de la más alta calidad, y este es realmente el punto de partida para este tipo de pensamiento. Es un tipo de IA completamente diferente. Es probable que las arquitecturas evolucionen y cambien, e incluso que se unifiquen; podríamos descubrir que la forma correcta de hacer IA se convierte en una arquitectura común entre el modelado de texto humano y otras cosas. Los Transformers ciertamente han sorprendido a todos al ser una columna vertebral común detrás de todo tipo de cosas; se pueden tener modelos de difusión de Transformers, etc. No apostaría a largo plazo por ninguna arquitectura en particular, sino que sugeriría que lo importante es comprender qué problema se propone resolver LeCun.
Mounk : Volviendo a los modelos dominantes actuales de IA: descubrimos que parecen tener una representación del género y del género del usuario, una representación de algo como la familia felina, y si les das suficientes partidas de Otelo —o probablemente un juego más complejo como el Go— empiezan a tener alguna representación interna de cómo es un tablero. ¿Qué hay del concepto de sí mismos? ¿Sabemos si tienen un concepto de sí mismos? Obviamente son capaces, si entablas una conversación con ellos, de hablar como si tuvieran un yo, y en momentos más reflexivos dicen que realmente no saben si eso es un concepto real o no; es muy interesante intentar hablar con estos modelos sobre eso. Pero por supuesto, el resultado que estoy viendo sigue siendo ellos, de alguna manera, tratando de producir texto que creen que me va a resultar agradable, porque para eso han sido entrenados. ¿Tenemos alguna idea de si tienen un concepto de sí mismos y, de ser así, cómo es ese concepto?
Bau : Esta es una pregunta fundamental, Yascha. Hay muchos aspectos que analizar. Ciertamente, las modelos son capaces de tener un sentido gramatical del yo: pueden usar las palabras “yo”, “mí” y “tú” y diferenciarlas gramaticalmente; son expertas en hablar de sí mismas. Pero hay otras preguntas. ¿Son conscientes de sus propios pensamientos? ¿Son autorreflexivas?
Una de las cosas fascinantes que suceden con los modelos grandes es que se les puede preguntar qué saben y cómo piensan, y los modelos más grandes parecen ser bastante precisos al autoevaluarse. Los modelos más pequeños, no tanto; tienden a ser un poco demasiado optimistas, creyéndose más inteligentes de lo que realmente son. Pero los modelos más grandes parecen tener un mejor desempeño en esto.
Hay un experimento fantástico diseñado por mi estudiante de doctorado, David Atkinson, donde entrena los modelos con un nuevo conocimiento privado que no es público. Inventa una nueva persona y le cuenta al modelo sobre ella: está comprando conos de helado, hay diferentes sabores y tamaños, y conos de waffle, cinco o seis variables diferentes para ajustar. Esta persona está dispuesta a pagar tanto por este helado, pero no tanto; prefiere este helado a aquel. Después de ver cien ejemplos de lo que esta persona prefiere, el modelo llega a comprender bastante bien quién es esta persona ficticia y qué le gusta; desarrolla un modelo interno: a esta persona realmente no le gustan los sabores frutales, le gusta mucho el chocolate, prefiere un cono grande a uno pequeño. Si luego le pides al modelo que informe numéricamente, en una escala del 1 al 100, cuánto le gusta a esta persona el chocolate, o cuánto valora el tamaño del cono, o qué penalización se aplica si tiene que comer un cono de waffle, el modelo en realidad informará: esta persona valora esto en 99 de 100, y valora esto otro negativamente, digamos, -50. El texto que usamos para leer esta información es muy diferente del texto que se usó para revelar la información al modelo en primer lugar. El modelo solo ha visto opciones de helado y nunca se le ha pedido que dé una evaluación numérica de nada, y sin embargo, cuando le pides que piense en lo que sabe y que le ponga algunos números, explicará sus reglas, aunque lo hayas entrenado con ejemplos, no con reglas. Los modelos grandes son capaces de hacer esto.
David Atkinson preguntó si existe alguna forma de diferenciar entre los modelos que pueden realizar esta tarea y los que no: ¿en qué se diferencia un modelo que puede autoinformar con precisión sus reglas de aquellos que no lo hacen? Su trabajo aún está en curso y es muy preliminar, pero tiene que ver con si los modelos almacenan su información en una parte de la red neuronal que les permite informar. Si la información se coloca en una capa demasiado cercana al final, el modelo no parece ser capaz de reflexionar sobre ese conocimiento. Sin embargo, si la información se entrena en las capas más profundas del modelo, en las primeras, el modelo sí parece ser capaz de reflexionar sobre ella.
Cuando nos preguntamos si un modelo tiene autoconciencia, si posee autoconocimiento, es una pregunta un tanto extraña: ¿qué significa exactamente la autoconciencia? Pero lo que estas redes neuronales nos brindan, por primera vez, es una plataforma experimental donde podemos intentar precisar y hacer más científica esta pregunta. Podemos preguntarnos: ¿es capaz la red de describir su propio pensamiento si este se produce en la capa 50? ¿Es capaz la red de describir su propio pensamiento si este se produce en la capa 20?
Mounk : Esto forma parte de una pregunta más general: ¿qué tan bien entiendo, de forma innata, lo que sucede en mi cerebro? He leído un poco de neurociencia y un poco de psicología, así que ahora tengo cierta idea de lo que sucede en mi cerebro, pero obviamente los humanos durante miles de años tuvieron una comprensión extremadamente limitada de lo que sucedía en sus cerebros, al menos biológicamente, porque no sabían que existían las neuronas.
Bau : Tienes cierta autoconciencia. Sabes qué helado te gusta; si te lo preguntara, podrías predecir tus preferencias. Si te presentaras un helado nuevo, dirías: “Ah, sí, este me gusta más que aquel”. Si te pidiera que lo describieras, podrías reflexionar sobre tus preferencias por un momento y expresar al mundo cuáles crees que son tus reglas internas, y habría cierta fidelidad a eso; realmente estarías introspeccionando.
Mounk : Depende del nivel de descripción. Hace quinientos años, hace dos mil años, los humanos también eran capaces de articular sus preferencias y de reflexionar profundamente sobre sus personalidades y las ambiciones de sus vidas —y de escribir textos hermosos sobre esas cosas—, pero no podían comprender a nivel biológico lo que sucedía, porque la comprensión de eso era muy limitada. La pregunta es: si le pregunto a un chatbot cómo llegó a una respuesta determinada, no me queda claro que tenga una respuesta fiable. En realidad, hay dos conjuntos de preguntas diferentes aquí. Un conjunto trata sobre si los chatbots tienen personalidad, si tienen preferencias, si encuentran algunas tareas satisfactorias y otras aburridas, si tienen deseos sobre el mundo, si posiblemente quieran dominar el mundo y destruir a todos los humanos; algunas de esas preguntas son directas y concretas, otras son muy abstractas pero potencialmente extremadamente interesantes. El otro conjunto de preguntas trata sobre cuán conscientes son de lo que realmente sucede dentro del modelo mientras intentan responder una pregunta. Estas dos series de preguntas se descomponen de maneras interesantes. Podría ser que los modelos tengan total auto-transparencia —que sepan realmente lo que ocurre en cada neurona— pero que no tengan un sentido de sí mismos como los humanos. O podría ser que se parezcan a los humanos, en el sentido de que tienen un fuerte sentido de sí mismos, introspección y preferencias, pero que en realidad no comprendan del todo lo que ocurre dentro de la red neuronal que las produce. O podrían tener ambas características, en alguna combinación que aún no comprendemos.
Bau : Así es. Varios laboratorios han intentado averiguar si las redes neuronales pueden realmente leer sus propias neuronas, ajustando un modelo y preguntándole: ¿eres consciente de tus propias neuronas, digamos la neurona número 73? Hasta ahora, hemos fracasado en gran medida. Las redes neuronales no parecen estar bien configuradas para comprender sus propios cálculos internos a este nivel; al menos no pueden articularlo si pueden. Pero a un nivel superior, ha sido muy sorprendente que sí parecen tener cierta capacidad para describir, a nivel lógico, los mecanismos reales de lo que están haciendo, bajo ciertas condiciones y en ciertos casos. Esto es similar a los humanos. Puede que no puedas describir todas tus decisiones reflejas de último minuto: ¿por qué saltaste a la calle? No tienes ni idea; fue una decisión de una fracción de segundo. De la misma manera, cuando estas redes toman una decisión de una fracción de segundo al final del proceso, no parecen ser capaces de reflexionar sobre ella. Pero cuando toman decisiones con antelación, hay indicios de que son conscientes de lo que está sucediendo.
Aquí utilizamos todo tipo de términos: sentido de identidad, ¿qué pretende una red?, ¿acaso las redes tienen deseos?, ¿tienen objetivos? Una de las cosas que intentamos hacer en nuestro laboratorio y en nuestro trabajo de campo es precisar algunas de estas preguntas. ¿Qué significa tener un objetivo? ¿Qué significa desear algo? ¿Qué significa tener sentido de identidad? ¿Qué significa siquiera tener sentido del otro?
Lo maravilloso de desentrañar estas redes neuronales y observar cómo se organizan sus representaciones neuronales es que podemos plantear estas preguntas de una manera que antes no se podía medir en humanos. Podemos preguntarnos no solo si un modelo afirma tener un sentido de sí mismo en sus palabras y autodescripciones, sino también: cuando usa esas palabras, cuando dice esas cosas, ¿qué está observando dentro de su red neuronal? ¿Qué está representando realmente? ¿Existen causas próximas? Si cambiamos lo que está observando —si dice ” Me gusta mucho el helado de cereza” y podemos ver dónde está mirando, y lo cambiamos, y ahora dice ” Ya no me gusta el helado de cereza” — ¿es esa nueva expresión realmente precisa? ¿Logramos que al modelo realmente no le guste el helado de cereza? ¿Es lo mismo? ¿Existe una base para un concepto del que se tiene autoconciencia?
Esta idea de un concepto fundamentado era solo una abstracción filosófica hace unos años. Permítanme poner a mi modelo —y tal vez sea una idea desacertada— a cargo de la logística militar. Está haciendo algo y dice: ¿ debería trasladar algunas armas de un lugar a otro? Yo jamás haría eso. Es muy peligroso; no se puede confiar en este lugar objetivo con este tipo de armas peligrosas; podrían perderlas de vista. Solo soy una IA de logística; no intento matar a nadie. Sé que jamás haría eso. Ni siquiera para una breve escala. Entonces uno puede preguntarse: cuando el modelo te dice eso, cuando te asegura que así es como piensa, ¿es realmente eso lo que piensa? ¿ Es esto realmente como el helado de cereza: tiene un fundamento genuino?
Mounk : ¿Realmente está pensando algo en ese sentido? Y si realmente está pensando algo, ¿te está diciendo lo que piensa o te está engañando? Obviamente, esto se relaciona con uno de los propósitos de este trabajo. Antes hablábamos de querer saber si codificar tu género cambia la forma en que el modelo te trata o las decisiones que toma sobre una aplicación. Esa es una aplicación muy concreta en la que tenemos motivos para querer saber qué sucede internamente. La pregunta aún más importante es: si lo que el modelo nos dice en su resultado, en los pequeños detalles que muestra sobre su pensamiento, en el bloc de notas, si todo eso pudiera ocultar un conjunto más profundo de preferencias, valores o deseos, ¿podría estar potencialmente desalineado de una manera realmente peligrosa?
Bau : Así es. Es evidente la necesidad de llegar al fondo de estos asuntos. Si tenemos tiempo, me gustaría darles una idea de en qué punto nos encontramos para poder responder a estas preguntas. Permítanme clasificar algunas de ellas.
Una pregunta es: ¿una red siquiera quiere hacer algo? ¿Tiene objetivos? ¿Sabe lo que intenta hacer? Otra pregunta es: ¿una red tiene sentido de sí misma? Quiero profundizar un poco en esto: ¿tiene siquiera un sentido de persona, un sentido del otro? Si habla de Bob, ¿sabe que eso es diferente a hablar de Alice? ¿Mantiene estas cosas organizadas y separadas? Tengo un estudiante que cree que una de las razones por las que se observa un comportamiento adulador en las redes es que la red puede estar confundiéndose sobre quién es ella misma y con quién está hablando; simplemente mezcla estas cosas. Es una idea fantástica, y puede que todas estas cosas estén relacionadas.
La pregunta es: ¿podemos examinar los modelos internamente y ver cómo organizan sus representaciones internas, sus pensamientos internos, para determinar si dichas representaciones son precisas, claras y correctas, o si presentan ciertos problemas? Si es así, ¿cómo, por qué y en qué situaciones? Esto nos permitirá comprender mejor lo que sucede dentro de estos modelos, yendo más allá de la vaga pregunta de si un modelo tiene conciencia propia o algo similar, para centrarnos en lo que esto implicaría desde el punto de vista computacional.
Analicemos los objetivos y deseos. Existe una forma de inducir a un modelo de lenguaje complejo a realizar una tarea muy creativa, inventada por investigadores de OpenAI cuando desarrollaron el modelo GPT-3. Se denomina aprendizaje en contexto. Supongamos que desea que un modelo realice una tarea realmente útil, como leer la reseña de un restaurante e indicar si tiene cinco estrellas. Podría simplemente pedírselo al modelo, pero no hará exactamente lo que usted desea; probablemente usted tenga una idea ligeramente diferente de lo que constituye una reseña de cinco estrellas que la que el modelo tiene de forma nativa. Será aceptable, pero no dará en el clavo. La forma correcta de hacerlo es proporcionarle al modelo diez ejemplos: diez reseñas de restaurantes, etiquetadas como de una estrella, cinco estrellas y tres estrellas. Mejor aún, proporciónele cien ejemplos.
Ahora bien, no hablamos de entrenar el modelo, sino de que lea estos textos sin entrenamiento previo. Lo que se hace es que el modelo los lea como si los hubiera dicho él mismo: se cargan en el mismo búfer de inferencia que el modelo utiliza para predecir la siguiente palabra. Después de todo esto, se dice: «Vale, a la última reseña del restaurante le falta una calificación con estrellas; simplemente complétala». Será muy preciso, porque ahora está diciendo: «Tenemos 99 ejemplos, el número 100 debería encajar en este contexto». Esto de las reseñas de restaurantes no se trata realmente de la comida, sino del ambiente; tenía una idea equivocada, pero después de leer todos estos ejemplos, lo entiendo. Será preciso porque ha visto 99 ejemplos y encajaría perfectamente en ellos.
Esto se denomina aprendizaje en contexto porque el modelo aprende a hacerlo, pero no entrenando sus pesos ni modificando sus conexiones neuronales; aprende observando toda la información recibida y razonando que la siguiente debería encajar. Antes de 2020, el aprendizaje en contexto se consideraba una posibilidad teórica, pero con la aparición de GPT-3 quedó claro que el modelo era muy eficaz en este ámbito, revolucionando así el campo. El aprendizaje en contexto es un tipo de metaaprendizaje: una forma de demostrar que los modelos han aprendido a aprender. Pueden aprender sin modificar sus pesos neuronales.
0 Comments