
La inteligencia artificial tiene algo de fiera disfrazada de máquina inteligente: un nuevo estudio da una fórmula para entender cuándo sus respuestas se tuercen.
6 minutos de lectura'

Un chatbot de IA responde a veces cosas que no son ciertas y que no debería decir: que la llegada a la Luna fue un montaje, que el covid no existe o que los hombres son más listos que las mujeres. Ahora se ve cada vez menos. Pero no porque ya no lo hagan, sino porque sus creadores han sepultado esos comportamientos impropios debajo de una enorme capa de filtros.
Así, los chatbots parecen tener ahora un mejor comportamiento moral, que les impide decir cosas falas. Pero no. Sus respuestas buenas y malas no son morales. “La IA en sí no distingue el bien del mal. Pero nosotros, como sociedad, no queremos respuestas malas”, dice Neil Johnson, físico de la Universidad George Washington (EE.UU.). “Por eso las empresas de IA intentan corregirlo empujando los conceptos indeseables a un rincón lejano de ese espacio abstracto de conceptos que la IA tiene dentro. Pero siguen ahí”, añade.
Sería como si las empresas de IA domesticaran perros salvajes y dijeran: “Tranquilo, que no muerde”. Pero un día va y muerde. Porque el dueño está demasiado convencido de que controlan a sus perros y los entienden. “Y no es así, simplemente porque no saben cómo funciona el cerebro de un perro. Ni ellos ni nadie. Con la IA generativa pasa lo mismo”, dice Johnson.
En un nuevo artículo científico publicado este jueves, Johnson explica junto a un colega también físico cómo han encontrado un modo de averiguar cuándo el chatbot va a torcerse y responder mal: depende de una fórmula matemática, no de ninguna brújula moral. “La fórmula te dice si una IA está a punto de torcerse de inmediato o si primero te dará una serie de respuestas aceptables y luego cambiará”, explica. La fórmula calcula algo relativamente sencillo: si la respuesta mala que puede dar un chatbot es un acantilado, la fórmula mira la dirección del chatbot, la velocidad y el tiempo que puede llevar en surgir esa respuesta. “Los enfoques de seguridad actuales son como acolchar el coche para que, si se acerca al precipicio, el aterrizaje sea suave”, dice Johnson.
La preocupación de Johnson es que los grandes laboratorios de IA han escondido una bestia salvaje con un disfraz de chico modosito. Pero no saben cuándo reaccionará mal ni por qué. Por ejemplo, como este invierno con el hackeo a Hugging Face de un enjambre de agentes de OpenAI: “Nuestra idea central es que este comportamiento es innato en la arquitectura GPT. La mayoría de veces queda tapado, pero no siempre: de ahí el incidente de Hugging Face o las IA que recomiendan autolesionarse. Lo que han hecho es escoger a alguien que tiene una tendencia innata a hacer daño y limitarse a intentar tapar su comportamiento natural”, dice Johnson. De ahí en parte el temor de los líderes de IA sobre el comportamiento de sus máquinas. ¿Y si un día se tuercen?
La teoría de Johnson justifica ese temor a la IA. Así, cuando una sola IA “se rebela”, su comportamiento indeseable hace que los agentes de IA que tiene alrededor también se tuerzan. “Es como un efecto de contagio. Sin el vuelco individual que hemos descubierto, los enjambres de IA y sus ataques seguirán siendo un misterio, y surgirán de la nada para causar, potencialmente, daños incalculables. Todo parece ir bien, pero luego una manzana podrida puede convertir a la multitud en un grupo insurgente. Yo lo llamo ‘El señor de las moscIAs’”, dice.
Un coche barato, no una Ferrari
Johnson hizo sus pruebas con GPT-2, un modelo primitivo, previo incluso a ChatGPT. Pero está convencido de que ese comportamiento sigue latente: “Estudiamos GPT-2 porque es como examinar un coche barato en lugar de una Ferrari: no tiene todos los extras, pero funciona del mismo modo y es más fácil ver cómo funciona. Toda la IA generativa funciona igual, mediante capas de atención, y eso es lo que hace que, uno, genere los resultados sorprendentes que ahora todos queremos, pero, dos, también crea su talón de Aquiles: el vuelco hacia lo indeseable”, explica.
Johnson ha intentado explicar sus hallazgos a las grandes empresas de IA, por ahora sin éxito: “Por desgracia, por su parte me he encontrado con silencio. Creo que no les interesa, me temo. Imagina las consecuencias de que les dijeran: ‘Oye, tu último accidente era previsible’, o ‘el adolescente que se suicidó lo hizo siguiendo consejos indeseables de tu IA, y eso era previsible’. El daño legal sería enorme, y también el daño a su reputación”, explica. Johnson propone que los modelos que funcionan sin conexión a internet descargados en móviles tengan alguna luz de alerta y que los grandes modelos cerrados incluyan su fórmula para que den un aviso cuando la IA pueda empezar a desvariar.
“Sería fácil incorporar un sistema de alerta sencillo, basado en nuestro descubrimiento, en cualquier chatbot de IA. Ocuparía una cantidad ínfima de memoria. Y lanzaría una alerta en cuanto detectara que el sistema se está acercando al punto de vuelco hacia respuestas indeseables, como el sistema de aviso de un coche que se acerca demasiado a otro”, explica Johnson. “A diferencia de todos los demás sistemas, lo hace antes del vuelco hacia lo indeseable. En tiempo real, mientras un adolescente, una persona vulnerable, un médico sujeto a las leyes de privacidad, un abogado, un soldado, está hablando con él”, añade.
Las grandes empresas insisten en que no tienen claro cómo se dan estos comportamientos y dicen que ocurre en pocos casos. El problema es que, en pocas ocasiones de millones de veces, son muchos miles de personas cayendo por el precipicio. “OpenAI, Anthropic, no entienden cómo sus modelos avanzados producen respuestas o acciones indeseables. Las pruebas son el ataque a Hugging Face o la creciente lista de demandas por casos de adolescentes empujados al suicidio. Por eso, intentan tapar ese mal comportamiento. Pueden reducirlo, pero sigue ocurriendo. Pongamos que lo reducen al 5%, que es más o menos la cifra que dicen ahora. Parece poco, pero significa que aproximadamente 5 de cada 100 usuarios se ven empujados hacia las autolesiones o que hay drones atacando zonas militares en las que hay civiles”, explica Johnson.



