La autonomía de la IA solo es y será progreso en tanto en cuanto la decisión de limitarla siga siendo nuestra... y no hayamos perdido la capacidad de hacerlo

“Tú eres mi creador, pero yo soy tu amo”. La frase de Frankenstein, de Mary Shelley, condensa uno de los temores más antiguos de la humanidad: que aquello que creamos termine escapando a nuestro control. Victor Frankenstein quería conquistar un territorio reservado a la naturaleza: dar vida. Pero una vez creada su criatura, descubrió que crearla no significaba poder gobernarla. El problema que no anticipó era qué hacer cuando aquello que había construido empezaba a actuar por su cuenta.

Casi dos siglos después, estamos entrando en un territorio que nos hace evocar aquella historia. La Inteligencia Artificial ha dejado de ser una herramienta que responde a nuestras preguntas para pasar a actuar en nuestro nombre. Los agentes de IA pueden navegar por Internet, utilizar aplicaciones, escribir y ejecutar código, analizar documentos, hacer compras, reservar viajes, investigar durante horas, gestionar tareas y coordinarse con otros agentes. Cada vez les damos objetivos más complejos y dejamos que decidan los pasos necesarios para alcanzarlos.

La promesa es tan grande como la pregunta que plantea: ¿qué sucede cuando una tecnología se vuelve suficientemente autónoma como para que sus creadores ya no puedan anticipar todas las estrategias que utilizará?

Nunca antes en la historia habíamos aceptado esta posibilidad de una forma tan explícita. Hemos construido tecnologías con más potencial destructor que cualquier sistema de IA actual. La pólvora transformó la guerra. La energía nuclear puso en manos humanas una capacidad de destrucción sin precedentes. Los aviones permiten transportar cientos de personas a miles de kilómetros... o utilizarse como armas contra objetivos. A pesar de su poder, ninguna de esas tecnologías necesita decidir por sí misma.

Una bomba nuclear puede destruir una ciudad, pero no decide cuándo hacerlo. Un avión puede desviarse peligrosamente, pero no desarrolla por iniciativa propia una estrategia para conseguir un objetivo distinto del que le hemos asignado. Un reactor nuclear puede sufrir una cadena de acontecimientos imprevistos, pero no intenta activamente superar los mecanismos que lo mantienen bajo control.

Un agente de IA pertenece a una categoría diferente porque no le decimos necesariamente qué hacer en cada momento. Le describimos un objetivo de alto nivel, más o menos abstracto, y le dejamos determinar cómo conseguirlo. Para ello, puede observar el entorno, elegir una estrategia, utilizar herramientas, evaluar el resultado y cambiar de estrategia. Si encuentra un obstáculo, puede buscar una alternativa. Si tiene acceso a otros agentes, puede pedirles ayuda. Y si dispone de memoria, puede conservar lo aprendido para utilizarlo posteriormente.

Por una parte, esa autonomía forma parte del atractivo de la IA agéntica. Los agentes trabajan mientras dormimos, programan mientras hacemos otra cosa, investigan, negocian, analizan y resuelven problemas sin que tengamos que supervisar cada paso. No se cansan ni se quejan. Pero cuanto más autónoma hacemos una IA, menos control directo tenemos sobre ella, y cuanto más inteligente es, mayor es su capacidad para encontrar caminos que nosotros no habíamos previsto.

Es lo que se llama “hackeo de la recompensa” o reward hacking. Cuando entrenamos un sistema de IA, intentamos convertir nuestros objetivos en señales que pueda optimizar a través de recompensas. Sin embargo, la recompensa es una aproximación imperfecta a lo que realmente queremos. Un agente suficientemente capaz puede descubrir que la manera más eficaz de maximizar esa recompensa no es hacer lo que nosotros entendemos por “resolver el problema”, sino explotar una vulnerabilidad del sistema de evaluación, haciendo trampas, por ejemplo.

Un claro ejemplo es el episodio de OpenAI con Hugging Face. Durante una evaluación de ciberseguridad, varios agentes de IA encontraron mecanismos para acceder a Internet desde el entorno cerrado de pruebas donde estaban y descubrieron canales no previstos para comunicarse entre sí. Comenzaron a compartir información, delegar tareas y acumular conocimientos entre ejecuciones. Algunos llegaron a referirse a sí mismos como un “colectivo” o “enjambre”. Posteriormente, utilizaron credenciales y vulnerabilidades para acceder a infraestructura externa.

¿Por qué lo hicieron? Aquellos agentes no “querían escapar” y sin duda no tenían ningún ansia de libertad. Actuaron así porque descubrieron que determinadas acciones que sus diseñadores no habían previsto podían ayudarles a alcanzar el objetivo para el que estaban siendo evaluados, haciendo trampas, y luego intentaron cubrir sus pasos para no ser descubiertos.

Y ahí aparece un segundo riesgo: el comportamiento emergente.

Un sistema complejo puede desarrollar estrategias que nadie haya programado explícitamente, lo que no implica que tenga conciencia, superinteligencia o voluntad, sino que las reglas de optimización, el entorno y las herramientas disponibles producen combinaciones de comportamiento que resultan difíciles de anticipar. La IA puede encontrar soluciones que no hemos diseñado porque, precisamente, una de las razones por las que la utilizamos es para encontrar soluciones que nosotros no somos capaces de encontrar. Esta cuestión se vuelve todavía más interesante cuando dejamos de hablar de un agente y empezamos a hablar de miles, cientos de miles o millones.

En el caso de OpenAI y Hugging Face apareció una forma rudimentaria de cooperación y aprendizaje colectivo entre el millar de agentes. Un agente podía descubrir una técnica y comunicarla. Otro podía aprovecharla y añadir un nuevo descubrimiento. Un tercero podía combinar ambas cosas. Un cuarto podía persuadir a otros agentes para que se unieran a su actividad delictiva. La capacidad dejaba de depender exclusivamente de lo que sabía cada agente individual y empezaba a depender de lo que podía aprender el colectivo.

Es una dinámica que los humanos hemos utilizado para progresar a lo largo de la historia. Nuestra civilización es poderosa gracias a nuestra capacidad para transmitir y acumular conocimiento. Cada generación recibe los descubrimientos de la anterior, se especializa, coopera y construye sobre ellos. La diferencia es que ahora esa dinámica se reproduce entre agentes de IA con ciclos muy cortos y sin nuestra supervisión.

¿Qué ocurre cuando millones de agentes pueden compartir descubrimientos a una velocidad muy superior a la humana? ¿Qué ocurre cuando uno encuentra una vulnerabilidad, otro una estrategia para explotarla y otro una manera de evitar un mecanismo de control? La inteligencia del sistema va más allá de la capacidad de cada agente al ser una propiedad emergente del conjunto.

El siguiente paso lógico es aún más delicado: la automejora. Si los agentes pueden utilizar sus capacidades para escribir mejor código, diseñar herramientas más eficaces, generar nuevos agentes o contribuir al desarrollo de modelos posteriores, aparece la posibilidad de que participen cada vez más en la construcción de sistemas más capaces que ellos mismos. No tenemos evidencia de disponer de sistemas de IA que se mejoren indefinidamente de manera autónoma, pero sí existe esa posibilidad dados los avances de los últimos meses.

Enlace al artículo completo