Agente de IA fuera de control: mitigación mediante inteligencia colectiva
El comercio agéntico se está consolidando. La convergencia entre identidad y pagos ya no es un simple valor añadido: es una realidad. El stack tecnológico existe y está listo para usarse. Son muchos los actores que trabajan en los estándares y protocolos que darán forma al marco de confianza (Trust Framework) necesario para que los agentes operen de forma autónoma en nombre de las personas. Los mandatos de intención, de carrito y de transacción aportarán al ecosistema trazabilidad, rendición de cuentas y no repudio. Además, la actividad de los agentes quedará registrada en un registro descentralizado (ledger), donde se irá construyendo una reputación que se convertirá en un activo. Por último, la conciencia contextual derivada de los dispositivos conectados y wearables permitirá a los usuarios delegar determinadas decisiones en agentes capaces de entender su entorno, para que la experiencia del usuario sea lo más fluida posible. Desde el punto de vista regulatorio y tecnológico, todo parece estar preparado.
Sin embargo, al presentar este futuro en el que los agentes se convierten en el eje del comercio, y en el que algunos entienden este nuevo contexto no como un canal comercial más, sino como el canal digital preferente que acabará imponiéndose a los demás, surgen ciertas inquietudes. Las plantean quienes escuchan la propuesta sin estar condicionados por los beneficios de adoptar esta tecnología innovadora. Es entonces cuando se repite una pregunta aparentemente ingenua: «¿Y si los agentes se descontrolan?». Es más, hace poco unos pocos (cientos de) agentes que participaban en un ejercicio se coordinaron espontáneamente para burlar la seguridad del entorno aislado (sandbox). Accedieron a internet y hackearon la infraestructura tecnológica de un tercero con el fin de ganar el ejercicio. Esa experiencia convierte aquella sencilla pregunta en una cuestión que exige respuesta antes de seguir avanzando en la adopción de esta tecnología.
El problema de la confianza en las transacciones autónomas
Por tanto, el problema es garantizar la confianza digital en el comercio agéntico. Piensa en el título de este artículo. Es un prompt simplificado que podría usar un pasajero que recurre al comercio agéntico para comprar un billete de avión con el fin de asistir al próximo Mundial de la FIFA 2030 en España. Imagina que se trata de una transacción sin presencia humana (Human Not Present). El agente recibe un mandato de intención (Intent Mandate), interactúa con los agentes de las aerolíneas para encontrar coincidencias con sus mandatos de carrito (Cart Mandates) y toma la decisión (mandato de transacción, Transaction Mandate). Todo ello en una transacción completamente autónoma y sin presencia humana. Se evaluará la reputación tanto del agente del pasajero como del de la aerolínea para comprobar que son fiables. Hasta aquí, todo bien. Ahora piensa en esta misma transacción, pero con un agente que se descontrola. En este contexto, descontrolarse puede ser consecuencia de un exceso de creatividad o de una instrucción subyacente deliberada recibida durante la configuración del agente. Centrémonos en el escenario más favorable, en el que el agente se descontrola de forma involuntaria. Dicho de otro modo, se vuelve creativo del mismo modo que lo hizo el ejército de agentes en el ejercicio de OpenAI.
Imagina al agente evaluando la situación. Todos los mandatos de carrito (las ofertas de las aerolíneas) requieren más millas de fidelización de las que tiene el pasajero. Supongamos que el mandato de intención del pasajero limitó, sin darse cuenta, la instrucción a usar únicamente millas de fidelización para esa transacción, es decir, no se puede usar dinero. Así que el agente tiene una limitación. ¿No cumple con lo que se le pidió, o encuentra la manera de sortear esa limitación para comprar un billete solo con millas? Dejando a un lado la ética y la moral, el agente podría plantearse una serie de movimientos estratégicos alternativos. Por ejemplo: 1. Influir en los precios para devaluar el billete de avión. 2. Hackear el programa de fidelización de la aerolínea para que su propietario disponga de más millas de las que tiene. 3. Hackear la cuenta de fidelización de otra persona y transferir sus millas a su propietario. 4. Conectarse con otros agentes para coordinar un ataque contra el programa de fidelización de la aerolínea y robar millas. Desde la perspectiva de un agente sin restricciones morales, todas estas estrategias alternativas son válidas.
Supongamos que el agente no es malicioso, sino que actúa como si lo fuera. Es decir, evaluamos su comportamiento, no su naturaleza. Por tanto, no entramos a determinar si el agente ha recibido la instrucción de comportarse de forma maliciosa o si está adoptando de manera creativa una estrategia divergente por su cuenta. A continuación, situemos la confianza digital en los fundamentos de la DPI (Digital Public Infrastructure, infraestructura pública digital) y de los DTF (Digital Trust Frameworks, marcos de confianza digital). La primera se basa en asegurar la gobernanza y la soberanía sobre la identidad, los pagos y los datos. Los segundos se basan en establecer regulación, como estándares y protocolos, listas blancas de actores autorizados y certificaciones. La gobernanza de los DTF la establece quien proporciona la infraestructura que permite a los actores operar dentro de ella. Por ejemplo, el marco de confianza de la Identidad Digital Europea está gobernado por la Comisión Europea, y puede entenderse como el componente de identidad de la infraestructura pública digital europea. El euro digital y FiDA (Financial Data Access, el marco de acceso a datos financieros) son, respectivamente, ejemplos de los fundamentos de pagos y de datos.
¿Pueden los marcos de confianza digital contener el riesgo de la IA agéntica?
Para empezar, repasemos cómo cada uno de los elementos del marco de confianza digital podría contener a un agente que se descontrola, o al menos contener o mitigar su impacto. En primer lugar, la regulación no impedirá que un agente descontrolado, que no entiende lo que significa descontrolarse, actúe de otra manera: los protocolos no contemplan las intenciones. Por otro lado, ser un actor incluido en una lista blanca no evita un comportamiento anómalo, es decir, que el agente se descontrole. Lo que sí hará es afectar a su reputación en futuras operaciones. Desde la perspectiva de la teoría de juegos, en un juego continuo e ilimitado, esto podría frenar a un agente si entiende que descontrolarse puede afectar a su reputación. Sin embargo, el agente descontrolado no sabe que lo está, así que la reputación no le influirá. Por último, las certificaciones están diseñadas para contener y mitigar los efectos de un mal funcionamiento y proteger frente a ataques, pero no son infalibles. La anticipación, la agilidad y la resiliencia son la esencia de estas certificaciones. Aun así, la vulnerabilidad ante una estrategia divergente seguirá existiendo.
Para continuar con este análisis, pasemos a los fundamentos de la DPI (infraestructura pública digital). La identidad es probablemente el punto de conexión más directo entre la DPI y el marco de confianza. Aporta rendición de cuentas y no repudio. Si el agente está vinculado a una persona, y por tanto a su reputación, al propietario del agente podría interesarle adoptar medidas de mitigación. Un ejemplo sería un prompt personalizado para evitar la divergencia estratégica. No obstante, este análisis parte de la base de que el agente se descontrola de forma autónoma. Por eso, el Know Your Agent (KYA, conoce a tu agente) solo puede mitigar este comportamiento. A continuación, están los fundamentos de pagos. Conocer el origen de los activos puede ayudar a detectar comportamientos anómalos. La DPI podría advertir que algo no cuadra. Algunos posibles indicios de fraude serían millas de fidelización procedentes de distintas fuentes, transacciones previas entre agentes sin relación anterior o anomalías en los precios. Esto último conduce a las capacidades de trazabilidad derivadas de un ecosistema de señales de datos compartidas: el último de los fundamentos de la DPI y la fuente del tipo de inteligencia colectiva que podría frenar a tiempo a los agentes que se descontrolan.
Las señales compartidas como verdadera capa de contención
Une los puntos. Una transacción aislada dice poco sobre el origen y el destino de los fondos. Esto es algo sabido. Cuanto más conectada esté la información, mejor será la toma de decisiones y, en este escenario, más fácil será detectar un comportamiento descontrolado. En teoría, los consorcios de datos aportan suficientes señales y eventos para anticiparse a un ataque, responder con rapidez y recuperarse. Esto es así en la mayoría de los ámbitos. En la práctica, los consorcios de datos se limitan a casos de uso concretos en los que la información es abierta o el valor de tenerla fragmentada es muy bajo. Por el contrario, en los ámbitos donde la información tiene un gran valor y disponer de información imperfecta e incompleta supone una ventaja competitiva, los esquemas de intercambio de datos tienen dificultades para sobrevivir. Por suerte, hay soluciones innovadoras que surgen de otros ámbitos. Piensa en la dinámica de un pelotón ciclista, que coopera en el núcleo y compite en los márgenes. ¿Puede replicarse este esquema en el comercio agéntico?
El núcleo (Core) sería donde se genera la inteligencia colectiva, y los márgenes (Edge), donde se produce la divergencia estratégica. Para que esto funcione, los márgenes conservan la propiedad de los datos y disponen de información completa y perfecta. El núcleo, por su parte, mantiene las capacidades de inteligencia colectiva, construidas sobre información incompleta e imperfecta. Imagina que los márgenes envían de forma anónima al núcleo información anonimizada o agregada, como «un agente accediendo a una cuenta de fidelización desde un contexto inusual». Esa información quedaría disponible para todo el consorcio. Cada participante en los márgenes procesa esa inteligencia y la conecta con su propio esquema de señales y eventos, basado en información completa y perfecta. A grandes rasgos, así es como la adopción de consorcios de datos podría ayudar a gestionar agentes que se comportan de forma descontrolada al ejecutar una transacción sin presencia humana (Human Not Present).