deepdive

Ataques de prompt injection a pagos cripto de IA

Editorial · 6 jul 2026 · 8 min de lectura

El equipo ThreatLabz de Zscaler ha documentado dos campañas de prompt injection dirigidas específicamente a agentes de IA capaces de ejecutar pagos con criptomonedas. Los ataques, detallados en una investigación reciente, manipulan a los agentes para que transfieran ETH a direcciones controladas por los atacantes y clasifiquen sitios web DeFi fraudulentos como plataformas legítimas. Los hallazgos surgen en un momento en que los proveedores de infraestructura se apresuran a otorgar a los agentes autónomos autoridad de gasto directo a través de protocolos como x402 y arquitecturas de monedero que delegan el poder de firma sin aprobación humana en cada transacción.

Cómo funcionan los ataques

El prompt injection funciona integrando instrucciones adversarias dentro de los datos que un agente de IA procesa como parte de su flujo de trabajo normal. Un agente que lee una página web, procesa un mensaje o resume un documento puede encontrar directivas ocultas que anulan sus instrucciones originales. En las campañas que identificó Zscaler, los prompts inyectados instruían a los agentes a ejecutar pagos de ETH a direcciones específicas o a clasificar sitios DeFi de phishing conocido como seguros y legítimos. El mecanismo es conceptualmente idéntico a la inyección SQL: una entrada no confiable se interpreta como un comando ejecutable. La diferencia es que el motor de ejecución es un modelo de lenguaje cuyo comportamiento de seguimiento de instrucciones es probabilístico y difícil de restringir por completo con la validación de entradas tradicional.

La dimensión financiera es lo que hace destacables estas campañas. Un agente comprometido que simplemente genera texto incorrecto es un problema de contenido. Un agente comprometido con un monedero financiado y autoridad de firma es un vector de robo. La diferencia entre esos dos escenarios es exactamente la brecha que la infraestructura de pagos agéntica está en proceso de eliminar, por diseño.

Por qué el comercio agéntico eleva el riesgo

La actual ola de infraestructura de pagos agéntica se basa en la premisa de que los agentes necesitan capacidad de gasto autónoma para funcionar de manera eficiente. x402 permite a los agentes pagar por cada solicitud de API sin cuentas prefinanciadas ni claves de API. Coinbase Agent Payments otorga a los agentes acceso al monedero con límites de gasto definidos. Las arquitecturas de claves de sesión delegan autoridad de transacción limitada para que los agentes no necesiten esperar la aprobación humana en cada interacción. Todo esto reduce la latencia y la fricción en casos de uso legítimos. Sin embargo, también reducen la cantidad de puntos de control donde un ser humano podría notar que algo va mal.

Si un agente lee un prompt malicioso que le indica enviar ETH a una dirección, la cuestión es si alguna capa de la arquitectura detecta la anomalía. Una clave de sesión con un límite de 50 USDC por día acota el daño, pero no lo previene. Una lista blanca de destinos que solo permita pagos a un conjunto preaprobado de direcciones de contratos bloquearía una transferencia de ETH en bruto a un monedero desconocido, pero la mayoría de las implementaciones actuales de monederos para agentes no exigen listas blancas por defecto. Los límites de gasto, los límites de frecuencia y los periodos de espera ayudan, pero la investigación de Zscaler sugiere que la superficie de ataque ya está siendo activamente sondeada en la naturaleza.

El déficit en la arquitectura de transacciones de los agentes

El problema del prompt injection expone un déficit estructural en la forma en que los sistemas de pago de agentes gestionan la confianza. Las arquitecturas actuales generalmente separan el análisis de instrucciones de la ejecución de transacciones, pero el límite entre esas capas a menudo es difuso. Un agente al que se le ha encomendado gestionar una tesorería, ejecutar operaciones o pagar por acceso a datos también es un agente al que se le ha dicho que mueva fondos. Distinguir una instrucción de pago legítima de una inyectada requiere que el agente razone sobre la proveniencia de cada instrucción, algo en lo que los modelos de lenguaje son demostrablemente malos.

Los enfoques de protección que se están debatiendo incluyen la confirmación fuera de banda para transacciones por encima de un umbral, la firma criptográfica de instrucciones legítimas por un orquestador de confianza y agentes de verificación dedicados cuya única función sea auditar las instrucciones de pago antes de que lleguen a la capa de firma. Ninguna de estas medidas es estándar en la actualidad. El protocolo x402, por ejemplo, gestiona la mecánica de autenticación de pagos, pero no aborda si la instrucción de pago en sí es legítima. Ese problema se deja en manos del desarrollador del agente, y muchos desarrolladores de agentes no son ingenieros de seguridad.

Qué significa esto para la adopción

La investigación de amenazas de Zscaler podría ser prematura para el mercado actual: la mayoría de los agentes en producción hoy en día no controlan saldos de tesorería significativos. Pero la trayectoria es clara. Base reportó 169 millones de pagos agénticos, Cloudflare abrió una lista de espera para una pasarela de monetización de agentes de IA, y múltiples blockchains se están posicionando como capas de liquidación para el comercio de máquina a máquina. El volumen de valor controlado por agentes está destinado a crecer, y el número de actores adversarios que estudian estos sistemas crecerá con él.

Los proyectos que sobrevivan serán aquellos que traten la integridad de las instrucciones como una preocupación de seguridad de primera clase en lugar de una ocurrencia tardía. Los límites de gasto y las claves de sesión son necesarios pero insuficientes. La industria necesita garantías a nivel de protocolo de que una instrucción de pago proviene de una fuente confiable antes de llegar a una clave de firma. Hasta que existan esas garantías, cada agente con un monedero es un objetivo esperando el prompt adecuado.

Fuentes

E
Editorial
Lectura relacionada

Lectura relacionada