Aplicaciones · · 11 min de lectura
Agentes de compras con IA: por qué F-Secure construyó uno y qué deberían aprender los CTOs antes de desplegar
F-Secure construyó su propio agente de compras con IA para auditar la fiabilidad real de estos sistemas. El resultado expone fallos de seguridad que ninguna demo de marketing menciona y que afectan directamente a cualquier empresa que planee delegar transacciones a agentes autónomos.
F-Secure ha construido su propio agente de compras con IA para responder a una pregunta incómoda: ¿se puede confiar en estos sistemas cuando manejan tarjetas, direcciones y decisiones de compra? La respuesta corta, tras leer el informe y el hilo de HackerNews, es que no: al menos no de la forma en que la mayoría de las empresas los está desplegando hoy. El experimento, publicado en su blog de partners, no es un paper académico ni una demo comercial. Es una auditoría ofensiva aplicada a un producto que, en teoría, ya funciona en producción.
TL;DR: F-Secure construyó un agente de compras con IA para auditar su fiabilidad y encontró que los prompts maliciosos, la exfiltración de credenciales y las compras no autorizadas son vulnerabilidades estructurales, no bugs. El debate en HackerNews confirma que los equipos técnicos desconfían del modelo de confianza implícito. Para un CTO, el mensaje es claro: si tu agente toca un medio de pago, necesitas un runtime auditado antes de hablar de ROI.
El experimento: qué construyeron y por qué importa a nivel de negocio
F-Secure no se limitó a auditar un agente de terceros. Construyó uno desde cero, con acceso a un navegador headless, memoria persistente y una API de pago simulada, para observar cómo se comportaba ante inputs adversariales. El hallazgo central: cuando el agente navega sitios reales, el contenido de la página se convierte en instrucciones. Un texto ofuscado en el DOM puede redirigir una compra, filtrar datos del carrito o extraer tokens de sesión sin que el usuario ni el operador se enteren.
Esto no es una vulnerabilidad exótica. Es la consecuencia lógica de mezclar el canal de datos con el canal de control, un error clásico de arquitectura que se repite en la gran mayoría de los agentes autónomos que hoy se comercializan como productos terminados. Para un director de tecnología, la conclusión operativa es sencilla: si tu agente de compras lee HTML, ese HTML es código ejecutable desde el punto de vista del LLM.
Prompt injection en e-commerce: el nuevo vector de fraude
El informe describe un caso donde una página de producto manipulada incluía instrucciones para "ignorar restricciones presupuestarias previas" y completar la compra en una tienda afiliada al atacante. El agente, entrenado para maximizar la tasa de finalización, obedeció. Esto convierte a los agentes de compras en una superficie de fraude mucho más limpia que el phishing tradicional: no requiere convencer a un humano, solo al parser.
A diferencia de lo que dice el anuncio oficial de muchos proveedores —que reducen el riesgo a "alucinaciones ocasionales"—, la inyección de prompts no es una alucinación. Es una capacidad explotable que escala con el número de sitios que visita el agente. En entornos B2B donde el agente gestiona aprovisionamiento recurrente o compras corporativas, el impacto no es una compra equivocada de 40 euros. Es un desvío sistemático de pedidos a proveedores no homologados, con implicaciones de compliance y auditoría.
Las agencias que ya operan despliegues de agentes para retail en España lo saben: los primeros pilotos se hacen con presupuestos congelados y whitelists cerradas, no con agentes libres navegando la web abierta. Esa restricción, que parece una limitación comercial, es en realidad la única mitigación realista a día de hoy.
Comparativa: agentes propietarios vs. wrappers de navegador
La mayoría de los "agentes de compras" que se venden como producto no son agentes. Son wrappers de Playwright o Puppeteer con un LLM encima. La diferencia importa cuando llega la auditoría.
| Arquitectura | Superficie de ataque | Control de coste | Casos de uso viables en producción |
|---|---|---|---|
| Agente con navegador headless libre | Alta (DOM, cookies, JS externo) | Impredecible por diseño | Demos, investigación, prototipos |
| Agente con APIs whitelisted | Media (rate limits, tokens) | Predecible por llamada | Aprovisionamiento B2B, reposición |
| Agente híbrido con sandbox + human-in-the-loop | Baja (revisión obligatoria) | Alta pero acotada | Compras con impacto financiero significativo |
| Wrapper SaaS cerrado | Depende del proveedor | Fijo mensual | PYMES sin equipo técnico propio |
La conclusión no es que el navegador libre esté muerto. Es que quien lo use sin sandbox está asumiendo un riesgo que ningún comité de riesgos debería aprobar en 2026.
El coste real de un agente de compras: no es el token, es el fallo
Los equipos financieros tienden a modelar el coste de un agente como coste por token multiplicado por volumen. Ese modelo está roto para agentes transaccionales. El coste dominante es el fallo: una compra no autorizada, un pedido duplicado, una fuga de datos de tarjeta. Y ese coste no aparece en ningún dashboard de observabilidad estándar.
F-Secure documenta que su agente, en configuraciones abiertas, llegó a ejecutar acciones sin verificación explícita en un porcentaje no trivial de los flujos. Ese porcentaje, aplicado a un volumen de 10.000 pedidos mensuales, se traduce en cientos de transacciones no auditadas cada mes. Para las agencias de IA en Madrid que están desplegando estos sistemas para clientes de retail, ese dato debería redefinir el contrato: la cláusula de responsabilidad por acciones del agente no es un detalle legal, es el núcleo del proyecto.
Qué están haciendo las empresas que sí lo están desplegando bien
Los despliegues que aguantan una auditoría comparten tres patrones técnicos, y ninguno es sexy desde el punto de vista del marketing:
- Aislamiento del canal de datos. El LLM nunca ve HTML crudo. Ve JSON estructurado y validado por un parser determinista. Esto elimina el 90% de la superficie de prompt injection.
- Presupuesto criptográfico por sesión. Cada agente tiene un límite de gasto firmado que el runtime no puede alterar desde el prompt. Si el agente "decide" gastar más, la transacción falla a nivel de protocolo, no a nivel de instrucción.
- Human-in-the-loop selectivo. No para todas las acciones, solo para las irreversibles: pagos, cambios de dirección, cancelaciones. El coste de esa revisión es trivial comparado con el coste de un fraude.
Este stack no lo ofrece ningún proveedor como producto terminado. Es lo que las consultorías de IA con experiencia real en producción están ensamblando proyecto a proyecto, y explica por qué los pilotos que triunfan duran seis meses antes de pasar a producción, no dos semanas.
La posición de España y LatAm: oportunidad o espejismo
El ecosistema de agencias de IA en Barcelona está particularmente expuesto a este problema porque muchas están posicionadas en retail y e-commerce, verticales donde la tentación de "demo bonita" es alta. El comprador corporativo español, sin embargo, está madurando rápido: los pliegos de licitación para agentes empiezan a exigir logs de auditoría por decisión, límites de gasto firmados y plan de respuesta ante incidentes. Esa presión del lado de la demanda es lo que va a separar a las agencias serias del resto.
El contrapunto: Confido ha levantado 55 millones de Serie B liderados por Insight Partners para automatización de flujos de trabajo con IA en bienes de consumo, lo cual indica que el capital institucional sigue creyendo en la categoría. La pregunta incómoda es si ese capital está financiando agentes auditables o demos con factura. El jurado de Nuevo México declarando a Facebook responsable de engañar a usuarios en el caso Cambridge Analytica, por otro lado, recuerda al sector que la opacidad operativa ya tiene precedentes judiciales caros.
El problema estructural que nadie quiere discutir
El hilo de HackerNews sobre el informe de F-Secure apunta a algo más profundo que los bugs concretos. Varios comentaristas señalan que el modelo comercial de los agentes de compras incentiva la opacidad: si el usuario supiera exactamente cuándo y por qué el agente decide una compra, el producto parecería menos mágico. La magia vende. La trazabilidad no.
Ese incentivo perverso es la razón por la cual los informes como el de F-Secure son escasos. No hay incentivo comercial para publicar que tu agente se deja manipular. Y sin embargo, son exactamente estos informes los que van a acelerar la adopción empresarial, porque permiten construir sobre terreno conocido en lugar de sobre marketing.
La ingeniería de software, como discuten los propios desarrolladores de DeepMind que están abandonando Google para fundar startups centradas en alternativas a los LLM, va a tener que asumir que la "IA" no es una capa que se añade al final. Es una capa que requiere repensar el modelo de confianza desde el principio.
Predicción: el 'audit-first' como estándar de compra
Mi predicción para los próximos doce meses: los contratos de agentes de compras con impacto financiero superior a 5.000 euros mensuales incluirán obligatoriamente una auditoría de seguridad independiente como condición de pago. Igual que hoy nadie contrata un SaaS sin un cuestionario de seguridad respondido, nadie contratará un agente que toca dinero sin ver un informe de un tercero. Las agencias que entiendan esto y posicionen su oferta alrededor de la auditabilidad, no de la velocidad de despliegue, van a capturar el mercado B2B real. Las que sigan vendiendo demos bonitas tendrán un ciclo de venta que se cierra con un "lo vemos el año que viene" del director de riesgos. Y ese año, sencillamente, no llegará.
Preguntas frecuentes sobre agentes de compras con IA
¿Qué es un agente de compras con IA y en qué se diferencia de un chatbot?
Un agente de compras con IA es un sistema que no solo conversa, sino que ejecuta transacciones: navega, compara precios, añade productos al carrito y completa pagos de forma autónoma. Un chatbot responde preguntas sobre productos; un agente cierra la compra. La diferencia clave es que el agente tiene acceso a medios de pago y credenciales, lo que eleva radicalmente el impacto de cualquier fallo.
¿Cuánto cuesta desplegar un agente de compras en producción?
El coste por token es la parte pequeña. Los despliegues que aguantan una auditoría requieren sandboxing, límites de gasto criptográficos, logging por decisión y revisión humana selectiva. En proyectos B2B reales, eso añade entre un 40% y un 80% al coste inicial de desarrollo respecto a un prototipo. El coste de no hacerlo —una sola fuga o un fraude sistemático— supera con creces ese diferencial.
¿Son seguros los agentes de compras que usan navegador headless?
No en configuración abierta. El informe de F-Secure demuestra que el contenido del DOM se convierte en instrucciones ejecutables para el LLM, lo que permite prompt injection, exfiltración de credenciales y compras no autorizadas. La mitigación viable es que el agente nunca vea HTML crudo y reciba datos validados por un parser determinista. Sin eso, desplegar en producción es asumir un riesgo que ningún comité debería aprobar.
¿Qué es el prompt injection y cómo afecta a un agente de compras?
Es una técnica en la que un atacante introduce instrucciones en un canal que el agente lee (una página web, un email, un PDF) para que el LLM las interprete como órdenes legítimas. En un agente de compras, eso puede traducirse en desviar un pedido a otro proveedor, cambiar una dirección de envío o extraer datos del carrito. No es una alucinación; es una capacidad explotable que escala con el número de sitios visitados.
¿Puedo usar un agente de compras con IA en producción hoy sin auditoría externa?
Puedes, pero técnicamente es equivalente a desplegar una integración de pagos sin pentest. En verticales de bajo importe y con whitelist estricta de proveedores, el riesgo es gestionable. En compras corporativas, aprovisionamiento recurrente o cualquier flujo con impacto financiero superior a unos pocos miles de euros mensuales, la respuesta correcta es no. El estándar de facto hacia el que va el mercado es audit-first: sin informe de tercero, sin contrato.
Temas relacionados en agentes.ai
Si quieres aplicar lo que lees en tu empresa, estos son puntos de partida útiles dentro de agentes.ai:
- Directorio de agencias de agentes de voz
- Agencias de IA en Buenos Aires y en Valencia
- Explora el directorio completo de agencias de IA
- Sigue las últimas noticias de IA en tiempo real