Investigación · · 9 min de lectura
Los equipos de agentes IA cuestan 5,1 veces más y apenas mejoran: el aviso de Vals AI que ningún CTO debería ignorar
Un estudio de Vals AI confirma lo que muchos equipos sospechaban: la orquestación multiagente se come el presupuesto en tokens sin devolver calidad proporcional. Analizamos los números, los casos donde sí compensa y qué debe hacer tu empresa.
Un equipo de agentes IA que multiplica por 5,1 el consumo de tokens para entregar una mejora de calidad que en tres de cada cuatro pruebas ni siquiera se mide. Esa es la conclusión del estudio de Vals AI recogido por The Decoder, y debería hacer temblar a cualquier CTO que tenga una factura de inferencia creciendo más rápido que su ARR.
TL;DR: Vals AI ha medido equipos de agentes IA contra agentes individuales y el resultado es demoledor: hasta 5,1× más coste en tokens y solo uno de cada cuatro tests (con GPT-6 Sol y Claude Opus 5.5) mostró una mejora real. Los datos internos de Anthropic lo corroboran: pasados diez agentes, la calidad se aplana mientras la factura sigue subiendo. La orquestación multiagente no es gratis, y en producción no siempre compensa.
El fin del entusiasmo ciego por la orquestación
Durante los últimos dieciocho meses, el relato dominante ha sido que más agentes equivale a más inteligencia. Los proveedores lo han vendido así, y el ecosistema de agencias de agentes autónomos lo ha replicado sin demasiado rigor. El paper de Vals AI pone un palo entre las ruedas: si un equipo de agentes solo gana en uno de cada cuatro benchmarks frente a un único agente bien instruido, el coste marginal de la orquestación no se justifica en la mayoría de flujos empresariales.
Los números concretos: hasta 5,1× más tokens consumidos. En pruebas con dos de los modelos frontera del momento, GPT-6 Sol y Claude Opus 5.5, el porcentaje de tests con mejora medible cayó al 25%. Es decir, en el 75% de los casos el equipo era más caro y no aportaba nada verificable. Traducido a factura cloud: si tu pipeline de atención al cliente gasta 4.000 € mensuales en inferencia con un agente único, moverlo a un equipo orquestado puede llevarte a 20.000 € sin que tu NPS se mueva un punto.
No es un problema de los modelos. Es un problema arquitectónico. La mayoría de equipos multiagente que se despliegan hoy están mal diseñados: se añaden agentes "por si acaso", se les asigna rol redundante y se genera un chat interno que multiplica los turnos sin resolver nada nuevo. El resultado es un sistema que gasta cómputo en coordinarse consigo mismo.
La curva de rendimiento decreciente que Anthropic ya venía midiendo
El estudio de Vals AI no cae en el vacío. Anthropic lleva meses publicando internamente el mismo patrón: más allá de diez agentes concurrentes en una tarea, la calidad agregada se estanca y los costes siguen subiendo linealmente. En el artículo reciente sobre cómo Claude orquesta 1.000 agentes en paralelo vimos la parte bonita de la historia. La parte fea es que esa escalabilidad no siempre la usa nadie para tareas que realmente la necesiten.
La conclusión operativa es incómoda: el multi-agente tiene sentido en dominios donde la división del trabajo es real, no decorativa. Un pipeline de investigación con búsqueda web, verificación factual y redacción puede beneficiarse de tres agentes con herramientas distintas. Un agente de soporte que consulta tu CRM no necesita cinco compañeros de equipo.
| Configuración | Coste relativo en tokens | Mejora medible reportada | Cuándo tiene sentido |
|---|---|---|---|
| Agente único con buenas herramientas | 1,0× | Baseline | Soporte, RAG, clasificación, extracción |
| 3 agentes (planificador + ejecutor + crítico) | ~1,8–2,5× | Modesta en tareas complejas | Research, generación con verificación |
| Equipos de 5+ agentes | Hasta 5,1× | 25% de los tests | Pipelines analíticos multimodales |
| >10 agentes | >6× (extrapolado) | Estancada según Anthropic | Solo en simulación o investigación |
La tabla anterior no la firma Vals AI al pie de la letra —las cifras intermedias son extrapolaciones plausibles del rango 1×–5,1× que sí reportan—, pero es la forma más honesta de leer el dato: elegir multi-agente es elegir un multiplicador de coste, y ese multiplicador hay que justificarlo con un caso de uso claro.
Por qué te venden orquestación aunque no la necesites
Aquí es donde el análisis se vuelve incómodo para el sector. La orquestación multiagente es técnicamente sexy y comercialmente fácil de vender. "Tenemos agentes que se coordinan" suena infinitamente mejor en una propuesta que "tenemos un prompt robusto con function calling". Para un proveedor, cada capa de agentes que añades justifica más horas de integración, más licencias y más consultoría. Para el cliente, es un gasto recurrente que no aparece en el pitch inicial.
Esto no significa que el multi-agente sea una estafa. Significa que la carga de la prueba está del lado de quien lo propone. Si tu proveedor no puede decirte con datos cuál es la mejora esperada en tu KPI concreto —no "una demo impresionante", sino una métrica medible—, la respuesta correcta es no. Y si tu equipo interno no puede instrumentar el experimento para comparar agente único vs. equipo, tampoco.
Aquí es donde una consultoría IA seria marca la diferencia frente a un integrador que factura por sprint: la primera te obliga a definir el baseline antes de escalar; el segundo te escala primero y te pregunta después.
Qué implica para agencias y equipos en España y LatAm
El mercado hispanohablante de IA empresarial está en una fase de madurez desigual. Las agencias IA en Madrid empiezan a tener clientes que ya quemaron presupuesto en pilotos multiagente fallidos y vuelven con escepticismo sano. Las agencias IA en Barcelona, con más mezcla de producto propio y desarrollo, están mejor posicionadas para vender arquitecturas eficientes en coste porque ya construyen SaaS propios donde la factura de tokens duele de verdad.
El efecto secundario más interesante del estudio de Vals AI es que revaloriza el trabajo de ingeniería de prompts y de elección de herramientas. Un agente único con function calling bien diseñado, retrieval selectivo y caching agresivo puede rendir a una fracción del coste de una flota orquestada. Eso devuelve protagonismo a perfiles que habían quedado relegados frente a los "arquitectos de agentes".
En verticales regulados —banca, seguros, salud— el argumento es aún más fuerte: un equipo de agentes es más difícil de auditar, más difícil de explicar a un regulador y más caro de mantener en compliance. La trazabilidad de una sola cadena de decisión es un activo regulatorio en Europa, y el multi-agente la complica gratis.
La pregunta que deberías hacer mañana en tu comité
¿Cuál es el multiplicador de coste que estás dispuesto a pagar por cada punto de mejora en tu KPI principal? Si la respuesta es "1,3× por 5 puntos de accuracy", el multi-agente tiene sentido. Si no tienes esa cifra, no tienes una decisión: tienes una intuición cara.
El sector va a corregir. Hacia finales de 2026 veremos menos pitches con "enjambres de agentes" y más pitches con "un agente, tres herramientas y caché agresivo". Las empresas que hayan quemado presupuesto en el ciclo anterior serán reacias, y ahí es donde las agencias de integración que sepan medir coste por transacción ganarán el contrato. La métrica reina deja de ser "cuántos agentes tienes" y pasa a ser "cuánto te cuesta cada tarea resuelta".
La predicción que me atrevo a firmar: en doce meses, el precio por millón de tokens del modelo frontera seguirá bajando, pero el coste por tarea de los sistemas multiagente mal diseñados no. La diferencia entre los dos será el nuevo filtro competitivo del mercado de agentes IA.
Preguntas frecuentes sobre equipos de agentes IA
¿Qué dice exactamente el estudio de Vals AI sobre agentes IA?
Que los equipos multiagente consumen hasta 5,1 veces más tokens que un agente único y que solo uno de cada cuatro tests con GPT-6 Sol y Claude Opus 5.5 mostró una mejora de calidad medible. En el 75% restante, el coste extra no se tradujo en resultado verificable. Los datos internos de Anthropic refuerzan el patrón: más allá de diez agentes la calidad se estanca.
¿Cuándo merece la pena usar varios agentes en lugar de uno?
Cuando la tarea tiene división de trabajo real y herramientas distintas por rol: investigación con búsqueda web, verificación factual y redacción final, por ejemplo. También cuando el pipeline necesita un agente crítico que revise el output de otro. Si tu caso es soporte, clasificación o extracción de datos, un agente único bien instrumentado suele rendir mejor coste/calidad.
¿Cuánto puede subir la factura de tokens al migrar a multiagente?
Dependiendo de la arquitectura, entre 1,8× y 5,1× sobre el baseline de un agente único. En un pipeline que hoy cuesta 4.000 € mensuales en inferencia, un equipo de cinco agentes puede llevarte a 20.000 € sin mejora medible en el 75% de los casos. El ahorro no viene de elegir un modelo más barato, viene de no añadir agentes innecesarios.
¿Es el multi-agente una mala idea en producción?
No es mala idea: es una idea cara que exige justificación. Tiene sentido en dominios donde la verificación cruzada o la especialización aportan valor medible y auditable. En entornos regulados añade además complejidad de compliance. La regla práctica es no desplegar más de tres agentes en producción sin haber medido el baseline de un agente único con las mismas herramientas.
¿Cómo sé si mi proveedor de agentes IA está sobrevendiendo orquestación?
Pídele el multiplicador de coste y la mejora esperada en tu KPI concreto, medidos sobre un baseline. Si no puede darte una cifra como "1,4× coste por 8 puntos de mejora", está vendiendo estética de arquitectura. Las agencias IA serias empiezan siempre por el baseline y por el coste por tarea resuelta, no por el diagrama de agentes.
Temas relacionados en agentes.ai
Si quieres aplicar lo que lees en tu empresa, estos son puntos de partida útiles dentro de agentes.ai:
- Directorio de agencias de automatización con ia
- Agencias de IA en Bilbao y en Ciudad de México
- Explora el directorio completo de agencias de IA
- Sigue las últimas noticias de IA en tiempo real