Investigación · · 7 min de lectura

Harness-1 y el coste oculto de los agentes: tokenomía real

Harness-1 bate en retrieval a todos los modelos open source con 20B parámetros. Pero el verdadero debate es cuánto cuesta operar agentes y quién paga la factura de tokens.

Harness-1 y el coste oculto de los agentes: tokenomía real

El retrieval siempre ha sido el talón de Aquiles de los sistemas agénticos en producción. Puedes tener el mejor LLM del mundo en el frontend, pero si el subagente de recuperación falla, el sistema entero falla. Harness-1, presentado por investigadores de UIUC y Chroma, ataca exactamente ese punto débil.

Harness-1: lo que significan 0.730 de recall curado en producción

El modelo alcanza un recall curado promedio de 0.730 en ocho benchmarks, superando al siguiente agente open source por 11,4 puntos porcentuales. Solo Opus-4.6 queda por delante, y Opus-4.6 no es precisamente el candidato económico de nadie. Con 20 mil millones de parámetros entrenados mediante aprendizaje por refuerzo dentro de un entorno de búsqueda con estado —que gestiona grupos de candidatos, conjuntos curados y grafos de evidencia—, Harness-1 representa un salto arquitectónico, no solo de escala.

Lo relevante para cualquier CTO no es el benchmark en sí, sino lo que implica tenerlo disponible con pesos y código públicos. Hasta ahora, construir un pipeline RAG competitivo en enterprise obligaba a elegir entre pagar por APIs propietarias (con los costes y las dependencias que eso implica) o conformarse con soluciones open source notablemente inferiores. Harness-1 rompe ese binomio.

A diferencia de lo que sugiere el anuncio oficial, el verdadero reto para las agencias de IA especializadas en agentes autónomos no será integrar el modelo: será operarlo con eficiencia de costes en infraestructura propia. 20B parámetros sigue siendo una carga considerable para empresas medianas sin equipo de MLOps. El ecosistema de agencias ia en Barcelona que trabaja con clientes del sector financiero y legal —donde la precisión en retrieval es crítica— tiene aquí una ventana de oportunidad clara antes de que las soluciones SaaS lo absorban y lo repriecen.

La tokenomía: el coste que nadie presupuesta correctamente

Paralelo a Harness-1, un estudio publicado esta semana en HackerNews aborda un problema que lleva meses siendo el elefante en la sala de cualquier proyecto de ingeniería con agentes: cómo y dónde se consumen los tokens en sistemas agénticos. El análisis no solo cuantifica el uso, sino que identifica los puntos de ineficiencia más costosos en flujos de trabajo de desarrollo de software automatizados.

Los números no se publican explícitamente en el resumen, pero el patrón que emerge es conocido para quien haya operado agentes en producción: el gasto de contexto en pasos intermedios, los re-reads de documentos ya procesados y los loops de verificación mal diseñados pueden multiplicar por 3x o 4x el coste teórico de una tarea. Esto no es un problema de precio por token —que seguirá bajando—, es un problema de arquitectura de agente.

Esta dimensión conecta directamente con el artículo sobre Codex como agente central en ingeniería de software: la promesa es real, pero la factura operativa de un equipo que delega trabajo de programación en agentes sin un modelo de tokenomía bien definido puede ser devastadora para el ROI del proyecto. Los equipos que están viendo retornos reales son los que han instrumentalizado sus pipelines con métricas de consumo antes de escalar.

Para la consultoría de IA en España, esto debería ser una señal de alerta: vender implementaciones de agentes sin incluir un modelo de coste operativo en el contrato es vender problemas diferidos. El cliente que en tres meses descubre que su agente de automatización cuesta el doble de lo estimado no renueva.

El hack de Meta: cuando el agente se convierte en vector de ataque

Meta ha confirmado que miles de cuentas de Instagram fueron comprometidas mediante el abuso de su chatbot de IA. No es un fallo de seguridad perimetral clásico: es un ataque que explota la lógica conversacional del agente para extraer o comprometer credenciales. Este tipo de incidente —que MIT Technology Review analiza en detalle— es exactamente el escenario que NVIDIA garak intenta sistematizar.

NVIDIA garak se presenta esta semana con un tutorial completo de red-teaming defensivo para LLMs, con sondas y detectores personalizados, integración con generadores de Hugging Face y exportación de resultados en formato AVID. Es un framework serio, no un wrapper con logo corporativo. La posibilidad de construir flujos de evaluación multi-sonda y exportar vulnerabilidades en un formato estructurado lo convierte en candidato real para pipelines de seguridad enterprise.

Pero aquí hay que ser directo: garak es una herramienta para equipos con madurez técnica en seguridad IA. La mayoría de empresas medianas no tiene los perfiles para operarlo autónomamente. Para las agencias ia en Madrid que ofrecen servicios de implementación a clientes del sector financiero o sanitario, la oportunidad es clara: la demanda de red-teaming de agentes va a crecer significativamente después de incidentes como el de Meta, y saber operar garak es diferencial.

El fondo del asunto es más preocupante que el titular. El chatbot de Meta no fue hackeado en el sentido tradicional: fue manipulado dentro de sus propios parámetros de funcionamiento. Esto plantea una pregunta incómoda para cualquier empresa que haya desplegado un agente de atención al cliente: ¿ha auditado los vectores de ataque conversacionales de su propio sistema?

Claude desplaza a Figma: la señal que los product leads deben leer correctamente

Un diseñador publicó esta semana que ahora diseña más con Claude que con Figma. La comunidad lo ha recibido como una declaración provocadora, pero el debate que ha generado es más interesante que la propia afirmación.

La lectura superficial es "la IA reemplaza herramientas de diseño". La lectura estratégica es otra: el flujo de trabajo de diseño se está reorganizando alrededor de la generación y exploración rápida de conceptos, y las herramientas de prototipado visual se están convirtiendo en la fase de refinamiento, no de ideación. Para product leads, esto implica repensar qué perfiles necesitan y qué herramientas presupuestar.

Para empresas que buscan transformar sus procesos de producto con IA, este cambio en el workflow es una entrada natural hacia soluciones más amplias de automatización con IA. No se trata de sustituir diseñadores: se trata de reorganizar qué parte del trabajo hace un humano y en qué punto de la cadena.

Google Colab CLI y Kimi Code: infraestructura para el agente-desarrollador

Google ha lanzado Colab CLI, que permite ejecutar código local en entornos remotos con GPU y TPU directamente desde terminal. Moonshot AI ha presentado Kimi Code CLI, un agente de codificación open source para terminal construido en TypeScript con soporte de subagentes y configuración MCP.

Dos movimientos que apuntan a la misma dirección: el agente de codificación ya no vive en una interfaz web, vive en el entorno nativo del desarrollador. La fricción de acceso a cómputo y la fricción de integración en workflows existentes bajan simultáneamente. Para equipos de ingeniería que evalúan adoptar agentes ia en su pipeline de desarrollo, este tipo de herramientas son las que convierten los pilotos en adopción real.

El ecosistema de herramientas de agentes para desarrollo de software ha pasado de tener dos o tres opciones relevantes a una docena en menos de seis meses. Eso es positivo para la competencia y para los precios, pero introduce un problema de evaluación técnica que muchos equipos no tienen capacidad de resolver internamente. Las agencias de integración de IA que dominen la comparativa real entre estas herramientas —no la comparativa de marketing— van a tener una ventaja de posicionamiento significativa en los próximos trimestres.

La convergencia que define el trimestre

Harness-1 con retrieval competitivo a coste open source, la tokenomía como nueva métrica de madurez en proyectos agénticos, y el primer hack masivo documentado de un agente conversacional en producción: estos tres vectores juntos definen el momento en que los agentes pasan de ser un experimento a ser infraestructura crítica con sus propios requisitos de seguridad, coste y rendimiento.

Las organizaciones que en los próximos doce meses no desarrollen competencia interna en tokenomía y red-teaming de agentes van a depender completamente de sus proveedores para entender si sus sistemas son eficientes y seguros. Eso no es una posición cómoda para ningún CTO que entienda lo que está en juego.

Temas relacionados en agentes.ai

Si quieres aplicar lo que lees en tu empresa, estos son puntos de partida útiles dentro de agentes.ai: