Herramientas · · 10 min de lectura

Google lanza agentes Gemini con memoria persistente: la jugada que rompe la guerra de modelos y aprieta a OpenAI y Anthropic

Google presenta agentes Gemini capaces de ejecutar tareas de larga duración con memoria persistente en la nube y compatibilidad con Claude. Analizamos qué cambia para los CTOs y para el mercado de agencias IA en España.

Comparte: Compartir en LinkedIn Publicar en X

Google acaba de mover ficha en el tablero de los agentes IA: agentes Gemini con memoria persistente en la nube capaces de seguir ejecutando tareas aunque el usuario cierre el portátil o cambie de canal. Y, lo más incómodo para el resto del sector, con compatibilidad nativa para Claude de Anthropic. La noticia, publicada por GeekNews ES, no es un anuncio más de feature: es un reposicionamiento de Google como capa de orquestación agnóstica al modelo, justo donde OpenAI y Anthropic se estaban peleando por ser el "cerebro único".

TL;DR: Google lanza agentes Gemini con memoria persistente en la nube que sobreviven al cierre del dispositivo y al cambio de canal. Lo disruptivo no es el modelo, es que el agente elige entre Gemini y Claude según la tarea, abriendo la puerta a un orquestador multi-modelo. Para los CTOs, esto traslada la decisión estratégica del "qué LLM uso" al "qué runtime de agentes adopto". La guerra de modelos pierde peso frente a la guerra de plataformas de ejecución.

El fin de la guerra de modelos: ahora compite el runtime, no el cerebro

El movimiento de Google es, leído en frío, una admisión estratégica. Durante 2024 y 2025 el discurso comercial de los grandes labs era que el modelo lo era todo: mejor razonamiento, mejor contexto, mejor tool use. Los agentes Gemini con memoria persistente y soporte para Claude rompen esa narrativa desde dentro. Si tu agente puede invocar a Claude cuando la tarea lo requiere, el LLM pasa a ser un commodity conmutables y el valor se desplaza al plano de la orquestación: gestión de estado, persistencia, políticas de reintento, trazabilidad y control de coste por tarea.

Es la misma lógica que vivió el cloud computing hace quince años. Nadie construye hoy sobre un solo proveedor si puede evitarlo, y ahora Google está ofreciendo explícitamente esa neutralidad como característica. Para los equipos que están evaluando plataformas, esto cambia el criterio de compra. Ya no se trata de "¿qué modelo rinde mejor en mi benchmark?" sino de "¿qué runtime me permite cambiar de modelo sin reescribir el agente?".

A diferencia de lo que dice el anuncio oficial, el verdadero reto para las agencias españolas no es técnico: es de gobernanza. Cambiar de modelo dentro de un agente que toma decisiones financieras o de RRHH implica que la empresa debe poder auditar qué versión tomó qué decisión y con qué prompt. La memoria persistente es una funcionalidad brillante de producto y un dolor de cabeza para compliance si no se diseña con retención y borrado explícitos desde el día uno.

Memoria persistente en la nube: qué significa en la práctica para producción

La memoria persistente es la pieza que faltaba para que los agentes dejen de ser demos de 30 segundos y pasen a ser empleados digitales con continuidad. Significa que el agente recuerda el estado de una negociación, un ticket, un onboarding o un proceso de compra entre sesiones y entre canales. Para un operador logístico, es la diferencia entre un bot que reinicia el contexto en cada mensaje de WhatsApp y un agente que sabe que el pedido #4421 lleva tres intentos fallidos de entrega.

Esa continuidad tiene un coste que conviene medir antes de firmar nada. La memoria persistente implica almacenamiento estructurado o vectorial, en muchos casos sincronización entre regiones y, sobre todo, tokens recurrentes en cada llamada para recuperar contexto relevante. Un agente con memoria mal diseñada puede multiplicar por 5 o 10 el coste de inferencia respecto a uno stateless. Aquí es donde las agencias de automatización con IA aportan valor real: no por conectar el SDK, sino por diseñar qué se persiste, qué se resume y qué se descarta.

Dimensión Agente stateless (2024) Agente con memoria persistente (2026)
Continuidad entre sesiones No Sí, en nube
Coste de inferencia Base 2-10x según diseño de contexto
Complejidad de compliance Baja Alta (retención, borrado, PII)
Casos viables FAQ, routing Onboarding, cobros, soporte L2, ventas
Orquestación multi-modelo Manual Nativa (Gemini + Claude)

La pregunta que un CTO debería hacer a su proveedor no es "¿tiene memoria?", sino "¿cuánto me cuesta cada turno de memoria y cómo purgo lo que ya no necesito?". Sin respuesta clara, esa feature premium se convierte en una factura imprevisible.

Gemini + Claude: el orquestador que Anthropic no quería

Google integrando Claude en sus propios agentes es un mensaje dirigido a dos audiencias. A los clientes: "puedes adoptarnos sin apostar solo por nosotros". A Anthropic: "o entras como proveedor subordinado en mi plataforma, o pierdes terreno en el punto de entrada real del cliente, que es el agente, no el modelo". Es el mismo patrón que Microsoft ejecutó con OpenAI: ser la capa donde se decide, no solo la capa que ejecuta.

Para el comprador B2B esto es bueno y es peligroso a la vez. Bueno porque permite ruteo por coste: tareas simples a Gemini Flash, razonamiento complejo a Claude, siempre dentro del mismo agente. Peligroso porque introduce dependencia de un orquestador propietario justo cuando el mercado prometía portabilidad. Si mañana Google decide subir el precio del runtime, migrar no es cambiar una API key: es reconstruir todo el sistema de estado.

Aquí el ecosistema de agencias IA en Barcelona está reaccionando más rápido que el de Madrid, sobre todo en verticales de retail y salud digital donde ya hay pipelines con Claude en producción. La razón es pragmática: estas agencias llevan meses construyendo abstracciones para no atarse a un proveedor y ahora ven validada su arquitectura por el propio Google. Las agencias IA en Madrid, más orientadas a banca y sector público, van a mirar esto con lupa por el lado de auditoría y residencia de datos antes de mover ficha.

El impacto real en el coste de los agentes en producción

La promesa comercial es que un agente con memoria persistente reduce coste porque evita repetir contexto y rehacer trabajo. Es verdad a medias. Reduce el coste humano (menos intervención, menos handoffs) y puede reducir el coste de cómputo si el enrutado entre modelos se hace bien. Pero introduce dos costes nuevos que pocas hojas de cálculo contemplan: almacenamiento de estado a largo plazo y evaluación continua de la calidad de la memoria. Recuerdos contaminados, preferencias caducadas o PII mal filtrada generan errores silenciosos más caros que un timeout.

Si tu organización está comparando proveedores, pide al menos tres datos antes de firmar: coste por turno de memoria mantenida, política de retención y borrado, y mecanismo de evaluación de qué recuerda el agente. Sin esos tres números, cualquier TCO que te presenten es marketing. Para compañías que ya están integrando agentes en CRM o ERP, tiene sentido apoyarse en consultoría IA para definir el modelo de gobernanza antes de tocar código.

Qué debería hacer un CTO esta semana

Primero, separar en el roadmap lo que es decisión de modelo y lo que es decisión de runtime. Son dos compras distintas y mezclarlas garantiza un bloqueo técnico en seis meses. Segundo, definir hoy una política de memoria: qué se guarda, dónde, cuánto tiempo y bajo qué base legal. Tercero, exigir a cualquier plataforma de agentes una vía de escape razonable: exportación de estado, contratos de portabilidad y APIs estándar donde existan.

Las empresas que están liderando el despliegue en verticales como seguros, logística y atención al cliente no están eligiendo el mejor modelo. Están eligiendo el mejor envoltorio. Y ese envoltorio, a partir de esta noticia, ya no es territorio exclusivo de OpenAI con sus agentes ni de Anthropic con Claude Managed Agents. Es una pelea a tres con Google jugando la carta de la neutralidad, que es la más inteligente comercialmente y la más difícil de ejecutar técnicamente.

Si estás contratando talento o partners para esto, mira más allá del logo del modelo. Mira quién sabe diseñar estado, gobernanza y enrutado. Las agencias especializadas en agentes autónomos son el cuello de botella real del mercado ahora mismo, no los LLMs.

Predicción: la memoria persistente se convierte en el nuevo campo de batalla regulatorio

Mi apuesta es concreta. Antes de doce meses, la memoria persistente de agentes será tratada por el AI Act europeo con el mismo rigor que el tratamiento de datos personales bajo el RGPD, porque funcionalmente lo es. Un agente que recuerda conversaciones, preferencias y decisiones de un usuario durante meses está construyendo un perfil conductual, se llame memoria o se llame CRM. Las empresas que hayan diseñado su política de retención ahora tendrán una ventaja competitiva estructural; las que hayan delegado el diseño al proveedor descubrirán el problema cuando un regulador o un cliente lo saque en una auditoría.

Y sobre Google: si consigue que Gemini + Claude convivan sin fricción para el desarrollador, habrá ganado la capa de mayor valor del stack. Si no, habrá regalado a Anthropic y OpenAI un argumento perfecto para vender sus propios runtimes como "más coherentes por diseño". La pelea ya no es de parámetros. Es de quién conserva el estado.

Preguntas frecuentes sobre los agentes Gemini con memoria persistente

¿Qué son exactamente los agentes Gemini que ha lanzado Google?

Son agentes construidos sobre los modelos Gemini que pueden ejecutar tareas de larga duración manteniendo el estado en la nube. La diferencia clave frente a versiones anteriores es que la memoria persiste aunque el usuario cierre el dispositivo o cambie de canal (web, móvil, API), y que el agente puede elegir entre Gemini y Claude según la tarea mediante el mismo runtime.

¿Puedo usar Claude dentro de un agente de Google?

Sí, según el anuncio de Google el agente combina modelos Gemini y Claude de Anthropic según la tarea, y hay planes de ampliar la compatibilidad a otros modelos propietarios y abiertos. Esto convierte la plataforma en un orquestador multi-modelo más que en un entorno atado a Gemini, algo poco habitual en los labs propietarios.

¿Cuánto cuesta un agente con memoria persistente frente a uno stateless?

No hay tarifa pública única, pero el patrón es claro: la memoria persistente añade almacenamiento de estado y tokens recurrentes de contexto en cada llamada, lo que en diseños mal optimizados puede multiplicar por 5 o 10 el coste de inferencia. Un diseño correcto de resumen, purga y enrutado por modelo mantiene el sobrecoste en cifras manejables.

¿Es seguro usar memoria persistente con datos de clientes?

Depende del diseño, no del proveedor. La memoria persistente puede almacenar PII y construir perfiles conductuales, lo que la sitúa directamente bajo requisitos de RGPD europeo: base legal, retención definida y borrado efectivo. Recomiendo exigir al proveedor políticas explícitas de retención y mecanismos de auditoría antes de poner un agente en producción.

¿Gemini o Claude para mis agentes en producción?

La pregunta correcta ya no es cuál elegir, sino cómo enrutar. En rutas sencillas (clasificación, respuestas cortas) un modelo rápido tipo Gemini Flash suele ser más barato; en razonamiento complejo o tool use largo, Claude sigue siendo competitivo. Lo sensato es un agente que pueda usar ambos y medir coste por tipo de tarea.

¿Qué perfil de agencia IA debería buscar para implantar esto?

Busca equipos que sepan diseñar estado, gobernanza y enrutado multi-modelo, no solo integradores de SDK. En España, muchos perfiles están en el directorio de agentes autónomos y de integraciones IA; allí puedes ver casos reales por vertical y ciudad antes de contratar.

Temas relacionados en agentes.ai

Si quieres aplicar lo que lees en tu empresa, estos son puntos de partida útiles dentro de agentes.ai:

Posts relacionados