Herramientas · · 7 min de lectura
Always-On Memory vs RAG: el coste real de abandonar los embeddings
Google elimina bases vectoriales con su Always-On Memory Agent sobre Gemini 3.1. Analizamos el impacto en costes, arquitectura y qué significa para las empresas que ya apostaron por RAG.
Google acaba de declarar obsoleto, al menos en intención, uno de los pilares más rentables del ecosistema de agentes de los últimos tres años: el pipeline RAG con embeddings y bases de datos vectoriales. El 'Always-On Memory Agent', construido sobre Google ADK y Gemini 3.1 Flash-Lite, propone algo conceptualmente diferente: memoria como proceso continuo, no como consulta puntual.
La pregunta que importa no es si el demo técnico funciona. La pregunta es cuánto cuesta en producción y quién realmente debería migrar.
Qué cambia (y qué no) con la memoria persistente continua
El enfoque tradicional RAG funciona así: tienes documentos, los troceas, los conviertes en vectores, los metes en Pinecone, Weaviate o pgvector, y en tiempo de inferencia recuperas los fragmentos más relevantes. Es un modelo de consulta bajo demanda. Funciona. Escala. Y tiene un coste operativo predecible.
El Always-On Memory Agent de Google plantea algo distinto: sub-agentes especializados que leen, conectan y escriben memoria estructurada en SQLite de forma continua, sin embeddings. La memoria no se recupera, se consolida constantemente. Sobre papel, esto resuelve un problema real de RAG: la pérdida de contexto semántico entre sesiones y la incapacidad de los embeddings para capturar relaciones complejas que evolucionan con el tiempo.
Pero hay un detalle que el anuncio oficial minimiza: ese proceso continuo de consolidación tiene un coste de inferencia permanente. No es una llamada al modelo cuando el usuario hace una pregunta. Es Gemini 3.1 Flash-Lite trabajando en background las 24 horas procesando y reorganizando memoria. Para un caso de uso con miles de usuarios concurrentes, ese coste se acumula de forma no lineal.
A diferencia de lo que sugiere el anuncio, el verdadero reto para las empresas españolas que evalúen esta arquitectura no será la implementación técnica, sino modelar el coste total de operación antes de comprometerse con ella en producción.
El contexto competitivo: por qué Google mueve esta ficha ahora
Este lanzamiento no es neutral. Google tiene un problema estructural en el segmento enterprise de agentes: Anthropic y OpenAI han construido ecosistemas de memoria más maduros y con mayor adopción real. Claude con su extended context y los proyectos de memoria de ChatGPT llevan meses acumulando casos de uso documentados.
Publicar una implementación de referencia open-source sobre ADK es una jugada de captura de desarrolladores, no de CTOs. El objetivo es que los equipos de ingeniería construyan sobre Google Cloud antes de que consoliden sus stacks sobre AWS Bedrock o Azure AI.
Paralelo a esto, la situación de Anthropic con Claude Fable 5 merece atención estratégica: a partir del 20 de julio, Anthropic recorta los límites de uso al 50% en planes Max y Team Premium, y los usuarios Pro reciben un crédito único de 100 dólares antes de ser empujados a tarifas de API. Este movimiento, que claramente responde a la presión competitiva del más económico GPT-5.6 Sol de OpenAI, revela algo importante: ningún proveedor de modelos ha resuelto aún la ecuación de rentabilidad a escala.
La consecuencia práctica para cualquier empresa que haya construido flujos de trabajo críticos sobre planes flat-rate de Anthropic es clara: el coste de sus agentes va a subir, o va a tener que reentrenar sus pipelines sobre un modelo diferente. Ninguna de las dos opciones es gratuita.
SQLite como base de memoria: elegancia o trampa de escala
La elección de SQLite como backend de memoria estructurada en el Always-On Memory Agent es técnicamente elegante para demos y casos de uso con un solo usuario o sesiones aisladas. Para producción enterprise con concurrencia real, SQLite tiene limitaciones bien conocidas en escritura concurrente que el anuncio no menciona en ningún momento.
Eso no significa que la arquitectura sea inviable. Significa que en producción habría que migrar a PostgreSQL, Cloud Spanner u otro backend transaccional, lo cual añade capas de complejidad que el tutorial de referencia no cubre. Las agencias especializadas en integración de IA que acompañan a empresas en estos despliegues van a encontrarse exactamente con este gap entre el prototipo de Google y la implementación real.
El patrón es familiar: Google lanza una implementación de referencia brillante, los equipos internos la replican en staging, y en el momento de escalar aparecen los problemas de concurrencia, latencia y coste que el notebook de Colab no simulaba.
La apuesta del Pentágono y lo que dice sobre adopción empresarial
El manual de IA del Departamento de Marina de EE.UU. contiene una frase que debería estar en la agenda de cualquier comité ejecutivo europeo: avanzar demasiado despacio representa un riesgo mayor que implementar una IA con alineación imperfecta. Esto no es descuido institucional. Es una postura estratégica explícita que The Decoder ha documentado con detalle.
El contexto importa: el Pentágono está construyendo flotas donde modelos de lenguaje operan directamente en buques de guerra. La tolerancia al riesgo de alineación imperfecta en ese contexto es, objetivamente, mayor que en una empresa de seguros o en un banco. Pero el mensaje de fondo tiene aplicación directa en entornos corporativos: el coste de oportunidad de la no-adopción ya es medible y, en muchos sectores, supera al riesgo técnico.
Para los CTOs españoles que siguen en ciclos de evaluación de 18 meses, esta señal geopolítica es relevante. No como argumento para saltarse la gobernanza, sino como presión de mercado real: los competidores que ya están en producción con agentes autónomos están comprimiendo márgenes y acelerando ciclos de decisión a un ritmo que no espera a los comités de riesgo.
Las empresas de consultoría de IA que trabajan con grandes cuentas en España están viendo este patrón: el gap entre empresas que han desplegado y las que siguen evaluando se está convirtiendo en una ventaja competitiva difícil de recuperar.
Meta-Anthropic: cuando los competidores se necesitan mutuamente
La noticia más estratégicamente interesante del día no es técnica: Meta estaría en conversaciones con Anthropic para alquilar capacidad de cómputo de sus centros de datos. Esto es notable por dos razones.
Primero, Anthropic tiene un problema de infraestructura real. Depende de AWS como proveedor principal y está bajo presión competitiva de OpenAI en pricing. Alquilar compute de Meta le daría diversificación de infraestructura y posiblemente mejores márgenes en inferencia.
Segundo, Meta convierte su apuesta de inversión masiva en centros de datos —hasta ahora justificada internamente por Llama y Meta AI— en un negocio de infraestructura que compite directamente con AWS, Google Cloud y Azure. Si cierra este acuerdo, el mercado de compute para modelos de lenguaje se fragmenta de una forma que beneficia a los compradores.
Para las agencias de agentes autónomos que asesoran a empresas sobre stack tecnológico, este movimiento sugiere que en 12-18 meses el mercado de inferencia puede ser significativamente más competitivo y barato. Apostar ahora todo a un único proveedor de modelos tiene más riesgo de lock-in del que muchos planes de adopción reconocen.
Lo que está pasando de fondo en el ecosistema de agentes
Tomando perspectiva sobre el conjunto de movimientos del día: Google presiona con memoria sin RAG, Anthropic sube precios efectivos, Meta entra en el negocio de compute, y el Pentágono explicita que la lentitud es un riesgo.
El patrón es una aceleración de la consolidación. Los modelos fundacionales grandes están en una guerra de precios que está exprimiendo sus márgenes —la presión de GPT-5.6 Sol sobre Claude Fable 5 es el ejemplo más visible—, mientras que la capa de infraestructura se abre a nuevos actores.
Para las empresas medianas y grandes en España que están eligiendo su arquitectura de agentes en este momento, el ecosistema de agencias de IA en Madrid y el de agencias de IA en Barcelona están procesando exactamente esta presión: qué stack construir cuando las reglas del juego del proveedor pueden cambiar en 60 días.
La respuesta más defensiva —y probablemente la más correcta— es diseñar con abstracción de modelo desde el primer día. No porque sea elegante técnicamente, sino porque la volatilidad de precios y límites que estamos viendo en julio de 2026 no va a estabilizarse en el corto plazo.
El mercado está recompensando velocidad de despliegue. Pero las empresas que están construyendo sin pensar en portabilidad van a pagar el precio de la migración en el peor momento posible: cuando ya tengan usuarios en producción y los costes cambien debajo de sus pies.
Temas relacionados en agentes.ai
Si quieres aplicar lo que lees en tu empresa, estos son puntos de partida útiles dentro de agentes.ai:
- Directorio de agencias de agentes de voz
- Agencias de IA en Buenos Aires y en Valencia
- Explora el directorio completo de agencias de IA
- Sigue las últimas noticias de IA en tiempo real