Empresas · · 7 min de lectura
GLM 5.2 y modelos chinos: cómo Coinbase redujo su coste IA un 50%
Coinbase migró a GLM 5.2 y Kimi 2.7 con enrutamiento automático y optimización de caché, cortando a la mitad su gasto en IA. Lo que implica para CTOs europeos.
Coinbase acaba de publicar el manual de cómo recortar a la mitad el gasto en IA sin sacrificar rendimiento. Y el protagonista no es OpenAI ni Anthropic.
El CEO Brian Armstrong confirmó que la compañía migró parte de su stack a modelos chinos —GLM 5.2 y Kimi 2.7— implementando un sistema de enrutamiento automático que asigna cada tarea al modelo más eficiente según coste y capacidad. El resultado: con uso de tokens en crecimiento, el gasto total se redujo un 50%. El otro factor clave fue la gestión del caché: la tasa de aciertos pasó del 5% al 60%, lo que en términos prácticos significa que seis de cada diez consultas dejan de pagarse al proveedor de inferencia.
Esto no es un truco de ingeniería menor. Es una señal de mercado que los CTOs europeos deberían leer con atención.
El enrutamiento multi-modelo ya no es una arquitectura avanzada, es higiene básica
La estrategia de Coinbase —conocida como LLM routing o model routing— no es nueva conceptualmente, pero su adopción a escala enterprise con modelos de distintas procedencias geográficas sí lo es. Durante 2024 y 2025, el debate giraba en torno a GPT-4o vs. Claude vs. Gemini. En 2026, la conversación ya incluye GLM 5.2, Kimi 2.7, Qwen y DeepSeek en el mismo tablero de decisión que los modelos occidentales.
El movimiento de Coinbase tiene dos lecturas. La primera, obvia: si un modelo chino supera a Claude en los benchmarks de HackerNews y cuesta significativamente menos, la lealtad de marca corporativa a un proveedor premium empieza a tener un coste financiero medible. La segunda, más incómoda: las empresas que hoy tienen un único proveedor de LLM están dejando dinero sobre la mesa y acumulando riesgo de concentración.
Sobre GLM 5.2, los datos disponibles provienen de pruebas internas publicadas en HackerNews que muestran rendimiento superior a Claude en varios benchmarks comparativos. Hay que aplicar el escepticismo habitual a cualquier benchmark publicado por el propio interesado, pero el hecho de que una empresa del calibre de Coinbase lo valide en producción le da una credibilidad que ningún leaderboard puede igualar.
La guerra de precios de memoria que encarecerá todo esto en 2027
Aquí llega la ducha fría. Mientras Coinbase celebra su reducción de costes, Samsung y SK Hynix —que controlan cerca del 80% del mercado HBM mundial— anuncian una inversión conjunta de 590.000 millones de dólares en nuevas fábricas y centros de empaquetado. El banco Jefferies proyecta subidas de precio de la memoria de hasta un 50% por trimestre hasta 2027.
Esto significa que la inferencia barata que hoy hace rentable el enrutamiento a modelos chinos puede volverse significativamente más cara en uestros próximos 18 meses. El coste de los tokens no solo depende de los márgenes de OpenAI o Anthropic: depende del precio del HBM que alimenta los data centers donde se ejecutan todos esos modelos, incluidos los chinos. Micron, que Wall Street posiciona ya como el próximo Nvidia, y los fabricantes coreanos van a dictar en buena parte cuánto pagará tu empresa por cada millón de tokens en 2027.
La conclusión estratégica es contraintuitiva: la ventana de arbitraje de costes entre modelos es real hoy, pero tiene fecha de caducidad. Las empresas que construyan ahora la infraestructura de enrutamiento multi-modelo estarán mejor posicionadas para optimizar cuando los precios de memoria impacten en los costes de inferencia, porque podrán cambiar proveedores con fricción mínima. Las que no lo hagan seguirán atadas a un proveedor que trasladará la subida de precios sin contemplaciones.
Para las empresas que trabajan con una consultoría de IA especializada en integración de modelos, este es el momento de revisar contratos con proveedores de inferencia y diseñar arquitecturas de enrutamiento antes de que la presión de costes llegue.
El ATS de HackerRank y la lección sobre fiabilidad en producción
Paralelamente, HackerRank liberó su sistema de seguimiento de candidatos como código abierto. El problema: el mismo currículum obtiene 90, 74 u 88 puntos dependiendo de cuándo y cómo se ejecuta la evaluación. Inconsistencia del 18% en un sistema que toma decisiones sobre personas.
Esto no es un bug anecdótico. Es la demostración empírica de algo que los equipos técnicos saben pero los CEOs suelen ignorar: los sistemas de evaluación basados en LLM tienen varianza no determinista por diseño, y sin capas de validación y control de calidad, esa varianza se convierte en decisiones inconsistentes a escala. Cualquier empresa que use IA para screening de candidatos sin un protocolo de calibración está expuesta exactamente a este problema.
El ecosistema de agencias de IA en Barcelona y agencias de IA en Madrid que desarrollan soluciones de automatización de RRHH debería tomar nota: el argumento de venta no puede ser solo velocidad y coste, tiene que incluir métricas de consistencia y auditabilidad. Los clientes enterprise que empiecen a hacer preguntas sobre varianza van a separar muy rápido las soluciones serias de las demos.
Ford y el coste oculto de la sobre-dependencia de la IA
Ford reconoció públicamente haber cometido un error estratégico: creyó que la IA por sí sola podría mantener la calidad de producción y prescindió de ingenieros veteranos. Resultado: ha tenido que recontratarlos.
Este caso merece más análisis del que generalmente recibe en la cobertura tecnológica. No es una historia anti-IA. Es una historia sobre qué tipo de conocimiento es sustituible hoy y cuál no. La IA de 2026 puede optimizar parámetros conocidos con eficiencia brutal, pero el conocimiento tácito de un ingeniero con 20 años de experiencia en manufactura —lo que sabe que no sabe que sabe— no está en ningún dataset de entrenamiento. Ford pagó la diferencia.
Para cualquier empresa que esté dimensionando su equipo humano asumiendo que los agentes autónomos cubrirán los gaps, este es un caso de estudio que debería entrar en los comités de dirección. La sustitución no es lineal ni universal: depende radicalmente del tipo de conocimiento implicado.
LFM2.5-230M: edge AI como variable de coste, no como experimento
Liquid AI presentó LFM2.5-230M, 230 millones de parámetros que corren a 213 tokens por segundo en un Galaxy S25 Ultra y a 42 en una Raspberry Pi 5. Supera a Qwen3.5-0.8B y Gemma 3 1B en seguimiento de instrucciones y uso de herramientas según sus propios benchmarks.
Dado que ya publicamos análisis sobre LFM2.5 el 28 de junio, no vamos a repetir el terreno cubierto, pero sí añadir una dimensión relevante al contexto de hoy: si los precios de HBM suben un 50% trimestral hasta 2027 tal como proyecta Jefferies, los modelos edge que no necesitan data centers HBM van a tener una ventaja de coste estructural que hoy parece marginal y en 18 meses puede ser decisiva. La apuesta de Liquid AI por la eficiencia en hardware estándar es más defensiva de lo que parece ante un ciclo alcista de memoria.
Para equipos que estén diseñando arquitecturas de automatización con IA donde la latencia y el coste por inferencia son críticos —manufactura, retail, campo—, LFM2.5-230M entra directamente en la lista de evaluación.
La predicción que nadie quiere hacer
El mercado de modelos de lenguaje en 2026 se está bifurcando en dos dinámicas simultáneas y contradictorias: los costes de inferencia bajan por competencia de modelos chinos y mejoras de eficiencia, pero la infraestructura que los soporta —memoria HBM, capacidad de fabricación— está en un ciclo de inversión masiva que inevitablemente generará presión alcista de precios.
Las empresas que van a ganar no son las que apuestan por el modelo más barato hoy. Son las que construyen ahora la arquitectura de enrutamiento, caché y evaluación que les permita cambiar de proveedor en 48 horas cuando los precios se muevan. Coinbase no redujo costes eligiendo el modelo correcto: redujo costes construyendo la infraestructura para elegir siempre el modelo correcto. Esa es la diferencia entre una decisión táctica y una ventaja competitiva.
Fuentes: The Decoder sobre Coinbase y modelos chinos · The Decoder sobre inversión Samsung y SK Hynix · TechCrunch AI sobre Micron
Temas relacionados en agentes.ai
Si quieres aplicar lo que lees en tu empresa, estos son puntos de partida útiles dentro de agentes.ai:
- Directorio de agencias de automatización con ia
- Agencias de IA en Madrid y en Sevilla
- Explora el directorio completo de agencias de IA
- Sigue las últimas noticias de IA en tiempo real