Modelos · · 7 min de lectura

VibeThinker-3B y LFM2.5-230M: el edge AI ya es una decisión de negocio

Modelos de 3B y 230M parámetros igualan a gigantes en razonamiento. Lo que esto significa para tu stack de IA en producción y qué agencias ya lo despliegan.

VibeThinker-3B y LFM2.5-230M: el edge AI ya es una decisión de negocio

Dos lanzamientos esta semana confirman lo que muchos CTOs intuían pero pocos habían cuantificado: el coste de inferencia en la nube está a punto de convertirse en un argumento indefendible frente a sus propios consejos de administración. VibeThinker-3B, de Sina Weibo, iguala a DeepSeek V3.2 y Kimi K2.5 en benchmarks de matemáticas y programación siendo hasta 333 veces más pequeño. Y Liquid AI acaba de soltar LFM2.5-230M, que corre en un Galaxy S25 Ultra a 213 tokens por segundo y en una Raspberry Pi 5 a 42. Ninguna de las dos noticias es hype: tienen números, tienen código abierto y tienen implicaciones de coste inmediatas.

El razonamiento se comprime; el conocimiento general, no

La conclusión técnica de Sina Weibo con VibeThinker-3B es la más importante que ha salido en semanas: el razonamiento lógico es comprimible, el conocimiento factual del mundo no. Esto tiene consecuencias directas para cualquier arquitectura de agentes empresariales.

Si tu caso de uso implica razonamiento estructurado —planificación de pasos, debugging, resolución de problemas matemáticos, análisis de código— un modelo de 3B parámetros entrenado con la técnica adecuada puede hacer lo que antes requería un modelo de 70B o más. Eso no es una mejora incremental: es un cambio de orden de magnitud en el coste de operación de un agente autónomo en producción.

Pero el matiz es crítico: VibeThinker-3B no sirve para responder preguntas generales sobre el mundo, procesar knowledge bases extensas sin RAG o gestionar contextos narrativos complejos. La arquitectura correcta para 2026 no es "un modelo pequeño para todo", sino routing inteligente según el tipo de tarea. Lo que nos lleva directamente a Wayfinder Router.

Wayfinder Router: la pieza que faltaba en la arquitectura híbrida

Wayfinder Router ha aparecido en HackerNews esta semana con un enfoque que merece atención: enrutamiento determinista de consultas entre modelos locales y en la nube. No probabilístico, no heurístico. Determinista.

Esto resuelve el problema de confianza que frena a muchas empresas a la hora de adoptar arquitecturas híbridas. Si no puedes predecir qué modelo va a procesar una consulta sensible, no puedes auditar, no puedes cumplir con políticas de datos y no puedes escalar con garantías. El enrutamiento determinista convierte la decisión local/nube en una regla de negocio explícita, no en un comportamiento emergente del sistema.

La combinación VibeThinker-3B (razonamiento local) + LFM2.5-230M (instrucciones y extracción en edge) + Wayfinder (enrutamiento) + un modelo frontier para tareas de conocimiento general es exactamente la arquitectura que las consultorías de IA más avanzadas van a vender como producto en el segundo semestre de 2026. El que lo tenga en producción antes tiene ventaja.

LFM2.5-230M: 230 millones de parámetros que superan a Qwen y Gemma

Liquid AI merece más atención de la que recibe en el mercado español. Su LFM2.5-230M no es un modelo de juguete: en seguimiento de instrucciones, uso de herramientas y extracción de datos supera a Qwen3.5-0.8B y Gemma 3 1B, ambos modelos más grandes. La arquitectura LFM2 (Liquid Foundation Model) es distinta a los transformers convencionales, y eso se nota en la eficiencia de inferencia.

Compatibilidad con llama.cpp, MLX, vLLM, SGLang y ONNX significa que la fricción de despliegue es prácticamente cero para cualquier equipo con experiencia en el stack estándar. A 213 tokens por segundo en un S25 Ultra, hablamos de un modelo que puede vivir en el dispositivo del usuario final, eliminando latencia de red, costes de API y riesgos de privacidad de datos en tránsito.

Para empresas en sectores regulados —banca, salud, legal— esto no es una optimización técnica. Es el argumento que desbloquea casos de uso que hoy están bloqueados por compliance. Las agencias de IA en Madrid que trabajan con entidades financieras deberían estar pilotando LFM2.5-230M esta semana, no el mes que viene.

DSpark de DeepSeek: aceleración especulativa sin sacrificar calidad

En paralelo, DeepSeek ha publicado como código abierto DSpark, un framework de decodificación especulativa que se integra directamente con los pesos de DeepSeek-V4. Los números son serios: entre 57% y 85% de incremento de velocidad por usuario respecto a la línea base MTP-1, sin pérdida de calidad medible en producción.

La clave técnica es la combinación de un módulo borrador paralelo con verificación adaptada a la carga real de la GPU. No es una optimización teórica de laboratorio: están reportando estas cifras en producción real con carga variable. Para cualquier empresa que ya tenga DeepSeek-V4 desplegado, DSpark es una actualización obligatoria. El coste de no aplicarla es literalmente pagar el mismo servidor para generar un 57% menos de tokens por segundo.

El ecosistema de agencias de automatización con IA que gestionan pipelines de generación de contenido o procesamiento masivo de documentos tiene aquí un win inmediato sin cambiar de modelo.

El fichaje de Apple Vision Pro en OpenAI: señal para el hardware de agentes

Paul Meade, VP de Apple a cargo del Vision Pro, se incorpora al equipo de hardware de OpenAI. Este movimiento hay que leerlo en contexto: OpenAI no está construyendo hardware para consumidores, está construyendo hardware para agentes. Un ejecutivo que ha gestionado el dispositivo computacional más ambicioso —y más caro de fabricar— de Apple en la última década no se ficha para hacer auriculares.

La apuesta es que los agentes de próxima generación necesitarán hardware propietario para ser competitivos en latencia y coste. Es la misma lógica que llevó a Google a construir TPUs y a Amazon a construir Trainium. OpenAI quiere controlar la pila completa. Para el mercado español, esto significa que la dependencia de APIs de OpenAI puede evolucionar hacia dependencia de hardware propietario de OpenAI. Las agencias de IA en Barcelona que construyen sobre APIs deberían diversificar su stack ahora, no cuando el lock-in sea un hecho consumado.

La encuesta de Anthropic: dato útil, pero con sesgo de selección masivo

Anthropoc publica que el 50% de sus usuarios cree que Claude ya gestiona el 50% o más de sus tareas laborales. El 26% espera llegar al 60-90% de cobertura en 12 meses. El dato es interesante, pero el sesgo de selección es enorme: son usuarios activos de Claude, probablemente early adopters con alta alfabetización en IA.

Lo que sí es válido como señal de mercado: los trabajadores en etapas tempranas de carrera son los más preocupados, mientras que los usuarios más intensivos son los más optimistas. Esto confirma lo que ya se observa en los proyectos de integración de IA en empresas: quienes más usan la herramienta ven oportunidades, quienes la observan desde fuera ven amenazas. La variable determinante no es la tecnología, sino la curva de adopción interna.

La arquitectura ganadora de 2026 ya está clara

Si juntas las piezas de esta semana —VibeThinker-3B, LFM2.5-230M, DSpark, Wayfinder Router— el patrón es inequívoco: el modelo monolítico en la nube como backbone de todos tus procesos va a ser la arquitectura más cara y menos competitiva en 18 meses.

La apuesta correcta ahora es invertir en capacidad de orquestación heterogénea: saber qué tarea va a qué modelo, en qué infraestructura y con qué política de datos. Eso no lo resuelve ningún modelo, lo resuelve arquitectura y criterio. El verdadero diferencial competitivo en IA para empresas españolas en 2026 no es qué modelo usas, es si tienes el equipo que sabe ensamblar estas piezas antes que tu competidor.

El que siga esperando al modelo perfecto va a descubrir que sus competidores ya están en producción con modelos "suficientemente buenos" que cuestan diez veces menos.

Temas relacionados en agentes.ai

Si quieres aplicar lo que lees en tu empresa, estos son puntos de partida útiles dentro de agentes.ai: