Modelos · · 10 min de lectura
Liquid AI d1: el modelo que decide sin escribir y por qué rompe el pricing de los LLM
Liquid AI lanza d1, un modelo de decisión que devuelve probabilidades calibradas sobre un conjunto cerrado de resultados sin generar un solo token. Analizamos el impacto real en costes, latencia y arquitectura de agentes IA en producción.
Liquid AI ha lanzado d1, un modelo de decisión que devuelve probabilidades calibradas sobre un conjunto fijo de resultados en una sola llamada y sin generar un solo token. No es un LLM más pequeño, ni un prompt mejorado: es una categoría distinta que ataca directamente la factura y la latencia de los agentes IA que hoy están en producción.
TL;DR: d1 no genera texto: recibe contexto y una pregunta tipada y devuelve una distribución de probabilidad sobre opciones predefinidas. Elimina el coste por token de salida, reduce latencia y hace medible la incertidumbre en decisiones de enrutado, scoring y triaje. Para CTOs, el impacto real está en pipelines donde el LLM solo se usaba para elegir entre 5 opciones.
El anuncio, publicado en MarkTechPost, coincide con un DevDay de OpenAI donde se ha hablado de ChatGPT como sistema operativo y con un Holo4 de Hugging Face que persigue agentes generalistas de uso de computadora. Todo apunta a lo mismo: la industria está separando el razonamiento generativo de la decisión estructurada. d1 es la primera pieza que se vende explícitamente como esa segunda mitad, sin disimulo.
Por qué "cero tokens de salida" es una noticia de coste, no de marketing
La facturación de la mayoría de APIs LLM se compone de tokens de entrada + tokens de salida. En producción, el output suele ser la partida cara: es más lento, más secuencial y se factura con multiplicadores de 3x a 4x respecto al input en casi todos los proveedores. Durante dos años, el truco de la industria ha sido pedir al modelo que responda solo 'sí', 'no' o 'A/B/C'. Sigue generando tokens. Sigue costando.
d1 rompe el contrato. Devuelve la distribución de probabilidad en una sola pasada, sin decodificación autoregresiva, sin tokens. Para una clasificación binaria sobre 10 millones de eventos mensuales, la diferencia no es marginal: es la diferencia entre un proyecto financiable y uno que no lo es.
Traducido a operación: si tu pipeline de triaje de tickets, scoring de leads o enrutado de intenciones estaba pagando por tokens de salida que luego tirabas a la basura (porque solo leías la primera letra), acabas de recuperar ese margen. Y ese margen, en empresas medianas, suele ser el que decide si un piloto de agentes IA pasa a producción o se queda en el PoC.
Calibración: lo que separa un juguete de un sistema auditable
El punto técnico que más debería importar a un CTO es la palabra calibradas. Un LLM que dice "tengo un 87% de confianza" está mintiendo casi siempre: esa cifra es una alucinación estadística sobre la que no puedes actuar. Un modelo calibrado, en el sentido propio, significa que entre los casos donde reporta 0,8 de probabilidad, aproximadamente el 80% son positivos. Eso es lo que permite poner umbrales.
Poner umbrales es lo que permite derivar a un humano cuando la probabilidad cae entre 0,4 y 0,6, y automatizar cuando supera 0,9. Sin calibración, esa política es imposible y todo termina pasando por revisión humana, que es exactamente el cuello de botella que las agencias llevan años vendiendo como "human in the loop" cuando en realidad era "humano pagando el pato".
Este movimiento posiciona a Liquid AI por delante de los proveedores generalistas en un nicho que estos ignoran porque es pequeño en titulares: decisiones repetibles con coste marginal cercano a cero. A diferencia de lo que sugiere parte del hype, d1 no sustituye a GPT ni a Claude. Los complementa. La arquitectura ganadora no es "un modelo para todo", es un router que decide qué motor usar según el tipo de tarea.
Impacto en arquitecturas de agentes IA y agentes autónomos
La arquitectura típica de un agente autónomo en 2026 tiene tres capas: percepción, planificación y ejecución. La capa de planificación es donde más tokens se queman hoy, porque casi todo el mundo la implementa como un chat interno. d1 ataca esa capa con una idea vieja bien ejecutada: si las acciones posibles son finitas, no necesitas generar texto, necesitas inferir la distribución sobre ese conjunto finito.
Ejemplos concretos que ya se ven en despliegues reales:
- Enrutado de intención en un agente de voz: 14 intenciones, una sola llamada, probabilidad por intención.
- Selección de herramienta en un agente tool-using: 8 funciones disponibles, distribución sobre cuál invocar.
- Triaje de tickets: urgencia, categoría y equipo responsable como tres cabezas de clasificación.
- Scoring de leads B2B: probabilidad de conversión en un rango discreto de bandas.
En los cuatro casos, la generación de lenguaje es irrelevante. Estabas pagando por un motor de escritura para hacer aritmética de decisiones. El ecosistema de agencias de IA en Madrid está empezando a mover sus frameworks de orquestación hacia este patrón porque el ahorro en coste fijo de inferencia es directamente atribuible al margen del cliente. Para las empresas que buscan agencias de IA en Barcelona, esta separación entre motor de decisión y motor de generación es la diferencia entre un agente que escala y uno que solo demuestra.
Comparativa: cuándo usar d1 y cuándo seguir con un LLM generativo
| Criterio | Modelo de decisión (d1) | LLM generativo |
|---|---|---|
| Salida | Distribución sobre opciones fijas | Texto libre |
| Coste de salida | Cero tokens generados | Facturado por token |
| Latencia | Una sola pasada | Decodificación secuencial |
| Incertidumbre | Calibrada y explotable en umbrales | No fiable sin post-proceso |
| Caso ideal | Enrutado, scoring, triaje, tool selection | Redacción, resumen, razonamiento abierto |
| Auditoría | Trivial (probabilidades y opciones cerradas) | Compleja (texto no determinista) |
La lectura estratégica de esta tabla es incómoda para muchos proveedores: durante dos años hemos vendido LLM como solución universal cuando una parte sustancial de los casos de uso empresariales eran problemas de clasificación disfrazados de conversación. d1 solo hace explícito lo que ya era cierto. Si tu arquitectura sigue metiendo un chat donde debería ir un clasificador, no tienes un problema de rendimiento: tienes un problema de diseño.
El hueco que deja en el mercado español de consultoría IA
Liquid AI no es un proveedor con canal enterprise en Europa. Esto es una oportunidad y un aviso. Es una oportunidad porque abre una ventana de 6 a 12 meses en la que las agencias de IA en Valencia y el resto del ecosistema pueden posicionar servicios de "decisión estructurada" antes de que los hyperscalers empaqueten la misma capacidad en sus plataformas. Es un aviso porque, cuando AWS o Azure la absorban, la diferenciación ya no estará en saber usar d1, sino en tener los datos, las opciones tipadas y las políticas de umbral bien definidas para cada cliente vertical.
Ahí es donde entra la consultoría IA real. Diseñar el espacio de decisión de un agente no es un ejercicio de prompt engineering. Es una conversación con negocio sobre qué decisiones se automatizan, con qué umbral de error tolerable y qué se hace con la banda gris. Las agencias que están haciendo esto bien se reconocen rápido: entregan matrices de decisión antes que diagramas de arquitectura.
El otro frente es la gobernanza. Un modelo que devuelve probabilidades calibradas es mucho más fácil de auditar ante un comité de riesgos que un LLM que genera texto plausible. Para banca, seguros o salud —verticales donde la IA lleva años atascada en comités—, esto puede desbloquear proyectos que estaban parados no por capacidad técnica, sino por imposibilidad de explicar la decisión. Si el modelo dice 0,91 y el umbral es 0,9, la defensa ante el regulador es una línea. Con un LLM generativo, son veinte páginas de interpretabilidad y ni así.
El riesgo que nadie está mencionando
Hay dos trampas en cómo se está contando esta noticia. La primera es asumir que un modelo cerrado de opciones es siempre mejor. No lo es: si tu problema real es de razonamiento abierto, forzar un espacio finito de respuestas degrada la calidad aunque ahorre coste. La segunda es que la calibración no es gratis. Se degrada con el tiempo, con el drift de distribución y con cambios en el contexto de entrada. Un sistema que era calibrado en enero puede estar mintiendo en junio si nadie lo reentrena o recalibra. Eso exige pipelines de monitorización que la mayoría de equipos no tiene montados.
Para las empresas que trabajan con agencias especializadas en agentes autónomos, la pregunta operativa es concreta: ¿quién recalibra? Si la respuesta es "nadie porque el modelo es de un tercero", tienes un pasivo silencioso en producción.
Mi predicción: en 12 meses, los modelos de decisión serán una capa estándar en cualquier stack de agentes maduro, igual que hoy lo es un vector store. Los proveedores generalistas integrarán una API equivalente y el diferenciador se moverá al diseño del espacio de decisión y a la política de umbrales por vertical. Las agencias que sepan vender eso —y no otro wrapper de chat— capturarán el margen que hoy se está quemando en tokens de salida innecesarios. La pregunta no es si vas a adoptar d1 o su equivalente, sino cuántos de tus agentes actuales están generando texto que nadie lee.
Preguntas frecuentes sobre Liquid AI d1
¿Qué es Liquid AI d1 exactamente?
Es un modelo de decisión que recibe contexto y una pregunta tipada, y devuelve probabilidades calibradas sobre un conjunto fijo de resultados en una sola llamada. No genera texto: no emite tokens de salida. Está diseñado para elecciones estructuradas (enrutado, clasificación, scoring) en lugar de generación.
¿Cuánto cuesta d1 comparado con un LLM generativo?
El ahorro estructural no está en el precio por token de entrada, sino en eliminar por completo la facturación de tokens de salida, que en la mayoría de proveedores se factura con multiplicadores de 3x a 4x respecto al input. Para volúmenes altos de decisiones discretas, el coste marginal por decisión cae de forma drástica porque no hay decodificación autoregresiva.
¿Puedo usar d1 en producción para un agente de voz?
Sí, y es uno de sus casos naturales. Un agente de voz con un conjunto finito de intenciones puede usar d1 para inferir la intención y reservar el LLM generativo solo para la respuesta hablada. Esto reduce latencia (una pasada en vez de decodificación secuencial) y da una probabilidad calibrada sobre la que aplicar umbrales de derivación a humano.
¿d1 sustituye a GPT o Claude en mi stack?
No. Los complementa. d1 cubre la capa de decisión estructurada; los LLM generativos siguen siendo necesarios para redacción, resumen y razonamiento abierto. La arquitectura correcta es un router que decide qué motor usar según el tipo de tarea, no sustituir uno por otro.
¿Qué significa que las probabilidades estén "calibradas"?
Que si el modelo reporta 0,8 de probabilidad sobre un resultado, aproximadamente el 80% de los casos con esa puntuación son realmente positivos. Esa propiedad es la que permite fijar umbrales de automatización, algo que un LLM generativo no ofrece sin post-procesado. La calibración, sin embargo, se degrada con el drift y exige recalibración periódica.
Temas relacionados en agentes.ai
Si quieres aplicar lo que lees en tu empresa, estos son puntos de partida útiles dentro de agentes.ai:
- Directorio de agencias de agentes de voz
- Agencias de IA en Sevilla y en Zaragoza
- Explora el directorio completo de agencias de IA
- Sigue las últimas noticias de IA en tiempo real