Herramientas · · 8 min de lectura

DeepSeek V4 Pro vs GPT-5.5 y 'Search as Code': qué cambia para tu stack

DeepSeek V4 Pro supera a GPT-5.5 Pro en precisión y Perplexity elimina las APIs rígidas de búsqueda. Dos movimientos que redefinen el coste y la arquitectura de los agentes empresariales.

DeepSeek V4 Pro vs GPT-5.5 y 'Search as Code': qué cambia para tu stack

DeepSeek V4 Pro acaba de superar a GPT-5.5 Pro en benchmarks de precisión. Si sigues construyendo tu estrategia de IA asumiendo que OpenAI lidera por defecto, tienes un problema de arquitectura, no solo de modelos.

Esta semana ha dejado dos noticias que, vistas por separado, parecen anecdóticas. Juntas, dibujan un cambio estructural en cómo se construyen y se costean los sistemas de búsqueda y recuperación de información para agentes empresariales. Y ambas tienen implicaciones directas para cualquier CTO o product lead que esté evaluando o desplegando agentes IA en producción.

DeepSeek V4 Pro: el coste de seguir apostando por defecto a GPT

El benchmark publicado en HackerNews sitúa a DeepSeek V4 Pro por encima de GPT-5.5 Pro en pruebas de precisión. No es la primera vez que un modelo chino sorprende al mercado occidental —ya lo hizo DeepSeek R1 a principios de 2025— pero esta iteración llega en un momento en que las empresas están revisando presupuestos de inferencia con lupa.

El verdadero impacto aquí no es técnico, es comercial. GPT-5.5 Pro opera en una franja de precio premium que muchas empresas medianas en España están empezando a cuestionar después de los primeros proyectos piloto. DeepSeek V4 Pro, con pesos que históricamente han sido más accesibles y con posibilidad de despliegue en infraestructura propia, abre una vía alternativa que antes no existía con esta paridad de rendimiento.

El matiz que los anuncios oficiales no mencionan: superar en precisión no es lo mismo que superar en latencia de producción, en soporte de contexto largo o en integración con ecosistemas empresariales ya establecidos. Para la mayoría de los casos de uso B2B —resumen de contratos, análisis de informes financieros, soporte técnico automatizado— la precisión factual es el KPI principal. En ese eje, el argumento de "paga más por OpenAI porque es mejor" se debilita considerablemente.

Para las empresas que trabajan con una agencia de consultoría de IA en la evaluación de modelos, este resultado obliga a incluir DeepSeek V4 Pro en cualquier proceso de benchmarking serio a partir de ahora. No hacerlo sería una negligencia técnica.

'Search as Code': Perplexity destruye el modelo de API rígida

La segunda noticia relevante del día viene de Perplexity, y merece más atención de la que está recibiendo. Su nueva arquitectura 'Search as Code' abandona el paradigma de la API de búsqueda con endpoints fijos y permite a los modelos de IA escribir sus propias rutinas de búsqueda en Python dentro de un entorno sandbox.

Traducido al impacto de negocio: en lugar de que tu agente llame a una API que devuelve resultados predefinidos, el propio modelo genera el código de búsqueda adaptado a la consulta. Resultado declarado: reducción de costes de tokens de hasta el 85% y superación de OpenAI y Anthropic en benchmarks clave de recuperación.

Este es un movimiento arquitectónico, no un feature. La diferencia entre una búsqueda rígida y una búsqueda generada dinámicamente es la diferencia entre un agente que sigue un script y un agente que razona sobre cómo buscar. Para sistemas multiagente complejos —donde un subagente de recuperación necesita adaptar su estrategia según el contexto— esto es exactamente el tipo de flexibilidad que faltaba.

La reducción del 85% en costes de tokens no es marketing vacío si se sostiene fuera del sandbox controlado de Perplexity. Y aquí está el escepticismo necesario: los benchmarks propios de las compañías siempre miden el escenario en el que su solución brilla. El número real en producción, con datos sucios, consultas ambiguas y usuarios no técnicos, probablemente sea mejor que el status quo pero peor que el 85% anunciado. Aun así, incluso un 40-50% de reducción en costes de tokens de búsqueda transforma la economía de agentes que hacen decenas de miles de consultas al día.

El ecosistema de agencias de IA en Barcelona que está liderando proyectos de agentes autónomos para retail y banca debería estar evaluando esta arquitectura ya, no en el próximo ciclo de planificación.

El RAG agéntico de Google: mejora real, pero con asteriscos

Google Research ha presentado su marco de RAG agéntico dentro de Gemini Enterprise Agent, con un "Agente de Contexto Suficiente" que realiza búsquedas iterativas hasta garantizar información sólida para consultas complejas. La mejora declarada es del 34% en precisión factual sobre RAG tradicional.

Este anuncio es relevante pero hay que leerlo en contexto. El RAG agéntico —iterar sobre búsquedas hasta tener contexto suficiente— no es un concepto nuevo. Lo que Google aporta es su implementación dentro de un stack empresarial ya consolidado (Gemini Enterprise, Workspace, BigQuery) con SLAs y contratos que las empresas grandes necesitan. Para un banco o una aseguradora, la integración nativa con el ecosistema Google puede valer más que una ganancia marginal de precisión.

Sin embargo, combinado con lo que hace Perplexity con 'Search as Code', empieza a dibujarse un patrón: el RAG de primera generación —recuperar documentos y pasarlos al modelo— está siendo reemplazado por arquitecturas donde el agente controla activamente su proceso de búsqueda. Google lo hace iterando consultas; Perplexity lo hace generando código de búsqueda. Son aproximaciones distintas al mismo problema, y ambas superan significativamente al RAG estático.

Para las empresas que buscan agencias de IA en Madrid especializadas en integración de RAG empresarial, este es el momento de preguntar explícitamente qué generación de RAG están implementando. Si la respuesta es "recuperamos documentos con embeddings y los metemos en el prompt", están mirando tecnología de 2024 en un mercado de mediados de 2026.

La NVIDIA omnipresente: infraestructura o lock-in

En el fondo de todas las noticias de esta semana aparece NVIDIA: acuerdo con LG para una fábrica de IA, alianza con Doosan para fábricas inteligentes, apoyo a la estrategia soberana del Reino Unido. El patrón es tan sistemático que merece una lectura crítica.

NVIDIA no está vendiendo chips, está vendiendo infraestructura de plataforma. Cada acuerdo con un conglomerado industrial —LG en electrodomésticos y displays, Doosan en generación de energía y robótica— es un punto de entrada a vertical tras vertical donde la computación acelerada será imprescindible en los próximos cinco años. La "fábrica de IA" con LG no es un centro de datos: es una infraestructura que abarca entrenamiento, simulación, validación y despliegue en todas las líneas de negocio del grupo coreano.

El riesgo para las empresas que se integran profundamente en el stack NVIDIA es el de siempre: dependencia de proveedor a un nivel que va más allá del hardware. Cuando la simulación de tu robot industrial corre sobre Omniverse, cuando tu inferencia depende de TensorRT, cuando tu orquestación usa Dynamo —ya cubierto en análisis anteriores— el coste de migrar no es solo económico, es de conocimiento acumulado.

Las agencias especializadas en automatización con IA que asesoran a clientes industriales tienen que tener esta conversación de forma explícita con sus clientes, especialmente los que están en sectores de manufactura y logística donde los ciclos de inversión en infraestructura son de diez años o más.

Lo que viene: el modelo barato que sabe buscar gana

La convergencia de estas noticias apunta a una dirección clara: la ventaja competitiva en sistemas de IA empresarial se desplaza desde "qué modelo usas" hacia "cómo gestiona ese modelo su proceso de búsqueda y recuperación de información". DeepSeek V4 Pro demuestra que la brecha de calidad entre modelos premium y alternativas se estrecha continuamente. 'Search as Code' de Perplexity y el RAG agéntico de Google demuestran que la arquitectura de recuperación puede reducir costes un 34-85% con la misma o mejor precisión.

La conclusión estratégica es incómoda para quienes han construido su propuesta de valor sobre el acceso a modelos premium de OpenAI o Anthropic: en 12-18 meses, el diferenciador no será el modelo, sino la capacidad de construir sistemas de recuperación y orquestación eficientes sobre modelos cada vez más parecidos entre sí. Los equipos y las agencias de IA que ya están desarrollando esa competencia técnica hoy serán los que marquen precio mañana. Los que siguen vendiendo "acceso a GPT" están construyendo sobre arena.

Temas relacionados en agentes.ai

Si quieres aplicar lo que lees en tu empresa, estos son puntos de partida útiles dentro de agentes.ai: