Modelos · · 7 min de lectura
LongCat-2.0, OCR sin límites y el coste oculto del contexto largo
Meituan lanza un MoE de 1,6B parámetros con 1M de tokens nativos. Baidu rompe el OCR por páginas. Lo que esto implica para empresas que procesan documentos a escala.
Dos lanzamientos técnicos llegaron esta semana con poco ruido mediático pero con implicaciones directas para cualquier empresa que procese documentos, contratos o datos científicos a escala. Meituan y Baidu han empujado simultáneamente dos límites que muchos daban por intratables: el contexto largo en modelos MoE y el OCR masivo de documentos multi-página. Ignorarlos sería un error estratégico.
LongCat-2.0: cuando 1 millón de tokens dejan de ser marketing
LongCat-2.0 es un modelo de Mezcla de Expertos (MoE) con 1,6 billones de parámetros totales, de los cuales activa aproximadamente 48.000 millones por token. El dato que merece atención no es el número bruto de parámetros —en 2026 ya no impresiona— sino el contexto nativo de un millón de tokens sin degradación por padding ni trucos de extrapolación posicional.
La arquitectura que lo hace posible se llama LongCat Sparse Attention, diseñada específicamente para mantener coherencia semántica a lo largo de documentos muy extensos. Esto no es trivial: la mayoría de los modelos que anuncian "contexto largo" lo consiguen a base de sacrificar precisión en los tokens medios —el conocido problema del "lost in the middle"— o de inflar el coste de inferencia de forma prohibitiva.
El detalle que más interesa desde una perspectiva de negocio: el entrenamiento y la inferencia se ejecutan íntegramente sobre superpods con chips de fabricación doméstica china. Meituan no depende de NVIDIA H100 ni de A100. Esto tiene dos lecturas. La primera, geopolítica: China está demostrando que la restricción de exportación de chips no ha paralizado su desarrollo de modelos frontier. La segunda, comercial: el modelo está disponible vía API, lo que significa que cualquier empresa puede acceder a 1M de tokens de contexto a un coste que Meituan puede controlar sin depender de precios de mercado de hardware occidental.
Para las empresas que procesan contratos legales completos, expedientes médicos voluminosos o bases de conocimiento corporativas extensas, LongCat-2.0 plantea una pregunta incómoda: ¿tiene sentido seguir fragmentando documentos en chunks y gestionando la pérdida de contexto con RAG cuando existe un modelo que puede ingerir el expediente completo en una sola inferencia? La respuesta no es automáticamente sí —el coste por inferencia de 1M de tokens sigue siendo significativo— pero la ecuación empieza a inclinarse.
El OCR de Baidu que imita el olvido humano: más útil de lo que parece
Mientras tanto, Baidu ha resuelto un problema diferente pero igualmente frustrante: el OCR de documentos multi-página se atascaba en torno a las diez páginas por inferencia. Su nuevo sistema rompe ese techo procesando decenas de páginas en un solo paso gracias a un mecanismo de atención modificado que mantiene el uso de memoria constante independientemente del volumen de páginas.
El mecanismo se describe como una imitación del "olvido humano": el sistema no intenta retener cada píxel de cada página con igual peso, sino que aplica una ventana de atención dinámica que prioriza el contexto relevante y descarta el ruido visual. El resultado es que el uso de memoria no escala linealmente con el número de páginas, lo que elimina el principal cuello de botella operativo.
El modelo ocupa actualmente el primer puesto en el benchmark de OCR más relevante del sector. Esto tiene implicaciones directas para cualquier pipeline de automatización documental: los flujos que hoy requieren dividir un PDF de 80 páginas en bloques de 8-10, procesar cada uno por separado y luego reconciliar el output pueden simplificarse de forma drástica.
No es casualidad que esta noticia llegue el mismo día en que el mercado habla de conversión de PDFs a JSON estructurado como el estándar de facto para hacer útiles los datos empresariales atrapados en documentos. La guía publicada esta semana sobre modelos open source para extracción PDF-a-JSON refuerza exactamente esa narrativa: la infraestructura para liberar datos documentales está madurando rápidamente, y el OCR era el eslabón más frágil de esa cadena.
OpenScience y el modelo de plataforma científica abierta
Synthetic Sciences ha lanzado OpenScience, una plataforma Apache 2.0 diseñada para investigación en ML, biología, física y química. Con más de 250 habilidades editables, bases de datos científicas consultables y compatibilidad con cualquier modelo vía API propia, es la apuesta más seria hasta la fecha por un entorno de trabajo científico agnóstico al proveedor.
Lo que diferencia a OpenScience de otras plataformas de investigación asistida por IA es precisamente eso: la compatibilidad con claves API propias. No hay lock-in al modelo del fabricante. Un equipo de I+D puede usar GPT-5.6, LongCat-2.0 o un modelo fine-tuneado propio sin cambiar de entorno. Para empresas farmacéuticas, químicas o de materiales avanzados con equipos de investigación en España, esto cambia el cálculo de TCO de sus plataformas de IA científica.
La pregunta que OpenScience todavía no responde es la de la gobernanza de datos: cuando ejecutas investigación científica sensible sobre infraestructura propia con un framework abierto, ¿quién audita los resultados? Las agencias de consultoría IA que trabajan con clientes en sectores regulados van a tener que integrar esta capa de validación antes de recomendar OpenScience en producción.
Lo que el entrenamiento de Gemma-3 con GRPO revela sobre el coste real del razonamiento
El flujo de trabajo publicado para entrenar Gemma-3 en razonamiento matemático estructurado —usando Tunix GRPO, adaptadores LoRA y el benchmark GSM8K— merece más atención de la que está recibiendo. No por el resultado en sí (mejorar el razonamiento matemático de Gemma-3 no es noticia de portada), sino por lo que el pipeline revela sobre la viabilidad del fine-tuning ligero en producción.
LoRA permite entrenar modelos grandes con una fracción del hardware necesario para un fine-tuning completo. GRPO (Group Relative Policy Optimization) es una variante de reinforcement learning que mejora progresivamente la política del modelo usando generaciones por muestreo grupal, sin necesidad de un modelo de recompensa separado. La combinación de ambos reduce el coste computacional de enseñar razonamiento estructurado a un modelo de propósito general hasta un punto en que equipos pequeños pueden replicarlo.
El dato relevante para quienes están evaluando si invertir en modelos propios o seguir dependiendo de APIs externas: este tipo de workflow permite especializar un modelo base en un dominio concreto —matemáticas financieras, lógica contractual, resolución de problemas de ingeniería— con recursos que ya no requieren un data center dedicado. Para las agencias especializadas en automatización con IA que asesoran a medianas empresas, esta tendencia democratiza el fine-tuning de forma que hace dos años era impensable.
GPT-5.6 Sol Ultra en Codex: potencia real o rebranding de versión menor
OpenAI tiene previsto integrar GPT-5.6 Sol Ultra en Codex. El anuncio es escueto y la nomenclatura —"5.6 Sol Ultra"— huele a naming de marketing más que a salto técnico real. Sin datos de benchmark publicados sobre qué mejora exactamente Sol Ultra respecto a versiones anteriores de la familia GPT-5, el escepticismo está justificado.
Lo que sí es verificable: Codex como plataforma de generación de código ha ganado tracción significativa entre equipos de desarrollo que necesitan asistencia contextual en proyectos grandes. Si Sol Ultra efectivamente mejora la comprensión de repositorios complejos —que es el cuello de botella real de los asistentes de código actuales, no la generación de snippets aislados— entonces la integración tiene valor. Si es simplemente un modelo con más RLHF aplicado para respuestas más fluidas, el impacto operativo será marginal.
Para el ecosistema de agentes autónomos de desarrollo de software, la pregunta no es si GPT-5.6 es mejor que GPT-5.5, sino si la integración en Codex incluye capacidades de ejecución, testing y feedback loop automatizado. Ahí está la diferencia entre un asistente y un agente real.
El verdadero mapa de prioridades para empresas españolas esta semana
Mirado en conjunto, el patrón de esta semana es claro: la infraestructura para procesar información no estructurada a escala —documentos, código, literatura científica— está convergiendo hacia una madurez que elimina las excusas para no actuar. LongCat-2.0 resuelve el contexto largo. El OCR de Baidu resuelve el volumen de páginas. OpenScience resuelve el entorno de trabajo científico. Los pipelines LoRA+GRPO resuelven el fine-tuning accesible.
Las empresas que buscan una agencia de IA en Madrid o en Barcelona para implementar automatización documental tienen ahora un stack técnico más sólido que nunca sobre el que construir casos de uso reales. El problema ya no es tecnológico: es de decisión organizacional y de saber qué priorizar.
La brecha que se está abriendo no es entre empresas con IA y empresas sin IA. Es entre empresas que han elegido ya su arquitectura de procesamiento documental y las que siguen en modo evaluación. Dentro de doce meses, las segundas no estarán evaluando: estarán recuperando terreno.
Temas relacionados en agentes.ai
Si quieres aplicar lo que lees en tu empresa, estos son puntos de partida útiles dentro de agentes.ai:
- Directorio de agencias de automatización con ia
- Agencias de IA en Ciudad de México y en Madrid
- Explora el directorio completo de agencias de IA
- Sigue las últimas noticias de IA en tiempo real