Investigación · · 7 min de lectura
AlphaEvolve, SANA-WM y Lighthouse: la IA técnica avanza en mayo 2026
DeepMind, NVIDIA y Nous Research presentan avances que redefinen agentes de código, generación de vídeo open source y velocidad de preentrenamiento LLM.
Tres publicaciones técnicas de primer nivel en menos de 24 horas marcan un patrón claro: el foco de la investigación aplicada se desplaza de los benchmarks de razonamiento general hacia la eficiencia computacional y la autonomía de agentes especializados. AlphaEvolve, SANA-WM y Lighthouse Attention son nombres distintos para el mismo problema: hacer más con menos, más rápido y sin depender de infraestructura de hiperescala.
AlphaEvolve: cuando un agente de código supera al ingeniero en dominios específicos
DeepMind ha detallado cómo AlphaEvolve, su agente de programación basado en Gemini, está generando impacto real en producción, no solo en entornos de laboratorio. El sistema no es un autocompletador de código glorificado: opera como un bucle de optimización autónomo que genera algoritmos, los evalúa contra criterios formales y refina iterativamente las soluciones.
Lo que distingue a AlphaEvolve de herramientas como Copilot o Claude Code es su enfoque en búsqueda algorítmica, no en generación de código conversacional. Mientras Claude Code maximiza la productividad del desarrollador humano, AlphaEvolve está diseñado para explorar espacios de solución donde los humanos no tenemos intuición práctica: optimización de rutas en centros de datos, diseño de materiales, scheduling de recursos computacionales.
El impacto declarado abarca infraestructura interna de Google (con mejoras medibles en eficiencia de TPUs), aceleración científica en áreas como matemáticas y biología computacional, y optimización de procesos empresariales complejos. Este último punto merece atención: las empresas que ya tienen equipos de ingeniería de datos pueden encontrar en AlphaEvolve un multiplicador de capacidad para problemas de optimización combinatoria que hoy resuelven con heurísticas manuales.
La arquitectura subyacente —Gemini como motor de generación, evaluadores automáticos como jueces, evolución iterativa como estrategia— es replicable en principio. La pregunta para cualquier organización no es «¿usamos AlphaEvolve?» sino «¿tenemos funciones objetivo lo suficientemente bien definidas para que un agente así las optimice?». Sin esa claridad, el agente no tiene nada que evolucionar.
Si estás evaluando capacidades de automatización con IA para tu organización, el patrón de AlphaEvolve —agente + evaluador + iteración— es el esquema de referencia para 2026.
SANA-WM: vídeo 720p de un minuto en una RTX 5090, sin nube
NVIDIA ha lanzado SANA-WM, un modelo de mundo open source con 2.600 millones de parámetros capaz de generar vídeos de 60 segundos en resolución 720p con control de cámara en 6 grados de libertad. El dato que más importa no es el entrenamiento (64 GPUs H100, accesible solo para grandes laboratorios), sino el despliegue: una sola RTX 5090 es suficiente para ejecutar inferencia.
Esto tiene implicaciones directas para estudios de producción, desarrolladores independientes y cualquier producto que necesite generación de vídeo sintético sin depender de APIs con coste por segundo. El modelo es open source, lo que significa que puede integrarse en pipelines propios, fine-tunearse con datos propietarios y ejecutarse sin latencia de red ni costes variables.
A diferencia de Sora (OpenAI) o Veo 2 (Google), que operan exclusivamente como servicios cerrados en la nube, SANA-WM apuesta por la soberanía computacional. Esto no significa que sea superior en calidad —los modelos cerrados siguen teniendo ventaja en coherencia temporal y comprensión semántica profunda—, pero el coste total de propiedad para casos de uso de alto volumen puede ser órdenes de magnitud inferior.
El control de cámara en 6DOF es el detalle técnico más relevante para aplicaciones industriales: simulación de entornos físicos, generación de datos sintéticos para entrenamiento de modelos de visión, visualización arquitectónica automatizada. Estos casos de uso requieren precisión geométrica, no solo estética visual convincente.
Para equipos de producto que estén evaluando generación de vídeo, la decisión entre API cerrada y modelo local ya no es solo una cuestión de presupuesto: es una decisión arquitectónica sobre control de datos y capacidad de personalización. SANA-WM en MarkTechPost detalla los benchmarks técnicos del modelo.
Lighthouse Attention: preentrenamiento 1.7x más rápido sin cambiar la arquitectura de inferencia
Nous Research ha publicado Lighthouse Attention, un mecanismo de atención jerárquica que acelera el preentrenamiento entre 1,4x y 1,7x en contextos largos, con una característica que lo hace especialmente pragmático: se aplica solo durante el entrenamiento y se elimina después. El modelo resultante tiene la misma arquitectura de inferencia estándar, lo que significa compatibilidad total con los stacks de despliegue existentes.
El mecanismo agrupa queries, keys y values en una pirámide multiresolución simétrica, reduciendo la complejidad computacional cuadrática de la atención estándar en secuencias largas. Los resultados se midieron sobre modelos tipo Llama-3 con 530 millones de parámetros, lo que los hace directamente relevantes para equipos que entrenan modelos en el rango de 1B-7B parámetros con presupuestos de cómputo moderados.
Esto funciona porque el cuello de botella en contextos largos no es la capacidad del modelo para aprender patrones, sino el coste cuadrático de calcular atención entre todos los tokens. Lighthouse no elimina ese coste en inferencia —donde ya existen soluciones como FlashAttention y GQA— sino en el entrenamiento, donde las opciones eran más limitadas.
El impacto práctico: si tu organización está considerando preentrenar o hacer continual pretraining de un modelo mediano con datos de dominio (legal, médico, financiero), una aceleración de 1,7x en el paso más costoso del pipeline puede traducirse en semanas de cómputo ahorradas. Los laboratorios que más se benefician son los de tamaño medio —demasiado grandes para depender solo de APIs, demasiado pequeños para absorber costes de cómputo sin optimización.
Lighthouse Attention en MarkTechPost incluye la comparativa detallada contra métodos anteriores como sparse attention y linear attention.
Goose vs. Claude Code: la presión open source sobre los agentes de código premium
Mientras DeepMind publica investigación sobre agentes autónomos, en el mercado de herramientas para desarrolladores se libra una batalla de precios con consecuencias estructurales. Claude Code de Anthropic cobra entre $20 y $200 al mes, dependiendo del volumen de uso. Goose, desarrollado por Block (la empresa de Jack Dorsey), ofrece capacidades comparables de forma gratuita y open source.
La presión que Goose ejerce sobre Claude Code no es solo de precio: es un cuestionamiento del modelo de negocio completo. Claude Code tiene ventaja en calidad de generación y coherencia en proyectos grandes, pero para casos de uso estándar —scaffolding, refactoring, debugging de código existente— la diferencia de calidad no justifica $200 mensuales para la mayoría de desarrolladores individuales.
Las empresas, sin embargo, deberían evaluar el coste real con más cuidado. Un agente de código de $200/mes que ahorra 5 horas semanales a un ingeniero senior tiene ROI positivo desde el primer mes. El problema es que la mayoría de los equipos no miden ese tiempo ahorrado con precisión suficiente para tomar la decisión con datos.
Goose, al ser open source, permite además integraciones con modelos locales o alternativos —un argumento relevante para organizaciones con restricciones de privacidad de código. Los equipos de desarrollo que trabajan con agencias de IA en Madrid o Buenos Aires y buscan implementar agentes de código en entornos corporativos deberían explorar Goose antes de comprometerse con suscripciones premium.
Conclusión
Tres ideas accionables para los próximos 30 días:
Primero, si tu equipo tiene problemas de optimización con funciones objetivo bien definidas (logística, scheduling, configuración de sistemas), el patrón de AlphaEvolve —agente generador + evaluador automático + evolución iterativa— es implementable hoy con modelos disponibles. No hace falta esperar acceso a AlphaEvolve en sí.
Segundo, si estás evaluando generación de vídeo sintético para datos de entrenamiento o visualización de producto, SANA-WM convierte una RTX 5090 en infraestructura suficiente. Compara el coste total frente a Sora o Veo 2 API antes de comprometerte con un proveedor cerrado.
Tercero, Lighthouse Attention señala una tendencia que se consolidará en 2026: las ganancias de eficiencia en preentrenamiento se acumularán en técnicas aplicadas solo durante el entrenamiento, sin penalizar la inferencia. Los equipos que monitorizan este tipo de publicaciones de Nous Research y aplicaciones similares tendrán ventaja competitiva en el diseño de sus pipelines de entrenamiento.
Temas relacionados en agentes.ai
Si quieres aplicar lo que lees en tu empresa, estos son puntos de partida útiles dentro de agentes.ai:
- Directorio de agencias de automatización con ia
- Agencias de IA en Ciudad de México y en Madrid
- Explora el directorio completo de agencias de IA
- Sigue las últimas noticias de IA en tiempo real