Modelos · · 10 min de lectura

RADAR de Alibaba en código abierto: el modelo de IA médica que detecta 150 enfermedades abdominales y lo que implica para el sector salud B2B

La Academia Damo de Alibaba ha liberado RADAR, un modelo visión-lenguaje médico evaluado en 40.000 tomografías reales que supera a la mayoría de radiólogos en detección abdominal. Analizamos qué significa esto para CTOs de salud digital, integradores de IA y el ecosistema de agencias en España.

Comparte: Compartir en LinkedIn Publicar en X

RADAR supera a la mayoría de radiólogos humanos en la detección de ~150 condiciones abdominales. No es un titular de marketing: es la conclusión de un estudio publicado en Science tras evaluar el modelo en cerca de 40.000 tomografías computarizadas reales. Y ahora Alibaba lo ha liberado como código abierto.

La Academia Damo, el brazo de investigación de Alibaba, ha publicado RADAR en acceso abierto, un modelo de visión-lenguaje (VLM) entrenado específicamente sobre imagen médica abdominal. El movimiento no es altruista: es una jugada de posicionamiento técnico en un mercado donde Google, Microsoft y un puñado de startups bien financiadas llevan años intentando hacer exactamente esto sin llegar a publicar benchmarks tan sólidos ni liberar pesos bajo licencia abierta.

Actualizado el 20 de septiembre de 2026: añadimos resumen TL;DR y preguntas frecuentes.

TL;DR: Alibaba ha liberado en open source RADAR, un modelo de visión-lenguaje que detecta ~150 condiciones abdominales en tomografías y superó al 85-90% de los radiólogos en un estudio en Science con 39.800 exámenes reales — aunque los radiólogos evaluados no tenían acceso al historial clínico. Elimina la barrera técnica de entrada frente a licencias propietarias de cinco cifras anuales, pero en la UE no puede usarse en diagnóstico clínico sin certificación bajo el AI Act (18-36 meses). El cuello de botella ya no es técnico: es regulatorio.

Qué hace RADAR exactamente (y qué no hace)

RADAR es un modelo multimodal que toma como entrada imágenes de tomografía computarizada abdominal y genera reportes estructurados en lenguaje natural. Su capacidad de clasificación cubre aproximadamente 150 condiciones, incluyendo variantes de cáncer de hígado, páncreas, riñón y colon, así como patologías inflamatorias y anomalías vasculares.

El benchmark publicado en Science es el dato que importa: evaluado sobre 39.800 exámenes reales procedentes de hospitales chinos, RADAR superó el rendimiento diagnóstico del 85-90% de los radiólogos en el conjunto de prueba. Hay que leer ese número con matices: los radiólogos evaluados no tenían acceso a historial clínico ni a estudios comparativos previos del paciente, condiciones que en la práctica real sí tienen. Esto infla el diferencial de rendimiento a favor del modelo, algo que el paper reconoce en sus limitaciones.

Lo que RADAR no hace: no integra datos de laboratorio, no accede a historia clínica longitudinal y no está validado fuera de población china de forma sistemática. Las advertencias que especialistas clínicos están lanzando sobre la IA médica más allá del diagnóstico por imagen son completamente pertinentes aquí: la eficacia en entornos hospitalarios reales de Europa o Latinoamérica aún no tiene evidencia publicada.

El impacto real para integradores y producto leads de salud digital

Aquí es donde el anuncio oficial se queda corto y la realidad B2B es más interesante.

Que RADAR sea código abierto significa que cualquier empresa de tecnología sanitaria puede descargar los pesos del modelo, fine-tunearlo sobre su propio corpus de imágenes y desplegarlo en infraestructura propia o en nube privada. Esto cambia radicalmente el análisis de build vs. buy que llevan años haciendo los CTOs de hospitales y aseguradoras.

Hasta ahora, las opciones eran: (a) contratar una solución propietaria como Aidoc, Zebra Medical o RaySearch —con precios de licencia que arrancan en cinco cifras anuales por módulo— o (b) construir internamente, lo que requería datasets propios de cientos de miles de estudios anotados. RADAR elimina la barrera de entrada del punto de partida técnico. El coste real se traslada a: infraestructura de inferencia, anotación de datos locales para fine-tuning, integración con el PACS del hospital y cumplimiento regulatorio bajo el AI Act europeo.

Ese último punto no es trivial. Un modelo open source liberado por una entidad china, sin certificación CE como dispositivo médico de clase IIa o IIb, no puede usarse directamente en flujos clínicos diagnósticos en la Unión Europea. Puede usarse en investigación, en sistemas de segundo criterio no vinculante o como herramienta de priorización de listas de espera, pero el camino hacia la certificación regulatoria es de 18 a 36 meses y varios cientos de miles de euros. Cualquier CTO de salud que planifique un despliegue productivo sin meter esto en el roadmap está construyendo sobre arena.

La jugada estratégica de Alibaba y por qué tiene sentido ahora

Liberar RADAR como open source en 2026 no es filantropía tecnológica. Es la misma estrategia que Meta ejecutó con LLaMA: crear un ecosistema de adopción masiva que ancle a desarrolladores y empresas a tu stack de infraestructura cloud (Alibaba Cloud, en este caso), mientras acumulas presencia en un vertical —salud— donde la regulación china es menos restrictiva y la velocidad de despliegue es mayor.

Este movimiento posiciona a Alibaba por delante de Baidu y Tencent en el segmento de IA médica open source, y lanza un desafío directo a Med-PaLM 2 de Google, que a pesar de sus impresionantes resultados en MedQA sigue siendo un modelo cerrado accesible solo a través de acuerdos enterprise con Google Cloud. La diferencia de accesibilidad es estructural.

A diferencia de lo que sugiere el anuncio oficial, el verdadero reto para las agencias españolas especializadas en salud digital no será integrar RADAR —eso es relativamente directo para cualquier equipo con experiencia en VLMs y DICOM—. El reto real será construir el pipeline completo: ingesta de imágenes desde PACS heterogéneos, anonimización conforme a RGPD, motor de fine-tuning sobre datos locales, y un workflow de revisión humana que cumpla con los requisitos del AI Act para sistemas de alto riesgo en medicina. Ese es el trabajo de consultoría que tiene valor económico real.

Las agencias de IA en Madrid y el ecosistema de agencias de IA en Barcelona que ya trabajan con verticales de salud o con grandes aseguradoras tienen una ventana de 6 a 12 meses para desarrollar aceleradores propios sobre RADAR antes de que los integradores globales sistematicen la oferta. Pasada esa ventana, la ventaja competitiva se diluye.

Infraestructura y costes reales de despliegue

RADAR es un VLM de escala considerable. Sin conocer exactamente el número de parámetros publicado (el paper no detalla la arquitectura completa del modelo final), los VLMs médicos de capacidades equivalentes suelen requerir entre 7B y 70B parámetros para este nivel de rendimiento en imagen de alta resolución.

Eso significa que la inferencia en producción —asumiendo un volumen hospitalario medio de 200-500 TAC abdominales al día— requiere al menos una A100 80GB o equivalente en latencia tolerable. En cómputo cloud, eso se traduce en un coste operativo de entre 3.000 y 8.000 euros mensuales solo en GPU, sin contar almacenamiento DICOM ni redundancia. No es barato, pero sí significativamente más asequible que las licencias propietarias para volúmenes similares.

Para equipos que evalúan arquitecturas de agentes autónomos en entornos clínicos, el directorio de agentes autónomos especializados y los servicios de consultoría de IA disponibles en España son el punto de partida más eficiente para no reinventar la rueda en la capa de integración.

El benchmark de Science y el problema de la generalización

Publicar en Science es una señal de calidad metodológica alta, pero no inmuniza contra el problema de distribución de datos. El dataset de entrenamiento y validación es de origen hospitalario chino, con distribuciones demográficas, equipos de tomografía y protocolos de adquisición específicos de ese contexto. La variabilidad entre un TAC adquirido en un hospital de tercer nivel en Tokio y uno en Sevilla puede ser suficiente para degradar el rendimiento de forma significativa.

No hay datos publicados todavía sobre validación externa en cohortes europeas o latinoamericanas. Esto no invalida el modelo —es el punto de partida más sólido que existe en open source para este caso de uso—, pero sí define dónde está el trabajo real de cualquier empresa que quiera desplegarlo en España o en mercados como México, Colombia o Argentina, donde el ecosistema de agencias en Ciudad de México y Bogotá empieza a madurar en verticales de salud.

Dónde termina el modelo y empieza el problema empresarial

La IA médica diagnóstica lleva una década prometiendo transformar la radiología. Los modelos ahora son genuinamente buenos —RADAR es evidencia de ello—. El cuello de botella ya no es técnico: es regulatorio, organizativo e institucional.

Los hospitales españoles que quieran explorar RADAR no necesitan un paper más que les diga que el modelo funciona. Necesitan un interlocutor que les ayude a navegar la certificación bajo el AI Act, a estructurar el contrato de datos con el comité de ética, a diseñar el flujo de revisión radiológica que mantenga al médico en el loop y a justificar el ROI ante una gerencia que lleva años oyendo que «la IA va a transformar el diagnóstico».

Eso no lo resuelve ningún modelo, por muy bueno que sea. Y es exactamente el espacio donde el trabajo de integración especializada tiene más tracción real que el hype.

La pregunta que deberían hacerse los CTOs de salud no es «¿funciona RADAR?». La respuesta ya es sí, con matices. La pregunta correcta es: ¿tenemos la infraestructura de gobernanza para desplegarlo sin exponernos a responsabilidad regulatoria? En la mayoría de organizaciones sanitarias españolas, la respuesta honesta es que no. Eso define exactamente dónde está la oportunidad en los próximos 24 meses.

Preguntas frecuentes sobre RADAR, la IA médica de Alibaba

¿Qué es RADAR de Alibaba?

RADAR es un modelo de visión-lenguaje (VLM) desarrollado por la Academia Damo de Alibaba y liberado como código abierto. Está entrenado específicamente sobre imagen médica abdominal: toma tomografías computarizadas como entrada y genera reportes estructurados en lenguaje natural, con capacidad de clasificación de aproximadamente 150 condiciones, incluyendo variantes de cáncer de hígado, páncreas, riñón y colon.

En el benchmark publicado en Science sobre 39.800 exámenes reales, RADAR superó el rendimiento diagnóstico del 85-90% de los radiólogos del conjunto de prueba. El matiz importante: esos radiólogos no tenían acceso al historial clínico ni a estudios previos del paciente, condiciones que en la práctica real sí tienen, lo que infla el diferencial a favor del modelo. Además, RADAR no integra datos de laboratorio ni historia clínica longitudinal.

¿Puede usarse RADAR en hospitales de la Unión Europea?

No directamente en flujos clínicos diagnósticos: al no tener certificación CE como dispositivo médico de clase IIa o IIb, su uso en la UE queda limitado a investigación, sistemas de segundo criterio no vinculante o priorización de listas de espera. El camino hacia la certificación regulatoria bajo el AI Act europeo es de 18 a 36 meses y varios cientos de miles de euros.

¿Cuánto cuesta desplegar RADAR en producción?

Para un volumen hospitalario medio de 200-500 TAC abdominales al día, la inferencia requiere al menos una GPU A100 80GB o equivalente, lo que en cloud supone entre 3.000 y 8.000 euros mensuales solo en cómputo GPU, sin contar almacenamiento DICOM ni redundancia. Más asequible que las licencias propietarias equivalentes, pero hay que sumar fine-tuning con datos locales, integración con el PACS y cumplimiento regulatorio.

¿Funciona RADAR con pacientes europeos o latinoamericanos?

Todavía no hay evidencia publicada: el dataset de entrenamiento y validación procede de hospitales chinos, con distribuciones demográficas, equipos de tomografía y protocolos de adquisición específicos de ese contexto. No existen datos de validación externa en cohortes europeas o latinoamericanas, y la variabilidad entre equipos y protocolos puede degradar el rendimiento de forma significativa.

Temas relacionados en agentes.ai

Si quieres aplicar lo que lees en tu empresa, estos son puntos de partida útiles dentro de agentes.ai:

Posts relacionados