Los modelos de lenguaje grande procesan descripciones textuales de hallazgos radiológicos para generar impresiones diagnósticas. Esta capacidad marca un cambio respecto a los sistemas previos limitados a la detección de anomalías en imágenes. Según el artículo de Kazufumi Suzuki publicado en 2026 en el Journal of Tokyo Women's Medical University, los LLM interpretan combinaciones de hallazgos y proponen diagnósticos diferenciales con sus justificaciones. El proceso tradicional de observación de imágenes, verbalización de hallazgos y razonamiento diagnóstico se amplía ahora con herramientas que operan en ambas direcciones. Estudios revisados en Frontiers in Digital Health del mismo año confirman que los LLM integrados en sistemas de soporte a decisiones clínicas alcanzan concordancia con guías cuando se supervisan. Estas funcionalidades surgen tras el entrenamiento en grandes volúmenes de texto médico, lo que permite razonamiento sin entrenamiento adicional específico para cada tarea. Los avances coinciden con la disponibilidad de modelos de razonamiento como o1, que superan en precisión a versiones anteriores en clasificaciones como TNM en cáncer de páncreas. La aplicación práctica se orienta hacia contextos educativos y de apoyo, no hacia uso autónomo.
Del análisis de imágenes a la inferencia textual
Los sistemas de inteligencia artificial en radiología se centraron inicialmente en la extracción de hallazgos a partir de imágenes mediante redes convolucionales y transformers de visión. Estos modelos detectan lesiones, segmentan estructuras y clasifican patrones con rendimiento comparable al de especialistas en tareas acotadas, según la revisión estructurada de 2026 en Frontiers in Digital Health. Sin embargo, la traducción de hallazgos a diagnósticos requería siempre la intervención humana. Los LLM modifican este límite al aceptar como entrada descripciones en lenguaje natural de los hallazgos y generar diagnósticos diferenciales. El trabajo de Suzuki detalla cómo un modelo personalizado traduce hallazgos de TC o RM a inglés, propone hasta tres diagnósticos diferenciales y explica el razonamiento de cada uno antes de devolver el resultado al idioma original. Esta función se logra mediante prompts que definen la tarea sin necesidad de reentrenamiento. El enfoque aprovecha el conocimiento médico acumulado durante el preentrenamiento del modelo, que incluye resultados de exámenes de especialidad. La precisión varía según la tarea y requiere verificación, ya que persisten fenómenos de alucinación inherentes a la arquitectura transformer.
Razonamiento bidireccional y sus implicaciones
Los avances recientes permiten no solo pasar de hallazgos a diagnóstico, sino también generar hallazgos plausibles o imágenes sintéticas a partir de etiquetas diagnósticas. Esta bidireccionalidad, descrita por Suzuki, abre posibilidades de aumento de datos para entrenamiento y de simulación de casos para formación. En la revisión de Frontiers se analiza cómo los modelos generativos, incluidos los basados en difusión y LLM con generación aumentada por recuperación, complementan a las redes de visión tradicionales. La capacidad de razonamiento mejorada en modelos como o1 se demuestra en evaluaciones de clasificación TNM, donde supera a GPT-4 Turbo en consistencia. Estas características resultan útiles para estandarizar informes y para escenarios donde los hallazgos están ya estructurados en texto. El flujo inverso apoya la creación de datasets sintéticos que mitigan la escasez de datos etiquetados, aunque introduce riesgos de amplificación de sesgos presentes en los datos originales. La integración con sistemas de soporte clínico exige calibración y supervisión humana continua, tal como señalan las normas de evaluación clínica revisadas en 2026.
Aplicaciones en educación médica y soporte clínico
Los LLM facilitan el entrenamiento de residentes al proporcionar retroalimentación inmediata sobre interpretaciones de hallazgos. El artículo de Suzuki incluye un ejemplo de herramienta accesible mediante código QR que genera diagnósticos diferenciales para fines educativos y de investigación, con advertencia explícita de no uso clínico directo. En el contexto de soporte a decisiones, los sistemas LLM-RAG consultan guías y literatura para proponer recomendaciones concordantes, según la revisión de Frontiers. Esta funcionalidad reduce la variabilidad en informes cuando se combinan con protocolos estructurados. Los modelos de razonamiento permiten explicar el peso de cada hallazgo en el diagnóstico propuesto, lo que mejora la transparencia frente a enfoques de caja negra anteriores. Las aplicaciones se limitan por ahora a entornos controlados donde un radiólogo valida la salida. Los datos de 2026 indican que la adopción en educación precede a la integración rutinaria en flujos de trabajo asistencial debido a requisitos regulatorios y de validación prospectiva.
Los LLM amplían el alcance de la inteligencia artificial en radiología al conectar hallazgos textuales con impresiones diagnósticas. Los estudios de 2026 documentan tanto el potencial bidireccional como las limitaciones actuales en precisión y necesidad de supervisión. Su papel principal se sitúa en la formación y el apoyo a decisiones bajo control humano.
Más de esta categoría
- Inteligencia artificial
IA en DBT genera tres veces más falsos positivos individuales que el radiólogo
- Inteligencia artificial
SLIViT: modelo genérico de IA de UCLA que iguala a especialistas en imágenes 3D
- Inteligencia artificial
IA agentic para detectar y clasificar hallazgos incidentales en TC abdominal