Inteligencia artificial

IA en DBT genera tres veces más falsos positivos individuales que el radiólogo

Un estudio retrospectivo con casi 3.000 mujeres compara los falsos positivos de la IA sola frente a la interpretación del radiólogo en cribado con DBT.

Redacción iRadiología · 22 de septiembre de 2026

Un estudio retrospectivo publicado en el American Journal of Roentgenology analizó 3.183 exámenes de tomosíntesis digital de mama (DBT) en 2.977 mujeres y reveló que la IA sola produce casi tres veces más hallazgos falsos positivos individuales que la interpretación sin asistencia del radiólogo. Aunque la tasa de exámenes falsos positivos se mantuvo en el 10 % para ambos, la IA generó 932 hallazgos falsos positivos frente a los 315 del radiólogo. El 40 % de los falsos positivos de la IA correspondieron a calcificaciones benignas, mientras que los del radiólogo se centraron principalmente en masas. Los resultados sugieren que esta discrepancia puede aumentar la carga interpretativa si la IA no se integra de forma adecuada en los flujos de trabajo de cribado mamográfico.

Diseño y resultados principales del estudio

La investigación revisó datos de cribado con DBT en un único centro y utilizó el sistema Transpara v1.7.1. Se compararon las interpretaciones sin asistencia del radiólogo con las evaluaciones de IA sola. Ambos métodos alcanzaron una tasa de falsos positivos por examen del 10 %, pero la IA identificó un volumen significativamente mayor de hallazgos individuales falsos positivos. Además, los falsos positivos de la IA se asociaron con menor frecuencia a mamas densas (24 % frente al 57 % en el caso del radiólogo). Los autores destacan que esta diferencia en el tipo de hallazgos, especialmente las calcificaciones benignas, puede generar revisiones adicionales que no aportan valor clínico inmediato.

Diferencias en el tipo de hallazgos falsos positivos

El estudio detalla que el 40 % de los falsos positivos generados exclusivamente por la IA correspondían a calcificaciones benignas, mientras que las interpretaciones del radiólogo se asociaron en un 47 % a presentaciones de masa. Esta discordancia en el perfil de los hallazgos explica por qué, pese a tasas similares por examen, el número total de marcas de la IA es mucho mayor. Los investigadores señalan que esta sobrecarga de marcas no accionables puede ralentizar los flujos de trabajo y aumentar la carga interpretativa del radiólogo, especialmente cuando la IA señala múltiples hallazgos en un mismo examen.

Solapamiento entre IA y radiólogo y posibles implicaciones

El solapamiento de falsos positivos entre IA y radiólogo fue del 13 %. En los 71 exámenes con coincidencia, solo 46 presentaron al menos un hallazgo concordante. De estos, el 39 % derivó en biopsia y el 44 % de las biopsias mostró lesiones de alto riesgo. Los autores sugieren que centrarse en los hallazgos concordantes podría ayudar a reducir recalls innecesarios sin comprometer la detección de lesiones clínicamente relevantes. El estudio también apunta que mejoras futuras en los algoritmos, como la reducción de marcas superfluas y el uso de exámenes previos para valorar estabilidad, serían necesarias para una integración más efectiva.

Los hallazgos indican que la IA actual puede generar más trabajo interpretativo que el radiólogo solo en cribado DBT, especialmente por el mayor número de hallazgos falsos positivos individuales. Una integración cuidadosa y mejoras en los algoritmos son necesarias antes de su adopción generalizada en la práctica clínica.