Un estudio retrospectivo publicado en el American Journal of Roentgenology analizó 3.183 exámenes de tomosíntesis digital de mama (DBT) en 2.977 mujeres y reveló que la IA sola produce casi tres veces más hallazgos falsos positivos individuales que la interpretación sin asistencia del radiólogo. Aunque la tasa de exámenes falsos positivos se mantuvo en el 10 % para ambos, la IA generó 932 hallazgos falsos positivos frente a los 315 del radiólogo. El 40 % de los falsos positivos de la IA correspondieron a calcificaciones benignas, mientras que los del radiólogo se centraron principalmente en masas. Los resultados sugieren que esta discrepancia puede aumentar la carga interpretativa si la IA no se integra de forma adecuada en los flujos de trabajo de cribado mamográfico.
Diseño y resultados principales del estudio
La investigación revisó datos de cribado con DBT en un único centro y utilizó el sistema Transpara v1.7.1. Se compararon las interpretaciones sin asistencia del radiólogo con las evaluaciones de IA sola. Ambos métodos alcanzaron una tasa de falsos positivos por examen del 10 %, pero la IA identificó un volumen significativamente mayor de hallazgos individuales falsos positivos. Además, los falsos positivos de la IA se asociaron con menor frecuencia a mamas densas (24 % frente al 57 % en el caso del radiólogo). Los autores destacan que esta diferencia en el tipo de hallazgos, especialmente las calcificaciones benignas, puede generar revisiones adicionales que no aportan valor clínico inmediato.
Diferencias en el tipo de hallazgos falsos positivos
El estudio detalla que el 40 % de los falsos positivos generados exclusivamente por la IA correspondían a calcificaciones benignas, mientras que las interpretaciones del radiólogo se asociaron en un 47 % a presentaciones de masa. Esta discordancia en el perfil de los hallazgos explica por qué, pese a tasas similares por examen, el número total de marcas de la IA es mucho mayor. Los investigadores señalan que esta sobrecarga de marcas no accionables puede ralentizar los flujos de trabajo y aumentar la carga interpretativa del radiólogo, especialmente cuando la IA señala múltiples hallazgos en un mismo examen.
Solapamiento entre IA y radiólogo y posibles implicaciones
El solapamiento de falsos positivos entre IA y radiólogo fue del 13 %. En los 71 exámenes con coincidencia, solo 46 presentaron al menos un hallazgo concordante. De estos, el 39 % derivó en biopsia y el 44 % de las biopsias mostró lesiones de alto riesgo. Los autores sugieren que centrarse en los hallazgos concordantes podría ayudar a reducir recalls innecesarios sin comprometer la detección de lesiones clínicamente relevantes. El estudio también apunta que mejoras futuras en los algoritmos, como la reducción de marcas superfluas y el uso de exámenes previos para valorar estabilidad, serían necesarias para una integración más efectiva.
Los hallazgos indican que la IA actual puede generar más trabajo interpretativo que el radiólogo solo en cribado DBT, especialmente por el mayor número de hallazgos falsos positivos individuales. Una integración cuidadosa y mejoras en los algoritmos son necesarias antes de su adopción generalizada en la práctica clínica.
Relacionado en iRadiología
Más de esta categoría
- Inteligencia artificial
SLIViT: modelo genérico de IA de UCLA que iguala a especialistas en imágenes 3D
- Inteligencia artificial
IA agentic para detectar y clasificar hallazgos incidentales en TC abdominal
- Inteligencia artificial
Agentic AI: el asistente de radiología que razona y genera informes interactivos