Inteligencia artificial en medicina: lista de comprobación frente a los sesgos

Conoce una lista de comprobación para identificar y evaluar sesgos en las herramientas de inteligencia artificial utilizadas en la práctica médica.

Inteligencia artificial en medicina: lista de comprobación frente a los sesgos

Tiempo estimado de lectura: 8 minutos

Tiempo estimado de lectura: 8 minutos

Para utilizar la inteligencia artificial en medicina con seguridad, es imprescindible evaluar los datos con los que se entrenó la herramienta, su rendimiento en distintos grupos de pacientes, la validación externa y las limitaciones del modelo, y realizar una supervisión continua tras su implantación.  

Estas precauciones ayudan a identificar los sesgos algorítmicos: la tendencia de una inteligencia artificial a rendir de forma diferente entre grupos de pacientes, que hoy representa uno de los mayores retos de la inteligencia artificial en medicina.

Una buena tasa de aciertos no basta para decidir si una herramienta de IA es adecuada para la práctica clínica. Un modelo puede presentar un rendimiento medio excelente, pero cometer más errores en determinados grupos de pacientes, aumentando los riesgos para esas poblaciones.

La edad, el sexo, la raza y la etnia, las comorbilidades, la gravedad clínica y el contexto asistencial pueden influir en el comportamiento de un algoritmo. Por eso, antes de incorporar una tecnología al flujo asistencial, el médico necesita saber dónde funciona, para quién se ha validado y en qué situaciones puede fallar.

Lista de comprobación: ¿qué preguntar al proveedor de IA?

La evaluación puede empezar con cinco preguntas para los responsables del modelo de IA utilizado en la práctica médica.

1. ¿Con qué población se entrenó el modelo?

Pregunta quién está representado en los datos y si esa población se parece al perfil de pacientes atendidos por la institución.

Comprueba:

  • el intervalo de edad y la distribución por sexo;

  • la raza y la etnia, cuando sean pertinentes;

  • la presencia de distintas comorbilidades;

  • el nivel de complejidad de los pacientes;

  • el origen de los datos y los centros asistenciales.

Un modelo desarrollado con datos de un hospital de alta complejidad puede no rendir igual en atención primaria o en organizaciones de otro país.

2. ¿Se analizó el rendimiento por subgrupos?

A menudo, una “exactitud del 95%” no cuenta toda la historia.

Solicita métricas estratificadas por características relevantes de los pacientes. Según la aplicación, pueden ser importantes la sensibilidad, la especificidad, los valores predictivos y las tasas de falsos positivos y negativos.

Este análisis ayuda a revelar desigualdades que desaparecen cuando todos los pacientes se evalúan mediante una única media. Los estudios sobre equidad algorítmica recomiendan precisamente evaluar el rendimiento en distintos grupos y contextos.

Esta es una de las formas de identificar sesgos en la IA médica antes de incorporarlos a la rutina.

3. ¿Se realizó una validación externa?

Los resultados obtenidos con la misma base de datos utilizada para desarrollar un modelo no demuestran, por sí solos, que funcionará en otros entornos.

Averigua:

  • si se validó en una población independiente;

  • si el estudio fue revisado por pares;

  • si se comparó su rendimiento con la práctica clínica;

  • si hay datos de instituciones similares a la tuya.

La U.S. Food and Drug Administration (FDA) recomienda transparencia sobre los datos de entrenamiento y prueba, las poblaciones poco representadas, las limitaciones y la supervisión de las tecnologías médicas basadas en aprendizaje automático.

4. ¿La herramienta explica claramente sus limitaciones?

Una IA que responde con aparente seguridad a cualquier pregunta puede inducir sesgo de automatización, llevando al profesional a aceptar una recomendación automatizada incluso cuando hay signos clínicos que la contradicen.

El proveedor debe informar del uso previsto, de las situaciones fuera de su alcance, de las limitaciones conocidas y de las principales formas en que puede fallar.

Transparencia no significa necesariamente revelar el código del sistema. Significa proporcionar información suficiente para que el profesional comprenda qué se ha evaluado y cuáles son los límites de esa evidencia.

5. ¿Cómo se supervisará el sistema después de su implantación?

La validación no termina cuando se implanta el modelo.

Los cambios en el perfil de los pacientes, los protocolos, los equipos o el propio modelo pueden alterar su rendimiento. Por eso, es importante saber:

  • quién supervisa los indicadores;

  • cómo se registran los incidentes;

  • cómo se investigan los fallos;

  • cómo se comunican las actualizaciones del modelo;

  • en qué circunstancias se puede suspender su uso.

¿Cómo utilizar la inteligencia artificial en medicina sin trasladar el sesgo a la consulta?

Incluso una herramienta validada debe interpretarse dentro del contexto clínico.

Antes de incorporar una recomendación de la IA a una decisión, el médico puede hacerse cuatro preguntas:

  1. ¿El resultado es compatible con los signos y síntomas del paciente?

  2. ¿Hay alguna información clínica relevante que el sistema no haya recibido?

  3. ¿Este paciente pertenece a la población en la que se validó la herramienta?

  4. ¿Llegaría a la misma hipótesis sin la recomendación de la IA?

Si hay discrepancias, no es necesario elegir automáticamente entre el médico y el algoritmo. La diferencia puede señalar una limitación del modelo, un dato que falta o una hipótesis clínica que merece investigarse.

La equidad también depende de los datos y del contexto

El sesgo no surge necesariamente en el algoritmo. Puede aparecer en la selección de los datos, en la definición del resultado clínico o en la propia forma de utilizar la herramienta.

Un ejemplo conocido apareció en el estudio Dissecting racial bias in an algorithm used to manage the health of populations, publicado en Science en 2019. Los investigadores demostraron que un algoritmo utilizado para identificar a pacientes para programas de salud presentaba disparidades raciales porque usaba los costes asistenciales previos como indicador de necesidad clínica.

El caso demuestra por qué la equidad en inteligencia artificial exige examinar las variables utilizadas por el modelo y el contexto en el que se aplicará.

LGPD: los datos también deben incluirse en la lista de comprobación

Los datos de salud son datos personales sensibles, según la Lei Geral de Proteção de Dados (LGPD) de Brasil.

Antes de implantar una solución, la institución debe entender qué información se recoge, con qué finalidad, dónde se almacena, quién puede acceder a ella y si puede utilizarse para entrenar o mejorar modelos.

La privacidad, por tanto, no es una fase separada de la evaluación de la IA. Forma parte de la gobernanza de la tecnología.

¿Cuál es la responsabilidad del médico?

La Resolución CFM nº 2.454/2026 establece normas para la investigación, el desarrollo, la gobernanza, la auditoría, la supervisión y el uso responsable de la IA en medicina. La norma también establece la responsabilidad del médico por los actos médicos realizados con IA.

En la práctica, esto refuerza un principio sencillo: la IA puede apoyar el razonamiento clínico, pero no sustituye la responsabilidad profesional por la decisión médica.

La OMS también recomienda principios como la autonomía humana, la seguridad, la transparencia, la responsabilidad, la inclusión y la equidad en el desarrollo y uso de la IA en salud.

¿Qué comprobar antes de adoptar una IA médica?

Antes de adoptar una herramienta, comprueba:

  • Conozco su finalidad clínica.

  • Sé con qué población se entrenó y validó.

  • Dispongo de datos de rendimiento por subgrupos.

  • Existe una validación externa independiente.

  • Conozco sus limitaciones y las situaciones en las que puede fallar.

  • Sé cómo se comunicarán las actualizaciones.

  • Existe supervisión tras la implantación.

  • Hay mecanismos para registrar incidentes.

  • El tratamiento de los datos cumple la LGPD.

  • El médico mantiene el control de la decisión clínica.

La pregunta más útil antes de adoptar una IA no es solo “¿funciona?”. Es: “¿para qué pacientes, en qué contexto y con qué limitaciones funciona?”

Este cambio de perspectiva ayuda a convertir la adopción de inteligencia artificial en medicina en una decisión basada en evidencia, gobernanza y responsabilidad clínica.

Preguntas frecuentes (FAQ)

¿Cómo pueden los médicos identificar sesgos en una herramienta de IA?

Solicitando datos de rendimiento por subgrupos, comprobando la población de entrenamiento y validación y comparando el resultado de la IA con los datos clínicos disponibles. Las métricas medias pueden ocultar diferencias importantes entre grupos.

¿Quién es responsable del uso de la IA en medicina?

En Brasil, la Resolución CFM nº 2.454/2026 establece que el médico sigue siendo responsable de los actos médicos realizados con IA. La tecnología debe servir de apoyo, sin transferir la decisión clínica al algoritmo.

¿Puede considerarse que una IA está libre de sesgos?

No es adecuado dar por hecho que una herramienta está completamente libre de sesgos. Lo más importante es identificar posibles fuentes de distorsión, medir las diferencias de rendimiento, reducir los riesgos y supervisar el sistema tras su implantación.

¿Qué hay que evaluar antes de implantar una IA médica?

La población de entrenamiento, la validación externa, el rendimiento por subgrupos, las limitaciones conocidas, la seguridad de los datos, la finalidad clínica, la supervisión posterior a la implantación y los mecanismos de registro de incidentes.

Publicado el

Tiempo de lectura: 8 minutos