ChatGPT en medicina: ¿puede una IA generalista ayudar en el diagnóstico?

Conoce los usos y límites de ChatGPT en el razonamiento clínico y los criterios para evaluar herramientas de IA en salud.

ChatGPT en medicina: ¿puede una IA generalista ayudar en el diagnóstico?

Tiempo estimado de lectura: 9 minutos

Tiempo estimado de lectura: 9 minutos

El uso de ChatGPT en medicina puede apoyar el razonamiento clínico, pero nunca debe sustituir el proceso diagnóstico dirigido por el médico. Un modelo generalista puede organizar información y plantear hipótesis, pero sus respuestas necesitan una validación rigurosa por parte del profesional.

La posibilidad de presentar síntomas, pruebas e historia del paciente a un chatbot de IA y preguntar “¿cuál es el diagnóstico?” puede resultar tentadora. Sin embargo, existe una diferencia entre reconocer información en el texto generado por la IA y llegar a conclusiones a partir de una valoración clínica rigurosa.

El diagnóstico depende de integrar información que no siempre está disponible para la IA. El médico evalúa la historia clínica, identifica qué queda por investigar, realiza la exploración física, interpreta las pruebas y considera la probabilidad de cada hipótesis. El análisis de la IA, en cambio, se limita a los datos proporcionados y a la forma en que puede interpretarlos.

¿Acierta ChatGPT en los diagnósticos?

Los resultados de ChatGPT para el diagnóstico médico dependen de la tarea y de cómo se mida el rendimiento.

Un estudio publicado en PLOS ONE en 2024 evaluó ChatGPT en 150 casos clínicos de Medscape. El modelo respondió correctamente a 74 casos, el 49% del total. Al considerar cada opción por separado, la IA global presentó una exactitud del 74%, pero una sensibilidad del 49% y una especificidad del 83%.

Los autores identificaron dificultades para interpretar valores analíticos, resolver diagnósticos más complejos y tener en cuenta información relevante para el caso. Concluyeron que ChatGPT, en aquella versión y en aquel contexto, no tenía la precisión suficiente para considerarse una herramienta diagnóstica.

El resultado no significa que la inteligencia artificial en medicina sea inútil. Pero demuestra que un buen rendimiento en una métrica concreta no significa que la herramienta esté preparada para diagnosticar a pacientes de forma autónoma.

¿Cuál puede ser el mejor uso de ChatGPT en medicina?

En lugar de delegar en ChatGPT la pregunta “¿cuál es el diagnóstico?”, el médico puede utilizarlo para estructurar su propio razonamiento.

Entre los posibles usos están:

  • organizar la información de un caso;

  • enumerar diagnósticos diferenciales;

  • identificar datos clínicos que faltan;

  • sugerir preguntas adicionales;

  • repasar conceptos fisiopatológicos;

  • comparar hipótesis;

  • señalar información que contradiga una hipótesis;

  • organizar material de estudio.

Una estrategia especialmente útil es pedir a la IA que busque qué podría estar equivocado en una hipótesis, en lugar de limitarse a pedir argumentos que la confirmen. Esto ayuda a reducir el riesgo de convertir el chatbot en una herramienta que confirme una conclusión ya elegida.

Es fundamental que el médico sepa evaluar los usos, riesgos y límites de ChatGPT en medicina.

¿Por qué el contexto clínico cambia la respuesta?

Considera esta pregunta: “Paciente con fiebre y dolor abdominal. ¿Qué diagnósticos hay que considerar?”

Una respuesta basada únicamente en ese texto tendrá limitaciones importantes. Factores como la edad, la duración de los síntomas, los medicamentos, los antecedentes, las constantes vitales, la exploración física y los resultados analíticos pueden cambiar por completo el diagnóstico diferencial que ofrece ChatGPT.

Sin embargo, proporcionar más datos a una IA generalista no garantiza automáticamente una mejor respuesta. La información incompleta, desactualizada o incorrecta también puede distorsionar el análisis del modelo. 

¿Y si la IA presenta referencias científicas?

El profesional debe comprobar la referencia. Un estudio publicado en Journal of Medical Internet Research en 2024 analizó 471 referencias generadas por GPT-3.5, GPT-4 y Bard en tareas relacionadas con revisiones sistemáticas. Las tasas de referencias alucinadas fueron del 39,6% para GPT-3.5 y del 28,6% para GPT-4.

En la práctica, esto significa que una respuesta de ChatGPT acompañada de una cita no debe considerarse automáticamente fiable.

El médico debe poder localizar el artículo citado, comprobar que existe y evaluar si esa referencia respalda realmente la afirmación de la IA.

La referencia forma parte de la evidencia; no es una garantía de calidad.

¿ChatGPT o una IA médica especializada?

La diferencia entre una IA generalista y una herramienta especializada desarrollada para su uso en medicina no reside solo en el modelo.

Una solución clínica puede incorporar:

  • contexto estructurado de la atención;

  • protocolos institucionales;

  • fuentes científicas seleccionadas;

  • referencias trazables;

  • integración con la historia clínica;

  • mecanismos de auditoría;

  • controles de seguridad;

  • flujos de trabajo específicos para profesionales sanitarios.

El objetivo de la IA especializada no es eliminar la supervisión médica, sino crear condiciones más adecuadas para utilizar la tecnología dentro del proceso asistencial.

Charcot, el agente clínico de Voa Health que utiliza el contexto del paciente para apoyar el razonamiento médico, ofrecer evidencia y agilizar tareas de la práctica clínica, obtuvo el mejor resultado en un estudio científico que comparó diez LLM en la resolución del Exame Nacional de Avaliação da Formação Médica (ENAMED) de 2026. 

Especializada en medicina, desarrollada para la lengua portuguesa y entrenada con guías clínicas brasileñas, la IA de Voa alcanzó un 96,97% de respuestas correctas, el porcentaje más alto entre los modelos evaluados, por delante de GPT-5, Gemini 2.5 Pro, Claude Opus 4.1 y otras herramientas globales de IA.

Charcot no sustituye el juicio clínico, sino que apoya al profesional en tareas complejas, repetitivas o que dependen de grandes volúmenes de información, con el médico como revisor cualificado, editor crítico y responsable de la decisión final.

¿Cuáles son los riesgos de utilizar ChatGPT para el diagnóstico?

Sesgo algorítmico

Los modelos pueden rendir de forma diferente según la población, el contexto o el tipo de caso. Una herramienta evaluada con un conjunto de datos concreto puede no obtener el mismo resultado en otra población.

Privacidad y LGPD

La información de salud es un dato personal sensible. Antes de introducir información de pacientes en cualquier herramienta, es necesario evaluar cómo se trata, almacena y protege, y si el uso se ajusta a las normas aplicables.

Responsabilidad médica

En Brasil, la Resolución CFM nº 2.454/2026 establece que la IA debe actuar como herramienta de apoyo. La decisión sobre el diagnóstico, el pronóstico, la prescripción y otros actos médicos sigue siendo responsabilidad del profesional.

Validación clínica

No se debe adoptar una IA solo porque obtenga buenos resultados en un benchmark. Es necesario saber para qué tarea, en qué población y en qué condiciones se ha validado el sistema.

¿Cómo evaluar una IA antes de utilizarla en la práctica?

Antes de incorporar una herramienta a la atención, el médico o el servicio sanitario puede preguntarse:

  1. ¿Para qué tarea clínica se ha validado el sistema?

  2. ¿Qué población participó en la evaluación?

  3. ¿Cómo se midieron los falsos positivos y los falsos negativos?

  4. ¿Existe evidencia independiente sobre su rendimiento?

  5. ¿Se pueden verificar las referencias presentadas?

  6. ¿Cómo se tratan los datos de los pacientes?

  7. ¿Hay supervisión humana y posibilidad de corregir la respuesta?

  8. ¿Se supervisa el rendimiento después de la implantación?

La OMS recomienda acompañar los sistemas de IA en salud de mecanismos de gobernanza, responsabilidad, transparencia y evaluación continua.

ChatGPT en medicina: ¿cuál es su papel más seguro?

El uso más defendible de ChatGPT en medicina no consiste en transferir el diagnóstico al chatbot. Consiste en utilizar la tecnología en tareas delimitadas, en las que el profesional pueda revisar la información y mantener el control de la decisión.

En la práctica, esto significa tratar la IA como una herramienta de apoyo al razonamiento, no como una autoridad clínica.

El médico sigue siendo responsable de interpretar el caso, contrastar la respuesta con la evidencia y decidir la actuación.

Preguntas frecuentes: ChatGPT en medicina

¿Puede ChatGPT diagnosticar enfermedades?

Puede generar hipótesis y diagnósticos diferenciales, pero no debe utilizarse como sustituto de la valoración médica ni como herramienta autónoma de diagnóstico.

¿Es fiable ChatGPT para tomar decisiones clínicas?

La fiabilidad depende de la tarea, del modelo, de los datos utilizados y de la validación. Las respuestas deben verificarse antes de influir en una decisión clínica.

¿Es seguro introducir datos de pacientes en ChatGPT?

La información de salud requiere una protección especial. Antes de utilizar cualquier herramienta, el profesional debe evaluar la privacidad, la seguridad, la finalidad del tratamiento de los datos y el cumplimiento de la LGPD.

¿Puede el médico ser responsable de un error de la IA?

El uso de IA no transfiere automáticamente la responsabilidad profesional. La Resolución CFM nº 2.454/2026 mantiene la decisión médica bajo la responsabilidad del profesional.

Explora la IA en tu flujo de atención. Conoce Charcot y descubre cómo consultar referencias y organizar información clínica.

Publicado el

Tiempo de lectura: 9 minutos