Charcot alcanza un 96,97% de aciertos en el ENAMED 2026 y supera a modelos globales de IA en un benchmark científico

Charcot alcanzó un 96,97% de aciertos en el ENAMED 2026 y superó a modelos globales de IA en un benchmark científico.

Charcot alcanza un 96,97% de aciertos en el ENAMED 2026 y supera a modelos globales de IA en un benchmark científico

Tiempo estimado de lectura: 10 minutos

Tiempo estimado de lectura: 10 minutos

Lo que necesitas saber sobre Charcot en el ENAMED: Charcot, el agente clínico de Voa Health, que utiliza el contexto del paciente para apoyar el razonamiento médico, ofrecer evidencia y agilizar las tareas de la práctica clínica, obtuvo el mejor resultado en un estudio científico que comparó diez grandes modelos de lenguaje (LLM) en la resolución del Exame Nacional de Avaliação da Formação Médica (ENAMED) de 2026.

Especializada en medicina, desarrollada para la lengua portuguesa y entrenada con guías clínicas brasileñas, la IA de Voa alcanzó un 96,97% de respuestas correctas, el porcentaje más alto entre los modelos evaluados, por delante de GPT-5, Gemini 2.5 Pro, Claude Opus 4.1 y otras herramientas globales de IA.

Realizado por investigadores de la Pontifícia Universidade Católica do Paraná (PUCPR), la Universidade Federal do Paraná (UFPR), el Instituto Tecnológico de Aeronáutica (ITA) y The Ohio State University, el estudio Performance of Large Language Models on the Brazilian National Medical Education Examination: Comparative Benchmark Study se publicó el 29 de mayo de 2026 en Journal of Medical Internet Research (JMIR), una de las principales revistas científicas del ámbito de la salud digital. 

El objetivo era cuantificar y comparar el rendimiento de los modelos comerciales más avanzados con el de Charcot, una IA brasileña especializada, evaluando la precisión, la consistencia y la capacidad de estas herramientas para responder a preguntas de distintas áreas de la medicina. Según los autores, comprender hasta qué punto estos sistemas pueden abordar retos clínicos complejos es un paso importante para su adopción segura y responsable en la práctica médica.

Cómo comparó el benchmark de IA médica a Charcot, GPT-5 y otros modelos

El ENAMED 2026 incluía 100 preguntas de opción múltiple sobre medicina interna, cirugía, atención primaria, salud pública, pediatría y ginecología-obstetricia. Tras la anulación de un ítem (la pregunta 10), el benchmark consideró 99 preguntas válidas para el análisis del rendimiento. Cada modelo realizó el examen completo en cinco rondas independientes, con el orden de las preguntas y las opciones aleatorizado en cada ronda, hasta un total de 495 respuestas. Todas las IA recibieron los mismos prompts en portugués, que pedían indicar la opción elegida y ofrecer una justificación breve para cada pregunta.

Aunque nueve de los 10 modelos evaluados superaron el 85% de aciertos, los investigadores observaron diferencias importantes de rendimiento cuando las preguntas abordaban protocolos clínicos, guías nacionales y aspectos específicos de la práctica médica brasileña. En esas situaciones, Charcot rindió mejor que sus competidores, lo que sugiere que la especialización en medicina, lengua portuguesa y contexto local puede suponer una ventaja importante incluso frente a los modelos generalistas más avanzados disponibles actualmente.

En comparación con el grupo de élite formado por GPT-5 y Gemini 2.5 Pro, el rendimiento de Charcot se consideró estadísticamente indistinguible. Aun así, el modelo de Voa Health mostró una mayor adecuación a las recomendaciones y respuestas esperadas en el contexto brasileño, por ejemplo en preguntas sobre tuberculosis y derrame pleural.


tabela com os resultados do estudo científico

“La medicina está influida por las guías locales, el perfil de la población y el funcionamiento del sistema sanitario. Por eso es esencial evaluar los sistemas de IA en el contexto brasileño”, explica el médico e investigador Francys de Luca, autor principal del estudio. “Los resultados muestran que las soluciones desarrolladas con este contexto en mente pueden ofrecer respuestas más acordes con las necesidades de la práctica médica del país, siempre con supervisión profesional y un uso responsable”.

Principales resultados:

  • Charcot: 96,97% de aciertos.

  • GPT-5: 94,34%.

  • Gemini 2.5 Pro: 93,94%.

  • Claude Opus 4.1: 91,92%.

  • Nueve de los diez modelos superaron el 85% de aciertos.

  • Charcot obtuvo mejores resultados en preguntas relacionadas con guías brasileñas.

Por qué este benchmark de IA médica es importante para Brasil

Los estudios de benchmark desempeñan un papel fundamental en el avance de la inteligencia artificial aplicada a la salud. Al someter distintos modelos a las mismas condiciones de prueba, permiten comparar su rendimiento, identificar limitaciones y generar evidencia más fiable sobre la capacidad de estas herramientas para abordar problemas clínicos complejos. La publicación de los resultados en JMIR Medical Education, una de las principales revistas científicas internacionales dedicadas a la salud digital, refuerza la credibilidad del trabajo y amplía su relevancia para investigadores, médicos y desarrolladores de IA.

Para la medicina brasileña, el significado es aún mayor. Este estudio es uno de los primeros benchmarks publicados en una revista científica internacional que utiliza un examen médico nacional de alta complejidad, realizado en portugués y basado en las guías, los protocolos y las características epidemiológicas del país. En un escenario en el que gran parte de las evaluaciones de inteligencia artificial se basa en referencias internacionales, el nuevo estudio ayuda a cubrir una carencia importante al medir el rendimiento de los modelos a partir de las necesidades reales de la práctica médica brasileña.

¿Por qué es importante el estudio?

1. Evalúa la IA en un contexto real de la medicina brasileña

Muchos benchmarks de inteligencia artificial en salud utilizan exámenes, bases de datos y guías internacionales. Al tomar el ENAMED 2026 como referencia, el estudio evalúa el rendimiento de los modelos en un escenario alineado con la realidad de la formación médica, los protocolos clínicos y el contexto epidemiológico brasileño.

2. Produce evidencia científica publicada, estandarizada y comparable

Al someter diez modelos de IA a las mismas condiciones de prueba, con preguntas, prompts y criterios estandarizados, el benchmark permite comparar el rendimiento de forma transparente. Este tipo de metodología ayuda a médicos, investigadores e instituciones sanitarias a comprender mejor las capacidades y limitaciones de cada sistema.

3. Muestra la importancia de la especialización en medicina

Los resultados indican que los modelos entrenados para contextos específicos pueden ofrecer ventajas relevantes en tareas médicas complejas. En el estudio, Charcot destacó especialmente en las preguntas relacionadas con guías nacionales y protocolos clínicos brasileños, reforzando el valor de la especialización en las aplicaciones sanitarias.

4. Contribuye al desarrollo seguro de la IA en medicina

Además de la tasa de aciertos, la investigación analizó aspectos como la consistencia de las respuestas, el tiempo de procesamiento y los patrones de error compartidos entre los modelos. Estos hallazgos ayudan a orientar el desarrollo de sistemas más fiables y aportan evidencia importante para adoptar la inteligencia artificial en medicina de forma responsable.

La cuestión del tiempo en el estudio

Además de la tasa de aciertos, los investigadores analizaron el Tiempo de Respuesta Medio Normalizado (NMRT), una métrica utilizada para comparar el tiempo que necesitaba cada modelo para generar sus respuestas. Los resultados mostraron una asociación positiva entre el tiempo de procesamiento y la precisión, indicando que los sistemas capaces de dedicar más etapas al razonamiento tienden a obtener mejores resultados en preguntas médicas complejas. Este hallazgo ayuda a comprender cómo las distintas arquitecturas de IA equilibran velocidad y calidad al tomar decisiones.

El estudio también investigó el denominado Error de Convergencia (CE), un fenómeno observado cuando al menos tres modelos elegían la misma opción incorrecta en todas las rondas de ejecución. Más allá de identificar errores aislados, este enfoque permite detectar patrones sistemáticos compartidos entre distintos sistemas de IA. Según los autores, la métrica puede contribuir tanto a mejorar los modelos como a validar exámenes educativos, al ayudar a identificar preguntas potencialmente ambiguas o susceptibles de interpretaciones equivocadas.

¿Qué es Charcot, la IA médica de Voa Health?

Mucho más que una herramienta de transcripción capaz de escuchar, procesar y documentar la conversación entre médico y paciente para mejorar la calidad de los registros y reducir la carga de escritura, Voa integra distintas etapas de la atención en un flujo continuo conectado con el contexto de cada paciente. Charcot, que utiliza el contexto clínico para apoyar el razonamiento del médico y la búsqueda de evidencia, es una pieza clave de la plataforma. El asistente, que funciona como copiloto del médico antes, durante y después de la consulta, es una herramienta versátil que apoya a los profesionales en distintos ámbitos. 

Al tratarse de una tecnología propietaria, el estudio no divulgó detalles sobre el funcionamiento interno de Charcot. Los investigadores evaluaron exclusivamente sus resultados, sometiendo el sistema a las mismas condiciones aplicadas a los demás modelos participantes en el benchmark. De este modo, la comparación se centró en el rendimiento al resolver las preguntas del ENAMED 2026, con independencia de las diferencias de arquitectura o implementación entre las herramientas analizadas.

¿Qué es Charcot?

Charcot es el agente clínico de Voa Health: una IA especializada en medicina, creada para apoyar el razonamiento clínico, generar ideas con referencias fiables y ayudar a los médicos a estructurar documentos, indicaciones y materiales a partir del contexto de la atención. A diferencia de una IA generalista, cuando se utiliza dentro de Voa tiene en cuenta el registro de la consulta y la información relevante del paciente. En el benchmark publicado en JMIR Medical Education, Charcot alcanzó un 96,97% de aciertos en el ENAMED 2026 y obtuvo el mejor resultado entre los modelos evaluados.

¿Qué es el ENAMED?

El Exame Nacional de Avaliação da Formação Médica (ENAMED) es una evaluación que mide los conocimientos y las competencias adquiridos durante la carrera de medicina. El examen reúne preguntas de áreas como medicina interna, cirugía, atención primaria, salud pública, pediatría y ginecología-obstetricia. En el estudio, el ENAMED 2026 se utilizó como referencia para comparar el rendimiento de distintos modelos de inteligencia artificial en tareas que requieren conocimientos médicos.

¿Cómo se realizó el benchmark?

Los investigadores plantearon las preguntas del ENAMED 2026 a diez grandes modelos de lenguaje (LLM), incluido Charcot. Tras anular una pregunta, se consideraron válidos 99 ítems para el análisis. Cada modelo respondió al examen completo en cinco rondas independientes, en las mismas condiciones y con prompts estandarizados en portugués. El objetivo era comparar la precisión, la consistencia y el comportamiento de las distintas inteligencias artificiales ante los mismos retos.

¿Por qué obtuvo Charcot el mejor resultado?

Según los resultados del estudio, Charcot mostró una ventaja principalmente en las preguntas relacionadas con guías clínicas nacionales y aspectos específicos de la práctica médica brasileña. Desarrollado para la lengua portuguesa y entrenado con el foco puesto en el contexto de la medicina brasileña, el sistema demostró una mayor adecuación a los protocolos y recomendaciones locales. Los hallazgos sugieren que la especialización en medicina y contexto regional puede ser un factor diferenciador importante en evaluaciones médicas de alta complejidad.

¿Quieres ver en la práctica cómo Charcot apoya la toma de decisiones y la búsqueda de evidencia en la consulta? Conoce Voa y cuenta con una plataforma de IA especializada a tu lado.

Publicado el

Tiempo de lectura: 10 minutos