Tecnología

¿Sirve ChatGPT para Estudiar tu Residencia Médica?

A
Alix · Editora Médica en ResiLab

La Respuesta Corta

No. Un chatbot de propósito general como ChatGPT no es una herramienta confiable para preparar el examen de residencia médica. En un estudio publicado en Cureus (2023), el 47% de las referencias médicas que generó ChatGPT eran inventadas y el 46% eran reales pero inexactas: solo el 7% eran correctas. Para un examen que define tu carrera, esa tasa de error es inaceptable.

Ahora la respuesta larga — porque entender por qué falla es lo que te va a proteger de cualquier herramienta que repita el mismo error, tenga o no un logo bonito encima.

ChatGPT No Sabe Medicina: Predice Palabras

Aquí está el malentendido de fondo. Un modelo de lenguaje no consulta una base de conocimiento cuando le preguntas por el manejo de la preeclampsia severa. Predice, token por token, cuál es la siguiente palabra más probable según los patrones estadísticos de su entrenamiento. El propio estudio de Bhattacharyya et al. en Cureus (2023) lo explica: el modelo no puede distinguir entre información correcta e incorrecta — solo produce respuestas que siguen los patrones que aprendió.

Dos consecuencias directas para ti como estudiante:

  1. La misma pregunta puede producir respuestas distintas. El proceso es probabilístico. Hoy te dice sulfato de magnesio con un esquema; mañana, con otro. Y ambas respuestas suenan igual de seguras.
  2. La fluidez no es señal de verdad. El modelo está optimizado para sonar convincente, no para ser exacto. Walters y Wilder lo llamaron estar “confidently wrong”: el chatbot defiende sus errores con total seguridad cuando le pides verificarlos.

Piénsalo así: no le pedirías a un compañero con memoria brillante pero cero escrúpulos para inventar que te dicte los criterios de Wells. Eso es, funcionalmente, lo que hace un modelo de lenguaje sin fuentes verificables.

Las Alucinaciones No Son un Bug: Son Estructurales

“Ya lo van a arreglar en la próxima versión” es la respuesta típica. La evidencia dice otra cosa.

Un estudio en Scientific Reports (2023) analizó 636 referencias bibliográficas generadas por ChatGPT en 84 textos académicos: el 55% de las citas de GPT-3.5 eran fabricadas — trabajos que no existen. GPT-4 mejoró, pero seguía fabricando el 18%. Y de las citas reales que produjo GPT-4, el 24% contenía errores sustanciales: autores, volúmenes, páginas o años incorrectos.

Otro trabajo en Cureus (2023) documentó el mismo fenómeno en escritura científica: referencias con DOI que no resuelven a ningún artículo real. Y aquí viene el dato que debería incomodar a cualquiera que confía en “los modelos nuevos”: un estudio publicado en Nature (2024) encontró que los modelos más grandes y más entrenados para seguir instrucciones se vuelven menos confiables en un aspecto clave — en lugar de reconocer que no saben, responden con seguridad cosas incorrectas. Más tamaño no compró más honestidad epistémica.

Si nos preguntas, este es el punto que más nos molesta del discurso alrededor de la IA en educación médica: se vende la mejora de versión como si fuera la solución del problema, cuando la evidencia muestra que el problema es de arquitectura, no de versión.

El Sesgo También Se Hereda

Hay un riesgo menos visible que las referencias falsas. Un estudio en npj Digital Medicine (2023) evaluó cuatro modelos de lenguaje comerciales con preguntas médicas sobre función renal, capacidad pulmonar y otros temas: todos los modelos reprodujeron, en al menos algunas respuestas, conceptos de medicina basada en raza ya desacreditados. El modelo no filtra la literatura obsoleta de su entrenamiento — la repite.

Para un examen de residencia que evalúa guías vigentes, estudiar con una herramienta que puede citarte fisiología descartada hace décadas no es un atajo. Es una lotería.

”Pero ChatGPT Aprobó el USMLE”

Sí — y ese titular merece contexto. El estudio original en PLOS Digital Health (2023) encontró que ChatGPT rindió en o cerca del umbral de aprobación del examen. Raspando.

¿Aceptarías como tutor a alguien que pasó raspando el examen que tú necesitas ganar por margen amplio? Porque en el examen de residencia colombiano no compites contra un umbral: compites contra cientos de aspirantes por un puñado de cupos. El que “apenas pasa” no obtiene el cupo.

Incluso los modelos entrenados específicamente para medicina tienen brechas documentadas: la evaluación de Med-PaLM publicada en Nature (2023) mostró que, aunque el modelo alcanzó resultados notables en benchmarks, los clínicos evaluadores seguían encontrando deficiencias en sus respuestas frente a las de médicos reales. Especializado no significa infalible.

Un Martes a las 11 PM

Imagina la escena, porque pasa todos los días. Llevas turno desde las 7 AM, te quedan 40 minutos de energía y le preguntas a ChatGPT el manejo inicial del TEP con inestabilidad hemodinámica. Te responde con un párrafo impecable, seguro, bien redactado. Lo anotas y te duermes tranquilo.

El problema: no tienes forma de saber si esa respuesta salió de una guía vigente, de un foro de 2014 o de una combinación estadísticamente plausible de ambos. No hay fuente. No hay fecha. No hay nadie que haya revisado esa respuesta antes que tú. Y tú, a las 11 PM de un martes, no estás en condiciones de auditarla — que es exactamente el momento en que más la necesitabas confiable.

Ese es el fallo de fondo: la herramienta te exige un nivel de verificación que, si pudieras hacerlo, no necesitarías la herramienta.

Lo Que Sí Funciona: Preguntas Validadas + Recuperación Activa

La ciencia del aprendizaje lleva décadas señalando el mismo camino. El estudio clásico de Roediger y Karpicke en Psychological Science (2006) demostró el testing effect: intentar recuperar la información — responder preguntas — produce una retención a largo plazo muy superior a releer el material. Larsen, Butler y Roediger extendieron esa evidencia a la educación médica en Medical Education (2008): la evaluación frecuente con preguntas es una herramienta de aprendizaje, no solo de medición.

Pero fíjate en el supuesto silencioso de toda esa literatura: las preguntas eran correctas. El testing effect consolida lo que practicas — incluyendo los errores. Si practicas con preguntas cuya respuesta “correcta” nadie validó, estás usando la técnica de retención más poderosa que existe para cementar información posiblemente falsa. Es el peor de los dos mundos.

Por eso el orden importa: primero material validado, después recuperación activa sobre ese material. Si quieres profundizar en la técnica, tenemos guías de estudio activo vs pasivo y de repetición espaciada.

Qué Exigirle a Cualquier Herramienta de Estudio

Antes de confiarle tu preparación a cualquier plataforma — incluida la nuestra — exige esto:

CriterioPregunta que debes hacer
Fuentes auditables¿De dónde sale este contenido? ¿Literatura científica, libros de texto, guías internacionales — o “de la IA”?
Validación¿Quién revisa las preguntas antes de que lleguen a ti? ¿Existe un proceso, o solo un generador?
Consistencia¿La misma pregunta tiene siempre la misma respuesta correcta y la misma explicación?
Vigencia¿El contenido refleja guías actuales o arrastra literatura obsoleta?

En ResiLab también usamos IA — no somos tecnófobos. Pero le damos el rol opuesto al del chatbot: nuestra propia IA, construida sobre artículos científicos, libros de texto médicos y guías clínicas internacionales, audita y pondera cada pregunta del banco de preguntas. No publica nada por su cuenta. Y cuando algo te genera duda, del otro lado hay soporte activo con un auditor médico real que revisa personalmente cada caso. La IA con base científica auditable es una herramienta de control de calidad; pedirle preguntas a un chatbot es una apuesta. Nuestro método de estudio está diseñado sobre esa distinción.

ChatGPT es útil para muchas cosas: redactar un correo, resumir un texto que tú ya verificaste, explicarte un concepto que luego contrastas con tu libro. El problema no es usar IA. El problema es usarla como fuente de verdad médica sin auditoría.

La pregunta que te dejamos es incómoda pero necesaria: de las respuestas que le has aceptado a un chatbot este mes, ¿cuántas verificaste contra una fuente real? Si la respuesta es “casi ninguna”, ya sabes qué cambiar antes de tu próximo simulacro.

A

Alix

Editora Médica en ResiLab

Editora médica en ResiLab. Investiga, verifica y redacta el contenido educativo sobre residencias médicas en Colombia, asegurando que cada dato sea preciso y útil para los aspirantes a especialista.

Compártelo con tu grupo

Prueba la tecnología que marca la diferencia

IA predictiva, repetición espaciada 2.0 y simulacros por universidad. Todo diseñado para que pases el examen.

Prueba ResiLab Gratis

Sin tarjeta de crédito · Plan gratuito para siempre

Recibe tips de preparación en tu correo

Guías, fechas de exámenes y técnicas de estudio para residencia médica. Directo a tu bandeja, sin spam.

Sin spam. Puedes darte de baja en cualquier momento.

Explora más sobre Técnicas de Estudio

Artículos relacionados