Preparación

7 Señales de un Banco de Preguntas Hecho con IA [Checklist]

A
Alix · Editora Médica en ResiLab

El Banco que Apareció de la Nada

Un lunes cualquiera, en el grupo de WhatsApp de tu promoción, alguien comparte el link de una plataforma nueva: “tiene 20.000 preguntas y acaban de subir 5.000 más este mes”. Precio atractivo, diseño moderno, promesas grandes. Tres semanas después, un compañero nota que dos preguntas casi idénticas sobre manejo de cetoacidosis dan respuestas contradictorias. Nadie sabe quién escribió las preguntas. Nadie responde en soporte.

Ese banco existe. Con distintos nombres, en distintos países, multiplicándose desde que generar mil preguntas cuesta lo mismo que un prompt.

Un banco de preguntas confiable para el examen de residencia médica se reconoce por tres cosas: fuentes auditables detrás de cada explicación, un proceso de validación con revisores identificables, y consistencia clínica entre preguntas del mismo tema. Un banco generado con IA sin validación falla en las tres — y hay señales concretas para detectarlo antes de pagar.

Este artículo es ese detector. Una aclaración editorial antes de empezar: en ResiLab también usamos IA — la nuestra, basada en conocimiento científico, para auditar y ponderar nuestro propio banco — así que esto no es un alegato contra la tecnología. Es un alegato contra usarla sin base científica ni control de calidad. La diferencia entre ambas cosas es exactamente lo que vas a aprender a ver.

Por Qué Esto Importa: la Ciencia del Error Barato

Cuando un modelo de lenguaje genera contenido médico sin fuentes verificadas, el resultado no es “un poco impreciso”. Es sistemáticamente defectuoso. En un estudio publicado en Cureus (2023), de 115 referencias médicas generadas por ChatGPT, el 47% eran fabricadas, el 46% eran reales pero con datos incorrectos, y solo el 7% eran correctas — con un promedio de 4,3 elementos erróneos por referencia. Otro análisis en Scientific Reports (2023) encontró que GPT-3.5 fabricó el 55% de sus citas académicas y GPT-4, aunque mejor, siguió fabricando el 18%.

Ese es el material del que están hechos los bancos sin validación. Ahora sí, las señales.

Las 7 Señales de Alerta

1. Explicaciones que no citan nada auditable

La explicación suena fluida, usa terminología correcta, tiene la longitud perfecta — y no referencia ninguna guía, ningún libro, ningún estudio. La fluidez sin fuentes es la firma de un modelo de lenguaje: está optimizado para sonar convincente, no para ser verificable. Una explicación médica seria te dice de dónde sale la conducta recomendada.

2. Referencias que no resuelven a nada real

Peor que no citar es citar en falso. Si el banco incluye referencias, tómate cinco minutos y busca tres en PubMed o Google Scholar. La evidencia sobre referencias fabricadas por IA es abrumadora — el fenómeno está documentado también en Cureus (2023, Athaluri et al.), donde parte de las referencias generadas apuntaban a DOIs que no existen. Si una sola referencia del banco no existe, asume que nadie las verificó todas.

3. Volumen que crece a velocidad imposible

Miles de preguntas nuevas en semanas. Haz la cuenta: un revisor médico serio necesita leer la viñeta, verificar la respuesta contra guías vigentes, auditar los distractores y aprobar la explicación. Si una plataforma sube 5.000 preguntas en un mes, pregúntate cuántos médicos revisores necesitaría — y si es plausible que los tenga. El volumen instantáneo no es una hazaña: es la confesión de que no hubo revisión humana.

4. Respuestas contradictorias entre preguntas casi idénticas

La generación con modelos de lenguaje es probabilística: la misma pregunta puede producir respuestas distintas en corridas distintas. Si el banco tiene dos preguntas sobre el mismo escenario clínico con conductas “correctas” incompatibles, no estás viendo un typo — estás viendo el mecanismo de generación sin control de consistencia. Este es el test más fácil de aplicar durante una prueba gratuita.

5. Ningún proceso de revisión médica con nombre y apellido

¿Quién valida las preguntas? Si la respuesta no está publicada — o es un genérico “nuestro equipo médico” sin proceso descrito — la respuesta real probablemente es “nadie”. Los bancos serios describen su proceso editorial porque les costó construirlo. Los que no lo tienen, lo esconden detrás de vaguedad.

6. Distractores gramaticalmente perfectos pero clínicamente implausibles

Esta señal requiere ojo clínico, y por eso es de las más reveladoras. En una pregunta bien construida, cada distractor es un error plausible — algo que un aspirante confundido elegiría. Los modelos de lenguaje producen distractores gramaticalmente impecables pero clínicamente huecos: opciones que ningún médico consideraría, dosis absurdas, conductas de otra especialidad. Si eliminas dos opciones por absurdas sin saber del tema, la pregunta no está entrenando tu razonamiento — está inflando tu porcentaje de aciertos.

7. Contenido que contradice guías internacionales vigentes

Los modelos entrenados con texto histórico arrastran literatura obsoleta — incluyendo conceptos activamente desacreditados. Un estudio en npj Digital Medicine (2023) mostró que los principales modelos comerciales reprodujeron conceptos de medicina basada en raza ya descartados al responder preguntas médicas. Toma un tema que domines y compara cinco preguntas del banco contra la guía internacional vigente. Si encuentras conductas viejas presentadas como actuales, el contenido no tiene curaduría — tiene fecha de vencimiento oculta.

El Checklist en una Tabla

SeñalCómo verificarla en 10 minutos
Sin fuentes en explicacionesAbre 5 preguntas: ¿alguna cita guía, libro o estudio?
Referencias falsasBusca 3 referencias en PubMed
Volumen imposibleCompara preguntas nuevas/mes vs revisores declarados
Respuestas contradictoriasBusca 2 preguntas del mismo tema y compara conductas
Sin proceso de revisiónBusca el proceso editorial publicado en el sitio
Distractores huecos¿Puedes descartar 2 opciones sin saber del tema?
Guías desactualizadasContrasta un tema que domines contra la guía vigente

Dos o más señales positivas: no le confíes tu preparación. Con lo que cuesta un cupo de residencia en Colombia — en años de esfuerzo, no solo en dinero — el estándar no puede ser “se ve profesional”.

¿Cómo Se Ve un Pipeline Serio?

Lo contrario de cada señal. Un banco de preguntas construido con rigor científico tiene:

  • Base documental real: las preguntas nacen de literatura primaria, libros de texto médicos y guías clínicas internacionales — no de pedirle a un chatbot que “genere 50 preguntas de cardiología”.
  • Validación antes de publicar: filtros de calidad que evalúan coherencia clínica, estructura de la pregunta y alineación con la especialidad, con revisión antes de que la pregunta llegue al estudiante.
  • Consistencia auditada: el mismo tema produce la misma conducta correcta, siempre.
  • Retroalimentación psicométrica: las preguntas que los datos revelan como ambiguas o defectuosas se corrigen o se retiran. Un banco vivo mejora; uno generado en bloque solo envejece.

Así funciona el banco de preguntas de ResiLab: una IA propia con base científica que audita y pondera cada pregunta del banco, más soporte activo donde un auditor médico real revisa personalmente cada caso que un estudiante reporta. Nada de generadores conectados a un botón de publicar. Si quieres comparar en detalle qué diferencia un banco con proceso de uno tradicional, tenemos una comparativa completa.

¿Y Si Ya Pagué un Banco Dudoso?

No entres en pánico, pero tampoco lo ignores. Aplica el checklist de arriba. Si el banco falla, lo peor que puedes hacer es seguir practicando ahí: la práctica con preguntas consolida lo que respondes — el testing effect documentado por Roediger y Karpicke en Psychological Science (2006) funciona igual de bien para fijar aciertos que para fijar errores. Practicar con preguntas mal validadas es entrenar tu memoria a largo plazo con información que nadie verificó. Escribimos sobre este mecanismo, y sobre por qué un chatbot genérico tampoco es la alternativa, en ¿Sirve ChatGPT para estudiar tu residencia médica?

¿Un Simulacro Puede Revelar la Calidad del Banco?

Sí, y es la prueba de fuego. Un simulacro cronometrado te expone a decenas de preguntas del mismo banco en una sesión: las inconsistencias, los distractores huecos y las explicaciones sin fuente se vuelven evidentes cuando las ves en volumen. Si después de un simulacro completo no encontraste ninguna explicación citando una fuente real, ya tienes tu respuesta.


Nuestra posición editorial, sin anestesia: generar preguntas médicas con IA sin validación científica no es innovación — es negligencia con interfaz bonita. La tecnología para hacerlo bien existe, el conocimiento para validarlo existe, y quien decide saltarse ese paso está transfiriendo el costo del error a médicos que se juegan su carrera en un examen. Exige fuentes. Exige proceso. El que los tiene, los muestra.

A

Alix

Editora Médica en ResiLab

Editora médica en ResiLab. Investiga, verifica y redacta el contenido educativo sobre residencias médicas en Colombia, asegurando que cada dato sea preciso y útil para los aspirantes a especialista.

Compártelo con tu grupo

Deja de leer y empieza a practicar

Cada día sin entrenar es ventaja para tu competencia. Simulacros tipo examen real de 30 universidades colombianas.

Haz tu Primer Simulacro Gratis

Sin tarjeta de crédito · Plan gratuito para siempre

Recibe tips de preparación en tu correo

Guías, fechas de exámenes y técnicas de estudio para residencia médica. Directo a tu bandeja, sin spam.

Sin spam. Puedes darte de baja en cualquier momento.

Explora más sobre Residencia Médica en Colombia

Artículos relacionados