Evaluación de la Soporte de Evidencia y Alucinaciones en Información Médica Generada por Modelos de Lenguaje Grande

Resumen ejecutivo
Un estudio reciente examina la precisión de la información médica generada por inteligencia artificial (IA) y su respaldo en documentos fuente. A pesar de obtener altas tasas de precisión, se destaca la falta de apoyo documental en muchos casos, lo que plantea desafíos para su utilización en la práctica clínica.
Contexto
La proliferación de la inteligencia artificial en el ámbito médico ha traído consigo la generación de información que, aunque a menudo se presenta de manera fluida y comprensible, puede carecer de fundamento en evidencias documentales. Esto es especialmente crítico en el contexto de la gestión de conocimiento clínico, síntesis de evidencia y desarrollo de guías. Los modelos de lenguaje grande (LLMs), como el GPT-5, han mostrado generar contenidos con alta precisión aparente en tareas clínicas, pero también han demostrado ser proclives a "alucinaciones", es decir, a producir información incorrecta o infundada. El estudio evalúa tres modelos: GPT-5, OpenAI o3-mini y GPT-3.5, en cuanto a su capacidad para realizar evaluaciones de riesgo de sesgo sobre ensayos clínicos aleatorizados.
Qué aporta esta novedad
La investigación se enfoca en medir el grado de apoyo documental que tienen las evaluaciones de riesgo de sesgo generadas por los LLMs. Se llevó a cabo una evaluación utilizando un conjunto de 97 ensayos controlados aleatorizados plenamente anotados y accesibles en texto completo, los cuales formaron la base de referencia. Se aplicó el algoritmo Okapi BM25 para recuperar pasajes relevantes de los informes de los ensayos y se clasificaron los hallazgos en categorías de evidencia como "apoyado", "contradicho", "no encontrado" o "fuera de alcance". Los resultados muestran que, a pesar de una alta precisión binaria en las clasificaciones de riesgo de sesgo (entre 90% y 98%), la precisión exacta fue considerablemente más baja (entre 42% y 71%), lo que indica desacuerdos frecuentes en la clasificación de severidad.
Por qué es relevante
Este estudio pone de manifiesto la importancia de evaluar el apoyo documental en los contenidos generados por IA, dado que muchos de estos contenidos, a pesar de ser útiles para la toma de decisiones, carecen de respaldo en documentos clínicos. Las tasas de soporte de la evidencia oscilaron entre 60% y 65%, con tasas de alucinación del 34% al 37%. Estas cifras subrayan limitaciones significativas que no son capturadas por métricas de acuerdo humano, sugiriendo que la confianza en la información generada por IA debe ser cuidadosamente considerada y validada. Además, se muestra que la verificación de evidencia basada en recuperación puede ser un enfoque reproducible y transparente para evaluar la fiabilidad de la información médica generada por IA.
Lectura final
Los hallazgos del estudio resaltan la complejidad de utilizar IA en el ámbito de la salud digital. Si bien los modelos de lenguaje pueden ofrecer resultados que se consideran correctos, es esencial que los profesionales de la salud consideren el respaldo documental de esos resultados al momento de hacer uso de la inteligencia artificial en su labor. Este enfoque no solo es crucial para la medicina basada en evidencias, sino que también pone de relieve la necesidad de un desarrollo continuo en la forma en que evaluamos y aplicamos la tecnología en el sector de la salud.
Lectura clínica
- Ensayo clínico
- Validación clínica
Información editorial dirigida a profesionales de la salud. No sustituye la evaluación clínica, las guías vigentes ni el juicio médico.
Clasificación editorial automática
Fuente original
También en el radar
Inteligencia artificialExhibición de mesas añadidas: Una última oportunidad para mostrar tu startup en TechCrunch Disrupt 2026
22 de septiembre de 2026
Inteligencia artificial4 días para ahorrar hasta $200: Razón 2 de 5 para estar en TechCrunch Disrupt 2026
22 de septiembre de 2026
Inteligencia artificialLas mesas redondas: Las mortales fallas del muro virtual
22 de septiembre de 2026
Inteligencia artificialLiderazgo clínico debe guiar la adopción de la IA
22 de septiembre de 2026
