← Volver a noticias
Inteligencia artificial

Medición de la consistencia entre las respuestas de modelos de lenguaje grandes sobre consultas de atención preventiva y las recomendaciones oficiales del Grupo de Trabajo de Servicios Preventivos de

30 de julio de 20263 min de lecturaPor RADAR AI GLOBALFuente: JMIR AI
IA y MedicinaSalud pública
Medición de la consistencia entre las respuestas de modelos de lenguaje grandes sobre consultas de atención preventiva y las recomendaciones oficiales del Grupo de Trabajo de Servicios Preventivos de

Resumen ejecutivo

Este estudio evalúa si varios modelos de lenguaje grandes (LLMs) generan respuestas sobre la atención preventiva que son consistentes con las recomendaciones del USPSTF. Se probaron 35 LLMs en 142 temas de atención preventiva, y se encontró que la concordancia varía significativamente entre los modelos y se mejora con ciertos enfoques de consulta.

Compartir

WhatsAppLinkedInXCorreo

Contexto

Los modelos de lenguaje grandes han mostrado un potencial prometedor para brindar orientación personalizada sobre atención preventiva a gran escala. Sin embargo, estudios previos han indicado que su desempeño no es uniforme al responder a preguntas sobre actividades de atención preventiva seleccionadas. Este estudio busca abordar estas inconsistencias al evaluar un conjunto más amplio de LLMs y una variedad más extensa de temas de atención preventiva, utilizando simulaciones de usuarios para probar la concordancia con las recomendaciones establecidas por el USPSTF.

Qué aporta esta novedad

El estudio se llevó a cabo en dos oleadas. En la primera (2025), se evaluaron 28 LLMs, y en la segunda (2026), 10 LLMs, con una superposición de 3 modelos. Se midió la concordancia entre las respuestas de los LLMs y las recomendaciones del USPSTF, encontrando que el LLM con la mejor tasa de concordancia logró un 87.77% de alineación en la segunda oleada. Además, se observó que ciertos tipos de consultas, como las que usan una cadena de pensamientos o prompts iterativos, mejoran significativamente la consistencia de las respuestas. En cambio, el uso de consultas de tipo "few-shot" mostró una disminución en la congruencia.

Por qué es relevante

La variabilidad en la consistencia de los LLMs con las recomendaciones del USPSTF es un aspecto crucial a considerar, ya que puede influir en el tipo de información de salud que se facilita a los usuarios. Las desviaciones observadas mayormente se deben a la tendencia de los LLMs a evitar hacer recomendaciones definitivas, lo que podría limitar su eficacia en el suministro de orientaciones claras y prácticas para la atención preventiva. El estudio subraya la importancia de desarrollar y ajustar los LLMs para mejorar su alineación con las normas de salud pública.

Lectura final

La investigación resalta que la concordancia entre los LLMs y las recomendaciones del USPSTF ha mejorado de manera notable en modelos más recientes. El uso de estrategias de consulta específicas puede desempeñar un papel clave en esta mejora, lo que sugiere que el diseño de las preguntas puede influir significativamente en la calidad de la información proporcionada. Con la creciente integración de la inteligencia artificial en el ámbito de la salud, comprender y optimizar la capacidad de estos modelos para ofrecer consejos adecuados sobre atención preventiva se vuelve esencial para la promoción de la salud y la toma de decisiones informadas por parte de los usuarios.

Lectura clínica

Información editorial dirigida a profesionales de la salud. No sustituye la evaluación clínica, las guías vigentes ni el juicio médico.

Clasificación editorial automática

Fuente original

JMIR AI

También en el radar