评估大型语言模型生成的手术前患者教育材料的质量:跨模型和手术类型的比较研究
Junwei Ma1, Yunshan Zhang2, Huifeng Tang2
1School of Nursing, Jilin University, Changchun, China.
Frontiers in medicine
|December 29, 2025
概括
大型语言模型 (LLM) 可以生成准确的手术前患者教育材料 (PEM),但没有单一的模型在各个方面都卓越. 医务人员应在患者使用之前审查和补充LLM生成的草稿.
科学领域:
- 人工智能在医学中的应用
- 医疗信息学 医疗信息学
- 自然语言处理自然语言处理.
背景情况:
- 大型语言模型 (LLM) 对患者教育有希望,但之前的研究重点是问答,而不是完整的手术前患者教育材料 (PEM).
- 在不同模型和手术类型中缺乏LLM生成的手术前PEM的全面质量评估.
研究的目的:
- 综合评估和比较六种常见的LLM产生的完整的手术前PEM的质量,用于各种类型的手术.
主要方法:
- 六个LLM为六种手术类型生成了手术前PEM.
- 专家小组评估了准确性和完整性;研究人员评估了可理解性,可操作性 (PEMAT-P) 和适用性 (SAM).
- 分析了可读性 (Flesch-Kincaid) 和情绪 (VADER);统计分析使用了弗里德曼和康诺弗的后期测试.
主要成果:
- 所有的LLM都表现出卓越的准确性,可理解性和可操作性,没有显著差异.
- 格罗克-4和克劳德-奥普斯-4在完整性方面优越;克劳德-奥普斯-4在适用性方面领先,而格罗克-4排名最低.
- 格洛克-4和Gemini-2.5-Pro的可读性最高;克劳德-Opus-4的可读性最低. 只有Gemini-2.5-Pro始终产生了积极的情绪.
结论:
- 通过LLM生成的手术前PEM在多个维度实现了高质量,但没有单一的模型是完美的.
- 法律学士可以协助医务人员起草手术前PEM.
- 在患者使用之前,医疗专业人员对人类的审查和补充是必不可少的.


