聊天机器人响应在前列腺癌和泌尿外科护理中的可读性:客观指标与患者感知
Lasse Maywald1, Lisa Nguyen2, Jana Theres Winterstein3,4
1Department of Urology, University Medical Center Mannheim, 68167 Mannheim, Germany.
Current oncology (Toronto, Ont.)
|October 28, 2025
概括
大型语言模型 (LLM) 为患者教育提供了潜力,但它们在泌尿瘤学中的可读性需要评估. 虽然客观上很难阅读,但患者认为聊天机器人的反应是高度可理解的,突出了测量和感知理解之间的差距.
科学领域:
- 尿瘤学 尿瘤学
- 医疗信息学 医疗信息学
- 卫生识字 卫生识字
背景情况:
- 低健康素养 (12%的成年人) 需要提高患者信息的可读性.
- 大型语言模型 (LLM) 显示出提高医疗信息可访问性的前景.
- 关于LLM对患者的可读性现有的证据是混合的,需要临床验证.
研究的目的:
- 评估聊天机器人响应的测量和感知可读性,用于与泌尿病患者进行基于语音的交互.
- 评估GPT-4聊天机器人输出的清晰度,技术语言和可解释性.
- 分析客观可读性指标与患者感知之间的关联.
主要方法:
- 泌尿病患者与基于GPT-4的聊天机器人进行无脚本对话.
- 通过使用Flesch-Reading-Ease (FRE),Lesbarkeitsindex (LIX) 和Wiener-Sachtextformel (WSF) 的可读性指数来分析成绩单.
- 通过对技术语言,清晰度和可解释性的调查来评估感知可读性.
主要成果:
- 分析了231次对话,重点关注前列腺癌,机器人辅助前列腺切除术和随访.
- 客观可读性得分表明难以阅读的文本 (FRE 43.1,LIX 52.8,WSF 11.2).
- 患者在技术语言,清晰度和可解释性方面高度评价感知可读性 (83-90%),与客观得分无关.
结论:
- 在泌尿瘤学中,聊天机器人的响应客观上很难读取,超过了健康素养建议.
- 尽管客观难度很大,但患者认为信息清晰易懂.
- 在测量语言复杂性和感知可理解性之间存在差异,这表明其他因素会影响患者的理解.


