利用大型语言模型对医疗软件的启发性可用性评估:与辐射规划助理的见解
Laurence E Court1, Jacobus Smit2, Lourens Strauss2
1Department of Radiation Physics, The University of Texas MD Anderson Cancer Center, Houston, Texas, USA.
Journal of applied clinical medical physics
|February 18, 2026
概括
像ChatGPT这样的大型语言模型 (LLM) 可以通过提供结构化的反来协助医疗软件可用性测试. 这项研究发现,LLM是传统启发式评估的有价值,低成本的补充,用于识别微小的界面改进.
科学领域:
- 医疗软件工程 医疗软件工程
- 人与计算机的交互
- 医疗信息学 医疗信息学
背景情况:
- 可用性工程对于医疗软件的安全性和有效性至关重要,因为设计缺陷会导致使用错误.
- 启发式评估确定可用性问题,但依赖于专家的解释.
- 大型语言模型 (LLM) 提供了结构化,上下文意识的可用性反的潜力.
研究的目的:
- 探索使用ChatGPT进行辐射规划助理 (RPA) 软件的启发性评估.
- 评估ChatGPT识别可用性问题的能力,并建议医疗软件的改进.
- 评估LLM产生的反与开发人员和用户的评估.
主要方法:
- 聊天GPT提供了RPA文档和可用性启发式.
- 该LLM使用张的启发式和严重程度尺度对RPA仪表板进行了评分,并提出了界面改进.
- 由RPA开发人员和13名用户进行反和评分,以进行比较分析.
主要成果:
- 聊天GPT发现了26个潜在的可用性问题,开发人员认为有9个可采取行动 (轻度严重).
- 用户的评分各不相同,少数人认为三个建议是优先考虑的.
- 用户和开发人员之间的定性协议是有限的,强调了需要多样化的观点.
结论:
- 聊天GPT的启发式评估引发了讨论,并确定了RPA软件的轻微改进.
- 医疗软件的LLM可以作为医疗软件传统启发式评估的经济有效补充.
- 这种方法支持早期的可用性审查和利益相关者参与医疗软件开发.


