大型语言模型的性能 聊天GPT和双子座在工作场所管理问题 放射学中的问题
Patricia Leutz-Schmidt1, Viktoria Palm1, René Michael Mathy1
1Department of Diagnostic and Interventional Radiology, University Hospital Heidelberg, 69120 Heidelberg, Germany.
Diagnostics (Basel, Switzerland)
|February 26, 2025
概括
大型语言模型 (LLM) 在放射学工作场所管理方面表现有前途. 与其他经过测试的LLM相比,ChatGPT-4.0的性能优越,包括Gemini Advanced.
科学领域:
- 医疗保健中的人工智能
- 医疗管理医疗管理
- 放射学 信息学 信息学
背景情况:
- 大型语言模型 (LLM) 越来越受欢迎,需要对其在工作场所的应用进行研究.
- 关于LLM在医疗管理中的作用的研究有限,特别是在放射学方面.
研究的目的:
- 评估和比较ChatGPT-3.5,ChatGPT-4.0,Gemini和Gemini Advanced在解决放射学工作场所管理问题的表现.
- 评估LLM产生的响应的质量,可理解性和可实施性.
主要方法:
- 四位LLM (ChatGPT-3.5,ChatGPT-4.0,Gemini,Gemini Advanced) 回答了四个领域的31个放射学工作场所管理问题.
- 两个独立的读者使用整体质量评分 (OQS),可理解性评分 (US) 和可实施性评分 (IS) 评估了回复.
- 计算了平均质量评分 (MQS),并评估了评价者之间的可靠性 (IRR).
主要成果:
- 聊天GPT-4.0获得了最高的整体质量评分 (OQS),可理解性评分 (US),可实施性评分 (IS) 和平均质量评分 (MQS).
- 聊天GPT-4.0显著优于其他聊天机器人 (p < 0.001-0.002). 双子座高级也比双子座显著改善 (p = 0.003).
- 所有LLM提供了被评为足够的答案,表明在放射学工作场所管理查询中表现良好.
结论:
- 所有评估的LLM在回答放射学工作场所管理问题方面表现良好.
- 与ChatGPT-3.5,Gemini和Gemini Advanced相比,ChatGPT-4.0表现出了更高的性能. 这就是为什么Gemini和Gemini是最先进的.
- 通过协助各种任务,LLM提供了提高放射学工作场所管理效率的潜力.


