聊天GPT和双子座可以证明脑CT转诊是合理的吗? 一项与人类专家进行的比较研究和一个定制的预测模型
Jaka Potočnik1, Edel Thomas2, Dearbhla Kearney3
1University College Dublin School of Medicine, Dublin, Ireland. jaka.potocnik@ucd.ie.
European radiology experimental
|February 18, 2025
概括
像ChatGPT和Gemini这样的大型语言模型显示出证明大脑CT扫描的潜力,但在不完整的转介方面存在困难. 一个定制预测模型在分析推适当性方面表现出卓越的表现.
科学领域:
- 医疗成像中的人工智能
- 临床决策支持系统 临床决策支持系统
- 放射学工作流的优化 工作流的优化
背景情况:
- 不适当的计算机断层扫描 (CT) 扫描在欧洲普遍存在,这是由于对成像推指南的不充分遵守.
- 正在探索公开的聊天机器人,如ChatGPT和Gemini,作为帮助证明现实世界成像推的工具.
- 之前的研究表明,在分析美国放射学学院的适当性标准时,ChatGPT的准确性很高.
研究的目的:
- 为了比较ChatGPT和Gemini在解释和证明成年大脑CT推时的性能与定制预测模型的性能.
- 评估聊天机器人根据欧洲放射学学会iGuide标准提出替代成像方式的能力.
- 使用预测模型与聊天机器人性能对推的自动化iGuide分类进行评估.
主要方法:
- 用欧洲放射学学会iGuide标准对143个现实成年大脑CT转诊的分析.
- 聊天GPT-4和双子座的解释,理由和成像建议与人类专家分析 (放射学家和放射科医生) 的比较.
- 使用kappa统计数据评估推的完整性和评价者之间的可靠性,以确定协议.
主要成果:
- 聊天机器人在证明推的性能是有限的 (κ=0.3),但通过更完整的推信息得到了改善.
- 定制预测模型在理由分析中显著优于聊天机器人 (κ=0.853).
- 聊天机器人在解释完整的转诊时表现出很高的一致性 (94.2%),在建议替代成像方式方面表现出很好的一致性 (83-86.5%).
结论:
- 目前的聊天机器人对分析成年大脑CT推的理由能力有限,特别是模糊的,与开发的预测模型不同.
- 聊天机器人的性能取决于推的完整性;涉嫌病理的详细推产生了更好的结果.
- 需要进一步的研究来验证这些发现在不同的CT扫描类型和成像模式.
更多相关视频
09:03Radiotracer Administration for High Temporal Resolution Positron Emission Tomography of the Human Brain: Application to FDG-fPET
Published on: October 22, 2019
9.9K
07:57Positron Emission Tomography-based Dose Painting Radiation Therapy in a Glioblastoma Rat Model using the Small Animal Radiation Research Platform
Published on: March 24, 2022
2.7K
