聊天GPT与双子座:CAD-RADS从放射学报告中的分数分配中的比较准确性和效率
Matthew Silbergleit1, Adrienn Tóth1, Jordan H Chamberlin1
1Division of Cardiothoracic Imaging, Department of Radiology and Radiological Science, Clinical Science Building, Medical University of South Carolina, 96 Jonathan Lucas Street, Suite 210, MSC 323, Charleston, SC, 29425, USA.
Journal of imaging informatics in medicine
|November 11, 2024
概括
聊天GPT-4o在从放射学报告中生成冠状动脉疾病报告和数据系统 (CAD-RADS) 评分方面取得了最高的准确性. 虽然更快,但ChatGPT-3.5的准确性较低,这表明LLM需要进一步开发用于临床使用.
科学领域:
- 放射学中的人工智能
- 医疗信息学 医疗信息学
- 自然语言处理自然语言处理.
背景情况:
- 放射学报告包含疾病分类的关键数据.
- 自动化冠状动脉疾病报告和数据系统 (CAD-RADS) 评分可以提高效率.
- 大型语言模型 (LLM) 显示了分析医学文本的潜力.
研究的目的:
- 为了评估ChatGPT-3.5,ChatGPT-4o,Google Gemini和Google Gemini Advanced在生成CAD-RADS得分中的准确性和效率.
- 将LLM的成绩与放射科医生分配的CAD-RADS分数进行比较.
- 评估LLM生成分数的观察者间一致性.
主要方法:
- 对100个冠状动脉计算机断层扫描血管学报告的回顾性分析.
- 在没有微调的情况下,将报告的发现部分输入到四个LLM中.
- 将LLM生成的CAD-RADS得分与放射科医生分配的得分进行比较.
- 记录每个LLM所花费的时间.
主要成果:
- 聊天GPT-4o显示了最高的准确性 (87%) 和强大的观察者间一致性 (κ=0.838,α=0.886).
- 双子座先进测试实现了82.6%的准确率 (κ=0.784,α=0.897).
- 聊天GPT-3.5是最快的 (5s),但最不准确的 (50.5%, κ=0.401, α=0.787).
- 双子座的失败率为12%,而双子座高级显示有所改善.
结论:
- 在接受测试的人中,ChatGPT-4o是CAD-RADS评分最准确的LLM.
- 目前的LLM需要进一步改进,以便在CAD-RADS评分中可靠的临床决策.
- LLM的速度和准确性差异很大,影响了潜在的临床整合.
关键词:
在这里,我们可以看到AIAIAI.在CAD-RADS中,我们可以使用CAD-RADS.聊天GPT 聊天GPT 聊天冠状动脉中心动脉瘤 (CTA) 的发生双子座是一个双子座.在法学士 (LLM) 课程中.更多相关视频
06:16Signal Acquisition, Score Interpretation, and Economics of a Non-Invasive Point-of-Care Test for Coronary Artery Disease
Published on: August 9, 2024
360
06:57Author Spotlight: Advancing Cardiovascular Imaging - Introducing the Spatially Weighted Calcium Score for Early Disease Detection
Published on: September 22, 2023
930
