在放射学中评估大型语言模型的参考准确性:跨子专业的比较研究
Yasin Celal Güneş1, Turay Cesur2, Eren Çamur3
1Kırıkkale Yüksek İhtisas Hospital, Clinic of Radiology, Kırıkkale, Türkiye.
概括
克劳德3.5索内特擅长生成精确的放射学参考,显著超过其他大型语言模型,如ChatGPT和Google Gemini. 这一进步为放射学研究和教育提供了可靠的引用,减轻了错误信息的风险.
科学领域:
- 医疗成像中的人工智能
- 用于科学文献的自然语言处理.
- 放射学 信息学 信息学
背景情况:
- 大型语言模型 (LLM) 在学术和临床环境中越来越多地使用.
- 准确生成科学参考文献对于研究完整性和避免错误信息至关重要.
- 在产生特定领域的可验证引用方面,LLM的表现在很大程度上尚未评估.
研究的目的:
- 为了比较六个领先的LLM在生成放射学参考文献的准确性,制造率和文献完整性.
- 为了评估包括ChatGPT变体在内的模型的性能,谷歌Gemini 1.5 Pro,Claude 3.5 Sonnet和Claude 3 Opus.
主要方法:
- 一项横截面的观察性研究对8个放射学子专业进行了120个开放式问题.
- 我们要求LLM创建四个参考文献,每个问题都有完整的文献详细信息和文本引用.
- 使用多个数据库和搜索引擎严格验证引用,在5分利克特级别上评分准确度.
主要成果:
- 克劳德3.5索内特实现了最高的参考精度 (80.8%的完全精度) 和最低的制造率 (3.1%),明显超过了所有其他模型.
- 克劳德3Opus显示中等性能 (59.6%的精度,18.3%的制造).
- 聊天GPT模型和谷歌Gemini 1.5 Pro的准确性明显降低,制造率更高,Gemini 1.5 Pro的表现最差.
结论:
- 克劳德3.5索内特是领先的LLM,用于生成准确的放射学参考文献,增强文献评论和教育材料.
- 其他模型的高制造率,包括ChatGPT和Google Gemini,在临床和学术环境中构成错误信息的风险.
- 进一步完善LLM是必要的,以确保他们的安全和有效的应用在学术引用生成.


