相关实验视频
Olivia Riccomi1, Francesco Andrea Causio2, Vittorio De Vita2
1Società Italiana Intelligenza Artificiale in Medicina (SIIAM), Roma.
Recenti progressi in medicina
|October 2, 2025
概括
大型语言模型 (LLM) 在意大利医学问答中显示的准确性有限. 导弹-7B-指导-v0.1 导弹-7B-指导-v0.1 导弹-7B-指导-v0.1 导弹
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
背景情况:
- 人工智能 (AI) 越来越多地融入医疗保健,需要严格的评估.
- 对人工智能模型的公正评估依赖于高质量的,特定领域的基准.
研究的目的:
- 评估Mistral-7B-Instruct-v0.1大型语言模型在意大利专业医疗数据集上的性能.
- 确定阻碍医疗保健应用中的AI准确性的潜在局限性.
主要方法:
- 该Mistral-7B-Instruct-v0.1模型在1120个经过人体验证的意大利医学多选择题 (SSM) 上进行了测试.
- 使用准确度和F1得分指标来评估性能.
主要成果:
- 在意大利的医疗数据集上,Mistral-7B-Instruct-v0.1的准确率为40.2%,F1得分为38.8%.
- 低于最佳的表现被归因于以英语为中心的培训,有限的医学领域知识和快速格式错位.
结论:
- 目前的大型语言模型需要显著的增强,以便在专业医疗领域可靠部署.
- 需要进一步的研究来提高AI对医学知识和语言细微差别的理解和应用.