Jove
Visualize
联系我们
JoVE
x logofacebook logolinkedin logoyoutube logo
关于 JoVE
概览领导团队博客JoVE 帮助中心
作者
出版流程编辑委员会范围与政策同行评审常见问题投稿
图书馆员
用户评价订阅访问资源图书馆顾问委员会常见问题
研究
JoVE JournalMethods CollectionsJoVE Encyclopedia of Experiments存档
教育
JoVE CoreJoVE BusinessJoVE Science EducationJoVE Lab Manual教师资源中心教师网站
使用条款与条件
隐私政策
政策

相关实验视频

Olivia Riccomi1, Francesco Andrea Causio2, Vittorio De Vita2

  • 1Società Italiana Intelligenza Artificiale in Medicina (SIIAM), Roma.

Recenti progressi in medicina
|October 2, 2025
PubMed
概括

大型语言模型 (LLM) 在意大利医学问答中显示的准确性有限. 导弹-7B-指导-v0.1 导弹-7B-指导-v0.1 导弹-7B-指导-v0.1 导弹

相关实验视频

相关概念视频

您也可能阅读

相关文章

通过共同作者、期刊和引用图与本文相关的文章。

排序
Same author

A multi-stakeholder perspective on barriers to the adoption of personalized prevention in European healthcare systems.

Frontiers in public health·2026
Same author

A European framework for the assessment of digital health technologies: conceptual advances, challenges, and future directions.

Frontiers in digital health·2026
Same author

Diabetes and melanoma: Impact on prognosis and healthcare costs.

Journal of the European Academy of Dermatology and Venereology : JEADV·2026
Same author

Effects of polygenic risk score communication on short term health outcomes: systematic review and meta-analysis.

BMJ medicine·2026
Same author

Shaping food system governance: mapping the national food and nutrition legislation landscape across Europe.

Frontiers in public health·2026
Same author

Costs of breast cancer care by stage and HER-2 Status: a population-based study.

Frontiers in health services·2026

科学领域:

  • 医疗信息学 医疗信息学
  • 医疗保健中的人工智能

背景情况:

  • 人工智能 (AI) 越来越多地融入医疗保健,需要严格的评估.
  • 对人工智能模型的公正评估依赖于高质量的,特定领域的基准.

研究的目的:

  • 评估Mistral-7B-Instruct-v0.1大型语言模型在意大利专业医疗数据集上的性能.
  • 确定阻碍医疗保健应用中的AI准确性的潜在局限性.

主要方法:

  • 该Mistral-7B-Instruct-v0.1模型在1120个经过人体验证的意大利医学多选择题 (SSM) 上进行了测试.
  • 使用准确度和F1得分指标来评估性能.

主要成果:

  • 在意大利的医疗数据集上,Mistral-7B-Instruct-v0.1的准确率为40.2%,F1得分为38.8%.
  • 低于最佳的表现被归因于以英语为中心的培训,有限的医学领域知识和快速格式错位.

结论:

  • 目前的大型语言模型需要显著的增强,以便在专业医疗领域可靠部署.
  • 需要进一步的研究来提高AI对医学知识和语言细微差别的理解和应用.