相关实验视频
Angelo D'Ambrosio1, Francesco Baglivo2, Luigi De Angelis2
1European Centre for Disease Prevention and Control, Stockholm, Sweden.
Recenti progressi in medicina
|October 2, 2025
概括
我们在旅行医学测试中评估了40个大型语言模型 (LLM). 像OpenAI o3这样的前沿模型显示出高准确度,证实了LLMs.
科学领域:
- 公共卫生 公共卫生
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 越来越多地用于信息检索.
- 在旅行医学等专业领域应用法学士学位需要严格的评估.
研究的目的:
- 在旅行医学知识测试中对40个大型语言模型 (LLM) 的性能进行基准测试.
- 根据准确性,一致性,可解析性和成本效益来评估LLM.
主要方法:
- 对40名LLM进行了40项旅游医学测试.
- 贝叶斯模型被用来分析性能指标.
- 为了确定最佳系统,生成了成本精度曲线.
主要成果:
- 士学位准确度差异很大,从27.9%到97.5%不等.
- 包括OpenAI o3和困惑声纳推理在内的前沿模型表现出卓越的性能.
- 与先进的边境模型相比,较小的,本地运行的模型通常表现不佳.
- 确定了五个帕雷托最佳系统,其中OpenAI o3在成本准确性方面代表了当前最好的.
结论:
- 目前的大型语言模型显示出作为公共卫生知识支持系统的巨大潜力.
- 先进的,推理调整的LLM为专业医疗信息提供了高准确度.
- 需要进一步发展,以提高医疗领域较小,本地LLM的表现.