分析医学领域大型语言模型的评估方法:一个范围审查
Junbok Lee1,2, Sungkyung Park3, Jaeyong Shin4,5
1Institute for Innovation in Digital Healthcare, Yonsei University, Seoul, Republic of Korea.
BMC medical informatics and decision making
|November 29, 2024
概括
本次对医学大语言模型 (LLM) 的综述强调了对标准化评估框架的需求. 目前的研究显示了各种方法,强调了系统方法对未来的医学LLM研究的重要性.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 大型语言模型 (LLM) 的快速增长需要在医学领域进行强有力的评估.
- 现有的绩效评估研究缺乏评估医学LLM适用性的标准化框架.
研究的目的:
- 系统地审查和分析医学领域当前LLM评估中使用的方法.
- 为研究人员开发未来的医疗保健LLM研究提供基础参考.
主要方法:
- 对三个主要数据库 (PubMed,Embase,MEDLINE) 进行了范围审查.
- 在2023年1月1日至2023年9月30日期间发表的文章中,分析了评估方法,查询数量,评估器类型和快速工程使用.
主要成果:
- 142篇文章符合纳入标准,评估主要使用测试检查 (37.3%) 或医疗专业评估 (56.3%).
- 大多数研究采用不到100个问题,仅限于重复测量 (24.2%) 和快速工程 (12.9%).
- 医疗评估主要使用50个查询,并涉及两个评估者.
结论:
- 进一步的研究对于LLMs在医疗保健中的系统应用至关重要.
- 未来的研究应该优先考虑绩效改进,并采用结构良好的方法.
- 标准化的评估框架对于推动医学LLM研究至关重要.


