在实验室医学中使用实习生考试对高级大型语言模型的性能进行评估
Kiwook Jung1,2, Hyun Jin Kim3,4, Sunghwan Shin5
1Department of Laboratory Medicine, Chungbuk National University Hospital, Cheongju, Republic of Korea.
Annals of laboratory medicine
|November 12, 2025
概括
大型语言模型 (LLM) 在实验室医学中表现有前途,但性能因问题难度和子专业而异. 在临床使用之前需要进一步开发和专家监督.
科学领域:
- 人工智能的人工智能
- 医疗信息学 医疗信息学
- 实验室医学 实验室医学
背景情况:
- 大型语言模型 (LLM) 在临床环境中越来越多地使用.
- 缺乏对实验室医学LLM绩效的全面评估.
- 诊断准确性在实验室医学中至关重要,需要严格的LLM评估.
研究的目的:
- 评估12个领先的大型语言模型 (LLM) 在董事会级实验室医学问题上的表现.
- 在临床领域评估LLM准确性,推理质量和可重复性.
- 确定LLM整合到实验室医学的优势和弱点.
主要方法:
- 来自主要提供商的12名法学士通过320个韩国居留考试问题 (2021-2024) 进行了测试.
- 问题涵盖了六个实验室医学子专业.
- 标准化提示,确定性设置 (温度=0) 和三次管理评估了准确性和可重复性.
主要成果:
- 谷歌的Gemini 2.0 Pro获得了最高的精度 (80.0%),其次是GPT-4.5 (77.2%) 和Claude 3.7 Sonnet (74.1%).
- 准确性随着问题的难度显著下降 (80%的问题简单而45%的问题具有挑战性).
- 输血医学问题准确度最低 (38.8%),表明知识缺口;推理错误是错误答案的主要原因.
结论:
- 在实验室医学中,LLM具有显著的潜力,特别是在临床化学和免疫学方面.
- 性能不一致和知识缺口,特别是在输血医学中,需要进一步开发LLM (例如,微调,检索增强生成).
- 在实验室医学中广泛临床应用LLM之前,强有力的专家监督是必不可少的.
更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
1.0K
07:13Comparison of Predictive Performance of Three Lymph Node Staging Systems in Colorectal Signet Ring Cell Carcinoma Based on Machine Learning Model
Published on: April 18, 2025
478
