在航空航天医学原则上评估大型语言模型
Kyle D Anderson1, Cole A Davis2, Shawn M Pickett3
1Department of Orthopaedics, Emory Sports Performance and Research Center, Emory School of Medicine, Flowery Branch, GA.
Wilderness & environmental medicine
|April 28, 2025
概括
大型语言模型 (LLM) 显示出太空医学决策支持的希望,但需要进一步开发. 虽然它们是准确的,但它们表现出知识差距和不一致性,需要在自主医疗操作中保持谨慎.
科学领域:
- 航空航天医学 航空航天医学
- 医疗保健中的人工智能
背景情况:
- 大型语言模型 (LLM) 为太空飞行中的临床决策支持提供了潜力.
- 由LLM产生的不正确信息在地球独立的医疗环境中构成风险.
研究的目的:
- 评估公开可用的LLM (ChatGPT-4,Gemini Advanced) 和一个定制的Retrieval-Augmented Generation (RAG) LLM的表现.
- 用航空航天医学材料评估事实知识,临床推理和LLM的一致性.
主要方法:
- 在857个自由答案和20个多选题的航空航天医学委员会问题上测试了LLM.
- 评估的读者得分 (利克尔特尺度1-5) 对于自由答案的答案.
- 评估了多选题的正确答案率.
主要成果:
- 聊天GPT-4,双子高级和RAG LLM的平均读者分数分别为4.23-5.00,3.30-4.91和4.69-5.00.
- 多选择题的正确答案率为70% (ChatGPT-4),55% (Gemini Advanced) 和85% (RAG LLM).这些问题中的正确答案率为70% (ChatGPT-4),55% (Gemini Advanced) 和85% (RAG LLM).
- 所有的LLM都展示了事实知识缺口和潜在的不一致性,理由可能无法通过董事会考试.
结论:
- 在太空飞行中,LLM对自主医疗操作有相当大的希望.
- 预计在法学士培训,数据质量和微调方面将继续取得进展.
- 在航空航天医学广泛临床应用之前,仔细的验证和开发至关重要.
更多相关视频
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
8.1K
05:56Objectification of Tongue Diagnosis in Traditional Medicine, Data Analysis, and Study Application
Published on: April 14, 2023
2.3K
