相关实验视频
Updated: Jun 30, 2026

06:09
An In Ovo Model for Testing Insulin-mimetic Compounds
Published on: April 23, 2018
糖尿病培训的大型语言模型:一项前性研究
Haoxuan Li1, Zehua Jiang2, Zhouyu Guan3
1Shanghai University of Sport, Shanghai 200438, China.
Science bulletin
|February 13, 2025
概括
大型语言模型 (LLM) 在中英两种语言的糖尿病知识评估中表现强. 这些人工智能工具可以显著帮助医生培训,并改善全球糖尿病护理.
科学领域:
- 医学教育 医学教育
- 医疗保健中的人工智能
- 内分泌学 在内分泌学.
背景情况:
- 在全球范围内,医疗保健专业人员之间存在糖尿病知识差距.
- 有效的糖尿病培训对于改善患者的治疗结果至关重要.
- 大型语言模型 (LLM) 为医学教育提供了潜在的新途径,但它们在糖尿病护理等专业领域的有效性,特别是非英语语言的有效性,需要评估.
研究的目的:
- 通过用中英两种语言进行标准化考试,评估10个LLM在糖尿病相关问题上的表现.
- 评估LLM的实用性,特别是ChatGPT-4.0,作为初级保健医生 (PCP) 在糖尿病管理方面的培训的补充工具.
- 在医生教育的背景下,确定LLM作为医疗助理的可靠性.
主要方法:
- 十名LLM的糖尿病知识被测试,使用中国国家初级糖尿病护理证书考试 (NCE-CPDC) 和英国皇家医学院内分泌学和糖尿病检查.
- 在NCE-CPDC考试中,ChatGPT-4.0对PCP绩效的影响通过比较AI辅助和没有AI辅助的分数来评估.
- 绩效指标包括每个LLM的准确性和通过率以及PCP得分的改善.
主要成果:
- 聊天GPT-4.0在英语考试中表现优异 (62.50%的合格率),超过了谷歌Bard和LLaMA等其他模型.
- 在中国的NCE-CPDC考试中,ChatGPT-4.0,Ali Tongyi Qianwen,Baidu ERNIE Bot,Google Bard,MedGPT和ChatGPT-3.5通过,而LLaMA2-7B,HuatuoGPT,中国LLaMA2-7B和LLaMA-7B没有通过.
- 聊天GPT-4.0在NCE-CPDC中获得了84.82%的得分,超过了所有PCP,并将大多数受助PCP的得分提高了1%-6.13%.
结论:
- 法学士在回答与糖尿病相关的问题时表现出了显著的能力,在中文和英语两种语言中.
- 聊天GPT-4.0显示特别有希望作为一个高性能AI工具用于糖尿病知识评估和医生培训.
- 士学位具有很大的潜力,可以增强全球医生培训计划的糖尿病护理.

