在外科住院医生检查中,ChatGPT和ERNIE Bot的表现
Siyin Guo1, Genpeng Li1, Wei Du2
1Division of Thyroid Surgery, Department of General Surgery, West China Hospital, Sichuan University, Chengdu, Sichuan 610041, China; The Laboratory of Thyroid and Parathyroid Disease, Frontiers Science Center for Disease-related Molecular Network, West China Hospital, Sichuan University, Chengdu, China.
International journal of medical informatics
|April 12, 2025
概括
ERNIE Bot-4.0和ChatGPT-4.0在外科住院医生的检查中进行了评估. 在中国医疗问题数据库中,ERNIE Bot-4.0与ChatGPT-4.0和人类居民相比表现优越.
科学领域:
- 医疗教育中的人工智能
- 外科培训和评估的外科.
- 在医疗保健中的自然语言处理.
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于教育应用.
- 评估LLM在外科住院等专业领域的有效性至关重要.
- 与人类基准对LLM绩效的评估为AI能力提供了宝贵的见解.
研究的目的:
- 为了评估两个突出的大型语言模型,ChatGPT-4.0和ERNIE Bot-4.0的性能,在外科住院检查的背景下.
- 将这些LLM的准确性与人类外科住院医生的标准化问题集的表现进行比较.
主要方法:
- 利用了来自医疗视觉世界平台的596个问题的数据集,包括提示和非提示查询.
- 在ChatGPT-4.0和ERNIE Bot-4.0中输入问题,以评估他们的答案正确性.
- 将LLM的成绩与43名外科住院医生在另外210个提示问题上的成绩进行了比较.
主要成果:
- 在任何LLM的提示和非提示问题之间没有观察到正确性的显著差异.
- 在596个问题上,ERNIE Bot-4.0的正确性明显高于ChatGPT-4.0 (p < 0.001).
- 这两种LLM,特别是ERNIE Bot-4.0,在210个外科问题上显著优于人类住院医生,ERNIE Bot-4.0在住院医生中排名前95%.
结论:
- 在外科住院检查中,ERNIE Bot-4.0与ChatGPT-4.0相比表现优越.
- 两项评估的LLM都显示出在这个特定的评估环境中超越人类居民的表现的能力.
- 这些发现表明,在医学教育和居民评估中,高级LLM的潜力很大.


