评估人工智能聊天机器人在口腔和面外科的董事会考试:性能和潜力
Reema Mahmoud1, Amir Shuster2, Shlomi Kleinman3
1Resident, Department of Oral and Maxillofacial Surgery, Tel-Aviv Sourasky Medical Center, Tel Aviv, Israel.
概括
与其他大型语言模型 (LLM) 相比,生成预训练型变压器4o (GPT-4o) 在口腔和面手术委员会问题上表现出卓越的准确性和错误校正. 这突显了GPT-4o在加强外科教育方面的潜力.
科学领域:
- 人工智能在医学中的应用
- 口腔和面外科 (WHO) 教育 教育
背景情况:
- 大型语言模型 (LLM) 在医学上表现有希望,但在口腔和面外科手术 (OMS) 中未得到充分探索.
- 评估LLM在专业医学检查上的表现对于理解其教育实用性至关重要.
研究的目的:
- 评估和比较四个领先的LLMs在OMS委员会考试问题上的准确性.
- 确定LLM需要改善的OMS教育的特定学科领域.
主要方法:
- 一个in-silico研究评估了四个LLM (GPT-4o,GPT-3.5,Gemini,Copilot) 使用714个OMS董事会问题.
- 准确度是以正确答案的百分比来衡量,其次要结果包括11个OMS领域的错误纠正能力.
主要成果:
- GPT-4o获得了最高的精度 (83.69%),明显超过了GPT-3.5 (64.83%),双子座 (66.85%) 和副驾驶员 (62.18%).
- 此外,GPT-4o还显示出优异的错误纠正 (98.2%),明显优于双子座 (70.71%),GPT-3.5 (93.44%) 和副驾驶 (29.26%).
结论:
- 由于其高精度和错误纠正能力,GPT-4o显示出作为OMS教育工具的巨大潜力.
- 跨领域的绩效变化需要持续的改进和评估,以便有效地将LLM整合到OMS中.


