谷歌的Bard聊天机器人在欧洲手术考试中表现比ChatGPT更好吗?
Goetsch Thibaut1, Armaghan Dabbagh2, Philippe Liverneaux3,4
1Department of Public Health, Strasbourg University Hospital, FMTS, GMRC, 1 avenue de l'hôpital, 67000, Strasbourg cedex, France.
International orthopaedics
|November 15, 2023
概括
谷歌谷歌谷歌谷歌是什么意思
科学领域:
- 医疗教育中的人工智能
- 用于医学检查的自然语言处理.
- 外科教育 技术评估 技术评估
背景情况:
- 之前的研究表明,ChatGPT V3.5无法通过欧洲手术委员会 (EBHS) 文凭考试.
- 人工智能的快速发展需要在专业医疗领域不断评估其能力.
- 了解AI在标准化医疗评估中的表现对于未来的教育整合至关重要.
研究的目的:
- 为了评估谷歌的聊天机器人Bard®在EBHS文凭考试中的表现.
- 将Bard®的性能与之前报告的ChatGPT V3.5结果进行比较.
- 通过代的问答试验来评估Bard®的学习能力.
主要方法:
- 巴德®在五次试验中回答了EBHS文凭考试中的18个多选题 (MCQ).
- 在试验3之后提供了正确的答案,在试验4之后提供了不正确的答案,以测试适应性学习.
- 通过正确答案率和答案一致性 (kappa统计) 来衡量表现.
主要成果:
- 在A1-A5试验中,Bard®分别获得了3/18,1/18,4/18和2/18的分数.
- 所有试验的平均正确答案率仍低于EBHS考试的通过门.
- 在Bard®的反应中观察到适度的一致性 (kappa = 0.62),表明一些一致性但学习有限.
结论:
- 在EBHS文凭考试MCQ中,Bard®没有在EBHS文凭考试MCQ中表现优于ChatGPT V3.5.
- 目前的ChatGPT和Bard®版本不足以通过EBHS文凭考试.
- 人工智能聊天机器人需要进一步开发,以满足专业医疗委员会检查的标准.
更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
596
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
236
