谷歌Gemini和Bard人工智能聊天机器人在眼科知识评估中的表现
Andrew Mihalache1, Justin Grad2, Nikhil S Patil2
1Temerty Faculty of Medicine, University of Toronto, Toronto, ON, Canada.
Eye (London, England)
|April 13, 2024
概括
谷歌双子和巴德在眼科考试问题上显示了可接受的准确性. 性能根据国家略有不同,聊天机器人有时会自信地提供错误的答案.
科学领域:
- 人工智能在医学中的应用
- 眼科知识评估知识评估
背景情况:
- 像ChatGPT这样的人工智能聊天机器人的兴起需要评估它们的医疗应用.
- 了解谷歌双子座和巴德在专业医疗领域的功能至关重要.
研究的目的:
- 评估谷歌双子座和巴德的眼科知识.
- 为了评估他们在船上认证实践问题上的表现.
主要方法:
- 谷歌Gemini和Bard在EyeQuiz平台 (150个多选题) 上进行了测试.
- 评估的指标包括准确性,响应长度,时间和解释质量.
- 二次分析包括特定国家版本 (美国,越南,巴西,荷兰).
主要成果:
- 两个聊天机器人的总体准确率为71%.
- 具体国家版本的准确性略有差异 (例如,越南双子座:74%,美国双子座:71%).
- 各国表现的差异在统计学上并不显著.
结论:
- 谷歌Gemini和Bard在眼科知识回忆中表现出可以接受的表现.
- 虽然在统计学上并不显著,但存在微妙的国际业绩差异.
- 聊天机器人甚至可以为错误的答案提供自信的解释.


