相关实验视频
Updated: May 30, 2025

07:06
Binocular Dynamic Visual Acuity in Eyeglass-Corrected Myopic Patients
Published on: March 29, 2022
2.5K
评估微软Copilot,GPT-4和谷歌Gemini在眼科中的性能
Meziane Silhadi1, Wissam B Nassrallah2, David Mikhail3
1Faculty of Medicine, University of Montreal, Montreal, QC, Canada.
Canadian journal of ophthalmology. Journal canadien d'ophtalmologie
|January 25, 2025
概括
这项研究评估了眼科问题的大型语言模型 (LLM),如GPT-4o和Gemini. GPT-4o非常出色,但提示技术对医学应用中的LLM准确性产生了重大影响.
科学领域:
- 人工智能在医学中的应用
- 眼科医生 眼科 眼科
- 自然语言处理自然语言处理.
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于医学应用.
- 评估LLM在眼科等专业领域的表现至关重要.
- 提示技术可以显著影响LLM的准确性和实用性.
研究的目的:
- 评估微软Copilot,GPT-4 (GPT-4o,GPT-4o mini) 和谷歌双子座 (Gemini,Gemini Advanced) 在回答眼科问题的表现.
- 确定不同提示策略对眼科LLM准确度的影响.
主要方法:
- 一项前性定性研究评估了来自StatPearls的300个眼科问题.
- 问题涵盖了各种各样的子专业,包括基于图像的任务.
- 使用了两个提示技术:零射击强制提示和基于角色/零射击计划和解决+提示的组合提示.
主要成果:
- GPT-4o在零射击提示时表现出卓越的表现,正确回答了72.3%的问题.
- 微软Copilot和GPT-4o在第二种提示技术下显示了显著的准确性改进.
- 像GPT-4o和Gemini Advanced这样的新型号通常表现优于它们的前身.
结论:
- 虽然先进的LLM显示出希望,但建议在眼科临床使用时谨慎使用.
- 提示技术极大地影响了LLM的表现,需要进一步的研究.
- 增强的LLM能力,特别是视觉数据解释能力,是安全医疗整合所需的.
更多相关视频
11:12Driving Simulation in the Clinic: Testing Visual Exploratory Behavior in Daily Life Activities in Patients with Visual Field Defects
Published on: September 18, 2012
17.3K
07:11Assessing Early Stage Open-Angle Glaucoma in Patients by Isolated-Check Visual Evoked Potential
Published on: May 25, 2020
6.3K