眼科中的ChatGPT-3.5和Bing聊天:对性能,可读性和信息来源的更新评估
Brendan Ka-Lok Tao1, Nicholas Hua2, John Milkovich2
1Faculty of Medicine, The University of British Columbia, 317-2194 Health Sciences Mall, Vancouver, BC, V6T 1Z3, Canada.
Eye (London, England)
|March 21, 2024
概括
与眼科考试中的ChatGPT-3.5相比,Bing Chat在眼科考试中表现优异,为学习者提供了更好的可读性和在线资源集成.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 眼科知识评估知识评估
背景情况:
- 像ChatGPT-3.5和Bing Chat这样的大型语言模型 (LLM) 越来越多地与互联网搜索功能集成.
- 与ChatGPT-4集成的Bing聊天允许访问实时在线数据,超越ChatGPT-3.5的知识切断.
- 评估这些先进的人工智能模型在专业医疗领域的性能对于了解它们的实用性至关重要.
研究的目的:
- 为了比较Bing Chat和ChatGPT-3.5在多选眼科检查中的性能.
- 评估两个AI模型之间的响应可读性和引用资源的差异.
- 为了确定哪种模式为眼科教育提供更大的实用性.
主要方法:
- 在2023年8月使用ChatGPT-3.5和Bing Chat对913个眼科考试问题的评估.
- 收集的数据包括模型性能得分,可读性 (Gobbledygook的简单测量) 和引用的资源.
- 绩效按问题类型 (明确与情境) 和子话题进行分析.
主要成果:
- 宾聊天获得的总体得分高于 (73.60%) 比ChatGPT-3.5 (59.69%).
- 这两种模型在明确的问题和一般医学主题上表现得更好,而不是临床推理或特定的眼科子章节.
- 与ChatGPT-3.5 (级别12.4) 相比,Bing Chat提供了更多的引用,并且显示出明显更好的可读性 (级别11.4).
结论:
- 宾聊天的访问在线数据的能力,其改进的可读性和引文功能增强了它对眼科学员的价值.
- 在使用人工智能生成的学习响应时,建议对引用的来源进行批判性评估.
- 人工智能工具在补充医学教育方面表现有前途,但需要仔细评估其输出.
更多相关视频
07:12Development of a Gaze-Contingent Display Framework Designed for Perceptual and Oculomotor Research with Simulated Central Vision Loss
Published on: April 11, 2025
332
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
555
