相关实验视频
Updated: Jun 16, 2025

05:36
Subjective Refraction Test Using a Smartphone for Vision Screening
Published on: October 18, 2024
647
在折射手术中学习兰德曼标准:使用ChatGPT-3.5与互联网搜索引擎相比
Jared J Tuttle1, Majid Moshirfar2,3,4, James Garcia1
1Ophthalmology, University of Texas Health Science Center at San Antonio, San Antonio, USA.
Cureus
|August 19, 2024
概括
像ChatGPT-3.5这样的大型语言模型的准确性不如互联网搜索医疗信息的准确性. 互联网搜索可靠地定义了兰德曼标准,而ChatGPT-3.5通常提供了不正确或伪造的细节.
科学领域:
- 医学教育 医学教育
- 医疗保健中的人工智能
- 信息检索 信息检索
背景情况:
- 大型语言模型 (LLM) 显示了自我指导医学学习的前景.
- 对于LLM的准确性存在担忧,例如ChatGPT-3.5,在专业医疗领域.
- 兰德尔曼标准需要精确的定义,以准确的医学应用.
研究的目的:
- 为了比较ChatGPT-3.5与互联网搜索引擎的准确性和可靠性.
- 评估这些工具在自主学习环境中定义兰德曼标准时的有效性.
- 评估通过ChatGPT-3.5和互联网搜索提供的信息的效率和真实性.
主要方法:
- 23名医学学生使用了ChatGPT-3.510分钟,然后进行了10分钟的独立互联网搜索.
- 分析了从两个来源收集的关于兰德曼标准的信息.
- 分析的重点是提供定义和参数的准确性,效率和可靠性.
主要成果:
- 互联网搜索为100%的学生提供了正确的兰德曼标准定义.
- 在ChatGPT-3.5中,只有26.1%的学生正确定义了标准.
- 聊天GPT-3.5产生了不正确的定义 (17.4%),捏造信息 (4.3%),并未为52.2%的学生定义标准.
结论:
- 互联网搜索引擎在访问准确可靠的医疗信息方面优于ChatGPT-3.5,例如兰德曼标准.
- 聊天GPT-3.5显示了显著的不准确性,包括伪造的数据和不完整的定义,阻碍了自我指导的学习.
- 医学学习者在使用LLM时必须谨慎和批判性地判断;进一步研究及时的工程和LLM更新是有必要的.

