相关实验视频
Updated: May 20, 2025

12:10
Assessment of Mouse Judgment Bias through an Olfactory Digging Task
Published on: March 4, 2022
2.5K
大型语言模型与嗅觉指南的一致性评估
Ariana L Shaari1, Anthony M Saad1, Disha Patil1
1Department of Otolaryngology - Head and Neck Surgery Rutgers New Jersey Medical School Newark New Jersey USA.
Laryngoscope investigative otolaryngology
|March 24, 2025
概括
像ChatGPT和Google Gemini这样的人工智能 (AI) 聊天机器人在提供嗅觉信息时显示出不同的准确性. 虽然ChatGPT的准确性更高,但AI都不符合临床指南,因此在广泛使用之前需要进一步评估.
科学领域:
- 耳鼻喉科 耳鼻喉科 耳鼻喉科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 2022年"过敏和鼻科:嗅觉"国际共识声明 (ICAR-O) 提供了当前的临床指南.
- 人工智能 (AI) 工具越来越多地用于医疗保健中的信息检索.
研究的目的:
- 评估人工智能产生的反应与已建立的嗅觉指南的准确性和一致性.
- 为了比较ChatGPT (4.0版本) 和Google Gemini在响应嗅觉相关查询方面的性能.
主要方法:
- 从ICAR-O中提取了42条指导方针,并以问题形式制定了它们.
- 向ChatGPT和Google Gemini提交问题,评估答案的准确性,一致性和可信度.
- 利用利克尔特尺度进行准确度分级和统计分析来比较AI平台.
主要成果:
- 聊天GPT的响应比双子座 (平均1.48/2) 准确得多 (平均1.85/2).
- 聊天GPT与ICAR-O指南达到了78.57%的一致性,而双子座达到了66.67%.
- 两个平台都引用了可信的资源,它们之间的一致性或可信度没有显著差异.
结论:
- 聊天GPT提供了比双子座更准确的嗅觉信息.
- 两种人工智能平台都没有与临床嗅觉指南一致一致.
- 在临床实施或作为教育辅助工具使用之前,进一步评估人工智能工具至关重要.

