医学人工智能聊天机器人的参考幻觉评分:开发和可用性研究
Fadi Aljamaan1, Mohamad-Hani Temsah1, Ibraheem Altamimi1
1College of Medicine, King Saud University, Riyadh, Saudi Arabia.
JMIR medical informatics
|July 31, 2024
概括
一个新的参考幻觉评分 (RHS) 评估了AI聊天机器人在医学研究中的引用. 在Elicit和SciSpace中,幻觉的发生率很低,而在ChatGPT和Bing中,幻觉的发生率很高,这凸显了对验证工具的需求.
科学领域:
- 医学研究 医学研究
- 人工智能的人工智能是人工智能.
- 科学写作 科学写作
背景情况:
- 医疗保健从业者越来越多地使用AI聊天机器人.
- 人工智能聊天机器人的输出,包括引用,可能包含幻觉.
- 这些不准确性引发了人们对医疗环境中AI可靠性的担忧.
研究的目的:
- 引入一种新的参考幻觉得分 (RHS) 来评估人工智能聊天机器人生成的引用的真实性.
- 在不同的AI聊天机器人中量化和比较引用幻觉.
主要方法:
- 六个人工智能聊天机器人被测试,每一个有10个医疗提示,每一个提示请求10个引用.
- 在开发RHS时,考虑了文献详细信息和相关性,以提示关键词.
- 对于个别引用,提示和提示类型 (基本与复杂) 计算了RHS.
主要成果:
- 巴德没有产生引用. 在Elicit和SciSpace中,RHS是最低的 (1),而ChatGPT 3.5和Bing的RHS是最高的 (11).
- 提示关键字的引用相关性是最常见的幻觉 (61.6%).
- 对于复杂或基于场景的提示,AI聊天机器人产生了显著更高的幻觉得分.
结论:
- 该研究强调了人工智能聊天机器人引用真实性的显著差异,需要强大的评估工具.
- 在Elicit和SciSpace中,幻觉的程度很小,而在ChatGPT和Bing中,幻觉的程度很高.
- 拟议的RHS可以帮助提高AI在医学研究中的可靠性和可信性.
关键词:
这就是为什么BingBingBingBingBing.聊天GPT 聊天GPT 聊天引发 引发 引起困惑感 困惑感 困惑感科学空间空间科学空间人工智能 (AI) 聊天机器人聊天机器人文献鉴定验证 文献鉴定验证参考幻觉是一种参考幻觉.更多相关视频
06:02Evaluating Usability Aspects of a Mixed Reality Solution for Immersive Analytics in Industry 4.0 Scenarios
Published on: October 6, 2020
2.2K
08:36The Immersive Cleveland Clinic Virtual Reality Shopping Platform for the Assessment of Instrumental Activities of Daily Living
Published on: July 28, 2022
3.7K
