相关实验视频
Updated: Jun 25, 2025

Assessment and Communication for People with Disorders of Consciousness
Published on: August 1, 2017
系统性审查的ChatGPT和Bard的幻觉率和参考精度:比较分析:比较分析
Mikaël Chelli1, Jules Descamps2, Vincent Lavoué1
1Institute for Sports and Reconstructive Bone and Joint Surgery, Groupe Kantys, Nice, France.
大型语言模型 (LLM) 在生成系统性审查的准确引用方面表现不佳,幻觉率高. 研究人员必须验证所有LLM生成的引用,以确保学术写作的可靠性.
科学领域:
- 科学研究中的人工智能
- 图书计量和信息科学 图书计量和信息科学
- 医学文献分析 医学文献分析
背景情况:
- 大型语言模型 (LLM) 提供了在系统审查中自动化文献搜索的潜力.
- 有关LLM可靠性和持续生成不支持 (幻觉) 内容存在担忧.
- 评估LLM在科学参考生成方面的表现对于学术诚信至关重要.
研究的目的:
- 评估LLM,特别是ChatGPT和Bard (现在是Gemini) 的参考生成能力.
- 为了比较LLM的表现与科学写作中人类进行的系统审查.
- 量化LLM生成引用的准确性,回忆,精度和幻觉率.
主要方法:
- 在LLM (GPT-3.5,GPT-4,Bard) 的测试中,采用肩旋转手套病理学系统审查的纳入标准进行了测试.
- 性能与人类进行的系统性审查中的黄金标准参考进行了测量.
- 关键指标包括精度,回忆力,F1分数和幻觉率,幻觉被错误的标题,作者或年份定义.
主要成果:
- 巴德显示精度为0%和幻觉率为91.4%;GPT-3.5和GPT-4显示精度低 (9.4%-13.4%) 和幻觉率高 (28.6%-39.6%).
- 对GPT-3.5和GPT-4的召回率也很低 (11.9%-13.7%),而Bard未能获取相关论文.
- 在研究类型,参与者标准和地理/开放访问代表性方面,LLM 显示出偏差,以及显著的幻觉问题.
结论:
- 目前的LLM不被推作为系统审查的主要工具,因为其准确性差,幻觉率高.
- 所有由LLM生成的引用都需要由人类研究人员严格验证.
- 在学术研究中可靠使用LLM培训和功能之前,需要改进LLM培训和功能.
更多相关视频
06:15Using the Visual World Paradigm to Study Sentence Comprehension in Mandarin-Speaking Children with Autism
Published on: October 3, 2018
06:19Comparison of Three Clinical Stereoscopic Methods for Measuring Binocular Visual Function During Amblyopic Treatment in Unilateral Amblyopia
Published on: September 27, 2024
相关概念视频
Hallucinogens and Psychedelics
Marijuana, derived from the dried leaves and flowers of the hemp plant, contains...
Positive Symptoms Schizophrenia: Hallucinations and Delusions
Hallucinations
Hallucinations in...
Blind Procedures