对生成性AI大语言模型ChatGPT,谷歌Bard和微软BingChat在支持基于证据的牙科方面的表现的评估:比较混合方法研究研究
Kostis Giannakopoulos1, Argyro Kavadella1, Anas Aaqel Salim1
1School of Dentistry, European University Cyprus, Nicosia, Cyprus.
Journal of medical Internet research
|November 27, 2023
概括
生成型人工智能大语言模型 (LLM) 在牙科方面表现有前途,但存在局限性. 虽然ChatGPT-4表现最好,但所有模型偶尔都会提供不准确或不完整的信息,需要牙科专业人员谨慎使用.
科学领域:
- 医疗保健中的人工智能
- 牙科信息学 牙科信息学
- 临床决策支持系统 临床决策支持系统
背景情况:
- 生成型人工智能大语言模型 (LLM) 越来越多地在包括牙科在内的各个学科中使用.
- 在临床环境中,对LLM产生的内容的准确性和可靠性存在担忧.
研究的目的:
- 在牙科中比较评估四个领先的大型语言模型 (LLM) 的准确性.
- 评估Bard,ChatGPT-3.5,ChatGPT-4和Bing Chat对临床牙科问题的反应.
主要方法:
- 通过20个临床相关的,开放式的牙科问题,对LLM进行了查询.
- 经验丰富的教师对已确立的科学证据进行了评分.
- 统计分析 (弗里德曼和威尔科克森测试) 与LLM绩效进行了比较.
主要成果:
- 在统计学上,ChatGPT-4的表现优于其他LLM (ChatGPT-3.5,Bing Chat,Bard).
- 所有评估的LLM都表现出偶尔的不准确性,一般性,过时的内容和缺乏引用.
- 质量评估揭示了LLMs的不相关,模糊或部分不准确的信息.
结论:
- LLM显示出基于证据的牙科的潜力,但由于目前的局限性,需要谨慎使用.
- 对于牙医来说,批判性思维和主题专业知识仍然至关重要.
- 进一步的研究,验证和监管监督对于安全地将LLM整合到牙科实践中至关重要.
关键词:
在这里,我们可以看到AIAIAI.聊天GPT 聊天 在GPT 聊天谷歌巴德 (Google Bard) 是一个微软微软的 Bing Bing 是一个.人工智能的人工智能是人工智能.在临床决策过程中.临床实践中的临床实践临床实践指南 临床实践指南在牙科实践中.专业的牙科专业人员.基于证据的牙科.生成式预训练变压器大型语言模型.更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
232
05:49Author Spotlight: Advancing CBCT and Digital Dental Image Integration with AI-Assisted Digitization
Published on: February 23, 2024
867
