生成型人工智能的基于证据的潜力 牙矯正的大型语言模型:对ChatGPT,谷歌Bard和微软Bing的比较研究
Miltiadis A Makrygiannakis1,2, Kostis Giannakopoulos2, Eleftherios G Kaklamanos2,3,4
1School of Dentistry, National and Kapodistrian University of Athens, Athens 11527, Greece.
European journal of orthodontics
|April 13, 2024
概括
大型语言模型 (LLM) 显示了牙矯正的潜力,但准确性各不相同. 微软的Bing聊天表现最好,尽管所有LLM都需要仔细的临床考虑,因为潜在的不准确性.
科学领域:
- 医疗保健中的人工智能
- ортодонтика研究 ортодонтика研究
- 医疗信息学 医疗信息学
背景情况:
- 生成型人工智能 (AI) 和大型语言模型 (LLM) 快速融入医疗和牙科领域,包括牙科,需要对它们的临床准确性进行评估.
- 对于基于证据的正义牙科实践,LLM产生的信息的可靠性和准确性存在担忧.
研究的目的:
- 为了比较评估四个领先的LLM (微软Bing聊天,OpenAI的ChatGPT-4,谷歌巴德和ChatGPT-3.5) 对临床正牙问题的答案的准确性和质量.
- 将LLM的绩效与科学证据进行基准测试,并确定它们在正牙科的应用中的优点和缺点.
主要方法:
- 十个开放式,临床相关的正牙问题被提交给每一个LLM.
- 答案使用基于科学证据的标题进行评估,包括系统性审查和共识声明,在0-10级别上.
- 在4周的时间间隔后,评估者内部可靠性被评估,对得分进行统计分析 (弗里德曼的,威尔科克森的测试).
主要成果:
- 微软的Bing Chat获得了最高的平均分数 (7.1),明显超过了ChatGPT-3.5 (3.8) 和谷歌Bard (4.6).
- 聊天GPT-4 (4.7) 也显示出优于聊天GPT-3.5 (P=0.011).
- 尽管表现有差异,但所有LLM偶尔都提供了缺乏全面性,科学准确性,清晰性或相关性的答案.
结论:
- 虽然LLM为基于证据的正义牙科提供了潜在的好处,但目前的局限性凸显了与非批判性使用相关的风险.
- 法律学士不能取代正牙医的批判性思维和专业知识;仔细的验证和进一步的研究对于安全的整合至关重要.
- 临床医生必须保持谨慎,以防止由于不谨慎地利用LLM产生的信息而导致患者不良后果.


