生成性人工智能的基于证据的潜力 牙脱落的大型语言模型:聊天GPT与双子座对比
Taibe Tokgöz Kaplan1, Muhammet Cankar2
1Department of Pedodontics, Faculty of Dentistry, Karabuk University, Karabük, Turkey.
概括
根据国际牙科创伤学协会的指导方针,双子座在回答牙脱落问题上表现出比ChatGPT更高的准确性. 需要进一步的研究来将这些AI语言模型整合到临床实践中.
科学领域:
- 牙科创伤学 牙科创伤学
- 医疗保健中的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 牙脱落是一种常见的牙科紧急情况,需要准确的信息才能有效管理.
- 人工智能 (AI) 语言模型为医疗保健中的信息传播提供了潜力.
- 在牙科等专业领域评估AI反应的准确性至关重要.
研究的目的:
- 为了比较评估ChatGPT和双子座关于牙脱落所提供的答案的准确性和全面性.
- 根据既定的牙科创伤学指南,评估AI语言模型的性能.
主要方法:
- 根据国际牙科创伤学会 (IADT) 的指导方针制定了33个关于牙脱落的问题.
- 问题包括多选项,二进制和开放式格式,涵盖技术和患者查询.
- 来自ChatGPT和Gemini的答案由四名儿科牙医得分,统计分析包括ICC和曼·惠特尼U测试.
主要成果:
- 双子座的平均得分比ChatGPT (p=0.001) 的平均得分高出了统计学上显著的数值.
- 虽然ChatGPT在开放式和真假问题中表现出色,但在多选题中,它的准确性较低.
- 双子座的答案在不同类型的问题中没有显著的准确差异 (p=0.088),总体而言,双子座的答案是显著更准确的 (p=0.004).
结论:
- 双子座和ChatGPT都显示出在IADT标准的指导下,提供有关牙脱落的信息的潜力.
- 进一步的研究,临床验证和模型改进对于成功将这些大型语言模型 (LLM) 整合到临床实践中至关重要.


