在牙科系统审查中,用于查步骤的大型语言模型
Rata Rokhshad1, Mobina Bagherianlemraski2, Sarah Sadat Ehsani3
1Department of Pediatric Dentistry, Loma Linda School of Dentistry, Loma Linda, USA.
Journal of dentistry
|June 6, 2025
概括
聊天机器人在系统审查的查研究中表现出有限的准确性和低的一致性,特别是在牙科放射图上人工智能驱动的牙细分中. 人类监督对于保持审查完整性至关重要.
科学领域:
- 放射学中的人工智能
- 医疗信息学 医疗信息学
- 系统审查方法论 系统审查方法论
背景情况:
- 系统性审查 (SRs) 对于医疗保健中的证据综合至关重要.
- 使用人工智能 (AI) 聊天机器人自动化SR选步骤是一个新兴的领域.
- 评估聊天机器人在牙科放射分析等专业任务中的性能是必要的.
研究的目的:
- 在系统审查的选阶段评估五个领先的人工智能聊天机器人的表现.
- 专门评估它们在识别牙细分研究中的有效性,使用人工智能对牙科X射线图进行识别.
- 为了比较聊天机器人选准确度和与专家人类审核员之间的评审者之间的协议.
主要方法:
- 在七个主要数据库中进行了系统的搜索,以寻找基于人工智能的牙细分在牙科放射图中的研究.
- 五个聊天机器人 (ChatGPT-4,Claude 2 100k,Claude Instant 100k,LLaMA 3,Gemini) 被用来选检索的文章. 这是一个非常好的例子.
- 使用准确度,精确度,灵敏度,特异性,F1得分和Fleiss' Kappa来评估性能,与专家评审员进行比较.
主要成果:
- 在聊天机器人的研究纳入/排除率中发现了显著的变化 (p < 0.001).
- 克劳德即时100k具有最高的纳入率 (54.88%),而双子座排除了大多数研究 (67.90%).
- 聊天GPT-4显示了最高的精度 (24%) 和准确性 (75%),但Fleiss' Kappa表示聊天机器人之间存在系统的分歧.
结论:
- 人工智能聊天机器人在系统审查的研究选过程中表现出有限的准确性和低的评分间一致性.
- 虽然聊天机器人理论上可以简化系统审查任务,但人类监督至关重要.
- 为了保持系统审查的完整性和可靠性,需要在选阶段持续参与人类.
更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
693
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
595
