多模式生成人工智能模型在处理复杂的牙科查询中使用文本,图像和分析数据的性能
Hang-Nga Mai1,2, Du-Hyeong Lee1,2, Jekita Kaenploy3
1Institute for Translational Research in Dentistry, Kyungpook National University, Daegu, South Korea.
概括
多模式大语言模型 (LLM) 对牙科教育有希望,但性能不同. 克劳德3 索内特在牙科检查中的准确性领先,尽管所有模型都面临复杂的临床数据的挑战.
科学领域:
- 人工智能在牙科中的应用
- 自然语言处理自然语言处理.
- 机器学习用于医疗保健
背景情况:
- 多模式大语言模型 (LLM) 整合了文本,图像和数据,为牙科教育和决策支持提供了潜力.
- 解决复杂的多模式牙科查询是当前人工智能系统的一个关键挑战.
研究的目的:
- 评估领先的多式联络LLM在回答牙科委员会考试问题的表现.
- 确定影响多式联络牙科查询LLM绩效的因素.
主要方法:
- 四个多式联络LLM (ChatGPT-4V,Claude 3 Sonnet,微软365 Copilot 2024,谷歌双子 1.5 Pro) 进行了测试.
- 使用综合国家牙科委员会牙科检查 (INBDE) 和高级牙科招生测试 (ADAT) 数据来评估绩效.
- 统计分析包括描述性统计,奇平方测试和科恩的卡帕来比较模型一致性和准确性.
主要成果:
- 克劳德3小诗在INBDE和ADAT考试中表现出最高的准确性.
- 在ADAT上的模型之间观察到显著的性能差异,但在INBDE中没有.
- 常见的错误包括误解临床情景,视觉数据和牙科术语.
结论:
- 多模式LLM具有牙科应用的潜力,但模型性能差异很大.
- 在准确解释复杂的临床数据,视觉信息和模两可的术语方面仍然存在挑战.
- 有效利用需要理解模型差异和管理复杂的临床数据.


