在口腔放射学中利用多式大型语言模型聊天机器人:使用韩国牙科大学的问题进行全面评估
Hui Jeong1,2,3, Kug Jin Jeon1,2, Chena Lee1
1Department of Oral and Maxillofacial Radiology, Yonsei University College of Dentistry, Seoul, Republic of Korea.
Dento maxillo facial radiology
|December 12, 2025
概括
通用多式大型语言模型 (LLM) 聊天机器人对基于文本的口腔放射学问题表现出很高的准确性,但在基于图像的任务中扎,表现出幻觉和不一致. 目前的人工智能聊天机器人尚未可靠用于口腔放射学应用.
科学领域:
- 口腔辐射学 口腔辐射学
- 人工智能的人工智能
- 医疗教育 医学教育
背景情况:
- 一般用途的多式联络大型语言模型 (LLM) 聊天机器人正在越来越多地被用于各种应用.
- 它们在口腔放射学等专业领域的实用性需要彻底评估.
研究的目的:
- 在口腔放射学中全面评估多模式LLM聊天机器人 (ChatGPT-4o和Gemini 2.0 Flash) 的性能.
- 评估基于文本和图像的问题的准确性,答案一致性和幻觉率.
主要方法:
- 90个基于文本和图像的口腔放射学问题被用于评估.
- 聊天机器人在不同内容类别的准确性,十次重复的答案一致性和使用5分级别的幻觉水平上进行了评估.
- 统计分析包括费舍尔的精确测试与邦费罗尼校正和弗莱斯的卡帕系数.
主要成果:
- 多模式人工智能聊天机器人在基于文本的口腔放射学问题上取得了超过80%的准确性.
- 基于图像的任务的性能有限,准确率低于30%.
- 基于图像的任务显示出高响应变化和频繁的幻觉,表明不可靠性.
结论:
- 目前的通用多式联络LLM聊天机器人在基于文本的口腔放射学查询中表现出色,但尚未适用于基于图像的任务.
- 调查结果强调需要进一步发展,以确保在口腔放射学和牙科教育中安全有效地整合AI聊天机器人.


