人与人工智能在口腔病理学诊断中的对比:ChatGPT,Grok和MANUS的比较研究
Abdullah F Alshammari1, Ahmed A Madfa2, Bassam Ali Anazi3
1Department of Basic Dental and Medical Science, College of Dentistry, University of Ha'il, Ha'il, Kingdom of Saudi Arabia. Abd.alshamari@uoh.edu.sa.
Scientific reports
|February 24, 2026
概括
三种大型语言模型 (LLM) 在解释口腔病理学幻灯片时显示出高精度. 格罗克是最准确的,ChatGPT是最一致的,MANUS是最专家一致的,支持AI整合数字病理学.
科学领域:
- 数字病理学数字病理学
- 人工智能在医学中的应用
- 口腔病理学 口腔病理学
背景情况:
- 人工智能 (AI) 正在增强诊断医学,特别是在病理学领域.
- 大型语言模型 (LLM) 显示了解释复杂医疗数据的潜力.
研究的目的:
- 评估三个LLM (ChatGPT,Grok,MANUS) 在解释口腔病理学幻灯片中的诊断性能.
- 为了比较人工智能模型的准确性,一致性和与人类专家诊断的一致性.
主要方法:
- 使用100张口腔病变组织病理学幻灯片进行的比较诊断研究.
- 通过使用标准化提示,通过ChatGPT (GPT-4-turbo),Grok (xAI) 和MANUS分析幻灯片.
- 评估诊断准确性,模型内部一致性,模型间一致性和专家协议.
主要成果:
- 所有的人工智能模型都显示出高诊断准确度,Grok (97%),MANUS (96%) 和ChatGPT (94%) 在第二轮.
- 聊天GPT表现出最高的模型内部一致性 (κ=0.918);专家病理学家达到98%的准确性.
- 曼努斯与专家病理学家达成最强的共识,表明与人类推理有很大一致.
结论:
- 多模式LLM具有强大的诊断能力,用于口腔组织病理学解释.
- 人工智能模型显示出与专家推理的一致性和一致性,支持其在诊断支持和教育中的作用.
- 建议在临床环境中进一步验证人工智能工具,以集成数字病理学.


