评估大型语言模型在兽医牙科客户沟通中的作用
1Department of Veterinary Surgery, Faculty of Veterinary Medicine, Atatürk University, Erzurum, Turkey.
Journal of veterinary dentistry
|February 18, 2026
概括
大型语言模型 (LLM) 对兽医牙科客户教育有希望,但需要专家监督. 虽然ChatGPT-5和Claude Sonnet 4.5的性能很好,但发现了一些不准确性,特别是关于麻醉安全性的不准确性.
科学领域:
- 兽医医学 兽医医学 兽医医学
- 人工智能的人工智能
- 客户通信 客户沟通
背景情况:
- 大型语言模型 (LLM) 越来越多地用于各种领域,包括医疗保健.
- 在兽医牙科中,有效的客户沟通至关重要.
- 人工智能为物主人生成的信息的准确性需要彻底评估.
研究的目的:
- 评估LLM对兽医牙科常见问题答案的准确性,一致性和临床适当性.
- 为了比较不同LLM在提供客户教育材料方面的表现.
- 确定在兽医与客户沟通中使用LLM的潜在风险和好处.
主要方法:
- 确定了六个常见的兽医牙科常见问题,并提交给多个LLM (ChatGPT-5,Gemini 2.5 Flash,Claude Sonnet 4.5,Perplexity,Qwen3-Max,DeepSeek).
- 人工智能生成的答案与专家审查的参考答案进行了比较.
- 兽医专家和新手对答案的准确性,一致性和临床适当性进行了评估,使用利克尔特尺度.
- 统计分析包括科恩的kappa,用于评估者间的协议,以及麦克内马尔的测试,用于模型比较.
主要成果:
- 聊天GPT-5展示了与专家内容的最高对齐,其次是Claude Sonnet 4.5.5.
- 在专家评价者中观察到实质性的评价者间一致性 (κ = 0.68).
- 在几个模型中发现了临床相关的不准确性,特别是关于麻醉要求和安全性的不准确性.
- 对于麻醉相关问题,专家和初学者评估者之间注意到了评估的差异.
结论:
- 士课程可能有助于客户在兽医牙科方面的教育.
- 专家监督对于确保人工智能产生的信息的临床准确性和安全性至关重要.
- 需要进一步改进LLM以解决特定的临床细微差别,例如麻醉协议.


