增强的大型语言模型在假牙多选题上的表现
Shenghan Gao1, Zi-Ang Wang2, Zihan Gao1
1Department of Prosthodontics, Peking University School and Hospital of Stomatology & National Center for Stomatology & National Clinical Research Center for Oral Diseases & National Engineering Research Center of Oral Biomaterials and Digital Medical Devices & Beijing Key Laboratory of Digital Stomatology & NHC Key Laboratory of Digital Stomatology & NMPA Key Laboratory for Dental Materials, Beijing, PR China.
使用检索增强生成 (RAG),上下文学习 (ICL) 和多数投票的增强大型语言模型 (LLM) 显示,在中文假牙问题上的准确性有所提高,但在英语问题上没有. 这些增强的LLM显示出牙科教育任务的潜力.
科学领域:
- 人工智能在牙科中的应用
- 用于牙科教育的自然语言处理.
- 大型语言模型的性能评估.
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于牙科等专业领域.
- 提升策略,如检索增强生成 (RAG),上下文学习 (ICL) 和多数投票,旨在提高LLM的准确性和可靠性.
- 评估LLM在特定领域问题上的表现对于其实际应用至关重要.
研究的目的:
- 评估检索增强生成 (RAG),上下文学习 (ICL) 和多数投票在增强大语言模型 (LLMs) 对于假牙问题的有效性.
- 为了比较增强的LLMs与它们的基础版本的性能,使用中文和英语的假牙问题集.
- 分析错误类型并确定LLM增强带来显著改进的领域.
主要方法:
- 使用RAG,ICL和多数投票技术增强了两个基本的大型语言模型 (OpenAI o1,DeepSeek-R1).
- 标准化中文多选题 (C-MCQs) 和英语多选题 (E-MCQs) 在假牙术中被用于评估.
- 通过对基础模型和增强模型的答案正确性,错误分析和统计比较 (χ2测试) 来衡量性能.
主要成果:
- 增强的LLM在C-MCQ上显示了统计学上显著的准确性改善 (P < .001) 和基于知识的错误的减少 (P < .008).
- 虽然增强的LLM在E-MCQ中显示出更高的准确性,但这种差异在统计学上并不显著 (P = .145).
- 提高LLM的好处,特别是在准确性和减少错误方面,主要是在中文问题集中观察到的.
结论:
- 推断时间增强策略 (RAG,ICL,多数投票) 显著提高了对中国假牙问题的LLM准确性.
- 这些改进有效地减轻了某些错误,但并不总是为英语问题带来统计学上显著的改进.
- 增强的LLM显示出处理牙科相关任务的前景,并有可能在牙科教育中应用.
更多相关视频
07:32Author Spotlight: 3D Movement Assessment of Maxillary Posterior Teeth in Clear Aligner Treatment
Published on: February 23, 2024
09:00Author Spotlight: Validation of SICOLE-R for Assessing Cognitive and Reading Skills in Spanish-Speaking Children and Its Role in Personalized Education
Published on: August 16, 2024
