相关实验视频
深度推理和轻量级大语言模型在口腔植入学多选择题上的比较性能
The International journal of prosthodontics
|October 2, 2025
概括
深度推理的大型语言模型 (LLM) 为植入学MCQ提供了更高的准确性,而轻量级LLM则提供了更快的响应. 模型选择应平衡牙科教育的准确性和速度.
科学领域:
- 牙科教育技术 牙科教育技术
- 人工智能在牙科中的应用
- 口腔植入物学口腔植入物学
背景情况:
- 大型语言模型 (LLM) 在牙科教育等专业领域显示出潜力.
- 各种LLM配置对植入学知识的表现在很大程度上仍然没有特征.
- 优化LLM选择对于有效融入牙科培训和实践至关重要.
研究的目的:
- 为了比较六种不同的大型语言模型 (LLM) 配置的准确性和响应时间.
- 为了评估专业口腔植入学多选择题 (MCQ) 数据集的LLM绩效.
- 为选择最适合植入学教育和实践的LLM提供指导.
主要方法:
- 在6个LLM设置中进行了675个口腔植入学MCQ:OpenAI (o3,GPT-4o),微软Copilot (Deep,Quick) 和谷歌双子座 (Flash,Pro).
- 记录的准确性 (正确答案的百分比) 和响应时间 (每批10个问题所花费的时间).
- 利用统计测试 (χ2和ANOVA) 来比较不同模型的准确性和响应时间.
主要成果:
- 在LLMs中观察到精度的显著变化 (p = 0.001).
- 双子Pro (83.1%) 和o3 (82.4%) 显示了最高的准确性,超过了GPT-4o (76.9%).
- 深度推理模型平均每批4-5秒,而轻量级模型响应时间不到1秒 (p < 0.001);所有模型都难以获得精确的流行病学数据.
结论:
- 深度推理的LLM为植入学MCQ提供了更高的准确性,但回应时间稍长的权衡.
- 轻量级LLM提供快速响应,但精度略低.
- 根据特定任务的复杂性量身定制LLM选择可以提高植入学中的效率,成本效益和精度.