代币分割改善了GPT-4.1在整形外科考试中的表现:对人工智能辅助医学教育的影响
Yung-Hsu Lei1, Chien-Chung Chen1,2, Ching-Ju Shen3
1Department of Plastic and Reconstructive Surgery, E-Da Hospital, I-Shou University, Kaohsiung, Taiwan.
Medical education online
|December 12, 2025
概括
一种基于认知负载理论 (CLT) 的新代币分割策略,通过优化认知处理以更好地保留知识,显著提高了大型语言模型 (LLM) 在专业医疗检查上的性能.
科学领域:
- 人工智能在医学中的应用
- 认知科学在教育中的应用
- 自然语言处理自然语言处理.
背景情况:
- 大型语言模型 (LLM) 在一般医学知识方面表现有前途,但由于数据限制和计算约束,在专门的董事会考试中扎.
- 现有的LLM架构在有效处理广泛的,特定领域的医疗信息方面面临挑战.
研究的目的:
- 研究一种由认知负载理论 (CLT) 启发的新型代币分割策略,以提高专业医学委员会考试的LLM绩效.
- 为AI辅助医学教育优化认知处理和知识保留.
主要方法:
- 实施了代币分割方法,将台湾整形外科委员会考试材料和教科书内容细分为可管理的代币长度 (4,000-20,000 代币).
- 使用标准的ChatGPT接口评估GPT-4.1性能,比较不同令牌长度和基于Bloom的分类学问题的复杂度的准确性和效率.
- 评估模型性能与基线 (未经修改) 模型相比.
主要成果:
- 代币分割策略在准确性方面明显超过了基线模型.
- 确定了6000个令牌的最佳细分长度,平衡认知连贯性和信息保留.
- 当相关文本内容被适当细分时,GPT-4.1获得了高准确度 (75.88%92.93%),错误主要是由于缺失或多式联络内容.
结论:
- 基于CLT的代币分割,在专业医疗委员会考试中大大提高了LLM的表现.
- 这种可访问的策略为教育工作者和临床医生提供了一种实际的方法,以改善人工智能辅助学习成果.
- 未来的工作应该专注于多式联运能力和适应性细分,以进一步优化.


