一个大规模的基准,用于评估在罗马尼亚语中回答医疗问题的大型语言模型
Ana-Cristina Rogoz1, Radu Tudor Ionescu2, Alexandra-Valentina Anghel3
1University of Bucharest, Bucharest, Romania.
NPJ digital medicine
|February 21, 2026
概括
我们创建了MedQARo,一个罗马尼亚医疗问答基准. 微调大型语言模型 (LLM) 显著提高了性能,突出了对临床QA的特定领域和特定语言培训的需求.
科学领域:
- 自然语言处理自然语言处理.
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
背景情况:
- 开发强大的医疗问答 (QA) 系统对于临床决策支持至关重要.
- 现有的基准通常缺乏多语言能力和特定领域的数据.
- 罗马尼亚语医学数据对当前的人工智能模型提出了独特的挑战.
研究的目的:
- 推出MedQARo,这是罗马尼亚语第一个大型医疗质量保证基准.
- 在这个基准上全面评估最先进的大型语言模型 (LLM) 的性能.
- 评估LLM在不同医疗领域和中心的概括能力.
主要方法:
- 构建一个高质量的数据集,其中包括来自1242名癌症患者病例摘要的105,880个QA对.
- 评估四个开源LLM使用零射击提示和监督微调.
- 在MedQARo基准上对两个基于API的LLM (GPT-5.2,Gemini 3 Flash) 的评估.
主要成果:
- 精心调整的LLM在所有测试集合中显著优于零射击模型.
- 预训练的模型在MedQARo基准上表现出有限的概括能力.
- 在不同的LLM家族和微调策略中,性能各不相同.
结论:
- 针对特定领域和特定语言的微调对于罗马尼亚语可靠的临床质量保证至关重要.
- MedQARo为推进医学NLP研究在代表性不足的语言中提供了宝贵的资源.
- 未来的工作重点应该是改善复杂的临床推理任务的LLM概括.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.7K
05:56Objectification of Tongue Diagnosis in Traditional Medicine, Data Analysis, and Study Application
Published on: April 14, 2023
3.3K
相关概念视频
Improving Translational Accuracy
3.7K
3.7K
Improving Translational Accuracy
15.2K
Base complementarity between the three base pairs of mRNA codon and the tRNA anticodon is not a failsafe mechanism. Inaccuracies can range from a single mismatch to no correct base pairing at all. The free energy difference between the correct and nearly correct base pairs can be as small as 3 kcal/ mol. With complementarity being the only proofreading step, the estimated error frequency would be one wrong amino acid in every 100 amino acids incorporated. However, error frequencies observed in...
15.2K
