使用大型语言模型高效维护大规模医学词典:生物标记物的案例
Yuka Otsuki1, Shuntaro Yada1,2, Tomohiro Nishiyama1
1Nara Institute of Science and Technology, Japan.
Studies in health technology and informatics
|August 8, 2025
概括
这项研究引入了一种使用大型语言模型来纠正医学词典元数据的自动化方法,大大降低了大规模生物医学资源的维护成本和工作量.
科学领域:
- 自然语言处理自然语言处理.
- 生物信息学是一种生物信息学.
- 医疗信息学 医疗信息学
背景情况:
- 字典对于自然语言处理 (NLP) 任务至关重要,但它们的构建和维护成本很高.
- 大型词典的手动更新是耗时且昂贵的.
- 利用修订历史记录可以自动纠正未经编辑的术语,提高质量并降低成本.
研究的目的:
- 提出和评估一种在大型医学词典中自动纠正元数据的方法.
- 为了减少字典维护的负担,使用自动化技术.
- 评估大型语言模型 (LLM) 在零射击设置中的有效性.
主要方法:
- 利用能够进行零射击学习的大型语言模型 (LLM) 来估计字典信息.
- 将该方法应用于一个包含超过50万个术语的医学词典.
- 进行的实验重点是基因生物标记物表达变异,需要专门的医学知识.
主要成果:
- 拟议的方法证明了在大型医学词典中的元数据的有效自动校正.
- 在不需要特定任务的配置的情况下,LLM提供了词典信息.
- 实验表明,字典维护负担显著减少.
结论:
- 使用LLM进行自动化元数据校正是大型医学词典的可行和经济有效的解决方案.
- 这种方法提高了词典的质量,同时最大限度地减少了手工工作.
- LLM的零射击能力非常适合专门的生物医学任务,如字典丰富.


