相关实验视频
Updated: Jun 19, 2026

07:16
Extraction of the EPP Component from the Surface EMG
Published on: December 16, 2009
12.5K
从非英语母乳镜报告中自动提取关键实体,使用名字实体识别与快速工程
Zafer Akcali1,2, Hazal Selvi Cubuk3, Arzu Oguz2
1Department of Medical Informatics, Faculty of Medicine, Baskent University, Ankara 06790, Türkiye.
Bioengineering (Basel, Switzerland)
|February 26, 2025
概括
这项研究表明,使用大型语言模型的基于提示的命名实体识别 (NER) 能够有效地从土耳其乳房造影报告中提取临床信息,优于其他一些射击方法.
科学领域:
- 自然语言处理 (NLP) 是一种自然语言处理.
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
背景情况:
- 命名实体识别 (NER) 对于从文本中提取临床信息至关重要.
- 现有的NER模型往往缺乏对非英语语言的强大支持,这限制了它们的全球适用性.
- 由于NLP资源有限,土耳其的乳房学报告带来了特殊的挑战.
研究的目的:
- 为了研究基于提示的NER方法,使用谷歌的Gemini 1.5 Pro用于土耳其临床文本.
- 评估模型在从乳房镜报告中提取关键临床实体的有效性.
- 评估低资源语言环境中多次学习的表现.
主要方法:
- 与谷歌的Gemini 1.5 Pro (1.5百万令牌上下文窗口) 采用基于提示的NER策略.
- 利用了多次拍摄的学习,在26000令牌提示符中结合了165个示例.
- 专注于从85份没有注释的报告中提取五个关键实体:解剖学 (ANAT),印象 (IMP),观察存在 (OBS-P),缺席 (OBS-A) 和不确定性 (OBS-U).
主要成果:
- 实现了高精度,宏观平均F1得分为0.99 (放松匹配) 和0.84 (精确匹配).
- 放松匹配为ANAT提供了0.99的F1分,IMP为0.99,OBS-P为1.00,OBS-A为1.00,OBS-U为0.99.
- 准确匹配实现了F1得分:ANAT的0.88,IMP的0.79,OBS-P的0.78,OBS-A的0.94,OBS-U的0.82.这些都是对比的结果.
结论:
- 使用LLM的多次射击提示工程是用资源不足的语言提取临床信息的有效方法.
- 这种方法与零射击和其他少数射击方法相比,显示出更高的性能.
- 具有在多语言医疗保健环境中显著提高临床工作流程和研究的潜力.

