博士论文的信息提取使用两个不同的大型语言模型与卫生服务研究人员:开发和可用性研究研究
Jonas Cittadino1, Pia Traulsen1, Teresa Schmahl1
1Institute of Family Medicine, University Hospital Schleswig-Holstein, Maria-Goeppert-Straße 9a, Lübeck, 23538, Germany, 49 451 3101 ext 8001.
JMIR formative research
|December 10, 2025
概括
像GPT-4o和Gemini-1.5-Flash这样的大型语言模型 (LLM) 可以有效地提取信息并从历史博士论文中生成摘要. 通过LLM生成的摘要与人类撰写的摘要相当,制作速度明显更快.
科学领域:
- 医疗信息学 医疗信息学
- 自然语言处理自然语言处理.
- 档案科学 档案科学
背景情况:
- 德语通用实践档案 (ADAM) 包含大约500篇纸质博士论文,从1965年到现在.
- 这些历史医学文件没有进行系统的信息提取 (IE).
- 大型语言模型 (LLM) 显示了IE在医学文本中的潜力,但存在对幻觉和与非最近文档使用的担忧.
研究的目的:
- 评估LLM (GPT-4o和Gemini-1.5-Flash) 在从ADAM档案中的纸质博士论文中提取信息的有效性.
- 评估与人类生成的摘要相比,LLM生成的摘要的质量.
主要方法:
- 随机选择10篇博士论文 (1965-2022) 进行分析.
- 利用两个LLM管道 (OpenAI的GPT-4o和谷歌的Gemini-1.5-Flash) 来进行信息提取和抽象生成.
- 将LLM生成的摘要与使用盲级评分器和从变压器 (BERT) 得到的双向编码器表示的人类生成的摘要进行了比较.
主要成果:
- 对于所有10篇论文,都提取了论文的主要特征 (研究所,标题,作者,年份).
- 用GPT-4o成功生成了9/10个论文的摘要,用Gemini-1.5-Flash成功生成了所有10个论文的摘要.
- 通过LLM生成的摘要显示了中等至高的语义相似性 (BERT F1分数:GPT-4o 0.72,Gemini 0.71) 并比人类摘要快24-36倍.
- 评级人员发现,LLM生成和人类生成的摘要之间的质量没有显著差异 (P=.44).
结论:
- LLM (GPT-4o和Gemini-1.5-Flash) 是从历史博士论文中提取信息和生成摘要的有效工具.
- 由LLM生成的摘要在语义上与人类生成的摘要相似,制作速度更快,并且在翻译过程中不会丢失信息.
- 这项研究证明了在标准工作流程中使用LLM的可行性,以提高历史家庭医学文献的可搜索性.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.2K
09:20Cloud-Based Phrase Mining and Analysis of User-Defined Phrase-Category Association in Biomedical Publications
Published on: February 23, 2019
9.1K
