大型语言模型对神经瘤学跨学科董事会决策的基于证据的建议的有效性:一项探索性研究和批判性评估
Maria Goldberg1, Viktor Maria Eisenkolb1, Amir Kaywan Aftahy2
1Department of Neurosurgery, School of Medicine, Klinikum rechts der Isar, Technical University Munich, Munich, Germany.
Digital health
|November 13, 2025
概括
大型语言模型 (LLM) 可以生成神经瘤病例概要,这些概要在风格和结构上相当于人类撰写的概要. 这些人工智能生成的摘要显示了作为一种有价值的工具来增强临床环境中的文档的承诺.
科学领域:
- 神经瘤学神经瘤学
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 在神经瘤学委员会决策中,传统的案例摘要对于文档和决策至关重要.
- 评估人工智能生成的摘要的风格和结构等价性对于它们在临床工作流程中的潜在整合至关重要.
研究的目的:
- 评估人工智能 (AI) 产生的摘要的风格和结构等价性,特别是来自大型语言模型 (LLM),与神经瘤学委员会决定中的人类产生的案例摘要相比.
- 探索人工智能生成和人类撰写的摘要之间的风格对齐,这些摘要来自神经瘤学董事会会议音频录音.
主要方法:
- 一项比较性研究涉及30个由人类生成的和30个由人工智能生成的从神经瘤学董事会会议中的病例摘要.
- 两位专家评价者,对摘要来源视而不见,使用利克特尺度对可信性,语言风格,证据坚持性和参考准确性进行了评估,评估了60个案例.
主要成果:
- 无论是LLM生成的总结还是人体审查的总结,在所有评估标准中都表现出很高的表现,可靠性,语言风格和证据坚持等等级都相当.
- 在人工智能生成的摘要中,参考准确度略高 (4.97 vs 4.9).
- 统计分析 (肯德尔的) 显示,人工智能生成和人类撰写的摘要之间没有显著差异 (P > .05).
结论:
- 士学位生成的摘要有效地模仿神经瘤学中人类撰写的摘要的风格和结构.
- 人工智能模型显示出作为增强文档质量和支持神经瘤学临床决策的补充工具的巨大潜力.
- 需要进一步的研究来探索LLMs在临床环境中的更广泛应用.
更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
1.0K
13:12Translational Brain Mapping at the University of Rochester Medical Center: Preserving the Mind Through Personalized Brain Mapping
Published on: August 12, 2019
46.3K
