使用大型语言模型进行非结构化前列腺MRI报告的结构化转换.
Luca Di Palma1, Fatemeh Darvizeh1, Marco Alì1
1CDI Centro Diagnostico Italiano, Saint Bon 20, 20147 Milan, Italy.
概括
高性能的大型语言模型 (LLM) 在从前列腺MRI报告中提取放射性特征方面表现出强大的能力. DeepSeek-R1-Llama3.3获得了最高的性能,表明了改善临床工作流程的潜力.
科学领域:
- 放射学和医学成像学 医学成像学
- 医疗保健中的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 前列腺MRI报告包含患者诊断和管理的关键信息.
- 从非结构化文本报告中提取关键的放射性特征是耗时的,容易出现人为错误.
- 大型语言模型 (LLM) 为自动信息提取提供了一个潜在的解决方案.
研究的目的:
- 评估开放式重量LLM在从前列腺MRI报告中提取特定放射性特征的性能.
- 为了比较不同LLM在确定尺寸,体积,PSA密度和病变特征方面的有效性.
- 评估放射科医生报告变异对LLM绩效的影响.
主要方法:
- 使用了五个先进的LLM (Llama3.3,DeepSeek-R1-Llama3.3,Phi4,Gemma-2,Qwen2.5-14B) 进行研究.
- LLMs处理了250份前列腺MRI报告的自由文本,每个模型运行三个提取提示.
- 经验丰富的放射科医生的手动注释是性能评估的基本真理.
主要成果:
- DeepSeek-R1-Llama3.3实现了最高的平均功能级性能 (98.6%).
- 所有模型都在提取PSA密度 (100%) 和体积 (≥98.4%) 中表现出色.
- 病变特征的提取显示出更多的可变性 (88.4-94.0%),并且在放射科医生的报告中性能有所不同.
结论:
- 开放式重量LLM显示出从前列腺MRI报告中自动提取特征的显著前景.
- 在这个评估中,DeepSeek-R1-Llama3.3成为了表现最好的模型.
- 建议根据个体医生报告风格量身定制提示,以优化LLM准确性和临床工作流集成.


