基于临床专业知识的先进提示技术提高了LLM数据提取的准确性,但增加了非确定性
Yifei Wang1, Alejandro Alejandrez Cisneros2, Carly Stewart3
1Department of Epidemiology and Biostatistics, University of California San Francisco, San Francisco, CA, USA. yifei.wang@ucsf.edu.
Journal of imaging informatics in medicine
|March 12, 2026
概括
在医学文本分类中用于生成AI的快速工程显示出有希望. 外部知识来源提高了准确性,而思维链和递归批评提高了敏感性,但增加了非决定性.
科学领域:
- 人工智能的人工智能
- 医疗信息学 医疗信息学
- 自然语言处理自然语言处理.
背景情况:
- 生成型人工智能 (AI) 和快速工程技术在分类任务方面取得了重大进展.
- 这些方法在从非结构化医疗文本中提取结构化数据的有效性尚不清楚.
- 放射学报告是非结构化医疗数据的关键来源.
研究的目的:
- 评估五种大型语言模型 (LLM),提示从非结构化的放射学报告中提取结构化分类数据的策略.
- 评估不同提示技术 (外部知识,递归批评,思维链) 对准确性和非决定性的影响.
- 确定快速工程在处理医学文本中的明确和隐含信息时的有效性.
主要方法:
- 五种不同的LLM提示策略应用于对非结构化放射学报告提出的结构化分类问题.
- 战略包括外部知识来源,递归批评和改进,以及思维链技术.
- 通过整体准确性,对非明确类别的敏感性和非决定性率 (多次运行中的输出可变性) 来衡量有效性.
主要成果:
- 外部知识来源显著提高了对需要将医学知识推算的类别的灵敏度,从10%提高到66%,对整体准确度的影响最小.
- 将外部知识与递归批评和思维链相结合,进一步提高了对78%的敏感性.
- 然而,这些先进的技术使非决定性输出的考试比例从7%增加到14%.
结论:
- 快速工程策略,特别是那些结合外部知识的策略,提高了从放射学报告中提取特定类别的效果.
- 虽然像思维链和递归批评这样的先进技术可以提高灵敏度,但它们在AI输出中引入了更大的变化.
- 需要进一步的研究来平衡精度的增长与人工智能驱动的医疗数据提取的可靠性.


