从大型语言模型开发提示,从乳腺癌病理学和超声报告中提取临床信息
Hyeon Seok Choi1, Jun Yeong Song1, Kyung Hwan Shin1,2
1Department of Radiation Oncology, Seoul National University Hospital, Seoul National University College of Medicine, Seoul, Korea.
Radiation oncology journal
|October 4, 2023
概括
开发大型语言模型 (LLM) 提示从乳腺癌患者记录中有效提取临床因素. 这种方法与手动数据收集相比,证明了时间和成本效益,对关键因素具有很高的准确性.
科学领域:
- 在瘤学瘤学.
- 医疗信息学 医疗信息学
- 自然语言处理自然语言处理.
背景情况:
- 从广泛的乳腺癌患者记录中提取临床因素对于研究和治疗至关重要.
- 手动提取数据是耗时和昂贵的,阻碍了大规模分析.
- 大型语言模型 (LLM) 为自动从医学文本中检索信息提供了一个潜在的解决方案.
研究的目的:
- 评估开发提示程序的效率和准确性,以便LLMs在乳腺癌患者中提取临床因素.
- 将基于LLM的数据提取与手动和半手动方法的时间和成本进行比较.
主要方法:
- 收集了2020-2022年期间接受治疗的2,931名乳腺癌患者的外科病理和超声波报告.
- 用于表格和文档的利用生成预训练变压器 (GPT) 开发和应用提取提示.
- 将LLM方法的时间和成本与"全手册"和"LLM辅助手册"方法进行比较;对340名随机选择的患者进行准确性评估.
主要成果:
- 开发了24个提示符 (12 提取, 12 格式) 以有效地提取和标准化信息.
- 总体准确率为87.7%,淋巴血管侵袭的准确率为98.2%.
- LLM的快速开发和处理分别需要3.5小时和15分钟,成本为95.4美元,包括估计的工资;比手工方法高效得多.
结论:
- LLM-prompt开发是一种有效的策略,可以从大量的医疗记录中提取关键的临床信息.
- 通过LLMs在乳腺癌研究中展示了自然语言处理的潜力.
- 开发的提示可以重复使用,用于在未来的研究工作中收集临床信息.


