临床数据提取的多模式管道:将视觉语言模型应用于输血反应报告的扫描
概括
本研究引入了一个开源管道,用于从扫描的医疗保健文件中提取检查框数据,减少错误和行政工作量. 该方法使用先进的OCR和视觉语言模型来从输血反应报告等表格中准确地提取数据.
科学领域:
- 医疗信息学 医疗信息学
- 计算机视觉 计算机视觉
- 自然语言处理自然语言处理.
背景情况:
- 由于依赖纸质文件,医疗保健系统面临数据数字化方面的挑战.
- 从纸张到数字格式的手动数据转录是低效的,容易出现错误.
- 不同质的现实世界医疗保健数据条件需要强大的数字解决方案.
研究的目的:
- 开发和展示一个开源管道,用于从扫描文件中自动提取和分类检查框数据.
- 简化将纸质健康数据转移到数字格式的工作流程.
- 为了证明管道适应各种丰富的检查框的文档类型的适应性,从输血反应报告开始.
主要方法:
- 管道整合了检查框检测算法.
- 多语言光学字符识别 (OCR) 用于文本识别.
- 多语言视觉语言模型 (VLMs) 用于高级数据解释.
主要成果:
- 管道在提取检查框数据方面表现出高精度和回忆.
- 性能与2017年至2024年每年编制的黄金标准数据集进行了验证.
- 实现了大幅减少行政工作量,提高了监管报告的准确性.
结论:
- 开发的开源管道提供了一个高效和准确的解决方案,用于从扫描的医疗保健文件中数字化检查框数据.
- 该系统的模块化设计支持适应不同类型的文档,超出了输血反应报告.
- 开源可用性促进了自主托管数据解析,增强了数据管理和医疗保健合规性.


