使用视觉语言预训练模型提高医疗语音对文本的准确性
IEEE journal of biomedical and health informatics
|December 22, 2023
概括
这项研究引入了一种新的视觉语言预训练 (VLP) 方法,以提高医疗语音到文本 (STT) 的准确性. 通过使用文本和图像数据,VLP方法增强了转录,大大改善了临床工作流程.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 自动语音识别 (ASR) 和语音对文本 (STT) 技术促进了人机交互.
- 医疗STT可以减少临床医生的工作量,但由于有限的特定领域数据而面临挑战.
- 现有的通用STT系统需要对医学等专业领域进行域调整.
研究的目的:
- 为医学领域的STT提出一种新的文本校正方法.
- 利用视觉语言预训练 (VLP) 提高STT在临床环境中的准确性.
- 证明多模式理解在医学STT中优于单模式方法.
主要方法:
- 使用视觉语言预训练 (VLP) 开发了一种医学领域的文本校正方法.
- VLP模型整合了文本和视觉信息,用于对文本进行上下文识别的校正.
- 对医疗语音转录任务的拟议方法进行了评估.
主要成果:
- 提出的基于VLP的方法显著改善了医学领域的STT性能.
- 观察到转录精度的定量和临床改善.
- 多模式理解 (图像和文本) 优于仅使用文本的方法.
结论:
- 视觉语言预训练为提高医疗STT准确度提供了强大的解决方案.
- 将视觉上下文与文本集成,可以提高STT系统在专业领域的稳定性.
- 这种方法有可能简化临床文档并减少转录错误.


