在EGD流中通过视觉时间意识嵌入和视觉-文本不对称协同工作进行细粒度的时间站点监控
IEEE journal of biomedical and health informatics
|October 30, 2024
概括
这项研究引入了一个新的AI模型,用于实时监测食道胃管腺镜 (EGD) 癌症查期间的癌症. 视觉时间感知嵌入加视觉文本不对称协同工作 (VTE+VAC) 模型提高了识别上部胃肠部位的准确性.
科学领域:
- 医疗成像医学成像
- 人工智能的人工智能
- 胃肠病学 胃肠病学
背景情况:
- 消化管胃管腺镜 (EGD) 需要对上部胃肠 (UGI) 部位进行彻底检查,以精确查癌症.
- 现有的EGD站点监控自动化方法与全球摄像机运动以及UGI站点细粒度,相似的外观作斗争.
研究的目的:
- 开发一种新的,定制的人工智能模型,以便在EGD期间实时,准确和精细地监测UGI站点.
- 为了应对摄像机运动和视觉均性在EGD视频分析中的挑战.
主要方法:
- 提出了一个新的EGD定制模型,包括视觉时间意识嵌入 (VTE) 和视觉文本不对称协同工作 (VAC).
- VTE使用分类和排名损失在时间无意识框架上捕捉时间关系,生成时间意识的嵌入.
- VAC使用了滑动窗口,VTE嵌入和结的BERT模型,结合视觉文本多式联络知识,同时通过随机预测丢弃/替换提高了对错误的容忍度.
主要成果:
- 与最先进的方法相比,VTE+VAC模型在实时UGI现场监测中表现出优异的性能.
- 在定性和定量实验中,平均F1得分至少提高了7.66%.
结论:
- 拟议的VTE+VAC模型有效地克服了自动化EGD协助现有方法的局限性.
- 这种方法可以在内镜手术期间更准确,更可靠地进行细粒度部位监测,从而有可能提高癌症检测率.


