LMT++:在机器人手术视频中适应性协作LLM与多专业教师,以获得持续的VQA
IEEE transactions on medical imaging
|June 20, 2025
概括
本研究介绍了LMT++,这是外科视觉问题解答 (VQA) 的无示例持续学习框架. 它使用多式大型语言模型 (LLM) 来解决领域转移和数据不平衡,改善外科教育.
科学领域:
- 医疗教育 技术 技术 医学教育
- 在外科手术中使用人工智能
- 计算机视觉 计算机视觉
背景情况:
- 视觉问题答案 (VQA) 对于外科教育至关重要.
- 患者数据隐私限制了传统的VQA模型培训.
- 无样本的持续学习 (CL) 是必要的,但在外科VQA中面临挑战.
研究的目的:
- 通过使用持续学习来解决外科VQA的领域转移和数据不平衡.
- 开发一个新的框架,将多式大型语言模型 (LLM) 集成到手术VQA的CL中.
- 提高VQA模型在外科教育中的性能和适用性.
主要方法:
- 开发了一个多模式的LLM辅助多教师的CL框架 (LMT++).
- 使用多式联络法学士作为辅助教师来处理领域转移和数据不平衡.
- 提出了适应性权重分配策略,以平衡LLM概括和VQA模型专业知识.
- 引入了一种方法,将LLM嵌入式转换为CL培训的逻辑.
主要成果:
- 拟议的LMT++框架有效地解决了手术VQA中的域位移和数据不平衡问题.
- 实验结果表明,与最先进的CL方法相比,其性能优越.
- 整合LLM改善了VQA模型对外科领域的理解.
结论:
- 在手术VQA中,LMT++框架提供了一个强大的解决方案,用于无示例的持续学习.
- 这种方法通过允许维护隐私的自适应VQA模型来增强外科教育.
- 未来的工作可以探索进一步整合LLMs以获得更复杂的外科手术培训工具.
更多相关视频
05:12Robotized Testing of Camera Positions to Determine Ideal Configuration for Stereo 3D Visualization of Open-Heart Surgery
Published on: August 12, 2021
2.2K
07:46Author Spotlight: Revolutionizing Remote Surgery with Augmented Reality and Robotics for Enhanced Precision and Accessibility
Published on: August 9, 2024
855
