Dual modality prompt learning for visual question-grounded answering in robotic surgery

Yue Zhang1, Wanshu Fan2, Peixi Peng1

  • 1National and Local Joint Engineering Laboratory of Computer Aided Design, School of Software Engineering, Dalian University, Dalian, 116622, Liaoning, China.

Summary

This study introduces a grounded visual question answering (VQA) model for robotic surgery that precisely locates relevant image regions while answering questions. The novel dual-modality prompt model enhances multimodal interactions for improved accuracy in surgical contexts.