通过语言和视觉传感器数据的交叉注意调整进行关键字条件的图像细分
1Department of Computer Engineering, Keimyung University, Daegu 42601, Republic of Korea.
Sensors (Basel, Switzerland)
|October 29, 2025
概括
本研究介绍了KeySeg,这是一种基于关键字的图像细分模型. KeySeg通过明确地将语言理解与视觉执行联系起来来改善基于推理的细分,以获得更准确的结果.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 多模式大语言模型 (LLM) 允许用于图像分割的联合视觉和语言处理.
- 由于语言解释和细分执行之间的断开,现有的方法面临语义上的差异.
研究的目的:
- 提出KeySeg,一个新的架构,解决多式模式图像细分中的语义差距.
- 显式编码并将推断的查询条件集成到细分过程中.
主要方法:
- KeySeg将多式联网输入的核心概念嵌入到一个[KEY]令牌中.
- 一个交叉注意力融合模块将[KEY]令牌与[SEG]令牌集成.
- 关键字对齐损失确保[KEY]令牌与查询的语义核心对齐.
主要成果:
- KeySeg在细分标准中明确而准确地反映了查询条件.
- 该模型在条件解释方面表现出更高的准确性.
- 达到表达能力和解释稳定性,即使在复杂的语言条件下.
结论:
- 在图像分割中,KeySeg有效地弥合了语言和视觉之间的语义差距.
- 分离条件推理和细分指令提高了模型性能.
- 该架构为基于推理的图像细分提供了稳定而准确的方法.


