OW-CLIP:通过人类-人工智能协作进行开放世界对象检测的数据高效视觉监督
IEEE transactions on visualization and computer graphics
|November 21, 2025
概括
开放世界物体检测 (OWOD) 模型现在可以使用OW-CLIP高效地学习新数据. 该系统减少了数据需求和过度装配,通过最小的自生成数据实现高性能.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 开放世界对象检测 (OWOD) 需要对新出现的对象进行持续的模型调整,但目前的方法需要大量的数据,容易过度拟合.
- 现有的OWOD方法通常需要广泛的众包注释和不灵活的模型架构修改.
研究的目的:
- 引入OW-CLIP,这是一个设计用于OWOD数据效率增量培训的视觉分析系统.
- 解决现有的OWOD方法的局限性,包括数据要求,部分特征过拟合和模型灵活性.
主要方法:
- OW-CLIP使用了插电式多式联机提示调和一种新的Crop-Smoothing技术来减轻过度拟合.
- 双模数据精制方法利用大型语言模型和数据生成和过的跨模相似性.
- 一个可视化界面促进了用户的探索和高质量的注释,包括特征短语和差异化图像.
主要成果:
- 通过仅使用3.8%的自生成数据,OW-CLIP实现了89%的最先进性能.
- 当系统与同等数据量进行训练时,其性能优于最先进的方法.
- 一个案例研究证实了该方法的有效性和可视化系统提供的增强注释质量.
结论:
- OW-CLIP为开放世界的物体检测模型培训提供了一个数据高效和有效的解决方案.
- 该系统成功地减轻了部分特征过拟合,并减少了对大型注释数据集的依赖.
- 集成的可视化工具提高了注释质量和OWOD管道中的用户交互.


