当语言和视觉相遇道路安全:利用多式联运大型语言模型进行基于视频的交通事故分析
Ruixuan Zhang1, Beichen Wang2, Juexiao Zhang2
1Tandon School of Engineering, New York University, Brooklyn, United States.
Accident; analysis and prevention
|June 5, 2025
概括
SeeUnsafe使用多模大型语言模型 (MLLM) 代理来分析交通视频,提高交通安全分析的效率和准确性. 这个新的框架自动化复杂的任务,从24/7的交通录像中获得更好的洞察力.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 交通安全 交通安全 交通安全
背景情况:
- 交通视频分析对于改善道路安全至关重要,但由于大量数据和繁的后处理,它面临挑战.
- 目前基于视觉的方法专注于数据提取,需要大量的手工努力才能获得可操作的见解.
研究的目的:
- 介绍SeeUnsafe,一种使用多式大型语言模型 (MLLM) 代理进行高效和交互式视频基础交通事故分析的新框架.
- 将交通安全分析从手动提取和解释过程转变为自动化的对话方法.
主要方法:
- 集成MLLM代理来自动视频分类和视觉接地.
- 开发一种基于严重程度的聚合策略,用于处理可变长度的视频.
- 引入多式联络提示器,用于结构化响应和细粒度的视觉接地.
- 关于信息匹配分数 (IMS) 的建议,这是一个基于MLLM的响应评估指标.
主要成果:
- SeeUnsafe有效地进行了事故意识视频分类.
- 该框架通过利用现成的MLLM来实现准确的视觉接地.
- 在处理吞吐量和适应各种交通场景的适应性方面显著提高.
结论:
- SeeUnsafe为基于视频的交通事故分析提供了一种变革性的,对话式的方法.
- 该框架提高了效率和准确性,通过自动化视频解释为改善交通安全铺平了道路.


