関連する実験動画
Updated: Jun 15, 2026

Automated Interactive Video Playback for Studies of Animal Communication
Published on: February 9, 2011
VideoA11y: アクセス可能なビデオ記述のための方法とデータセット
Chaoyu Li1, Sid Padmanabhuni1, Maryam S Cheema1
1School of Computing and Augmented Intelligence, Arizona State University, Tempe, Arizona, USA.
VideoA11yは,視覚障害者や視覚障害者のためのより良いビデオ説明を作成するために,マルチモダルの大型言語モデル (MLLMs) を使用しています. このアプローチは,現在の方法と比較してアクセシビリティとユーザー満足度を大幅に改善します.
科学分野:
- コンピュータ科学
- 人とコンピュータの相互作用
- 人工知能
背景:
- 視覚障害者や視覚障害者のアクセシビリティに ビデオ説明は不可欠です
- 既存のAIで生成された記述は,トレーニングデータの制限により,BLVユーザーのニーズを満たすことができず,しばしば品質が欠けている.
研究 の 目的:
- BLVユーザー向けに高品質のビデオ記述を生成するためのマルチモダルの大型言語モデル (MLLMs) とアクセシビリティガイドラインを用いたアプローチ (VideoA11y) を開発する.
- VideoA11y-40Kデータセットを作成し,BLVユーザー向けの記述されたビデオの最大のコレクションを作成します.
主な方法:
- MLLMとビデオアクセシビリティのガイドラインを活用して説明を作成します.
- ビデオA11y-40Kのデータセットを整理し,4万件のビデオを記述した.
- 視覚障害者やBLVの参加者とプロの記述者の間で実験を行い,記述の質を評価する.
主要な成果:
- VideoA11yの記述は,初心者のアノテーションよりも優れていることが判明しました.
- 生成された記述は,明確性,正確性,客観性,記述性,およびユーザー満足度において,訓練された人間の注釈に匹敵する品質を示した.
- VideoA11y-40Kデータセットで微調整されたMLLMは,高品質のアクセシブルなビデオ記述を生成しました.
結論:
- VideoA11yのアプローチは,BLVユーザーにとってアクセシブルなビデオ記述を生成します.
- VideoA11y-40KデータセットとMLLMの微調整は,ビデオアクセシビリティの分野を進めている.
- この作品は,BLVの個人のビジュアルコンテンツへのアクセスを改善するためのスケーラブルなソリューションを提供します.
さらに関連する動画
10:11Portable Intermodal Preferential Looking IPL: Investigating Language Comprehension in Typically Developing Toddlers and Young Children with Autism
Published on: December 14, 2012
08:25Combining Eye-tracking Data with an Analysis of Video Content from Free-viewing a Video of a Walk in an Urban Park Environment
Published on: May 7, 2019
関連する概念動画
Data Collection by Observations
An astronomer viewing the motion and brightness of stars in the sky and recording the data is an example of observational data collection. A botanist recording...
Data Collection I
Data Collection II
Data Reporting and Recording