関連する実験動画
Updated: Jun 19, 2026

13:19
Deep Neural Networks for Image-Based Dietary Assessment
Published on: March 13, 2021
9.3K
コンボリューションニューラルネットワーク-リキュアントニューラルネットワークの組み合わせとコネクショニスト時間分類デコーダーを使用して,自然シーン画像の双言語ウルドゥー語と英語のテキストの検出と認識
Khadija Tul Kubra1, Muhammad Umair1, Muhammad Zubair2
1Faculty of Information Technology and Computer Science, University of Central Punjab, Lahore 54000, Pakistan.
Sensors (Basel, Switzerland)
|August 28, 2025
まとめ
この研究は複雑な自然環境で ウルドゥー語と英語の双言語テキストを検出し認識するための 新しいパイプラインを導入します 開発されたモデルは文字認識と文字認識の両方において高い精度を達成し,自律的なナビゲーションなどのアプリケーションを支援します.
科学分野:
- コンピュータ・ビジョン
- 自然言語処理
- 人工知能
背景:
- 公共の場 (看板,ナビゲーション) での ウルドゥー語と英語のテキストは 翻訳や自律システムなどのアプリケーションに不可欠です
- 現存する研究では,自然シーンにおける双言語テキストの検出と認識のための包括的なデータセットと効果的な方法が不足しています.
研究 の 目的:
- 複雑な自然風景の画像で,堅固なウルドゥー語と英語 (双言語) のテキスト検出と認識のための新しいパイプラインを提案する.
- 改善されたモデルトレーニングのためのバイリンガルデータセットを作成し,拡張することによって,以前の研究の限界に対処します.
主な方法:
- 特徴抽出のためのカスタマイズされたコンボリューションニューラルネットワーク (CNN) と特徴学習のためのリキュアントニューラルネットワーク (RNN) を組み合わせたパイプライン.
- 正確なテキスト認識のためにConnectionist Temporal Classification (CTC) が使用されました.
- 単語のデータセットを双語データセットに拡張するために,データセット増強技術が使用されました.
主要な成果:
- 提案されたモデルは,ウルドゥー語の文字認識では98.5%,ウルドゥー語の文字認識では97.2%,英語の文字認識では99.2%の平均精度を達成しました.
- 消去試験はモデル成分の有効性を確認した.
- パイプラインは既存のテキスト検出と認識方法と比較して優れた性能を示しました.
結論:
- 開発されたバイリンガルテキスト検出と認識パイプラインは,複雑な自然シーンに有効です.
- モデルが達成した高い精度は,自動運転車や強化されたナビゲーションなどの現実世界のシナリオでのアプリケーションをサポートします.
