人間からのメトリック:テスト時適応によるゼロショット単眼メトリック深度推定
Yizhou Zhao1, Hengwei Bian1, Kaihua Chen1
1Carnegie Mellon University, Pittsburgh.
Advances in neural information processing systems
|February 23, 2026
まとめ
この研究では、単眼メトリック深度推定 (MMDE) のための Metric from Human (MfH) を紹介します。MfH は、生成モデルと人間のメッシュ復元を使用して、未知のシーンでの正確な深度予測を可能にし、現在の制限を克服します。
科学分野:
- コンピュータビジョン
- 人工知能
背景:
- 単眼深度推定 (MDE) は、2D画像からの3Dシーン再構成にとって重要です。
- 現在の単眼メトリック深度推定 (MMDE) は、シーン依存のスケール復元のため、未知のシーンで苦労しています。
- 単眼相対深度推定 (MRDE) は効果的ですが、メトリックスケール情報が不足しています。
研究 の 目的:
- 未知のシーンに汎化するゼロショット単眼メトリック深度推定 (MMDE) のための新しいアプローチを開発すること。
- 既存のMMDEモデルのシーン依存性の限界を克服すること。
- メトリックスケール復元のために、生成モデルと人間の事前知識を活用すること。
主な方法:
- アノテーション不要のテスト時適応のためのMetric from Human (MfH) アプローチを提案しました。
- 入力画像内に人間の姿を合成するために、生成ペインティングモデルを利用しました。
- 既存の人間メッシュ復元 (HMR) モデルを使用して、人間の次元を推定しました。
- 推定された人間の次元からシーンコンテキストへのメトリックスケール情報を、MRDE予測を使用して伝播させました。
主要な成果:
- MMDEにおける優れたゼロショット性能を達成しました。
- MfHアプローチの新しい未知のシーンへの強力な汎化能力を実証しました。
- 生成と推定の戦略を通じて、一般的なMRDEをゼロショットMMDEに効果的に橋渡ししました。
結論:
- Metric from Human (MfH) は、人間をランドマークとして使用して、シーンに依存しないメトリックスケール事前知識を効果的に抽出します。
- 提案された方法は、シーン固有のトレーニングデータを必要とせずに、堅牢なMMDEを可能にします。
- MfHは、深度推定モデルの汎化を改善するための有望な方向性を提供します。


