A Survey on Vision--Language--Action Models for Embodied AI.

Summary

This survey introduces vision-language-action (VLA) models, crucial for embodied artificial intelligence (AI) and artificial general intelligence (AGI). It categorizes VLA research and resources, outlining future directions for AI agents in the physical world.