XPENG releases TuringViT for smart driving and humanoid robots

TL;DR AI
2 min readKey summary
XPENG has released TuringViT, a vision encoder for smart driving, smart cockpit systems, and humanoid robots.
The model targets vision-language and vision-language-action use cases and comes in two variants, TuringViT-18L and TuringViT-24L.
XPENG says it was trained on 850 million image-text pairs and delivered strong throughput and benchmark results at 1536×1536 resolution.
The launch signals XPENG is building core multimodal AI infrastructure to compete in autonomous driving and robotics.


