新浪科技讯 7月21日晚间消息,近日,小鹏正式发布TuringViT 高效视觉编码器,面向 VLM/VLA 时代系统性重构视觉编码器的架构设计、数据范式与训练流程。TuringViT 将全面支撑智能驾驶、智能座舱、IRON 人形机器人三大业务场景。
视觉编码器是物理 AI 的 “感知入口”—— 所有场景理解、状态判断、动作决策的第一步,都始于高质量的视觉特征提取。行业普遍采用的 “复用开源通用 ViT” 方案,已难以匹配智能驾驶、具身机器人等真实场景对性能、延迟与定制化的综合需求。TuringViT 正是小鹏针对这一行业痛点给出的系统性解决方案。TuringViT 从架构、数据、训练三个维度同步突破,打造了 “线性注意力主导 + 高质量数据治理 + 原生动态分辨率” 的完整技术体系,实现了效果、效率与落地性的三重提升。
随着TuringViT的发布,小鹏全栈自研的物理 AI 底层技术能力逐步完善和丰富。小鹏的物理AI底层技术能力,也不仅仅服务于智能辅助驾驶,更将赋能更多物理AI业务场景。包括赋能 VLA 2.0,让高分辨率感知真正落地车端;升级座舱交互,实现视觉与语言的自然融合;夯实具身基础,为 IRON 机器人打造通用视觉能力。