具身智能 / VLA 算法工程师
#2
今日锚点 + 面试官怎么问锚点:第 11 届世界机器人大会 8/19–23 正在北京举办,今天 8/20 是「采购日」,本届首发新品破 150 款创历届新高、同期启动「具身智能技能人才培养计划」等 6 项人才计划;开幕前一天宇树科技上市首日收涨 460.34%、市值 3417.72 亿元。招聘侧:具身智能岗位招聘量同比暴涨约 15 倍(AI 整体约 8.7 倍),人形赛道新发职位同比 +215.80%,平均年薪约 40.61 万元;学术侧 VLA 论文在 ICLR 从 2024 年 1 篇 → 2025 年 9 篇 → 2026 年 164 篇。问法:简历写了 CLIP/BLIP-2/LLaVA 的人投这条线,必被问「VLA 和 VLM 到底差在哪、难在哪一段」。
怎么答(4 点,第 4 点是大多数人的真实处境)
- 一句话给出本质差别,别背定义。VLM 的输出是话,VLA(Vision-Language-Action)的输出是动作指令——多出来的不是一个模态,而是一个会产生真实物理后果、且撤不回来的输出空间。说错一句话可以重说;机械臂打碎的杯子拼不回去。这一句就把「看过介绍」和「想过工程」分开了。
- 三个难点,每个都落到工程上。① 动作怎么表示:连续控制量离散成 action token 交给自回归,还是直接回归输出?控制频率多高?② 数据从哪来:网上有海量图文对,但没有「该怎么动」的数据,真机遥操作采集又贵又慢——这正是人社部拟发布新职业「具身智能机器人应用技术员」职责第一条写多模态交互数据的采集与处理的原因。③ 闭环与延迟:VLM 一次前向就交差,VLA 要在闭环里持续输出,推理慢一点机器人就抖、就撞——推理优化在这条线上不是加分项,是硬需求(接上今天 #1)。
- 说清评测口径的差别。VLM 看基准分,VLA 看任务成功率与泛化——换个物体、换个光照、换个摆位还成不成?且必须在真机或高保真仿真里验证,仿真到真机的差距(sim-to-real gap)本身就是常考点。能说出「我先定义什么算成功、再定义换哪些条件测泛化」的人,明显靠前。
- 没碰过真机怎么答:别装。诚实说没有真机经验,然后把可迁移的部分讲实——多模态对齐、数据管线与质检、评测集设计、推理延迟优化,这四样在 VLA 里一样吃紧。再给一个能马上做的动作:在开源仿真环境里跑通一个公开 VLA 基线,做「换了物体还成不成」的小对照实验,把成功率曲线放进作品集。一个能复现、能对照的小实验,胜过背十页综述。
过来人提醒(对转行者的诚实判断):这条线薪资最亮(赛道平均月薪从 5.9 万涨到 6.2 万的口径),但也是门槛最高、最不适合零基础速成的一条——第一大缺口是算法人才,其次是硬件与系统工程人才。别看着 460% 的涨幅就冲进去背 VLA 八股。转行者更现实的入口是数据侧(遥操作采集、多模态标注与质检)与应用部署侧——正是人社部新职业写明的活儿,也是今天 #3 的地盘。