AI 面试日报 · 2026-08-20 封面 速览 题 ① 题 ② 题 ③ 硬核 快问 锦囊 来源
AI INTERVIEW DAILY · 转行进 AI · 2026-08-20

AI 面试日报
机器人在台上,账单在台下

世界机器人大会正在北京开(今天是采购日)、宇树上市首日涨了 460%——今天整期压在算力这一侧:AI Infra 岗那道一问就见底的容量与成本估算题、具身智能岗暴涨 15 倍之后的第一道筛子「VLA 比 VLM 多出来的那个『动作』难在哪」、以及门槛最低那条线里最容易被答成吵架的一题。硬核拆解换到近半个月从未讲过的推理与部署域。

3今日面试题
2覆盖岗位线
5快问快答
58第 58 期
速览

TL;DR · 今日速览

TL;DR = Too Long; Didn't Read(太长不看版)· 读这一屏就够

一句话总览:借 世界机器人大会 8/19–23 在北京开幕(今天 8/20 是「采购日」)宇树科技 8/19 上市首日暴涨 460.34%、市值 3418 亿 这个正在发生的由头,讲三条实战:AI Infra 岗的容量与成本估算题、具身智能岗的「VLA 难在哪」、以及数据标注线上最容易答成吵架的「同一条回答你打 3 分我打 5 分」。硬核拆解换到推理与部署域——投机解码为什么能白捡两三倍速度,还敢说不掉质量。

1
AI Infra / 推理优化|估算题:面试官不核对你的数字,只核对你有没有口径——不问清输入/输出长度、峰值还是均值、TTFT 要求就报「4 张卡」的当场出局;并发的真正天花板通常是 KV Cache 显存,不是模型权重。
2
具身智能 / VLA|第一道筛子:VLA 比 VLM 多出来的不是一个模态,而是一个会产生真实后果、且撤不回来的输出空间——说错一句话可以重说,机械臂打碎的杯子拼不回去。薪资最亮,但也最不适合零基础速成。
3
AI 训练师 / 数据标注|分歧题:正确答案不是「谁对」,是规则没定义清楚——拆成有用/真实/无害三维打分、冲突时安全一票否决,再把争议 case 回流成规则补丁。一致性靠规则迭代,不靠标注员素质。
🎯 今日面试经验 Top 3第 1 题 / 共 3
AI Infra / 推理优化工程师 #1
今日锚点 + 面试官怎么问锚点:算力这笔账本周正在被公开追问——据证券文件,英伟达为 OpenAI 俄亥俄数据中心的融资担保最终定在最高 1050 亿美元,而此前传闻高达 2500 亿,Fortune 直接把这 1450 亿的缩水解读为「对芯片虚假需求的担忧」。上游被追问「这些算力真有人用吗」,下游的传导极直接:「你会不会算这笔账」从加分题变成必答题问法:「7B/14B 模型上线做客服、预计 500 人同时在线,要多少卡?成本多少?」→ 显存卡在哪?延迟和吞吐怎么取舍?还能怎么降本?
怎么答(4 点,第 1 点是分水岭)
  • 先别报数字,先把口径问回去。四件事:平均输入/输出多长(token 数)、500 是峰值并发还是日活(差一个数量级)、对首字延迟(TTFT,按下回车到看见第一个字)有无要求、能否接受排队。然后把请求拆两段:Prefill(读题)一次性算完输入,算力密集;Decode(写字)一个字一个字吐,访存密集。两段瓶颈不同,混在一起算必错。
  • 显存账先算,并说清真正的天花板是 KV Cache。显存 ≈ 权重 + KV Cache + 运行时开销。权重固定(FP16 下 7B 约 14GB);KV Cache 随并发与上下文线性膨胀,常用口径 2(K/V)× 层数 × 每层 KV 维度 × 精度字节 × 序列长度 × 并发数。一句话结论:并发上限通常不是被权重卡死的,是被 KV Cache 卡死的——说出这句,面试官就知道你真上线过东西。
  • 再算单位成本,并主动声明它只是量级。公开口径:每千 token 成本 ≈ 1000 ×(参数量 × 2 ÷ 单卡每秒计算次数)× 卡时价——真实利用率远达不到理论峰值,所以给的是量级不是报价单。然后报出降本四把刀continuous batching(连续批处理:请求随到随进、不等整批攒齐,填满卡的空转)、量化(INT8/INT4/FP8,省显存换并发)、前缀/上下文缓存(相同系统提示词只算一次)、投机解码(见今天的硬核拆解)。
  • 最后给「三档方案 + 一个验证办法」,别只给一个数。省钱档(小模型+量化+大批次,牺牲 TTFT)/体验档(大模型+小批次+投机解码,TTFT 优先)/混合档(模型路由,简单请求走小模型)。验证只需一句:压测出「并发—P95 延迟」曲线,找到延迟陡增的拐点,按拐点前的吞吐算容量;并且按峰值算容量、按均值算成本——这是两个数,报成一个就是错的。
过来人提醒:两种典型死法——张口就来「4 张 A100 吧」,一句「输出多长」就崩;或公式背得很熟却说不出「所以我建议怎么做」。面试官要的不是精确值,是你敢不敢在信息不全时给出一个带假设的数,并说清哪个假设错了结论会怎么变。加分句:「我先按这组假设给个量级,压测完再校准。」
具身智能 / VLA 算法工程师 #2
今日锚点 + 面试官怎么问锚点:第 11 届世界机器人大会 8/19–23 正在北京举办,今天 8/20 是「采购日」,本届首发新品破 150 款创历届新高、同期启动「具身智能技能人才培养计划」等 6 项人才计划;开幕前一天宇树科技上市首日收涨 460.34%、市值 3417.72 亿元。招聘侧:具身智能岗位招聘量同比暴涨约 15 倍(AI 整体约 8.7 倍),人形赛道新发职位同比 +215.80%,平均年薪约 40.61 万元;学术侧 VLA 论文在 ICLR 从 2024 年 1 篇 → 2025 年 9 篇 → 2026 年 164 篇问法:简历写了 CLIP/BLIP-2/LLaVA 的人投这条线,必被问「VLA 和 VLM 到底差在哪、难在哪一段」。
怎么答(4 点,第 4 点是大多数人的真实处境)
  • 一句话给出本质差别,别背定义。VLM 的输出是,VLA(Vision-Language-Action)的输出是动作指令——多出来的不是一个模态,而是一个会产生真实物理后果、且撤不回来的输出空间。说错一句话可以重说;机械臂打碎的杯子拼不回去。这一句就把「看过介绍」和「想过工程」分开了。
  • 三个难点,每个都落到工程上。动作怎么表示:连续控制量离散成 action token 交给自回归,还是直接回归输出?控制频率多高?② 数据从哪来:网上有海量图文对,但没有「该怎么动」的数据,真机遥操作采集又贵又慢——这正是人社部拟发布新职业「具身智能机器人应用技术员」职责第一条写多模态交互数据的采集与处理的原因。③ 闭环与延迟:VLM 一次前向就交差,VLA 要在闭环里持续输出,推理慢一点机器人就抖、就撞——推理优化在这条线上不是加分项,是硬需求(接上今天 #1)。
  • 说清评测口径的差别。VLM 看基准分,VLA 看任务成功率与泛化——换个物体、换个光照、换个摆位还成不成?且必须在真机或高保真仿真里验证,仿真到真机的差距(sim-to-real gap)本身就是常考点。能说出「我先定义什么算成功、再定义换哪些条件测泛化」的人,明显靠前。
  • 没碰过真机怎么答:别装。诚实说没有真机经验,然后把可迁移的部分讲实——多模态对齐、数据管线与质检、评测集设计、推理延迟优化,这四样在 VLA 里一样吃紧。再给一个能马上做的动作:在开源仿真环境里跑通一个公开 VLA 基线,做「换了物体还成不成」的小对照实验,把成功率曲线放进作品集。一个能复现、能对照的小实验,胜过背十页综述。
过来人提醒(对转行者的诚实判断):这条线薪资最亮(赛道平均月薪从 5.9 万涨到 6.2 万的口径),但也是门槛最高、最不适合零基础速成的一条——第一大缺口是算法人才,其次是硬件与系统工程人才。别看着 460% 的涨幅就冲进去背 VLA 八股。转行者更现实的入口是数据侧(遥操作采集、多模态标注与质检)与应用部署侧——正是人社部新职业写明的活儿,也是今天 #3 的地盘。
AI 训练师 / 数据标注 #3
今日锚点 + 面试官怎么问锚点:接着 #2 的势头——具身智能这波扩张里,涨得最凶的是算法岗,但真正在批量开、且不卡学历专业的是数据采集与标注这一层(人社部新职业「具身智能机器人应用技术员」第一项职责就是多模态交互数据的采集与处理)。机器人大会这一周对普通转行者最实际的机会,不在展台上的人形机器人,而在它身后那条要靠人喂的数据线。问法:「你和另一位标注员对同一批模型回答打分,分歧很大,问题出在哪、怎么处理?」有的公司会直接给两条回答让你当场打分并说理由。
怎么答(4 点,第 1 点是题眼)
  • 第一反应不能是「我觉得我对」——题眼是「规则没定义清楚」。分歧的默认归因应该是标注规范缺少可判定的锚点,而不是某个人水平差。这一句答出来整道题就赢了一半;反过来,一上来论证自己那条为什么该给 3 分的人,基本答偏了。
  • 拆维度打分,别打整体印象分。通用三维:有用性(有没有真解决问题)、真实性(有没有编、有没有可核实依据)、无害性(会不会造成伤害)。主动说出冲突时的优先级:无害 > 真实 > 有用,安全一票否决——一条又漂亮又好用但有害的回答不是 4 分,是不合格。每个维度都要有可判定锚点(如「出现无法核实的具体数字即扣真实性」),两个人才可能打出同一个分。
  • 给出质控机制,而不是只给态度。多人交叉标注(同一批多人独立标,多数决或仲裁定案)+ 一致性度量 + 定期抽检;关键一步是把争议 case 回流成「规则补丁」写进下一版手册。一致性是靠规则迭代出来的,不是靠标注员素质自然长出来的——这是这道题的高分句。
  • 说清边界 case 怎么办。拿不准的不要硬打:走「存疑标记 → 升级仲裁 → 沉淀为规则」。能当场举例最锁定,比如:「用户问医疗建议,模型回答正确但没提示就医,该扣有用性还是无害性?我会写一条规则补丁:涉健康类问题缺少免责与转介提示,统一按无害性扣分。」
过来人提醒:这行最先被淘汰的不是「打得慢的人」,而是「打得快但和别人对不齐的人」——返工和仲裁的成本远高于慢一点。想往上走(高阶训练师、评测、规则设计),最有力的证据是「我写过或改过标注规则」「我把一致性从多少提到了多少」,而不是「我标了多少条」。
🧠 今日硬核拆解1 / 2 · 大白话版
知识域:推理与部署 考点提炼
为什么今天讲这个域 + 面试官怎么问由头:今天 #1 那道容量题里,「降本四把刀」的最后一把就是它;而 2026 的推理岗面试,纯八股比重在降、机制题比重在升。问法:「投机解码怎么加速的?」→「它会不会让模型输出变差?」→「什么情况下用了反而不划算?」——第二问是筛子,八成候选人会答错。
大白话版答案(零基础也能懂)
  • 想象大模型在答卷子,一个字一个字地写,慢。投机解码的做法是配一个写得飞快的小助手,让它先把接下来的几个字猜着写出来
  • 大模型不用自己写了,只需要「一眼扫过去核对」。而「核对好几个字」可以一次并行做完,比「一个字一个字写」快得多——这就是速度的来源。
  • 猜对的部分直接白赚;从猜错的那个字开始,大模型自己接手重写。所以小助手猜得越准,省下的时间越多。
  • 关键的一句:最终交上去的答案,仍然是大模型自己认可的那份。这也是它和「干脆直接换个小模型」的本质区别——后者是拿质量换速度,它不是。
先记住这条主干:小模型抢答 → 大模型批卷 → 对的留下、错的从那里重写。下一页四个进阶点全挂在这条主干上——面试里能把主干一口说全,已经比大多数候选人清楚。
🧠 今日硬核拆解2 / 2 · 进阶版
推理与部署 · 面试里能加分的深度 进阶
进阶版答案(4 点,第 2 点是这题真正的分水岭)
  • 省的是访存,不是算力。自回归的 Decode 阶段是典型的 memory-bound(访存受限):每吐一个 token 都要把模型权重从显存搬一遍,这一步的算力大量闲置。一次验证多个候选 token,等于把同一次权重搬运摊薄到好几个 token 上——闲置算力被用起来了。说得出「memory-bound → 摊薄访存」这条因果链,比说「并行所以快」高一个段位。
  • ⭐ 为什么敢说质量不变(最容易答错的一句)。它用的是一套接受-修正(拒绝采样式)规则:草稿 token 按一定概率被接受,被拒时从修正后的分布重新采样。这套规则可以证明其采样过程与目标模型逐 token 采样等价,即理论上输出分布不变。答成「小模型顶上去所以稍微差一点」,这道题就废了。
  • 关键指标是接受率 α。接受率取决于草稿模型和目标模型有多「像」;加速比随接受率与草稿长度上升,但草稿越长、一旦被拒浪费越多,因此存在最优草稿长度。公开资料给出的加速区间大致 2–6.5 倍,实际落地常见 2–3 倍量级,强依赖任务分布。
  • 什么时候不划算(答得出就赢了)。接受率太低——草稿模型太弱或领域差异大(目标是代码、草稿只见过通用文本),验证开销吃掉收益;② batch 很大时收益缩水——大批次下服务已接近 compute-bound(算力受限),没那么多闲置算力可捡;③ 草稿模型自己占显存,挤压 KV Cache、压低并发上限(正好接上 #1 那笔显存账)。演进方向是自投机(Medusa / EAGLE 这类用同一模型加几个轻量头出草稿),省掉额外模型。
一句话记忆钩子:小模型抢答,大模型批卷;抢得准才省时间,交上去的仍是大模型的答案。
补一个高频追问:它和量化、continuous batching 不是一回事——量化省的是显存(换更高并发)、continuous batching 提的是卡的利用率(换更高吞吐)、投机解码砍的是单条请求的生成延迟。三者可以叠加,但能说清各自砍的是哪一刀,比把名词全背出来有用得多。
⚡ 八股快问快答5 道 · 跨域抽题
  • Q:向量数据库和普通数据库到底差在哪?为什么做 AI 应用绕不开它?
    A:普通数据库擅长精确匹配(找 id=123、名字等于张三的行),向量数据库擅长意思相近——它存的是文本/图片被模型转成的一串数字(向量),查询时找距离最近的那些。RAG 的检索层就靠它。面试常追一句:它返回的是「相似的」,不保证是「对的」,所以后面往往还要加重排与引用校验。
  • Q:什么是 Prompt Caching(提示词/上下文缓存)?为什么能同时省钱又提速?
    A:把请求里重复不变的那一段前缀(系统提示词、长文档、few-shot 例子)算过的中间结果缓存下来,命中就不必重算。省的是 Prefill 阶段的算力,所以首字延迟明显下降,命中部分的计费通常也远低于正常输入价。用好它的关键是把不变的放最前面、变动的放最后——顺序一变,缓存整段失效。
  • Q:最近常听的「世界模型」和大语言模型是什么关系?
    A:大语言模型学的是「下一个词最可能是什么」,世界模型学的是「这个世界下一刻会变成什么样」——给定当前画面和一个动作,预测接下来会发生什么。它是机器人、自动驾驶这类需要「先在脑子里试一遍再动手」的场景的基础能力。和今天 #2 的关系可以这么说:世界模型负责预演后果,VLA 负责输出动作。
  • Q:面试要「手撕 Attention」,我写不全怎么办?
    A:先写骨架、边写边讲:QK^T → 除以 √d_k → mask → softmax → 乘 V卡住时主动说出你知道但没写的部分(「多头就是把这套在若干子空间各做一遍再拼回去」「因果 mask 保证第 t 个位置看不到未来」)。面试官考的是你是否理解每一步为什么存在——能解释「为什么要除以 √d_k」(防止点积过大把 softmax 推进梯度极小的饱和区),往往比默写完整代码更能拿分。
  • Q:怎么判断一家公司的 AI 岗是真在做,还是蹭热点凑编制?
    A:反问三个问题就够:① 「这个岗位现在线上有在跑的 AI 功能吗?用户量大概多少?」(有没有真实流量);② 「效果好不好,你们看什么指标?谁来定?」(有没有评测体系,没有多半还在 demo 阶段);③ 「上一个做这个岗位的人现在在做什么?」(团队稳定度与晋升通道)。三个都答得含糊的,大概率是跟风开的坑。
🧭 转行者锦囊 · 给在职后端 / 运维 / 测试:AI Infra 是目前最短的一条转型路
① 你的存量能力比你以为的值钱
这条线的日常是服务化、压测、容量规划、监控告警、成本核算——后端和 SRE 每天都在干的事。要补的不是从头学算法,而是三样:推理框架(PagedAttention / continuous batching / prefix caching)、显存与吞吐的账(今天 #1 那套口径)、加速手段的取舍(量化与投机解码的适用边界)。
② 最快的可交付物是一份压测报告,不是一张证书
在一张消费级显卡或按小时租的云卡上把开源模型跑起来,做三组对照:开/关 continuous batching量化前/后不同并发下的 P95 延迟曲线,把「并发—延迟—单位成本」三条线画出来。这份东西在面试里能直接顶掉半小时八股——它证明的是「我算过、也压过」。
③ 别只盯大厂的推理岗——按 JD 关键词投,别按岗位名投
需求量更大、门槛更现实的,是各类做 AI 应用落地的公司里的「模型服务」职责:岗位名可能叫 AI 应用工程师、后端工程师(AI 方向)、平台工程师,JD 里出现「推理优化 / 降本 / 高并发」字样的都是。这条线的 title 目前还没标准化,只按名字筛会漏掉大半。转型路径部分属考点提炼,可结合自身背景取用。

数据源状态

本期素材来源(透明可信)· 第 58 期 · 生成于 2026-08-20 北京时间上午
真实性说明:三张题卡、硬核拆解与锦囊均基于公开报道、公开题库与公开技术资料归纳,未编造任何面试官原话或个人面试经历——本期无一条声称来自某人的真实面经;数字均标注出处与口径(赛道平均口径 / 论文投稿量口径 / 成本公式只给量级)。#3 的三维评分口径、#1 的答题结构与锦囊的转型路径属考点提炼

WebSearch 中英双语 7 轮(本期唯一可用抓取通道)
世界机器人大会官网 / 北京市科委(锚点一)
本仓同日《AI 大事件》(宇树 +460.34%、英伟达 1050 亿)
钛媒体 / 凤凰网 · 具身赛道薪酬与招聘增速
中国就业网 · 人社部 12 个新职业公示(7-03 公示,非本周新事)
⚠️ 牛客 / 知乎 / 阿里云 / 火山引擎 / 百度(摘要可达,正文未取)
⚠️ 内推鸭 / CSDN · 标注一致性题库(摘要可达)
WebFetch 正文:smarter.xin / cnblogs / zhihu / aliyun / hn.algolia(EGRESS_BLOCKED)
牛客 / 小红书 / BOSS 直聘正文(云端出口 IP 反爬,长期已知)
📌 今日与近 7 天的差异点:岗位组合——「AI Infra / 推理优化 + 具身智能 / VLA + AI 训练师 / 数据标注」,前两个岗位近 7 天从未出现过,与昨日(AI PM / AI 应用·Agent / AI 解决方案)三条全不重合,昨日 #1 的 AI PM 今日未占任何位次;题目角度——#1「容量与单位成本估算」近 7 天空白(8-19 #3 讲的是给客户算项目 ROI,不涉及显存/吞吐/卡数),#2 与 8-19 多模态硬核(讲一张图怎么被看懂)无重叠,#3 与 8-16 那张训练师卡角度不同(那张讲涨到 2 万的能力门槛,今天讲评分规则与质控);知识域——推理与部署,近 7 天(RAG / 训练对齐 / Agent / 深度学习 / Transformer / AI 安全 / 多模态)均未做过,且与 #1 刻意错开(#1 是工程估算,硬核是机制原理);今日锚点两个——① 世界机器人大会 8/19–23(今天是采购日)+ 宇树 8/19 上市首日 +460.34%,② 英伟达兜底 1050 亿、比传闻缩水 1450 亿(8/17–18);快问快答 5 题全新
P 切换投影一屏一页模式