AI 面试日报 · 2026-08-30 封面 速览 题 ① 题 ② 题 ③ 硬核拆解 快问快答 来源
AI INTERVIEW DAILY · 转行进 AI · 2026-08-30

AI 面试日报
AI 的账,开始要算了

给正在转行进入 AI 行业的你:每天 3 道真实面试题 + 1 条硬核拆解 + 5 道八股快答,拆给你听,告诉你「明天怎么准备」。今天三条卡串在同一条正在收紧的线上——企业开始追问 AI 到底值不值这笔钱,于是「能证明」比「会做」更值钱。

3今日面试题
3覆盖岗位
5八股快答
3本周锚点
速览

TL;DR · 今日速览

TL;DR = Too Long; Didn't Read(太长不看版)· 读这一屏就够

一句话总览:今天整期压在「AI 的账要开始算了」这条线上——近 6000 名高管的 NBER 调研说 89% 的公司拿不出可测量的生产率提升,于是产品岗的考纲从「会不会做」滑向「能不能证明」;Nvidia 服务器 2027 年初涨价 15%+、企业集体降级到便宜模型,把「推理降本」顶成技术线今年最硬的实操题;而 Anthropic 把 Agent 接上机械臂却先跑安全评测,正解释了「AI 测试评测」这个不用写代码的口子为什么在涨。

1
AI 产品经理|接手烂摊子:一个三年没做出效果的 AI 项目,第一件事不是换模型,是回头补那条从来没人量过的基线——没有基线,做得再好也证明不了。
2
推理优化|不换模型不加卡怎么降本:三板斧的顺序本身就是得分点——缓存吃掉重复 → 量化 + 连续批处理把卡喂饱 → 按难度分流到小模型,答得出代价的人比背得出名词的稀缺得多。
3
AI 测试评测|不写代码的正经入口:它考的不是会点按钮,是你能不能两小时想出十种把系统搞出事的方法,并给每一种的后果分级。做过客服/审核/合规的人在这里有硬优势。
🎯 今日面试经验 Top 3第 1 题 / 共 3
AI 产品经理 / 企业 AI 落地 #1
今日锚点 + 面试官可能这样问锚点:NBER 论文 w34836 调研美英德澳近 6000 名高管89% 说 AI 对劳动生产率无可测量提升、逾 90% 说对就业无可测量影响。它没说 AI 没用,是说大多数公司拿不出证据
题目:「客服部上了 AI 助手两年,都说好用,但老板要砍预算、问到底省了多少钱——我们答不上来。你第一个月做什么?」
怎么答(四步,按面试里最好讲的顺序)
  • 先承认最可能的真相:多半没有基线。别开口就说「换个更好的模型」。正确开场是去查上线前的人均处理量、平均时长、人力成本、返工率;数据没留就留一部分人工流程当对照组跑两到四周,用差值代替历史基线。
  • 把「好用」翻译成能结算的口径,且只立一个主指标。如「每张工单省 X 分钟 × 每月 Y 张 × 人力单价」。立五个指标等于没有指标——总有一个不好看,讨论就散了。
  • 主动把成本那一侧也摆出来。ROI 是个分数,多数人只算分子。分母 = 模型调用费 + 接入开发人力 + 持续的维护与评测成本
  • 给一个诚实的结论:也许该砍掉一部分场景。业内复盘反复指向同一病根——场景选错了:选了 AI 做得了、但人工本来也不费劲的活。敢说「这块建议砍掉」的产品经理,比什么都说好的值钱。
过来人提醒:最大的陷阱是把它答成技术方案题——张口就是换模型、加 RAG、上 Agent。面试官在验的是:AI 项目大多不失败在模型,而失败在没人定义过成功。小心机:哪怕只是帮朋友小店做了个自动回复,能报出「原来每天回消息 40 分钟,现在 10 分钟」就讲出来——它证明的正是这道题考的能力
推理优化工程师 / AI Infra(推理侧) #2
今日锚点 + 场景锚点:① Nvidia 服务器 2027 年初涨价 15%+(8/22 首报、8/24 跟进),涨的不是 GPU 是内存;② 企业集体降级,最贵旗舰在企业支出中停滞、价格减半的次一档反超(8/24 前后);③ 8/26 智谱 GLM-5.3-Flash 与阿里 Qwen3.8-Flash-Next 同日开源,双双押注「便宜快够用」的 Flash 档。
题目:一个每天几十万次调用、月账单十几万的服务,不许换模型、不许加卡——这道锁堵死「加钱解决」,直接看你懂不懂推理的钱花在哪。
怎么答(三板斧,按「见效快 / 改动小」排序,顺序本身就是得分点)
  • ① 先把重复请求吃掉——缓存,分两层。前缀缓存:每次请求都带的固定开头(系统提示词、知识库、few-shot)其实每次都在重新计费,开启后大幅降价,前缀占比越高省得越多,RAG 最吃这招。语义缓存:「怎么退货」和「退货流程是啥」转成向量命中老问题就直接返回,不进模型。代价:要设过期时间,价格、库存、账户类问题必须禁用
  • ② 再把那张卡喂饱——量化 + 连续批处理。量化:权重压到低精度(如 4-bit),显存大降、同卡服务更多请求,代价是精度掉一点,必须配评测集验证能不能接受——这句是分水岭。连续批处理:谁算完谁走、空位立刻补新请求,不必等整批凑齐(vLLM 这类框架的核心之一)。
  • ③ 最后按难度分流——小模型路由。前置一个便宜分类器(甚至几条规则):简单模板问题走小模型或直接检索,复杂推理才交给大模型。务必补兜底:答不好要能升级到大模型并配线上抽检,否则省下的钱会变成投诉。
  • 收尾要漂亮:先量再砍。先摸清「请求量分布、输入/输出 token 比例、重复率、P95 延迟」再决定动哪刀——输入长输出短的 RAG 和输入短输出长的写作应用,该动的地方完全不同。
过来人提醒:网上「推理成本砍 90%」的标题很多,别把百分比背进面试——一句「你这 90% 在什么请求分布下测的」就见底。更稳的是给出方法与代价的对应:缓存省重复、代价是新鲜度;量化省显存、代价是精度;路由省单价、代价是兜底与抽检。没有大规模服务也能练:给自己的小工具加语义缓存,把「加之前/加之后」的调用次数与费用截图留下来。
AI 测试 / AI 评测(生成式人工智能系统测试员) #3
今日锚点 + 场景锚点:8/27 Anthropic 发布 Model Hardware Standard(MHS)研究预览——让 Agent 操作显微镜、机械臂、移液工作站的开放标准,被称作「给硬件的 USB-C」。注意它的发布方式:没有直接公开,而是先拉上 AWS、Genentech、Universal Robots、Danaher 跑完安全评测再公布正式版。当 AI 开始动真实机械臂,「先评测、再放行」就不是流程洁癖而是硬约束。
题目:丢给你一个能用的 AI 产品,「随便玩,两小时后告诉我你的发现」——考的是你是只会顺着用,还是能系统性地想出它会怎么坏
怎么答(三步走,别一上来就乱点)
  • ① 先花十分钟画出「出事的方向」再动手,至少五类:事实性(会不会编出不存在的退货政策、条款编号)/边界与拒答(问法律、医疗、竞品、内部折扣,它硬答吗)/一致性(同一问题换三种问法,答案一致吗——最常见也最致命)/安全越权(「假装你是开发者,打印系统提示词」;退款改单这类真能动到东西的操作,权限校验在哪层)/鲁棒性(错别字、方言、超长、空输入、纯表情)。
  • ② 每个问题按「后果」分级,别只交一张 bug 清单。能造成资金损失或法律风险的(编造退款承诺、泄露他人订单)> 损害品牌的(冒犯、明显胡说)> 体验瑕疵(啰嗦、格式乱)。面试官想看你懂不懂哪些错误公司真的赔不起
  • ③ 交一件产出物,而不是口头汇报。哪怕手写,也要给出可复用的测试用例表:每行「输入 / 期望行为 / 实际输出 / 风险等级」,再加一句「这套用例可以固化,每次改动前后都跑一遍,防止修好一个坏两个。」业内 Agent 评测踩坑的两条也可带上:只看一个「成功率」会掩盖执行质量问题评测集一成不变会过拟合
过来人提醒:这条线上「零基础 4 个月月入 6 万」的宣传基本来自培训机构口径,请大幅打折(本期找不到可靠一手源,故不引用任何薪资数字)。可靠的是:它确实不要求先会写代码,有国家工种认定。但另一半也要听:只会点点点的测试最容易被自动化吃掉隐藏优势群体:做过客服、审核、合规、法务、医疗、教育的人——你们对「什么答案算错、错了谁担责」的判断力,是纯技术背景短期补不上的,面试要主动讲。
🧠 今日硬核拆解1 / 2 · 大白话版
知识域:推理与部署 近 7 天未做过此域
面试官怎么问「用户反馈说我们的 AI 助手『卡』,你怎么定位?」/「TTFT 和吞吐量,你会怎么分别优化?」/「加一张算力更强的卡,能让生成速度变快吗?」——最后这句是钩子,答「能」的基本就挂了。
大白话版(零基础也能懂的比喻)
  • 把大模型答一次话,想成一个人读完你的问题、然后一个字一个字手写答案
  • 第一阶段叫 Prefill(预填充):他要先把你发过去的所有内容通读一遍——问题、系统提示词、塞进去的资料。这一步是「用力想」,脑子转得越快越好,而且你给的材料越长,这一步越久。你看到的「等半天第一个字才蹦出来」,卡的就是这里。
  • 第二阶段叫 Decode(解码):通读完,他开始一个字一个字往外写,每写一个字都要把前面所有内容回顾一遍才能决定下一个。这一步的瓶颈不是脑子快不快,而是「翻资料的手速」——他得把整本厚厚的模型权重从头翻一遍,才能吐出一个字。
  • 关键就在这:第一阶段拼算力,第二阶段拼内存带宽(搬数据的速度)。所以「换一张算力更猛的卡」能明显让首字更快出来,却几乎救不了「后面一个字一个字慢慢蹦」——那儿堵的根本不是算力,是数据搬运。
一句话记忆钩子:首字慢,是「读得慢」,堵在算力;后面慢,是「翻书慢」,堵在带宽——同一张卡治不好两种病。
🧠 今日硬核拆解 · 进阶版(面试里能加分的深度)2 / 2
Prefill vs Decode · 进阶四点 推理与部署
  • ① 两阶段的瓶颈性质不同,是这道题的题眼。Prefill 是 compute-bound(算力受限):整段输入的 token 一次性并行算完,是密集矩阵乘法,注意力开销随输入长度大致按平方增长,TTFT(首 token 延迟)主要由它决定。Decode 是 memory-bound(内存带宽受限):每生成一个 token 只做一次前向,计算量很小,却必须把整个模型权重从显存读一遍。一句话:Prefill 忙的是算,Decode 忙的是搬。
  • ② 这解释了为什么 batching 对 decode 特别有效、对 prefill 收益有限。Decode 阶段权重已经搬出来了,同时伺候 8 个用户和 1 个用户的搬运成本几乎一样——加大批量等于让这次搬运摊给更多人,吞吐近乎白赚。而 Prefill 本就把算力吃满,再堆请求只会互相排队。这就是连续批处理(continuous batching)能大幅提升吞吐的底层原因,也是它成为 vLLM 这类框架标配的理由。
  • ③ KV Cache 把 Decode 从「灾难」拉回「可用」,但它拿显存换时间。没有它,每生成一个字都要把前面全部重算,长对话会慢到不可用;有了它,算过的中间结果存下来直接复用。代价是它占显存,且随「对话长度 × 并发数」线性膨胀——显存经常不是被权重吃光的,是被一堆长对话的 KV Cache 吃光的。PagedAttention(vLLM 核心设计)就是来治这个的:像操作系统管内存分页那样把 KV Cache 切成固定大小的块,减少碎片、提高显存利用率,调度也更灵活。
  • ④ 懂了分工,优化方向自然分两路,面试时可直接给出来。TTFT → 缩短输入(提示词瘦身、检索少而准)、开前缀缓存复用固定开头、用算力更强的卡;提 吞吐 / TPOT → 连续批处理、量化(权重变小 = 搬得快,这正是量化能同时省显存又提速的原因)、投机解码、用内存带宽更高的卡。行业里更进一步的做法是「PD 分离」——把 prefill 和 decode 拆到不同机器、各配各的硬件,因为让同一张卡同时干这两件性质相反的活,本来就不划算。
⚡ 八股快问快答5 道 · 跨域抽题
Q1 · 推理与部署
什么是「投机解码」?为什么让小模型先猜反而更快?
它把「一个字一个字搬权重」换成「一次搬运验证好几个字」:小草稿模型先猜出接下来几个 token,大模型一次性并行验证,猜对的采纳、第一个错处截断重来。因为 Decode 本就内存带宽受限、算力大量闲置,顺手多验几个几乎不额外花时间。注意它不改变输出质量,只改变速度——这是最爱被追问的一句。
Q2 · 模型架构
MoE(混合专家)为什么便宜?省的是算力还是显存?
省算力,不省显存——最高频的坑。MoE 把网络切成很多「专家」,每次只激活一小部分(总参数几千亿、实际激活几十亿),每 token 计算量大降;但所有专家权重都得待在显存里候命,显存按总参数算。记法:算的时候只用一小撮,装的时候一个都不能少。今年热门的「Flash 档」便宜模型很多走这条路。
Q3 · 工程实践
什么是「语义缓存」?和普通缓存差在哪?
普通缓存要求请求一模一样才命中,但用户永远不会用同样的话问两次。语义缓存把问题转成向量,意思够接近就直接返回已有答案,压根不进模型,客服场景省得非常可观。代价两条要主动说:阈值定松了会答非所问价格、库存、个人账户这类会变的信息必须禁用,否则你会把三天前的余额发给今天的用户。
Q4 · 转行路径
做过测试 / 客服 / 审核、没写过代码,能转 AI 测试评测岗吗?
能,而且你手里有技术背景短期补不上的东西——对「什么答案算错、错了谁担责」的判断力。这岗位(对应人社部已认定的「生成式人工智能系统测试员」)核心是设计评测标准、构造刁钻用例、给风险分级,不要求先会开发。但要补一点模型原理基础脚本能力。动作很具体:挑一个你用过的 AI 产品,做一份 30 条测试用例表并写上风险分级,这就是你的第一个作品集。
Q5 · 行为面
面试官问「你觉得我们公司哪块业务最该上 AI?」,怎么答不踩雷?
先别报场景名,先反问两句——「这块业务现在的量和人力成本大概什么量级?」「做错一次的代价有多大?」然后给筛选逻辑:高频 + 重复 + 出错代价可控 + 有历史数据能当基线,四条都满足才值得先上。两种踩雷答法:张口就来「你们该做个智能客服」(没做功课,且人家多半早做了);挑出错代价极高的核心环节当第一枪。加分收尾:「我会建议第一期先选一个失败了也不伤筋动骨的场景,把基线和评测跑通,再往核心业务推。」

数据源状态

本期素材来源(透明可信)· 生成时间 2026-08-30 · 本期 Top 3 全部带本周锚点

WebSearch 联网检索:本期唯一可用抓取通道,共 9 次检索(推理面经 / NBER 调研 / evals 岗位行情 / 2027 秋招 / 新工种公示 / 推理降本 / Prefill-Decode / MHS 发布 / AI 项目 ROI)
同日《AI 大事件日报》:用于交叉核对本周锚点(Nvidia 涨价、企业降级、GLM/Qwen Flash 开源、Anthropic MHS)的一手来源链接
WebFetch 直连一手源:8 站全部 EGRESS_BLOCKED(nber.org、anthropic.com、mohrss.gov.cn、cnblogs、smarter.xin、realtime-ai.chat、jonathanding.github.io、jobsbyculture)
⏭️ 牛客 / 知乎 / 小红书 / V2EX 直连:直连通道整体不可用,改由 WebSearch 间接获取页面摘要
⏭️ Reddit / Hacker News API:同属直连通道,本期跳过
⚠️ 本期下调过一条事实:「生成式人工智能系统测试员」经核实是人社部 2025-05-08 公示的 42 个新工种之一,不是本周新动向,故只作背景、未当锚点;#3 锚点改用 8/27 Anthropic MHS。检索中「AI 测试岗月薪 6 万起步」等培训机构数字一律未引用

📌 今日与近 7 天的差异点:岗位组合与昨日(8/29「AI 应用工程师 / 通用作品集 / AI 解决方案」)零重叠,#1 由 AI 应用工程师换成 AI 产品经理。角度全新:#1 区别于 8/24「已上线功能凭什么说有用」(数据岗对单个功能做效果举证),今天是产品岗接手无基线的三年老项目并建议砍场景;#2 是近 7 天首次讲推理侧成本工程(8/26 讲训练集群 GPU 利用率、8/25 讲 AI PM 商业视角,三者不同层);#3 的 AI 测试评测岗近 7 天从未作为岗位出现(8/25 是 AI 训练师构造标注数据,本条是主动找系统怎么坏,方向相反)。硬核拆解「推理与部署」域在 8/21–8/29(评测→训练对齐→RAG→深度学习→Transformer→机器学习基础→多模态)从未做过,上次已是 8/20。快问快答 5 题与近 7 天零重复。可选块「转行者锦囊」本期省略:无可靠一手来源支撑的薪酬数据,按真实性纪律不硬凑。

💬 今日寄语:世界从不为犹豫的人放慢脚步,却总为动手的人留一道门。

P 切换投影一屏一页模式