AI 面试日报 · 2026-09-03 封面 速览 题 ① 题 ② 题 ③ 硬核拆解 快问快答 锦囊 来源
AI INTERVIEW DAILY · 转行进 AI · 2026-09-03

AI 面试日报
做得出来变便宜了

今天三条卡压在同一句话上:「做得出来」正在变便宜,「管得住」才开始值钱。9/2 fal 发布 H3 Max,5 秒 768p 视频生成不到 3 秒——比实时还快,AIGC 运营的考题跟着换了问法;同一天 Gemini 3.8 Flash 落地,四个月第四款 Flash、距上一版仅三周,技术线长出一道很硬的实操题;Anthropic 的 Enterprise Frontier Safeguards 把监控日志放进客户自己的云,售前那句「数据不能出域」终于有了第三种答法。

3今日面试题
3今日锚点
5快问快答
70第 70 期
速览

TL;DR · 今日速览

TL;DR = Too Long; Didn't Read(太长不看版)· 读这一屏就够

一句话总览:今天整期讲「生成变便宜之后,人靠什么值钱」——应用线讲生成趋近零成本后,内容产线的瓶颈会迁移到哪儿;技术线讲模型三周换一代时,你凭什么保证升级不翻车;交付侧讲客户说「数据不能出域」时,怎么把它拆成四类、给出三档方案。三条线一次集齐。

1
AIGC 运营|考题从「产多少」变成「产十倍后怎么不翻车」:生成不再是瓶颈,瓶颈迁到选题供给人工把关。要盯的是一次过审率 / 返工率 / 单条「可用」成本——十条只能用三条,真实成本就是三倍。
2
模型版本治理|生产环境一律写死版本号:别名会让厂商替你换代且事后无法复现。靠「金标集 + 回归跑 + 影子流量 + 一键回滚」接住它;最常见的翻车不是变笨,是输出格式变了、话变多了导致成本翻倍
3
AI 解决方案|别脱口而出「那就私有化部署」:先问清「数据」指的是业务数据 / 训练数据 / 监控日志 / 模型权重哪一类——多数客户卡的是前三类。问清这一句,你就从「销售」变成了「顾问」。
🎯 今日面试经验 Top 3第 1 题 / 共 3
AIGC 运营 / AI 内容运营 #1 · 锚点 9/2
面试官可能这样问「做一条 15 秒短视频全流程要多久?如果生成环节的耗时接近 0,你这条产线的瓶颈会跑到哪儿去?」/场景版:「账号矩阵日更从 10 条提到 100 条,人力预算都不变,你怎么排?」今日锚点:9/2 fal 发布 H3 Max(基于开源权重 MiniMax H3 后训练 + 专用推理引擎)——5 秒 768p 视频生成不到 3 秒(比实时还快),吞吐约为官方 H3 端点 35 倍、同画质方案平均快约 15 倍,人类偏好评测在质量/提示词遵循/美感三项均列第一。
怎么答(四步,按序说)
  • 先拆产线,指出瓶颈迁移:一条内容 = 选题脚本 → 生成 → 审核合规发布。生成从几分钟压到几秒后,能不能日更 100 条,取决于上游你有没有 100 个值得做的选题下游你能不能当天把 100 条都看一遍。说出这句,你就站在了运营负责人的位置,而不是工具使用者。
  • 把核心指标从「产量」换成「一次过审率」和「单条可用成本」——这是题眼:单条生成成本 ≠ 单条可用成本。十条里只有三条能用,真实成本是生成成本的三倍多,还要加三倍人工筛选。能说出「我把一次过审率从 3 成提到 6 成,等于产能翻倍而预算没变」,面试几乎不会被问倒。
  • 给出三道护栏,说得具体:一致性——人物形象、品牌色、口播音色跨条不漂,靠固定参考图/参考音 + 统一提示词模板;② 合规——AI 内容标识与各平台规则要有一步机器校验,不靠人记;③ 调性——抖音/小红书/视频号开头三秒逻辑不同,同素材要有差异化二剪规则,不是一稿全平台分发。
  • 落回你自己做过的事,带一个量化:个人账号也算。「我把某类内容从每条 X 小时压到 Y 分钟,同期一次过审率从 A 到 B,代价是我要多花 Z 分钟筛选。」——有代价的数字,比只报好消息的数字可信十倍。
过来人提醒:别把「熟练使用 XX 工具」当卖点——工具三个月换一批,这句话的保质期比简历还短。真正留下印象的是一份别人照着能跑的 SOP,和一个失败案例的复盘(哪条翻了车、怎么发现的、之后加了哪道检查)。
AI 应用工程师 / LLMOps · 模型版本治理 #2 · 锚点 9/2
面试官可能这样问「供应商下个月要下线我们在用的版本、推荐升级,你怎么安排?」/场景版:「上周产品说 AI 回答变奇怪了,但我们代码一行没动。你从哪儿开始查?」今日锚点:9/2 Google DeepMind 发布 Gemini 3.8 Flash——四个月内第四款 Flash 档位模型,距 8 月中的 3.7 Flash 仅约三周;定价 $0.75/百万输入 token、$3.75/百万输出。当厂商发版周期(三周)远快于你的迭代周期(一季度),「模型」就不再是常量,而是一个会自己变的依赖。
怎么答(五步,前三步基本盘,后两步拉开差距)
  • ① 生产环境一律写死版本号,不用 latest 别名:别名意味着厂商一更新你就被换掉,而且事后无法复现「当时跑的是哪一版」。写死版本 + 主动排期升级 = 把「什么时候变」的控制权拿回自己手里。这一句通常就能过第一层。
  • ② 升级不是切换,是一次受控对比:同一批输入、同一套评分器、同一组阈值,新候选版本 vs 上一个通过的基线,跑出一张差异表。这就是金标集(golden set)存在的意义——它让「变好还是变差」成为一个吵得出结论的问题。
  • ③ 评测要分三层,别只有一层:确定性断言(能否解析成 JSON、必填字段在不在)最便宜、最该卡死;㈡ 规则指标打分(关键信息命中率、引用是否落在给定文档内);㈢ 模型当裁判——有位置偏见、偏爱长答案,所以只用于排序和挑异常样本,不单独卡上线阈值。主动说出第三层的局限是明显加分点。
  • ④ 上线走「影子 → 灰度 → 可回滚」三段:影子流量(跟着真实请求跑但结果不给用户看,只做比对)→ 5% 灰度,盯的是业务指标(人工转接率、投诉)而非离线分 → 全程保留一键切回旧版本。这套讲清楚,比会用哪个评测框架重要得多。
  • ⑤ 加分句,也最容易被漏掉:「除了质量,我还会跑格式、延迟、成本三条回归——版本升级最常见的翻车不是模型变笨,而是输出格式悄悄变了(下游解析全崩),或者新模型话变多了,单价降了账单反而涨。」这句能立刻显出你是真上过线的人。
过来人提醒:能说出「我上一版的基线分是多少、这次卡在哪一条没过」的人极少。别背工具名(评测框架半年换一轮),要讲清判断标准怎么定下来——阈值定在哪、谁拍板、不过时是回滚还是带缺陷上线。这是工程判断力,不是工具熟练度。
AI 解决方案 / 售前 · 企业交付 #3 · 锚点 9/1–9/2
面试官可能这样问客户模拟版:「我们是一家银行,合规要求数据不出自己的环境——你们这套 AI 方案还能做吗?」/内部版:「客户法务把数据条款打回来了,POC 卡住,你怎么推进?」今日锚点:9/1–9/2 Anthropic 发布 Enterprise Frontier Safeguards,正面拆解「企业要零数据留存、厂商必须做滥用检测」这个死结:监控用的客户活动数据放进客户自己的云账户(S3 / Azure Blob / GCS),密钥由客户掌握;三项开关(自有存储、自管密钥、自动审阅)均为可选。背景是 6 月随 Fable 5 上线的 30 天留存策略让受监管客户用不了,EFS 与 100 多家金融、医疗、电信、法律及公共部门客户共创,今秋分阶段开放。
怎么答(四步,第一步就能拉开差距)
  • ① 先问清「数据」是哪一类——这是题眼:至少四类,约束强度完全不同:业务数据(推理输入输出)/训练微调数据运维监控日志模型权重本身。多数客户嘴上说「不出域」,真正卡的是前三类,而第四类才是逼你走私有化的那一条。当场拆开问,你就从「销售」变成了「顾问」。
  • ② 给三档方案,不要只给一档:ⓐ 公有云 + 零数据留存 + 区域驻留;ⓑ 客户 VPC 内托管/专属实例;ⓒ 完全私有化(权重落客户机房)。每档同时报出代价:成本、能用到第几代模型、上线周期、谁来长期运维。诚实说出私有化的隐性账单(拿不到最新模型、推理优化与安全补丁自己扛、显卡自己买)反而最建立信任。
  • ③ 用今天这个例子回答「监控和隐私能不能兼得」:EFS 给的正是第三条路——不是关掉滥用检测,也不是把日志交给厂商,而是把监控数据的物理位置和密钥交还客户。举得出这样一个具体产品形态,比空谈「我们重视合规」有说服力得多,还顺带证明你在跟进行业。
  • ④ 最后落到商务节奏:把数据条款提前到 POC 之前谈,别等方案做完被法务一票否决。合同里要能说出四件事:留存周期、删除承诺、子处理者清单、审计权。这四个词一出口,对面做过 To B 的人立刻知道你不是新手。
过来人提醒:售前最容易失分的动作是什么都答「能做」。当场承认一条做不到的限制、并立刻给出替代路径(「这一档我们做不到 ⓒ,但 ⓑ 能满足你合规里的第 3、5 条,代价是这个」),是这个岗位少有的减分变加分时刻——最后翻车的项目,都是当初什么都答应的那些。
🧠 今日硬核拆解1 / 2 · 大白话版
知识域:Transformer 架构 本报历史上从未完整拆过
面试官怎么问「说说 KV Cache 是什么,为什么大模型推理离不开它?」→「用了它的代价是什么?」→「我们服务并发上不去、显存老爆,和它有关系吗?」→「那 MQA / GQA 又是解决什么问题的?」几乎每场技术面都会问,而多数人只答得出前半句。
大白话版:它就是模型的一本读书笔记
  • 先说麻烦在哪:大模型是一个字一个字往外吐的,而它每吐一个新字,按原理都要回头把前面所有的字重新读一遍才知道下一个说什么——吐第 1000 个字时要重读 999 个字。
  • KV Cache 就是「读书笔记」:前面每个字被读过之后,模型都算出了一份关于它的摘要;把这些摘要存下来,下次不用重读原文,直接翻笔记。速度立刻上来了。
  • 代价是:笔记要占地方(显存),而且是每个用户各存一份,越聊越厚。十个人同时聊、每人都聊得很长——十份越来越厚的笔记同时压在同一张显卡上。
  • 所以那个经典现象有了解释:「模型不大,服务却撑不住几个人」——撑不住的往往不是算力,是笔记本堆不下了
先记住这句:KV Cache 是模型的读书笔记——它让模型不必每吐一个字就重读全文,代价是每个用户都要占一本,而且越聊越厚。
🧠 今日硬核拆解2 / 2 · 进阶版
进阶版 · 面试里真正加分的部分 缓存什么 / 显存账 / 三条优化 / 别答混
  • ① 缓存的是 K 和 V,不缓存 Q——这一点必须说对:每层、每个注意力头都会把已处理 token 算成 Key 与 Value 存起来;Query 只对「当前这个新 token」有意义,下一步就作废,所以不缓存。省下的是 Prefill 之后每步解码的重复计算,把生成 n 个 token 的总计算量从 O(n²) 量级压回接近 O(n)。
  • ② 把显存账算给面试官听——这是「背过」和「用过」的分水岭:粗略估算 ≈ 2(K和V)× 层数 × KV头数 × head_dim × 序列长度 × 并发数 × 每个数的字节数。关键结论一句话:权重是固定的一块,KV Cache 随「上下文长度 × 并发数」线性膨胀——所以线上显存被打爆,爆的通常不是权重,是它。这也解释了长上下文产品的成本曲线为何那么陡。
  • ③ 三条主流优化,正好各砍一个维度:MQA / GQA——多个 Q 头共享一组 K/V 头,直接把公式里「KV 头数」砍掉几倍,现在主流开源模型的标配;㈡ KV Cache 量化——从 FP16 存成 FP8/INT8,一点精度换掉一半显存;㈢ PagedAttention / vLLM——像操作系统管内存分页那样管缓存,消灭碎片、允许超额分配,把并发抬上去。记法:GQA 砍它的宽,量化砍它的厚,PagedAttention 管它的账。
  • ④ 别和 Flash Attention 答混(高频追问):KV Cache 省的是「重复计算」,代价是多花显存;Flash Attention 省的是「显存搬运」——它改的是注意力的计算方式,让巨大的中间矩阵不落显存,训练推理都能用。一个是空间换时间,一个是减少数据搬运,解决的根本不是同一件事,答混是常见扣分点。
  • ⑤ 接回业务,这句才是真正的加分句:「做长上下文或多轮对话产品时,成本压力往往不在模型单价,而在每多一个并发用户、每多一轮对话,KV Cache 就多吃一块显存——它直接决定单卡能服务多少人,也决定我们该不该给对话设上限、该不该做上下文压缩。」
🔑 记忆钩子:KV Cache 是拿显存买速度的记事本——它按「上下文 × 并发」收租;GQA 砍它的宽,量化砍它的厚,PagedAttention 管它的账。
⚡ 八股快问快答5 道 · 跨域抽题
Q ① · 基础与成本
什么是 tokenizer(分词器)?为什么同样一句话,中文往往比英文更费钱?
它是把文字切成模型能吃的最小单位(token)的那把刀,而计费和上下文长度都按 token 算。常见 tokenizer 里一个英文常用词只占 1 个 token,一个汉字却常要 1–2 个——同样信息量,中文更贵、也更快吃满上下文。顺带一提,这也是模型「数不清单词里有几个字母」的原因:它看到的根本不是字母,是 token
Q ② · 工程实践
调 API 时写 latest 别名和写死版本号,面试官为什么爱问这个?
结论:生产环境一律写死版本号。别名意味着厂商一更新,你的底层模型就被悄悄换掉——提示词效果、输出格式、成本都可能一夜变样,而且事后无法复现当时跑的是哪一版。写死版本 + 主动排期升级,是把「什么时候变」的控制权拿回自己手里。
Q ③ · 评测
什么是「金标数据集(golden set)」?和传统测试用例是一回事吗?
它是一批人工确认过标准答案或判据的样本,专门用来在换模型、改提示词、改检索时重跑对比。与传统用例最大的区别:它多数不是对/错二值,而是打分 + 阈值——所以除了准备数据,还得先定清楚「谁来打分、分数怎么算、差多少才算真的退步」,否则它会变成扯皮现场。
Q ④ · 行为面
「你为什么从 XX 行业转来做 AI?」怎么答才不像喊口号?
别答「看好这个行业」。答成一条因果链:我原来的工作里有一个具体的、我亲身被它烦到的问题 → 我用 AI 做了一件具体的事去解它 → 结果是什么、我发现自己还缺什么。有物证(一个跑起来的东西、一组前后对比数字)的转行动机,比任何「热爱」都可信,还顺便证明你会自己找问题。
Q ⑤ · 投递实操
JD 写「有大模型应用经验优先」,我只做过个人项目,算不算?
算,但要按生产标准讲。不是「我用 API 做了个 demo」,而是「它有几个真实用户、跑了多久、出过什么线上问题、我怎么发现和修的、一个月成本多少」。面试官真正在筛的是:你有没有体验过一个 AI 应用会以什么方式坏掉——而不是你调过几个接口。
🧭 转行者锦囊 · 怎么读一份模型发布公告,把它变成面试谈资四步读法
① 看档位,不看「多强」
Flash / mini / turbo 这类档位的频繁更新,说明厂商在抢的是成本敏感的量产场景——这直接决定你面试时该聊什么。旗舰模型的跑分高低,跟你日常要做的事关系反而小。
② 看价格和速度这两行
多数人跳过它们,可价格与延迟决定了哪类产品形态从「不可能」变成「可能」。今天的 H3 Max 就是最好的例子:生成比实时还快,「边聊边生成的直播」第一次有了工程基础——新岗位正是从这种地方长出来的
③ 看它没说的那几件事
上下文长度上限、限流额度、可用区域、数据留存策略——这四条几乎不会出现在标题里,却真正决定「能不能上生产」。今天 Anthropic 那条 EFS 公告,本质上就是在补第四条。
④ 压缩成一句能说出口的话
模板:「X 发布之后,我把项目从 A 换成了 B,因为 ___,结果省了 ___ / 快了 ___。」一句这样的话胜过背十条参数——它同时证明了你在跟进、在动手、且有判断力。
⚠️ 一条诚实提醒
别在面试里硬背发布日期和版本号。宁可说「上个月发布的那一版」,也别把数字说错——说错一个具体数字,比模糊表述更伤可信度。
📎 今天就能练
今天同一天落地了三条公告(Gemini 3.8 Flash / H3 Max / Enterprise Frontier Safeguards)。挑一条按上面四步走一遍,写下那句话——这就是你下周面试时最自然的开场谈资。

数据源状态

本期素材来源(透明可信)· 第 70 期 · 生成于 2026-09-03(北京时间)

WebSearch(中英文)· 本期实际获取通道
PR Newswire / fal 模型页 · H3 Max 耗时、吞吐、评测名次多源一致
Artificial Analysis / 9to5Google · Gemini 3.8 Flash 日期、代次、定价交叉一致
Anthropic 官方 / Help Net Security / MarkTechPost · EFS 存储位置与开放节奏一致
FutureAGI / Confident AI · LLM 回归测试结构参考
中国日报网 / woshipm · AIGC 岗位与私有化部署口径
卡码笔记 / 小林 coding / JavaGuide · 考点结构参考
⚠️ 快手可灵增资(14 亿 / 投后约 1228 亿)· 仅见中文聚合快讯,未取一手公告,已在卡内标注
WebFetch 逐条打开原文 · 云端出口 EGRESS_BLOCKED(实测 anthropic.com、blog.fal.ai 均被挡),核实止步于搜索摘要层,同一事实要求两家独立来源一致才写入
牛客 / 小红书 / BOSS 直聘 / Reddit / HN · 反爬与登录墙,跳过

📌 今日与近 7 天的差异点:岗位组合全新且三条线一次集齐——AIGC 运营(应用线)+ AI 应用工程师/LLMOps(技术线)+ AI 解决方案/售前(入门与客户侧),与昨日(AI 安全评测 / 具身智能技术员 / MLE 面试新形态,几乎全压技术线)结构上完全反过来,#1 岗位未连续两天重复;② AIGC 运营换了角度——9/1 讲「AI 内容打标识的合规责任」,今天讲「生成趋零成本后产线瓶颈迁移与一次过审率」,一个合规、一个产能经济学;③ 「模型版本治理」本报从未讲过——8/29 讲的是「闭源 API vs 开源自部署」选型、8/30 讲「不换模型怎么降推理成本」,今天讲的是选定之后厂商替你换代这第三种处境;④ AI 解决方案换了角度——8/29 是「机器人项目第一期交付什么」(范围管理),今天是「数据不出域怎么拆四类、给三档方案」(合规架构与商务);⑤ 硬核域换到 Transformer 架构(近 7 天六个域均未涉及;该域上次 8/25 讲 RoPE 与长上下文外推,KV Cache 在本报历史上从未做过完整拆解,8/25 快问快答仅用两行区分过它与 Flash Attention);⑥ 主动避开两个近期题:RAG 域「混合检索 + Rerank」(8/23 刚讲)、推理与部署域(8/30 刚讲);⑦ 五道快问快答与近 7 天零重合;⑧ 今日锚点三个且全部落在 48 小时内:fal H3 Max(9/2)、Gemini 3.8 Flash(9/2)、Anthropic EFS(9/1–9/2)。

💬 今日寄语:工具一年换三轮,可你在慌乱里仍愿意把事情做扎实的那份定力,从来不过期。

P 切换投影一屏一页模式