AI 面试日报 · 2026-08-10 封面 速览 题 ① 题 ② 题 ③ 硬核拆解 快问快答 锦囊 来源
AI INTERVIEW DAILY · 转行进 AI · 2026-08-10

AI 面试日报
今天,离 offer 更近一步

今天给你三样东西:大模型算法岗出现频率最高的白板手撕题怎么写、平台本周严打纯 AI 内容后 AIGC 运营面试的答案该怎么改、以及 FDE 最能拉开差距的那道「AI 上线了却没人用」复盘题。外加一条推理部署硬核拆解 + 5 道八股。

3今日面试题
3覆盖岗位
5八股快答
48第 48 期
速览

TL;DR · 今日速览

TL;DR = Too Long; Didn't Read(太长不看版)· 读这一屏就够

一句话总览:今天讲大模型算法岗出现频率最高的「白板手撕 Self-Attention」到底怎么写,平台本周严打纯 AI 内容后 AIGC 运营面试的答法变了,以及 FDE 最能拉开差距的那道「AI 上线了却没人用」复盘题。

1
大模型算法|手撕 Self-Attention:不是考你背公式,是考你「维度对不对、mask 加没加、softmax 在哪一维」——这三点错一个就出局。
2
AIGC 运营|平台限流:本周平台把「纯 AI 内容」按下限流键,答案要从「我用 AI 提效多少倍」改成「我怎么让 AI 内容活下来还不被判定」。
3
FDE|落地复盘:企业 AI 试点约 95% 没产出,坏在最后一公里;面试真正筛的是你会不会查「为什么没人用」,而不是会不会写代码。
🎯 今日面试经验 Top 3第 1 题 / 共 3
大模型算法工程师 #1
面试官可能这样问大厂大模型算法岗流程固定五段:自我介绍 → 项目拷打 → 通识 → 手撕代码 → 反问。手撕这轮不给 LeetCode,直接说:「用 PyTorch 手写一个 Self-Attention,再改成 Multi-Head。」
名词一句话:Self-Attention(自注意力)=一句话里每个词都去看一遍所有别的词,按「跟我多相关」打分,再按分数把信息汇总回自己身上。
怎么答(照这四步,别上来就敲代码)
  • 先口述三行公式再动手:Q/K/V 怎么来 → scores = QKᵀ/√d_ksoftmax(scores) @ V。先讲逻辑再写,卡壳时才有回旋余地。
  • 主动喊出三个最高频失分点:① 除 √d_k 是为把点积方差拉回来、防 softmax 饱和;② softmax 必须在最后一维(dim=-1),写成 dim=1 是头号翻车点;③ mask 加在 softmax 之前(填 -inf),加在之后权重和不为 1,逻辑就错了。
  • 改 Multi-Head 时把形状念出来:不是跑 N 遍注意力,而是把 d_model 切成 h×d_h 并行算完再拼回去:(B,L,d) → (B,L,h,d_h) → (B,h,L,d_h)。多数人死在 reshape 和 transpose 搞反。
  • 写完补一句工程视角:「这是教学版,生产上用 FlashAttention 一类融合算子避免显式构造 L×L 矩阵——那块显存和访存才是长文本的瓶颈。」
过来人提醒:手撕轮允许写错再改,但不允许沉默——卡住时把你正在权衡什么讲出来,面试官打的是思维过程分。对转行者说句实话:这岗门槛是全场最高一档(通常要相关专业硕博 + 论文/开源),手撕 Attention 只是入场券不是通行证;但它是整条技术线的公共地基,走 Infra、多模态、AI 应用都值得写熟。
AIGC 运营 / AI 内容运营 #2 · 📌 今日锚点
今日锚点 + 面试官可能这样问8 月 8 日「自媒体红利期只剩 AI 了?」冲上微博热搜,同期平台明显收紧:微信封禁 AI 批量写号、小红书对未标识 AI 笔记限制进推荐池、今日头条累计处置超 260 万条低质 AIGC 内容并封约 1.1 万账号。面试官于是会问:「你用 AI 做内容,怎么保证既有效率、又不被平台判定?」
怎么答(三层递进,把「会用工具」答成「懂平台规则」)
  • 第一层:先答合规,别答对抗。张口就是「我有办法绕过 AI 检测」在 2026 是减分项。正解是主动标识,并报出平台差异:抖音只支持自主声明不自动识别;快手会系统判定并加「可能为 AI 生成」;小红书目前仅 PC 端有声明入口,且会对检出的未标识内容补标 + 限制分发。
  • 第二层:平台判什么,你就补什么。判定靠三类信号——文本特征(句式过于规整、词汇多样性低)、账号行为(发布频率异常、互动畸形)、水印与举报。对应作业:AI 出初稿人补具体数字与亲身细节、发布节奏做得像真人、自拍素材与自跑数据当护城河。
  • 第三层:落到一个可验证的动作。「我会做小样本 A/B:同批选题,一组纯 AI 出稿、一组 AI 起草+人工重写导语结尾,各发 10 条,比 7 日曝光与进池率,用数据定人机分工线。」
过来人提醒:这条线的面试正从「你会用几个 AI 工具」转向「你知不知道平台边界在哪」——工具人人会用,早不是加分项了。诚实话:这条线转行门槛最低、机会最多,但入门起薪也确实不高(内容/运营入门岗普遍 6–10K),要靠行业 know-how + 数据思维才站得住。「会用 AI」只是 2026 的识字水平,不是终点。
FDE 前向部署工程师 #3
先纠一个误译 + 面试官可能这样问FDE 不是「前端部署工程师」——Forward 是「前向/驻场推进」,和 Front-end 毫无关系。面试官会给一个扎心场景:「验收时指标都达标、客户也满意,三个月后一看后台日活个位数。你接手,怎么办?」有研究估算约 95% 的企业生成式 AI 试点没有可衡量回报,问题绝大多数不在模型,而在最后一公里。
怎么答(先分诊,再动手——别一上来说要优化模型)
  • 把「没人用」拆成四种病:不知道(入口太深,是推广问题)/用不了(要额外登录、和现有工作流两张皮,是集成问题)/不敢用(怕答错担责、答案无出处,是信任问题)/不需要(当初就没抓到真痛点)。先问「哪一种」,这一步就是分水岭。
  • 要的证据,非数字那种更关键:数字看漏斗(打开 → 问过一次 → 第二周还回来);但更要去现场约 3–5 个真实用户,看他们走完原流程、观察 AI 在哪一步本该被用却被跳过。「后台数据告诉我哪里掉了,只有坐在他们旁边才知道为什么掉。
  • 给一个有取舍的方案,并说明你不做什么:「若诊断是『用不了』,我优先把它嵌进他们天天开着的系统,而不是优化模型效果——用户不会为了更聪明的答案多开一个网页。」敢说「模型我先不动」,反而证明你分得清主次。
  • 把预防前置:「以后我会在上线前就和客户约定采用率指标与一个月复盘节点,而不是验收完就撤」——这是从「交付者」到「对结果负责的人」的分界线。
过来人提醒:FDE 面试里权重最高、通过率最低的就是这类模糊案例题(有指南估算权重约 30%、通过率约 40%)。答案不在选得对不对,在提问顺序对不对:先澄清、再假设、再验证,全程出声。诚实判断:需求确实猛涨(有调研称计划招 FDE 的公司从 2026 年初 5%–10% 升到 Q2 末约 70%),但它本质是工程岗,通常要 3–5 年经验、能独立扛线上结果,不是绕过编程的速成转行路
🧠 今日硬核拆解1 / 2
知识域:推理与部署 大白话版
面试官怎么问「你们服务用户反馈慢,你怎么定位是哪一段慢?」「Prefill 和 Decode 阶段的瓶颈分别是什么,为什么优化手段不一样?」——这是 AI Infra / 推理优化岗的分水岭题,也越来越多出现在 AI 应用工程师的成本轮里。
大白话版(零基础也能懂)
  • Prefill(预填充)= 读题。把你输入的整段话一口气并行读完,特点是「算得多」——像考生拿到卷子先通读题目,题越长读得越久。它决定你按回车后第一个字多久蹦出来(业界叫 TTFT,首 token 延迟)。
  • Decode(解码)= 答题。一个字一个字往外写,每写一个都要回头看前面所有内容(靠缓存好的 KV Cache,不用重算)。特点是「算得少但搬得多」——每吐一个字都得把整个模型权重从显存搬一趟,搬运时间远大于计算时间。它决定后面文字刷出来的快慢
  • 一句话对比:Prefill 卡在算力不够(compute-bound),Decode 卡在显存带宽不够(memory-bound)。所以「首字慢」和「吐字慢」是两个病,得开两种药。
与近 7 天的差异:8/4 讲的是同域另一考点「量化选型(GPTQ/AWQ/QLoRA 怎么选)」、8/7 讲的是 Transformer 域的 GQA 如何为 KV Cache 减负;前两次答的是「怎么把模型塞进显卡」,今天答的是「塞进去之后,慢在哪一段」。
🧠 今日硬核拆解 · 进阶2 / 2
Prefill vs Decode 进阶版 · 面试里能加分的深度
  • 两阶段的药方完全不同。首字慢(Prefill)→ 往算力和输入长度使劲:更强的融合算子、砍冗余长提示词、前缀缓存(Prefix Caching)(系统提示词每次都一样,算过一次别再算第二遍,这是最省事的一刀)。吐字慢(Decode)→ 往「搬运」使劲:量化(权重变小,一趟搬得少)、投机解码(小模型草拟、大模型批量验证)、加大 batch(一次搬权重顺手服务多个请求,把带宽摊薄)。
  • 它解释了一个反直觉现象:加大 batch 能显著提吞吐,却几乎不改善单用户首字延迟。因为 Decode 是访存瓶颈,多来几个用户「搭同一趟车」几乎不增加成本;而 Prefill 是算力瓶颈,人多了要抢算力,首字反而可能更慢。这就是为什么线上要把 TTFT(首字延迟)和 TPOT(每字间隔)分开定 SLA——一个笼统的「平均响应时间」根本没法优化。
  • 再往前一步是 P/D 分离。两阶段一个吃算力一个吃带宽,混在同一批 GPU 上会互相拖累(一个长 Prefill 进来,正在流畅吐字的用户会明显卡一下)。所以现代推理系统会做 Prefill / Decode 分离部署,两组机器各干各的、中间传 KV Cache。主动提这点,基本能证明你读过 vLLM 一类框架的设计而不是背题。
一句话记忆钩子:Prefill 是读题、拼算力,决定第一个字什么时候来;Decode 是答题、拼带宽,决定后面的字有多流畅。首字慢别去量化,吐字慢别去砍提示词——药方不能开反。
来源:小林 coding · AI 大模型题库 · 卡码笔记 · LLM 推理与部署面试题 · 考点提炼 · 行业通用高频考点
⚡ 八股快问快答5 道
Q · MoE 混合专家
为什么几千亿参数的模型反而跑得更便宜?把前馈层拆成很多「专家」,每个 token 进来只激活其中少数几个(如 8 选 2)。总参数量大(知识多)、每次实际计算的激活参数小(推理便宜)。加分点:省的是算力,不是显存——全部专家仍要装进显存。
Q · RAG 重排 Rerank
检索完为什么还要再排一次?向量检索为了快,用「问题和文档各压成一个向量比距离」的粗筛,会漏语义细节。重排把「问题+每篇候选」成对精算相关性,准得多但慢,所以只给粗筛出的前 50 篇重排、留前 5。先广撒网捞回来,再用细筛子挑。
Q · token 成本估算
「你这功能一个月烧多少钱」怎么答?先说清输入/输出 token 分开计价、输出通常贵好几倍。公式:月成本 ≈ 日请求数 ×(单次输入 token×输入单价 + 单次输出 token×输出单价)× 30。补一句「长系统提示词是隐形大头,每次请求都要重算,所以我会上前缀缓存」——从会算账升级成会省钱。
Q · 蒸馏 Distillation
小模型凭什么学到大模型的本事?大模型(老师)先对大量问题作答,用这些回答训练小模型(学生)。关键是学生学的不只是标准答案,还有老师输出的概率分布(「七分对/三分对」这种带犹豫的软信息),信息量远大于硬答案。代价:上限被老师锁死,换个领域就现原形。
Q · 行为面 · 怎么跟上领域
「一周一变,你怎么跟上」怎么答不像套话?别说「每天刷 arXiv」。给结构+证据:① 分层(必须跟的 2–3 个方向 vs 知道就行的);② 固定动作与产出物(每周两小时把一个新工具真跑一遍、写一页笔记);③ 甩证据——最近三个月你因此改掉的一个技术选择。没产出的「保持关注」等于没说。
🧭 转行者锦囊 · 把「我会用 AI」换成「我有一个被人用过的东西」

今天三条线的信号其实指向同一件事:市场对「会用 AI 工具」的溢价正在快速消失。平台在打纯 AI 内容(工具用得多≠内容能活)、企业在为 95% 的失败试点找 FDE(模型能跑≠有人用)、大厂手撕轮在筛能不能把公式写成代码(背过≠会)。三者共同的判据都是:有没有真实的、被验证过的产出。

第一步 · 挑一件真事
挑你原来行业里真实存在的重复劳动——整理周报、筛简历、给客服问题分类。不用高级,越具体越好。
第二步 · 让真人用起来
用现成工具端到端做出来(Coze / Dify / n8n 都行,不必写代码),关键是让至少 3 个真人用一周
第三步 · 记三个数字
用之前多久、用之后多久、他们弃用了哪一步、为什么。第三个数字最值钱。
为什么这管用
这三个数字是面试时唯一稀缺的东西——别人讲工具,你讲有人用过它之后发生了什么。

数据源状态

本期素材来源(透明可信)· 生成时间 2026-08-10 · 第 48 期

WebSearch · 中文面经(大模型算法岗手撕高频题)
WebSearch · AIGC 运营与平台标识政策
WebSearch · 英文 FDE 面试源(Exponent / HeroHunt)
卡码笔记 LLM 题库(经检索摘要)
小林 coding AI 题库(经检索摘要)
WebFetch 逐条打开原页核实 —— EGRESS_BLOCKED:k.sina.com.cn、techcrunch.com 等域被本环境出口代理拦截,本期数字取自检索摘要,未逐条打开原页二次核实,链接均已给出供自查
牛客 / 小红书 / 即刻 / BOSS 直聘 直连(云端出口受限,改由检索摘要间接取材)
📌 今日与近 7 天的差异点:岗位组合「大模型算法 + AIGC 运营 + FDE」与昨日(MLE/DS + AI 应用 + 提示词)无一重叠,#1 已换岗;角度全新——大模型算法从 8/5 的「项目拷打轮」换到手撕代码轮,AIGC 运营从量化提效(8/2)与矩阵号(8/4)换到平台限流与合规标识,FDE 从 8/3 的数据清洗编码题换到交付后无人使用的复盘题;硬核拆解换到「推理与部署 · Prefill vs Decode」,与 8/4 量化选型、8/7 GQA 互不重叠;快问快答 5 题全为近 7 天未出现的新题。今日锚点:2026-08-08「自媒体红利期只剩 AI 了?」登微博热搜 + 多平台同期收紧纯 AI 内容处置。
P 切换投影一屏一页模式