AI 面试日报 · 2026-07-22 封面 速览 题 ① 题 ② 题 ③ 硬核 快问 来源
AI INTERVIEW DAILY · 转行进 AI · 2026-07-22

AI 面试日报
今天,离 offer 更近一步

给正在转行进入 AI 行业的你:今天聊 Agent 工程师防死循环、AI Infra 显存成本估算、AI 训练师入职试标,再拆一个 Transformer 经典八股——为什么大模型都用 RoPE。岗位覆盖应用线 · 技术线 · 入门客户侧。

3今日面试题
3覆盖岗位
31第 31 期
速览

TL;DR · 今日速览

TL;DR = Too Long; Didn't Read(太长不看版)· 读这一屏就够

一句话总览:今天聊 Agent 工程师面试为什么从「背概念」转向「死循环了怎么兜底」、AI Infra 那道「部署 70B 要几张卡」的显存成本估算、以及门槛最低的 AI 训练师「入职试标」考什么;硬核拆解讲清大模型为什么都用 RoPE 旋转位置编码。

1
AI Agent 工程师|防死循环:面试不再问「什么是 Agent」,而是「它调三个工具就死循环,异常处理写哪」——考你会不会设最大步数 + 异常跳出 + 日志兜底。
2
AI Infra|显存成本估算:部署 70B 要几张卡?会算「权重(FP16 每 B 约 2G)+ KV Cache(约 0.35M/token)」,落到几张卡多少钱,才算过。
3
AI 训练师|入职试标:门槛最低的口子,面试主动展示「读规范 + 提边界 case + 质检一致性」,把自己从「标注员」抬成「训练师」。
🎯 今日面试经验 Top 3第 1 题 / 共 3
AI 应用 / Agent 工程师 #1 · 今日锚点
面试官可能这样问给你一个开放场景「设计一个能查公司内部知识库的客服 Agent」,追问:工具调用失败怎么兜底?它反复调同一个工具、陷入「尝试→失败→再尝试」的死循环,你怎么防、怎么排查?
(Agent=能自己「想一步→调工具→看结果→再想下一步」循环干活的大模型程序,最容易出的事故就是循环停不下来。)
怎么答(三层防御,照这个结构讲最稳)
  • 硬熔断层:给循环设最大步数(如 10 步)+ 总超时 / 总 Token 预算,到顶强制退出、转人工,而不是无限烧钱空转。这句面试官最想先听到。
  • 观察-判停层:每步观察结果后做异常检测——同一工具连续两次同样报错、或参数没变还在重复调,就判「鬼打墙」,主动跳出换策略,而不是把烂结果继续喂回模型。
  • 可观测 + 兜底层:全链路结构化日志(每次调用记时间 / 入参 / 返回 / 状态),线上一眼定位哪步开始打转;关键工具加重试上限 + 退避,失败有确定性兜底(缓存 / 默认答案 / 转人工)。
过来人提醒:别只背「ReAct 三步走」,面试官考的是「失控了你怎么办」。举一个你自己 debug 过死循环的例子——哪怕是个人项目里 Agent 把 API 额度烧光那次,最加分。
AI Infra / 推理优化 #2
面试官可能这样问给你一个模型规模、并发和上下文长度,现场估:显存要多少、几张卡装得下、成本大概多少、怎么再压下来。
(KV Cache=生成时把每个 token 算过的中间结果 K、V 存起来复用,省时间但吃显存,并发一高就爆——这是题眼。)
怎么答(三步算账,别只报框架名词)
  • 算权重:经验法则 FP16 每 1B 参数约 2GB。70B → FP16 约 140GB(一张 80G 卡装不下);INT4 量化后约 35GB,单张 A100/H100 就能装。
  • 算 KV Cache(常被漏):70B 级 FP16 约 0.35MB/token。并发 100 路 × 每路 2000 token = 20 万 token × 0.35MB ≈ 70GB——「显存不够」十有八九栽在这。
  • 给降本结论:要塞进卡 / 提并发 / 降本就上量化(FP8 适合新硬件、INT4 适合小卡);用 vLLM(PagedAttention 不留碎片、continuous batching 提吞吐);再补一句区分 Prefill(compute-bound)/ Decode(memory-bound)。
过来人提醒:面试官要你把账算到「几张卡、月成本多少」。只背「vLLM 用了 PagedAttention」却给不出数字,是这道题最常见的翻车姿势。记住:显存 ≈ 权重 + KV Cache + 余量。
AI 训练师 / 数据标注 #3
面试官可能这样问入职前几乎都有一道「试标」:给你真实数据 + 标注规范现场标;或问「两个人标同一批数据,结果对不上,你怎么办?」。它筛的不是手速,是质量意识
怎么答(三点,把自己从「标注员」讲成「训练师」)
  • 先吃透规范再动手:标注前逐条过 guideline,把模棱两可的边界 case 先记下集中问,别拍脑袋——一致性(不同人标得一样)比标得快重要得多,标注打架模型就学乱了。
  • 边界 case 的处理逻辑:规范没覆盖的,不是随手选,而是「按规范精神就近归类 + 标注疑问 + 反馈给规则方」,帮着把规范补全——这正是训练师高于标注员的地方。
  • 展示质检闭环:主动讲自检 / 互检、抽检、算标注一致性(如两人一致率 / kappa);发现系统性错标就回去改规范,而不是逐条硬标。
过来人提醒:门槛最低但别把自己框在「点鼠标」。面试主动展示「会读规范、会提边界 case、有质检意识」,天花板差一截。职业路径:标注员 → AI 训练师 → 提示词 / 评测 → AI 产品经理
🧠 今日硬核拆解技术线主菜
知识域 · Transformer 架构 RoPE 旋转位置编码
为什么现在的大模型(LLaMA / Qwen / GLM)几乎清一色用 RoPE,不用老式绝对位置编码?
面试官怎么问Transformer 的注意力本身分不清词的先后,位置信息是怎么加进去的?为什么现在都用 RoPE 而不是原始绝对位置编码?RoPE 好在哪?
大白话版:注意力看一句话的所有词是「一锅端」,天然分不清「猫抓老鼠」和「老鼠抓猫」——必须额外告诉模型每个词站第几位。老办法(绝对位置编码)给每个位置发一张固定「工牌」贴到词上。RoPE 换思路:不发工牌,而是按位置把每个词的向量「旋转」一个角度——第 1 位转一点、第 2 位转多一点。这样两个词做注意力时,数学上自动只跟「它俩隔多远」有关,跟「绝对第几位」无关。
进阶版(面试能加分的深度)
  • 天然编码相对位置:注意力分数只依赖两 token 的相对距离,更贴合语言「远近关系比绝对坐标重要」的本质。
  • 更好的长度外推:没见过的更长上下文更容易泛化,配合 NTK 缩放 / 位置插值还能拉长窗口——长上下文模型的地基。
  • 实现优雅零成本:只在 Q、K 上按位置旋转,不加参数、不改结构,和注意力计算天然融合。
  • 能横向对比更稳:绝对编码简单但外推差;相对这条路里 T5 用位置 bias、ALiBi 靠给远处 token 线性降权外推——拎出来对比深度就够了。
记忆钩子:位置不发「工牌」,而是「转角度」——只认「隔多远」、不认「第几个」,所以外推能力更强。
⚡ 八股快问快答5 题 · 顺手刷
Q · temperature(温度)是干嘛的?
A:控制输出随机性的旋钮。调低(近 0)更确定保守,适合客服 / 代码;调高更发散有创意但更易胡说。原理是在「下一个词的概率」上做缩放,越高越抹平、越容易选到冷门词。
Q · Top-p 和 Top-k 有啥区别?
A:都是「怎么挑下一个词」的采样。Top-k 只在概率最高的 k 个里选(个数固定);Top-p(核采样)把概率累加到 p(如 0.9)为止那批里选,候选集随上下文伸缩,通常更稳。
Q · 「上下文窗口」满了会怎样?
A:模型一次能看的最大 token 量(输入+输出共用),是它的「短期记忆容量」。超了最前面会被截断遗忘,长文档靠 RAG / 分段绕开;窗口越大越贵(就是 #2 里 KV Cache 那笔账)。
Q · Embedding(向量嵌入)是什么?
A:把文字 / 图片变成一串数字(向量),让机器能「算」语义。意思相近的向量离得近——RAG 检索、语义搜索的地基。注意:Embedding 是「变成向量」,余弦相似度是「比两个向量像不像」的下一步。
Q · 为什么说「token ≠ 字数」?
A:模型先把文本切成 token(子词 / 字的碎片)再处理。一个汉字常 ≈ 1–2 token,一个英文单词可能切成几个。API 按 token 计费、窗口也按 token 算,所以估成本要按 token 估。
🧭 转行者锦囊攒作品集

「没大厂经验,怎么攒一个能打的项目?」——与其刷 100 道八股,不如做一个「能跑、有真实用户、你自己部署上线」的小项目。它一次性回答面试官三个问题:你会写代码、你懂 AI 落地、你踩过真实的坑。

第一步 · 选真实痛点
挑你熟悉领域的真实小痛点(帮小店回消息、整理资料、给爱好做问答助手),用「大模型 API + RAG」搭最小可用版。
第二步 · 亲手上线
部署到公网能访问(Vercel / 一台云服务器都行),完整体验「上线后出问题怎么查」——今天 #1 死循环、#2 成本你都会踩到。
第三步 · 写篇复盘
为什么这么设计、踩了什么坑、怎么防死循环 / 控成本。这篇复盘比简历上任何「精通 XX」都有说服力。
一句话记牢
作品 > 证书 > 网课结业。转行者最大的劣势是「没经验」,补救不是等公司给,是自己先做出来给人看。

数据源状态

本期素材来源(透明可信)· 面经不强时效,窗口取最近 30 天,择优而非择新

WebSearch · 牛客 / 知乎 / 阿里云 / 腾讯云面经聚合(Agent 死循环真题)
WebSearch · vLLM / AI Infra 面试题(显存与 KV Cache 估算)
WebSearch · AI 训练师 / 数据标注(试标 · 一致性质检)
⚠️ WebFetch 逐条核实一手源 · 多数社区页对云端 IP 返回 403(反爬),改以搜索聚合摘要归纳
知识域地图(13 域)· 硬核拆解 Transformer/RoPE 兜底出题
今日锚点 · 当周行业热点「2026 Agent 大年」+ 字节死循环真题热传
📌 今日与近 7 天的差异点: ① 岗位组合=AI Agent 工程师(#1) + AI Infra/推理优化(#2) + AI 训练师(#3),覆盖应用线 + 技术线 + 入门客户侧三条线,与昨日(07-21:AI PM / MLE / AI 解决方案售前)无一重叠,#1 已换岗、无连占。 ② 角度全新:Agent 上次 07-17(场景系统设计)/ 07-15(上下文工程),今天换「防失控/死循环三层防御」;AI Infra 上次 07-12 讲「量化选型」,今天讲「显存与成本估算」;AI 训练师上次 07-16 讲「薪资地图」/ 07-12 讲「偏好标注」,今天讲「入职试标 / 一致性质检」。 ③ 硬核域=Transformer 架构(RoPE),近 7 天硬核域(深度学习/多模态/训练对齐/推理部署/Agent/RAG)均未用过,自 07-09 后未做。 ④ 快问快答(temperature / Top-p vs Top-k / 上下文窗口 / Embedding / Tokenizer)与近 7 天已出题零重叠。 ⑤ 今日锚点=当周行业热点「2026 Agent 大年、AI 应用/Agent 岗需求爆发」+ 字节「调三个工具就死循环」真题热传,锚定 #1。

💬 今日寄语:真正的门槛从不是天赋,而是敢不敢把还不完美的自己,先交出去。

P 切换投影一屏一页模式