AI 面试日报 · 2026-09-05 封面 速览 题 ① 题 ② 题 ③ 硬核拆解 快问快答 锦囊 来源
AI INTERVIEW DAILY · 转行进 AI · 2026-09-05

AI 面试日报
秋招开闸,今年的三道关都换了

给正在转行或应届求职的你:今天讲秋招正式批的三道新关卡——「AI 全栈工程师」这个新岗位名到底该不该投、第一场面试为什么不是人、以及技术面那道「现场改提示词」在考什么。硬核拆解换到评测(Evals)域:你说的「提升 15%」,那个分是谁打的?

3今日面试题
3覆盖岗位线
5快问快答
72第 72 期
速览

TL;DR · 今日速览

TL;DR = Too Long; Didn't Read(太长不看版)· 读这一屏就够

一句话总览:秋招正式批开闸,而今年这场秋招的三道关跟去年都不一样——第一关在投递框里(字节新增「AI 全栈工程师」「AI Agent 开发」、技术产品岗超七成;百度 AI 岗超 90%),第二关在第一场面试里(它多半不是人),第三关在技术面那道现场改提示词的题上。

1
AI 全栈工程师|该投它还是算法岗:它不是算法岗的降级版,两条线是同期并列扩招;判断标准只有一条——你手里能拿出的是「训练/评测模型本身」的经历,还是「端到端做上线、有人真在用」的经历。
2
AI 面试官|它在打什么分:打的是可提取的证据分,不是气场分。说「效果挺好」它抓不到东西,说「3 小时压到 30 分钟」它才有分可打;而被最多人漏掉的,是单独占 34% 的「工作意向」那一栏。
3
现场改提示词|考的是诊断不是文采:先把毛病归类(指令冲突 / 缺边界 / 缺输出契约 / 上下文没给够),再按骨架重排,最后补一句「拿 20 条失败样例改前改后各跑一遍」——没有最后这句,前面全是主观意见
🎯 今日面试经验 Top 3第 1 题 / 共 3
AI 应用 / AI 全栈 / Agent 开发 #1
今日锚点 · 面试官可能这样问字节 8/3 启动 2027 届校招,研发岗新增「AI 全栈工程师」「AI Agent 开发」,技术与产品岗需求超七成;百度 7/9 启动,AI 岗占比超 90%。于是必问一句:「你为什么投这个岗不投算法岗?你觉得它每天在做什么?」
怎么答(四步)
  • 先分清两条线,别当它是算法岗降级版:算法岗解决「模型本身好不好」(训练/对齐/评测),AI 全栈解决「模型怎么变成真有人用的东西」。今年是两条线同期并列扩招,不是替代。
  • 用「三段式」证明你是全栈:①数据怎么进来 ②模型怎么被编排(提示词/工具/记忆/兜底)③结果怎么交付和被验证。第三段是多数应届简历的空白区,一句话就能拉开差距。
  • 该投哪个,一条硬标准:有论文/竞赛/训练开源模型 → 算法岗;有端到端上线、有真实用户 → AI 全栈 / Agent。字节全年滚动、百度通道全年开放(7 月起面试、11 月起发 offer),时间允许分批试。
  • 补一句诚实话:应用方向入门门槛确实低于算法岗,但天花板不在「谁模型调得好」,在「谁能扛住线上」——半夜出问题能不能定位到是检索错了、提示词冲突了,还是上游模型换了版本。
过来人提醒:别把「我用过 LangChain / Coze / Dify」当经历讲——工具名是这届简历里最不值钱的东西。讲一个具体故障和你怎么修的,抵得过十个工具名。
通用 · 校招/社招 AI 初筛(非技术友好) #2
今日锚点 · 场景点开面试链接,对面是数字人或纯语音 AI:限时、会追问、全程零表情反馈。北森报告称 2026 春招已有超 85% 的中大型企业引入 AI 招聘工具;而它公布的考察配置是——44% 考岗位胜任力、34% 考工作意向、仅 18% 考专业能力。也就是说:这关基本不考八股。
怎么过(四条)
  • 它评的是「可提取的证据」,不是气场:打分链路是「语音→转写→抽取胜任力证据→对岗位模型评分」,所以形容词一律零分。硬规矩:每段回答里至少放进一个数字 + 一个具体动作。
  • 主动给「追问」留钩子:它普遍带 STAR 追问。先给结构(「我做了 A、B、C,其中 B 最难」),把最有料的那件只点名不展开——它十有八九追问 B,你凭空多一次展示机会。
  • 「工作意向」那 34% 是白送的分:「为什么投这个岗」不是客套,是单独计分项。答:具体触发点 + 你已经为它做过什么 + 你能接受什么(城市/方向/强度)。转行者在这栏反而占优——转行动作本身就是最硬的意向证据。
  • 工程细节别翻车:安静环境、稳定网络、正对摄像头、语速慢半拍(转写出错=直接吃分,专有名词第一次出现顺口解释一句);别念稿——节奏异常,且真人复面对不上自己的说法。
过来人提醒:AI 面试官最擅长的是「前后不一致」检测——简历写「负责」嘴上说「跟着学」、简历写 3 个月嘴上说「大半年」,在结构化打分里扣得极狠。面试前把自己简历从头读一遍,是性价比最高的五分钟。
提示词 / 上下文工程(横向技能) #3
今日锚点 · 面试官可能这样问甩你一段真实跑偏的系统提示词,给 10 分钟改,然后问「你改了哪几处,为什么」。9/1 Anthropic 发布 Fable 5.1 / Mythos 5.1:缓存读取降到 $0.25/百万 token(便宜 75%),并明确减少「误拒」。上下文变便宜了,「省字」不再是本事;模型不乱拒了,「咒语」也在贬值。
怎么答(四步)
  • 先诊断、后动手:别上来就改字,先当众把毛病归类——①指令冲突(前面要简洁后面要详细)②缺边界(没说「不知道时怎么办」)③缺输出契约(没规定格式,程序没法解析)④上下文没给够。归类能力比改得漂亮重要。
  • 按骨架重排,而不是加形容词:角色与目标 → 可用信息与工具 → 硬约束 → 输出格式(严格到程序能解析)→ 少量示例。并把稳定不变的部分放最前面——那正是提示缓存能命中的前缀,缓存刚降到四分之一价,这个排法直接省钱。
  • 一定要有可验证的收尾:「我会准备 20 条真实失败样例,改前改后各跑一遍,比一次通过率和格式合规率,再决定这版上不上。」没有这句,前面全是主观意见。
  • 主动点破职业现实:「提示词工程师」作为独立岗位标题近两年明显下滑(多口径约 30%–40%),但技能被吸收进 AI 应用工程师 / 上下文工程 / AI 产品经理的 JD,要求反而涨了。当技能,别当目标岗——投递搜「AI 应用工程师」「AI Agent 开发」。
过来人提醒:现场改 prompt 最容易丢分的动作,是往里加更多礼貌用语和强调词。加「请务必一定严格」不是工程;删掉一条自相矛盾的指令、补上一句「资料中没有就回答『我不知道』」,才是
🧠 今日硬核拆解1 / 2
知识域:评测(Evals) 大白话版
面试官会怎么问「你怎么评测这个 AI 应用输出得好不好?」→ 你答「我们用大模型当评委(LLM-as-a-Judge)自动打分」→ 紧跟一刀:「那你怎么知道这个评委是对的?它会不会有偏见?」——这一刀是今年区分「搭过 demo」和「上过线」最快的一道题。
大白话版答案(零基础也能懂)
  • 「用大模型给大模型打分」,本质上是让一个学生去批另一个学生的卷子。他大体上确实能分出好坏——这就是这套方法能用的原因。
  • 但他有三个改不掉的毛病:①谁的卷子先递给他,他就更容易觉得谁写得好②写得长、看着满满当当的,更容易给高分(哪怕内容注水);③遇到跟自己风格像的答案,他会偏心
  • 所以正确姿势不是「不能用」,而是——你得先证明这个评委靠谱,才有资格拿它打的分去汇报。
  • 你在面试里说的那个「提升 15%」,如果背后是一个从没被校准过的评委,那 15% 可能只是噪音。面试官要听的,就是你有没有意识到这一点。
下一页:三种偏见的专业名字、每种对应的工程解法,以及那个几乎没人答得出的第四层——「评委的评委」
知识域:评测(Evals) 进阶版
进阶版答案(面试里能加分的深度)
  • 三种偏见要能叫出名字:位置偏见(position bias,成对比较偏爱先出现的)、冗长偏见(verbosity bias,越长分越高)、自我偏好/自恋偏见(self-preference bias,偏爱同源模型的输出)。2026 年仍有多篇实证在持续验证,并发现多模态评委对冗长偏见比对位置偏见更脆弱
  • 每种偏见都有对应解法,能一一对上是最高分:位置偏见 → A/B 顺序互换各跑一次,两次一致才算数,不一致记平局(几乎是标配,答不出显得没实操过);冗长偏见 → 拆成分维度 rubric 并对长度设约束;自我偏好 → 换不同家族的模型当评委并抹掉身份信息。
  • 成对比较优于绝对打分:让模型打 1–10 分,分数会大量堆在 7、8 上且跨批次不可比;改成「A 和 B 哪个更好」一致性明显更高。非要绝对分,就拆成 0/1 维度——事实正确、是否有据可依(groundedness)、是否答到问题、格式合规。
  • 必须有「评委的评委」(这层把你和大多数人分开):抽 100–200 条人工标注金标,算评委与人的一致率(Cohen's kappa 或直接一致率);不达标就先修评委,再谈业务指标。能主动说出「我们先校准了评委」,基本就赢了。
  • 别用同一个模型既生产又评判:自我偏好会让每次迭代看起来都在涨——你以为在优化产品,其实在优化「讨好评委」。稳妥做法:独立家族评委 + 持续人工抽检(如每周随机 30 条),后者是你唯一的地面真值。
一句话记忆钩子:大模型当评委,先问它三件事——谁先出场(位置)、谁写得长(冗长)、谁跟它像(自恋)。这三条治不住,它给你的分只是一个更贵的随机数
⚡ 八股快问快答5 题
Q01 · 提示词 / Transformer
什么是「思维链」(CoT)?现在的推理模型还要不要写「请一步步思考」?
让模型把中间推理写出来再给结论,早年能明显提升数理逻辑题正确率。但对自带推理模式的新模型收益很小,还会让输出变啰嗦变贵。小/老模型仍值得写;新模型把力气花在「说清任务和输出格式」更划算。
Q02 · 提示词
few-shot 给例子,是不是越多越好?
不是。例子主要用来定格式和口径,2–5 个典型 + 1–2 个边界就够;再加收益递减而成本线性涨,还容易让模型死板照抄。比数量更重要的是:一定要有一个「该拒答/该说不知道」的样本
Q03 · 秋招实务
提前批挂了还能投正式批吗?会不会留记录?
多数大厂两者是独立通道,提前批未过不影响正式批(部分公司有「同岗位 N 个月冷却期」,以官网为准)。字节全年滚动、百度通道全年开放。提前批的正确用法是当免费练手,补完被问住的地方再打正式批。
Q04 · 简历
项目该写「参与」还是「负责」?
写你真做到的那一层,用动作不用形容词。写「负责」会把追问难度拉满,答不上来比老实写「参与」扣得更狠。稳妥写法:「负责其中的 X 模块(具体动作+结果数字),整体方案由团队共同确定」。
Q05 · 择业
国企/央企的 AI 岗和大厂 AI 岗,考的一样吗?
底层八股重合度高,侧重差别大。大厂看「你把什么做上线了、扛住了什么」,手撕和项目拷打更狠;国企/央企看学历专业匹配、笔试(行测+专业课),以及数据合规与国产化适配意识。两边都投就备两版简历。
🧭 转行者锦囊 · 秋招是应届生的场,那 9 月这一个月,非应届的转行者该干什么?

别空等。大厂校招团队全速运转的这几个月,社招 HC 的审批往往同期放开——9–10 月对转行者同样是窗口期,只是入口不同。

① 别去挤应届生那个门
校招通道会校验应届生身份,你多半用不了。去社招页搜这些同义岗位名:AI 应用工程师、AI Agent 开发、AI 产品经理、AIGC 运营、AI 训练师、AI 解决方案。不要只搜「AI 全栈工程师」——它这次主要是作为校招新岗位名出现的。
② 把秋招 JD 当免费考纲抄
校招 JD 里新冒出来的要求(Agent 开发、大模型应用方向、模型能力边界判断),就是这些团队明年真正缺的能力。把三四家大厂的 AI 岗 JD 并排放,抄下反复出现的那三四个词,对照自己补——比任何转行课程大纲都准,而且免费。
③ 这个月做完一件可验证的事,而不是学完一门课
一个有真实用户、你自己部署上线、并且带评测数据的小项目(哪怕只是 30 条测试样例的通过率和一份失败案例记录),比任何证书都更能对上今年 JD 的口径。今天硬核拆解那套「先校准评委、再报数字」的做法,完全可以用在你自己的小项目上——简历上能写出「我用 30 条样例做了改前改后对比」,就已经领先绝大多数同期投递者。

数据源状态

本期素材来源(透明可信)· 生成时间 2026-09-05 · 第 72 期
真实性说明:三个由头(字节/百度校招岗位结构、北森 AI 面试报告、Fable 5.1 发布)均为可溯源公开信息;三张题卡的答题骨架与硬核拆解结构为考点提炼,非某位具体候选人的真实面经,未编造公司内部题目、面试官原话或个人薪资数字。

WebSearch 联网检索(中英各 4 轮,全部命中,本期主力)
界面新闻 / 腾讯新闻 / 雷峰网 · 字节 2027 届校招
澎湃 / 新浪财经 / 赛迪网 · 百度 2027 届校招
北森《AI 原生求职时代》+新浪科技报道(厂商样本,已标口径)
TechCrunch / VentureBeat · Fable 5.1 与 Mythos 5.1(9/1)
arXiv · LLM-as-a-Judge 偏见研究(含 2026 新论文)
同花顺 field.10jqka.com.cn(EGRESS_BLOCKED,已用同题报道替代)
牛客 / 小红书 / 即刻 / 知乎 直连未取到正文(未采信其中面经细节)
Reddit / Hacker News API 本期无可用条目(不影响成稿)

📌 今日与近 7 天的差异点:① 岗位组合全新(AI 全栈/Agent 开发 + 通用 AI 初筛 + 提示词/上下文工程),与昨日无一重合,#1 未连续两天重复;② 「秋招岗位名解读与投递选择」本报从未讲过(8/29 是简历侧,今天是投递侧);③ 「AI 面试官」近 7 天未进 Top 3,与 9/2「这一轮你可以用 AI」互为镜像(那条讲你怎么用 AI,今天讲 AI 怎么评你);④ 提示词/上下文工程近 7 天未出现,且避开 9/4 已讲过的「提示缓存是什么」,改为现场改稿的诊断与评分点;⑤ 硬核拆解换到「评测(Evals)」——近 7 天七个域均未涉及,该域上次为 8/21 的 pass@k/pass^k,LLM-as-a-Judge 偏见与评委校准从未拆过;⑥ 主动避开 RAG(9/4)与 Transformer(9/3);⑦ 五道快问快答与近 7 天零重合;⑧ 今日锚点三个:秋招正式批进入高峰、北森 2026 AI 招聘报告、Fable 5.1 发布(9/1)。💬 今日寄语:秋天不筛选出身,它只是把准备好的人,一个一个喊上台。

P 切换投影一屏一页模式