AI 应用工程师 / AI Agent 工程师
#2
今日锚点 + 面试官怎么问锚点:8 月 16 日 Stripe 敲定超 70 亿美元收购模型路由商 OpenRouter(为约 800 万开发者提供跨 400+ 模型的统一路由,价格是三个月前 B 轮 13 亿估值的 5.4 倍)——多模型路由这一层正从「自己搭的中间件」变成巨头的基础设施。问法:「为什么用这个模型?」→「它明天涨价一倍/被下线/出合规问题,你多久能换掉?」→「换完你怎么知道效果没变差?」
怎么答(4 点)
- 把选型答成可复现的过程,而不是口味。用自己的评测集(哪怕 30–50 条真实样本)盲测候选模型,比四个数:任务质量、延迟(首字/整体)、单位调用成本、失败率(超时、格式不合法、拒答)。「我拿 50 条真实工单跑了三个模型,A 质量高 6 个点但延迟翻倍,最后线上用 B、复杂路径兜底给 A」——胜过十句「我觉得 A 更强」。
- 分级路由:不是所有请求都该用最强的模型。面试里的标准骨架是「快路径 + 慢路径 + 前面一个路由」——意图识别、分类、格式化走小模型或蒸馏模型,复杂推理才走大模型。但一定要同时说出代价:路由本身也会判错、也要单独评测,多一跳就多一份延迟和故障面。只讲收益不讲代价,等于承认没上过线。
- 换模型的真实成本在提示词和评测,不在 API。提示词要重调(各家对结构化指令与工具调用格式的敏感度不同)、输出格式要回归(JSON/工具调用合法率会变)、评测集要整体重跑、成本要重算(输出单价通常是输入的 2–4 倍,缓存与批量折扣规则各家不同)。成熟度信号只有一个:模型调用和提示词有没有抽成一层,业务代码不写死某家 SDK。
- 对「自建路由还是买」给依据,别给绝对结论。判断维度:调用量规模(量小买现成、量大自建才划算)、合规与数据出境要求(强合规常只能自建或私有化)、是否需要按租户计量计费(这正是支付公司买路由的动机——谁掌握路由,谁就掌握计量与结算入口)。给维度而不是给结论,是这题的高分姿势。
与 8-13 那期的差异:8-13 讲的是「你怎么设计一个评测集」;今天讲的是评测集在换模型这个动作里怎么被使用——它是本题里唯一能证明「换完没变差」的东西。攒一份 30–50 条的评测集,是转行者少数不需要公司资源就能自己做出来的硬通货。