提示词工程师
#2
📌 今日锚点:SurePrompts/TheInterviewGuys 2026 面试题汇总一致指出,「Prompt 评测与 A/B 测试」已成高频必考题;「Prompt 工程师过剩」讨论再次升温——只会写,没有闭环评测能力,站不住脚。
题目 / 场景「你写了一个新版 Prompt,怎么证明它比旧版好?」考的不是技巧,而是有没有工程思维——能把感觉变成数据。
怎么答(评测闭环四步法)
- 定义「好」的标准(量化指标):分类任务看准确率;摘要任务看忠实度;对话任务看满意度。先把指标写明白,评测才有基准。
- 构建评测集:30–100 个测试输入,覆盖常规样本 + 边界样本 + 容易出错的样本。没有评测集,所有改动都是蒙。
- A/B 对照实验:同一批样本分别跑旧版/新版 Prompt,控制变量(模型版本、温度不变)。例:「新版准确率高 15%,token 多 80(成本涨约 0.2 分)」。
- 迭代 + 版本记录:根据数据改,发现规律性错误继续调优,建立版本日志,不回头。
过来人提醒:能说出「我会建一个小评测集来量化改动效果」就是加分项。提示词岗正在速朽,但把「Prompt 评测能力」当敲门砖进 AI PM 或 AI 应用工程师,才是更聪明的定位。