AI Agent 工程师#1Agent 跑二十分钟后失败,如何从正确位置恢复?把流程拆成检查点;有副作用的调用必须使用业务幂等键。保存稳定输入输出与状态。未知状态先向外部系统对账。区分重试、拒绝和人工复核。记录完整审计轨迹。提醒:自动重试不是可靠性设计,关键是证明不会重复产生副作用。来源:OpenAI Agents API
AI Infra 工程师#2实时语音 Agent 的延迟预算怎么拆?拆为端点检测、网络、模型首 token、语音合成和播放缓冲。监控 P50/P95/P99。定位网络、排队或模型长尾。峰值时限制上下文与工具深度。用背压、超时与熔断保护系统。提醒:先给指标和容量假设,再谈优化技术。来源:OpenAI GPT Live 1
AI 训练师#3怎样验收一批高风险领域训练数据?规则、双标、仲裁、难例抽检和来源追溯缺一不可。写清标签定义与拒标条件。计算双人标注一致性。提高难例与少数类抽检。检查数据泄漏、隐私和版权。提醒:高阶训练师看的是质量诊断与领域判断。来源:Anthropic 威胁情报
幂等与检查点超时只说明没收到答案,不代表对方没做成。使用业务级 operation ID。未知状态通过查询接口对账。状态机区分 pending / succeeded / failed / needs_review。补偿操作同样要可审计。记忆钩子:超时不是失败;先对账,再重试。