Q:Agent 的「记忆」到底是什么?短期和长期记忆分别怎么实现?
A:Agent 没有真正的记忆,所谓记忆就是「每次调用前你往上下文里塞了什么」。短期 = 当前会话历史,满了就摘要压缩;长期 = 存进外部存储(向量库存「语义相关的往事」、结构化库存「用户的确定性事实」),下次按需检索塞回去。加分点:说破「长期记忆本质是一次 RAG」,并补「要有遗忘/更新策略」——用户改了地址,旧记忆不删会一直污染回答。
Q:什么是 LoRA?为什么它能让一张消费级显卡就微调大模型?
A:LoRA 不动原模型参数,只在旁边挂一小撮可训练的「补丁」,训练时只更新这撮。大白话:原模型是印好的百科全书,全量微调等于整本重印,LoRA 等于在书页边贴便利贴、只写便利贴。要更新的参数常只有千分之几,显存和成本直线下降。加分点:提「秩 r 越大表达力越强但越易过拟合、越费显存」,以及「QLoRA = 先量化压小再挂 LoRA」。
Q:什么是 AI 产品的「冷启动」问题?没有数据的时候怎么办?
A:冷启动 = 刚上线时既没用户行为数据也没领域样本,效果差 → 留不住用户 → 更没数据的死循环。四条破法:① 规则和人工先兜底;② 借外部知识替代内部数据(先上 RAG 挂公开文档,而不是等攒数据去微调);③ 设计能自然产生标注的交互(点赞点踩、人工接管记录都是免费训练信号);④ 小范围灰度。加分点:「冷启动阶段我不追求模型多准,我追求把数据飞轮先转起来」。
Q:JD 上写「熟悉 Linux / Docker」,转行者要补到什么程度才够?
A:够用的标准是「能自己把一个服务跑起来并说清它跑在哪」,不是「能运维集群」。Linux:看日志、查进程查端口、改权限、用 ssh/scp 登服务器传文件;Docker:看懂 Dockerfile、会 build/run/logs、知道端口映射和挂载卷干什么。加分点:别空口说「熟悉」,说一件具体的事——「我把自己的 RAG demo 打成镜像部署在云服务器上,用 Nginx 做了反代,遇到 XX 问题这么解决的」,这一句抵十个「熟悉」。
Q:非技术岗被问「你怎么和算法同学协作、需求怎么提」,怎么答才不空?
A:答「我提的是问题和验收标准,不是解法」。三点:① 需求写成「输入 → 期望输出 → 判错标准」,最好附 10–20 条真实 badcase;② 主动承担评测集建设——把「什么算答对」定义清楚并维护测试集;③ 接受概率性,不问「能不能 100% 准」,问「现在多少、还能提多少、剩下的错怎么兜」。加分点:「我会先跟算法同学一起标 50 条,标完常发现是我们对『对』的定义没统一」——只有真干过的人说得出来。