Q · Transformer
MHA / MQA / GQA 有什么区别?为什么爱用 GQA?
区别在多个 Query 头共享多少组 K/V:MHA 各头独立(最好但最占 KV Cache)、MQA 全共享(最省易掉点)、GQA 分组折中。GQA 几乎不掉效果又压缩 KV Cache、加速推理,成 Llama 等标配。
Q · 训练对齐
LoRA 为什么能大幅省显存?
不动原模型海量参数,只在旁加两个低秩小矩阵学「变化量」(ΔW≈B·A),原权重冻结,显存和存储省一个数量级。(低秩=用「瘦长两块」近似「一大块」。)
Q · 推理部署
temperature 和 top-p 有什么区别?
temperature 调分布「陡峭度」(低→保守、高→发散);top-p(核采样)调「候选范围」(只在累计概率达 p 的词里采样,砍长尾)。要稳就低 temperature,要创意适当调高。
Q · Agent
Function Calling 底层原理?模型真能自己调 API?
模型不执行任何函数,只输出「结构化的调用意图」(JSON)。你把工具名和参数格式喂给它,它选工具、生成参数,真正执行由你的代码完成再回填。是 Agent 能动手的地基。
Q · 机器学习基础
什么是过拟合?怎么判断和缓解?
模型把训练集背太死、遇新数据就拉胯(训练准、测试差)。看训练/验证误差差距是否拉大。缓解:加数据/增强、正则(L1/L2、Dropout)、早停、降复杂度、交叉验证。
刷题心法
八股别死背——「先看面试翻车现场 → 再看图解原理 → 合上网页自己复述一遍」,能复述才算真会。