Q1 · 上下文窗口
什么是 context window,为什么它有限很关键?
它是大模型一次能「读进去」的最大文本长度(按 token 计),超了就截断或遗忘。它决定一次能塞多少资料、也直接影响成本(越长越贵)——RAG、长文档问答的很多设计都在跟这个上限较劲。
Q2 · precision vs recall
两者区别,什么时候看哪个?
precision 看「你判为正的里有多少真对」,recall 看「真正该抓的抓到了多少」。怕误伤(推荐、内容审核)重 precision,怕漏抓(疾病筛查、风控)重 recall,常此消彼长,用 F1 折中。
Q3 · 量化 quantization
什么是模型量化,为什么要做?
把权重从高精度(FP16)压成低精度(INT8/INT4),用一点精度换显存和速度。让大模型塞进更小显卡、跑得更快更便宜,是推理降本常规操作(常见 GPTQ / AWQ)。
Q4 · BLEU/ROUGE 局限
为什么它们不够评测大模型生成?
只比「和参考答案字面重不重合」,管不了意思对不对、有没有幻觉。大模型答案措辞千变万化却都对,字面比对会误杀——现在多叠加 LLM-as-a-Judge、人工抽检、faithfulness 来补。
Q5 · embedding
什么是向量表示,RAG 为什么离不开它?
把文字变成一串能表示「语义」的数字向量,意思相近的向量也相近。RAG 靠它把问题和文档都变向量,用相似度快速找最相关资料喂给模型,没它就没法做语义检索。