Q什么是 Tokenizer(分词器)?为什么大模型按 token 计费,而不是按字?
ATokenizer 把文本切成模型认识的最小单位「token」(可能是一个词、半个词或一个汉字)。模型只认 token 不认字,计费和上下文长度都按 token 算——一个英文单词常算 1 个 token,一个汉字常算 1~2 个,同样字数中文往往更「费」token。
Q向量数据库(vector DB)是干嘛用的?
A专门存「文本转成的一串数字(向量)」并做相似度检索的数据库,是 RAG 的记忆仓库——你提问时它按「语义相近」而非「字面相同」找资料,所以你问「手机没电」,也能匹配到写「电池续航」的那篇。
Q采样时的 Top-k 和 Top-p(nucleus)有什么区别?
ATop-k 是「只从概率最高的 k 个词里挑」(固定个数);Top-p 是「从累计概率凑到 p 的那批词里挑」(个数随情况变)。Top-p 更灵活——该确定时候选少、该发散时候选多,所以现在更常用。
QRAG 里常说的「Lost in the Middle」是什么坑?
A指把一堆资料塞进很长的上下文时,模型对「开头和结尾」记得清、对「中间」容易忽略。所以最相关的资料要放开头或结尾、别埋中间,并靠「重排(reranker)」把最关键那条顶上去。
Q为什么 BLEU / ROUGE 这类指标不适合评测大模型的生成质量?
A它俩靠「和标准答案字面重合多少」打分。可大模型能用完全不同的措辞给出同样正确的回答,字面对不上但意思全对——所以现在更多用 LLM-as-a-Judge 或 faithfulness 这类语义/事实层面的评测。