Q1什么是「Embedding(嵌入 / 向量)」?为什么说它是大模型「理解」语言的基础?
A把一个词、一句话变成一串数字(向量),让意思相近的内容在数字空间里离得也近(「猫」和「狗」比「猫」和「汽车」更近)。有了它,计算机才能用「算距离」比较语义——这是向量检索、RAG、语义搜索的地基。一句话:Embedding = 把语言翻译成机器能算距离的坐标。
Q2什么是「涌现能力(Emergent Abilities)」?
A模型小的时候完全不会某项技能,参数/数据堆到某个临界点后突然就会了(多步推理、按格式输出),不是线性变好而是「过了个坎」。它是「大模型为什么要做大」的重要论据;能补一句「近年也有研究质疑部分涌现是评测指标选得突兀造成的错觉」显得读得细。
Q3什么是模型的「知识截止日期(knowledge cutoff)」?为什么它不知道昨天的新闻?
A模型知识来自训练时喂的那批数据,截止点之后的事它就不知道,问它「最新版本」要么答旧的要么瞎编。这正是要给它接 RAG(外挂检索)或联网工具的根本原因——用实时资料补上它「记忆之外」的那段。
Q4能不能让模型告诉你「它对这个答案有多确定」?(置信度 / logprobs)
A能,但要小心。模型每输出一个词都有概率(logprob),综合起来能得到「置信度」,可用来筛「没把握」的回答转人工。但关键坑是:模型「说得很自信」≠「答得对」,它可能高置信地胡说(幻觉)。所以置信度只能当参考信号,不能当正确性证明。
Q5什么是「思维树(Tree-of-Thoughts, ToT)」?它比思维链(CoT)强在哪?
A思维链让模型「一条道走到黑」地一步步推理;思维树则让它像下棋一样同时展开多条思路、比较哪条更靠谱、走不通就回头换一条。适合有多种解法、需要试探回溯的难题(数学、规划)。代价是算得更多更贵,是「难题才上」的重武器,不是默认选项。