什么是「幻觉(hallucination)」?为什么大模型会一本正经胡说,怎么减少?
流畅但与事实不符的生成。根因是它本质在「猜下一个最像的词」,不真「知道」对错。减少三招:挂知识库(RAG)让它有据可依、加「找不到就说不知道」的兜底、对关键输出做二次校验。
什么是 MoE(混合专家)模型?为什么 2026 很多大模型都用它?
把大模型拆成很多「专家」子网络,每次推理只激活一小部分。好处是「总参数大(能力强)、单次算得少(更省更快)」——养一屋子专家,每次只叫最对口的几个来干活。
什么是量化(quantization)?为什么它能让大模型跑在更小的显卡上?
把参数从高精度(如 16 位浮点)压成低精度(8 位/4 位整数),显存和计算量随之大降,精度略损。像把高清图压成小体积,肉眼几乎看不出差别。GPTQ/AWQ 是常见方案。
什么是 Function Calling(函数调用)?和普通聊天有什么不同?
普通聊天是模型「用文字回你」;Function Calling 是模型判断「该调工具了」,输出结构化指令(调哪个函数、传什么参数),由你的程序真正执行再把结果喂回。它是 Agent 能「动手」而不只「动嘴」的底层机制。
什么是 grounding(接地/有据可依)?为什么它是评估 AI 客服好坏的关键?
模型回答是否真基于给定资料而非自己编的。评 AI 客服光看「流不流畅」不够,要看「每句能不能在原文找到出处」——groundedness 高才说明没瞎编,是 2026 LLM 上线评测的高频硬指标。