LLM 基础
沿六篇长文理解文字编码、Transformer、训练与生成、上下文缓存、多模态,以及模型应用的能力、成本与可靠性。
文字怎样变成模型的输入:Token、Tokenizer 与向量表示
更新于:LLM 基础沿一句售后问题,手推子词切分,观察聊天模板、Token ID、掩码和 Embedding 如何组成模型输入。
Transformer 怎样处理一句话:从 Attention 到完整计算过程
更新于:LLM 基础用向量手算和完整前向代码,解释 QKV、多头、位置编码、FFN、残差、归一化与输出投影,并理解 GQA 和 MoE。
大模型怎样学会回答:训练、指令微调与生成策略
更新于:LLM 基础从错位标签和交叉熵走到梯度更新,解释预训练、SFT、偏好优化与 LoRA,再用概率例子理解采样和幻觉。
一次对话怎样运行:上下文、KV Cache 与流式生成
更新于:LLM 基础从两次请求的差异理解历史、窗口预算、Prefill、Decode、KV Cache 与流式返回。
模型怎样看图和听声音:多模态与实时对话
更新于:LLM 基础从破损照片和语音售后问题,理解视觉编码、跨模态连接、语音链路、播放与打断,以及多模态证据的边界。
怎样把模型用进应用:能力、显存、速度、成本与可靠性
更新于:LLM 基础用同一组客服任务理解质量、延迟、Token 费用与失败处理,再决定调用方式。