1. 项目概述
作为一名长期深耕AI领域的技术博主,我经常收到读者关于大模型术语的咨询。今天,我将系统梳理36个AI大模型领域的核心术语,帮助开发者从入门到精通掌握这个快速发展的领域。这些术语不仅是理解大模型的基础,更是实际开发中必须掌握的关键概念。
2. 核心术语分类解析
2.1 基础架构类术语
大语言模型(LLM)大型语言模型(Large Language Model)是通过海量数据(通常TB级以上)训练而成的深度学习模型,参数量可达数十亿甚至数万亿。这类模型不仅能处理自然语言文本,还能理解和生成声音、图像等多模态内容。
Transformer架构这是当前主流大模型的基础架构,其核心是自注意力机制。相比传统RNN,它能更好地捕捉长距离依赖关系。Transformer由编码器和解码器组成,GPT系列主要使用解码器,而BERT则使用编码器。
注意力机制模型在处理每个词时,能够动态分配不同权重关注输入序列的其他部分。这种机制解决了传统序列模型的信息衰减问题,计算公式为: Attention(Q,K,V)=softmax(QK^T/√d_k)V
参数微调(Finetuning)在预训练模型基础上,使用特定领域数据继续训练的过程。常见方法包括:
- 全参数微调:更新所有参数
- LoRA:仅更新低秩适配矩阵
- P-Tuning:仅更新提示词嵌入
2.2 训练与优化术语
预训练(Pretraining)模型在大规模无标注数据上进行的初始训练,目标是学习通用的语言表示。典型任务包括掩码语言建模(MLM)和下一句预测(NSP)。
强化学习人类反馈(RLHF)通过人类对模型输出的评分来优化模型的技术。主要包括三个阶段:
监督微调(SFT)
奖励模型训练
强化学习优化
分布式训练大模型训练通常需要多GPU/TPU并行,主要策略有:
- 数据并行:拆分批次到不同设备
- 模型并行:拆分模型层到不同设备
- 流水线并行:按层分阶段执行
- 混合精度训练同时使用FP16和FP32数据类型来加速训练并减少显存占用。关键是要使用损失缩放(loss scaling)来避免梯度下溢。
2.3 推理与应用术语
- 生成策略
- 贪婪搜索:每一步选概率最高的词
- 束搜索(Beam Search):保留多个候选序列
- 温度采样:通过温度参数控制随机性
- Top-k/p采样:限制候选词范围
- 提示工程(Prompt Engineering)设计有效提示词的技巧,包括:
- 零样本提示:直接给出任务描述
- 少样本提示:提供少量示例
- 思维链提示:引导模型分步推理
检索增强生成(RAG)结合外部知识库的生成技术,工作流程:
用户提问
检索相关文档
将文档和问题一起输入模型
生成最终回答
智能体(Agent)具备自主决策能力的AI系统,通常包含:
- 记忆模块
- 规划模块
- 工具调用能力
- 反思机制
3. 关键技术深度解析
3.1 模型量化技术
- 权重量化将模型参数从FP32转换为低精度格式(如INT8)以减少模型大小和推理延迟。常见方法:
- 动态量化:推理时实时转换
- 静态量化:提前校准量化参数
- QAT:训练时模拟量化效果
- KV缓存优化在生成式任务中缓存先前计算的Key-Value矩阵,避免重复计算。优化策略包括:
- 分块缓存
- 压缩缓存
- 动态缓存管理
3.2 微调技术对比
Adapter在Transformer层间插入小型神经网络模块,仅训练这些适配器参数。优势是参数效率高,但可能增加推理延迟。
Prefix Tuning在输入前添加可训练的前缀向量,引导模型行为。相比提示微调,这些前缀参数是连续向量而非实际token。
Prompt Tuning类似Prefix Tuning,但通常指面向具体任务的提示词优化。适用于少样本场景,对基础模型影响最小。
4. 应用开发框架
4.1 主流开发工具
- LangChain提供组件化的大模型应用开发框架,核心概念包括:
- Chains:任务流程编排
- Agents:工具调用能力
- Memory:对话状态管理
- Indexes:文档检索集成
- LlamaIndex专注于RAG应用的框架,提供:
- 文档加载和解析
- 高级检索策略
- 查询改写功能
- 响应合成优化
- HuggingFace生态包含:
- Transformers库
- Datasets数据集管理
- Accelerate分布式训练
- Inference API服务
4.2 部署优化工具
- vLLM高性能推理引擎,特点:
- 连续批处理
- PagedAttention技术
- 支持多种量化方案
- 高吞吐量服务
- TensorRT-LLMNVIDIA推出的推理优化库,提供:
- 内核融合优化
- 特殊算子实现
- 动态批处理
- 多GPU支持
5. 评估与监控
5.1 评估指标
困惑度(Perplexity)衡量语言模型预测能力的指标,数值越低越好。计算公式为: PP(W)=exp(-1/N Σ logP(w_i|w_<i))
BLEU分数机器翻译质量评估指标,通过比较生成文本和参考文本的n-gram重叠度计算。
ROUGE主要用于文本摘要评估,计算召回率导向的n-gram重叠。
5.2 可观测性
- Langfuse开源LLM应用监控平台,可追踪:
- 提示词和补全
- 延迟和消耗
- 用户反馈
- 链式调用
- Promptfoo提示词测试和评估工具,支持:
- 批量测试用例
- 自动评分
- 版本对比
- 可视化分析
6. 前沿技术方向
6.1 模型架构创新
Mixture of Experts(MoE)稀疏化模型架构,每层包含多个专家网络,每个token只路由到部分专家。优势是参数量大但计算量可控。
Retrospective Models通过检索和记忆机制增强模型能力,典型代表如Retro、REPLUG等。
6.2 多模态扩展
CLIP连接文本和图像编码器的多模态模型,支持跨模态检索和生成。
Flamingo处理交错图像和文本输入的对话模型,具备强大的上下文理解能力。
7. 实用资源推荐
7.1 学习路径
- 大模型学习路线建议的学习顺序:
- Transformer基础
- 预训练方法
- 微调技术
- 应用框架
- 部署优化
7.2 开发工具链
- 完整工具栈典型开发环境包含:
- 代码编辑器(VSCode等)
- 版本控制(Git)
- 环境管理(Conda)
- 实验跟踪(Weights&Biases)
- 容器化(Docker)
8. 常见问题解答
- 如何选择基础模型?考虑因素包括:
- 任务类型(生成/理解)
- 语言支持
- 计算资源
- 商业授权
- 处理长文本的挑战解决方案:
- 扩展上下文窗口
- 层次化注意力
- 检索增强
- 摘要压缩
- 降低推理成本的方法有效策略:
- 模型量化
- 缓存机制
- 动态批处理
- 边缘部署
在实际项目开发中,我发现合理使用RAG架构可以显著降低幻觉问题,特别是在专业领域应用中。同时,建立完善的评估体系对持续优化模型表现至关重要。