跳转至

功能指南

按使用场景组织的深度指南。如果你是第一次接触框架,建议先走 🚀 快速开始,再按下面的分类深入。

  • 🚀 训练与数据


  • 🧠 模型与微调


    • PEFT 微调 — LoRA / QLoRA / AdaLoRA / IA³ / BitFit / Adapter / Prefix Tuning
    • 模型量化 — GPTQ / AWQ / SmoothQuant / 混合精度
    • 量化参数搜索 — 枚举 (bits, granularity) 最小化重建 MSE
    • 知识蒸馏--task distill、teacher-from-checkpoint、温度缩放 KL
    • 模型剪枝llm-prunePrunedLinear weight_mask、magnitude/random 策略
    • 低秩分解llm-decomposeLowRankLinear SVD U-V、rank 旋钮
    • 多模态扩展ModalityEncoderRegistry + MultimodalDataModule 契约 spike
    • 图像→Token 预处理器 — ViT 风格 patchify、图像编码链路
    • 混合专家 (MoE) — Expert Choice Routing(专家选 token、结构性负载均衡)
    • Aux 负载均衡损失 — Switch / ST-MoE 辅助均衡、防 gate 塌缩与 dead 专家
    • Soft MoE — slot 软分配、可微路由替代硬 top-k
    • 动态专家选择 — 按路由置信度逐 token 调节专家数
    • GRPO — 组相对策略优化(--task grpo、group advantage + 裁剪 policy loss)
    • Rejection Sampling — best-of-N / top-K 过滤高奖励响应再 SFT
    • RLAIF — AI/规则 judge 标定偏好 → --task dpo
    • SimPO — 无参考奖励偏好优化(--task simpo、长度归一化隐式奖励)
    • 对齐方法对比 — 同一合成偏好任务上的 DPO / PPO(RLHF) / GRPO 三方对比基准
    • Constitutional AI — 规则 constitution + 自批判→改写切片
    • Block Sparse Attention — 块稀疏注意力掩码 + CPU parity
    • StreamingLLM — attention-sink 流式掩码 + CPU parity
    • Longformer — dilated 滑窗注意力掩码 + CPU parity
    • BigBird — global+window+random 掩码 + CPU parity
    • Infinite Attention — Infini-Attention 压缩记忆(非负特征映射 + 状态累积)
    • 统一稀疏注意力 APIbuild_sparse_attention_mask(kind) 派发
  • 推理与部署


    • 推理优化 — KV cache、Paged Attention、连续批处理、Flash Attention
    • 模型导出 — ONNX / TorchScript / GGUF、自定义后端
    • 模型评估 — lm-evaluation-harness、MMLU / ARC / WikiText

相关入口

文档 说明
预训练教程 从零训练一个小型语言模型
微调教程 SFT / DPO + LoRA/QLoRA 实操
推理教程 llm-serve 部署与 API 调用
系统架构 分层设计、Registry 机制
CLI 命令参考 llm-train / llm-serve