人工智能大模型模型压缩模型量化模型蒸馏模型优化【免费下载链接】AngelSlimModel compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.项目地址https://gitcode.com/gh_mirrors/an/AngelSlim点击查看免费下载AngelSlim 是腾讯混元团队开源的大模型压缩工具包将量化、投机解码投机采样、稀疏注意力、蒸馏、Token 剪枝等主流模型压缩算法整合进统一框架覆盖 Qwen3、Hunyuan、DeepSeek、GLM 等主流 LLM/VLM/语音/扩散模型端到端打通从压缩到部署的全流程。本文面向新手带你 5 分钟上手这个「大模型压缩神器」掌握一键量化、推理加速与长上下文稀疏化的完整用法。 认识AngelSlim一站式大模型压缩工具箱AngelSlim 的设计目标是更易用 更全面 更高效高度集成FP8/INT8/INT4 量化、Eagle3 投机解码训练、Stem 稀疏注意力等算法全部注册进统一引擎一条命令即可调用持续创新除工业界通用算法外还内置自研算法如 DAQ、DFlare、D-Cut、Stem、LeptoQuant 等性能导向支持在单卡上完成 Qwen3-235B、DeepSeek-R1 级别大模型的量化压缩。它覆盖的模型场景与压缩策略如下模型类型量化投机解码其他压缩技术LLMQwen3/Hunyuan/DeepSeek/GLMFP8、INT8、INT4-GPTQ/AWQ、NVFP4Eagle3、DFlare、DFly、MTP、SpecExitStem 等稀疏注意力VLMQwen3-VL、Qwen2.5-VLFP8、INT8、INT4Eagle3Token 剪枝IDPruner、VisionZip扩散模型FLUX、SDXL 等FP8-Dynamic、FP8-Weight-Only-DeepCache、TeaCache语音Qwen3-Omni、Qwen2-AudioFP8、INT8Eagle3-完整的模型与技术矩阵可参考官方文档首页 docs/source/index.md。 快速上手安装AngelSlim并一键压缩模型安装步骤pip一条命令pip install angelslim依赖清单见 requirements/requirements.txt按需安装可选依赖如[sparse]、[multimodal]。核心工作流配置驱动四步完成压缩AngelSlim 采用「YAML 配置驱动」的设计整体流程分为四步核心引擎在 angelslim/engine.pyPrepare Model通过模型注册工厂加载目标模型Prepare Data加载校准数据集内置 ShareGPT 等示例数据如 dataset/sharegpt_gpt4/sharegpt_gpt4_256.jsonlRun执行选定的压缩算法量化/投机采样/稀疏化Save / Deploy导出压缩权重直接对接 vLLM、SGLang 等推理框架。最快体验一条命令完成FP8量化仓库的 configs/ 目录下按「模型 × 压缩策略」组织了大量现成 YAML例如对 Qwen3-1.7B 执行静态 FP8 量化python3 tools/run.py -c configs/qwen3/ptq/fp8_static/qwen3-1_7b_fp8_static.yaml配置文件由三大块组成tools/run.py 负责解析调度配置块作用常见字段model指定要压缩的模型name、model_path、torch_dtypecompression指定压缩算法与参数name: PTQ、quantization.name: fp8_staticdataset指定校准数据集data_path、num_samples、batch_size以 configs/qwen3/ptq/fp8_static/qwen3-1_7b_fp8_static.yaml 为例ignore_layers可以跳过对精度敏感的lm_head层。修改配置的完整教程见 docs/source/design/prepare_config.md。 显存不足时可切换 low-memory 模式或PTQWeightOnly路径直接处理 safetensors不占 GPU 显存例如 FP8 block-wise 分块量化脚本 tools/fp8_quant_blockwise.py 支持多 GPU 并行。 量化FP8/INT8/INT4压缩方案怎么选量化是 AngelSlim 支持最完整的压缩方向核心入口是 angelslim/compressor/quant/ptq.py支持的算法一览算法特点适用场景FP8-Static / Dynamic显存减半精度几乎无损首选方案INT8-Dynamic兼容性好消费级 GPUINT4-GPTQ / AWQ4bit 极致压缩显存极度紧张W4A8-FP8权重 4bit 激活 FP8DeepSeek-R1 类超大 MoENVFP4 / MXFP4新一代 4bit 格式Blackwell 等新硬件量化前后权重分布从「密集小值」变为「低比特离散值」如下面的权重直方图对比所示BF16 vs FP8精度表现如何以 Qwen3 系列为例数据来自 README 官方基准模型量化方式CEVALMMLUGSM8KHumanEvalQwen3-8BBF1679.2774.7887.7963.41Qwen3-8BFP8-Static78.2374.7986.9662.20Qwen3-8BINT4-GPTQ77.1973.2686.4362.20FP8 量化后各项指标与原始模型基本持平而权重体积直接减半。更多算法细节见 docs/source/features/quantization/fp8.md、docs/source/features/quantization/gptq.md 和 docs/source/features/quantization/awq.md。除 PTQ训练后量化外AngelSlim 还提供QAT量化感知训练、QAD量化感知蒸馏基于 Megatron-Core 分布式与QAT Zero3方案适合对精度要求苛刻的场景详见 docs/source/features/quantization/qat.md。 投机解码Eagle3与DFlare无损加速推理大模型推理慢投机解码Speculative Decoding是精度无损的加速方案让一个小而快的草稿模型先「猜」出多个 token再由目标模型一次性并行验证。AngelSlim 内置了完整的投机解码训练与测试工具链angelslim/compressor/speculative/支持的方法包括Eagle3目前最成熟、加速最稳的方案LLM/VLM/语音模型均有 1.4~1.9× 实测解码加速DFlare块扩散式投机解码框架通过「逐层融合」把目标模型多层隐藏状态融合给草稿层使用最高实现5.52× 端到端加速DFly / MTP新一代草稿方法在 Hy3-A21B 上平均1.98~2.40×加速SpecExit推理早退算法推理类任务可提前结束思考进一步省算力。训练脚本示例scripts/speculative/train_eagle3_online.sh、scripts/speculative/run_dflare_online.sh算法原理与复现步骤见 docs/source/features/speculative_decoding/eagle/index.md 和 docs/source/features/speculative_decoding/dflare.md。✂️ 稀疏化Stem加速长上下文Prefill处理 32K~128K 长上下文时Prefill 阶段的注意力计算量随序列长度平方增长。AngelSlim 的稀疏注意力模块angelslim/compressor/sparsity/通过动态跳过低重要性注意力块来削减计算Stem稳定版先用低成本的块级打分估计每个 attention block 的重要性再只对 top-k 关键块执行精确注意力Prefill 大幅提速且质量基本无损MInference / FlexPrefill / XAttention 等实验性算法亦可一键调用。如上图所示在 FP8-W8A8 Stem 配置下模型在 SWE-bench Verified72.40 vs 74.40等基准上与 BF16 基线基本持平。使用方式与其他压缩策略统一——只需一份 YAMLpython tools/run.py -c configs/sparse/stem/qwen3-8b_stem_torch.yaml参数说明与原理推导参考 docs/source/features/sparse_attention/stem.md更多稀疏策略配置在 configs/sparse/。 还有哪些隐藏能力蒸馏支持全精度模型与量化模型的 QAT 式蒸馏见 angelslim/compressor/distill/QADMegatron-Core 量化感知蒸馏TP/EP/CP/SP 分布式下直接训练量化模型配置示例 configs/qwen3/mcore_qad/qwen3_moe_nvfp4.yamlToken 剪枝视觉 Token 压缩统一框架IDPruner、VisionZip、FastV 等 11 种算法在 75% 压缩率下平均保留94.42%精度配置见 configs/qwen2_5_vl/pruning/SmoothQuant / 旋转变换量化前对权重做平滑/旋转预处理见 angelslim/compressor/transform/。 部署验证压缩完直接上线压缩后的模型可直接对接主流推理引擎仓库自带部署脚本docs/source/deployment/deploy.md# vLLM 启动 OpenAI 兼容 API 服务 bash scripts/deploy/run_vllm.sh --model-path $MODEL_PATH --port 8080 -d 0,1,2,3 -t 4 # 离线快速验证 python scripts/deploy/offline.py $MODEL_PATH Hello, my name is # 精度评测lm-evaluation-harness bash scripts/deploy/lm_eval.sh -d 0,1 -t 2 -r $RESULT_PATH --tasks ceval-valid,mmlu,gsm8k $MODEL_PATH 学习路径小结想做什么从哪入手第一次量化docs/source/getting_started/quickstrat.md改配置/换模型docs/source/design/prepare_config.md研究算法实现angelslim/compressor/ 下 quant / speculative / sparsity 目录复现性能数据evaluation/ 与 README.md 中 Benchmark 章节AngelSlim 用「一个引擎 一份 YAML」的极简设计把原本分散在多个项目里的大模型压缩技术整合成了开箱即用的工具链——无论你想省显存、降延迟还是压缩长上下文都能在这里找到对应的一键方案。赞分享人工智能大模型模型压缩模型量化模型蒸馏模型优化【免费下载链接】AngelSlimModel compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.项目地址https://gitcode.com/gh_mirrors/an/AngelSlim点击查看免费下载相关推荐如何快速掌握fastai模型剪枝神经网络稀疏化与压缩完整指南如何快速掌握fastai模型剪枝神经网络稀疏化与压缩完整指南 fastai深度学习库是一款强大的工具帮助开发者和研究人员快速构建和训练各种深度学习模型。在实人工智能深度学习FlashMLA模型压缩指南结合量化与稀疏的双重优化策略FlashMLA模型压缩指南结合量化与稀疏的双重优化策略 FlashMLA作为高效的MLA解码内核项目通过量化与稀疏化双重优化策略在保持模型性能的同时显著算子库大模型如何高效压缩Denoising Diffusion模型权重量化与稀疏化协同优化终极指南如何高效压缩Denoising Diffusion模型权重量化与稀疏化协同优化终极指南 Denoising Diffusion模型作为当前AI图像生成领域的核人工智能深度学习媒体生成创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考