首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
MoE就是复制的mlp;gate 训练就是谁答的好久分给谁奖励
📅 2026/9/25 18:54:55
✍️ 爱科研究院
👁 阅读 3,247
MoE-MLP 完整流转(输入→门控选专家→专家计算→输出)目录MoE-MLP 完整流转(输入→门控选专家→专家计算→输出)一、先固定:几个专家、选几个(人工超参,不是模型决定)二、内部逐层流转(一个token,从输入到输出)步骤1:Gate门控打分(核心,一个线性层)步骤2:softmax转概率步骤3:选Top-K(这里K=2)步骤4:只把x送进选中的专家(每个专家就是你截图的MLP)步骤5:按Gate概率加权合并 → 最终输出关键:Gate怎么"学会"选哪个专家Gate 为什么能打分?关键:每个专家在Gate里有一列专属权重用最小数字演示(d=2,2个专家)为什么点积能衡量"匹不匹配"这套"模板"哪来的专家分工是怎么来的?分工靠一个"正反馈"循环每层Gate权重都不一样为什么不统一两个辅助机制为什么能分开MoE 放在哪一层?Gate 权重怎么训练?梯度怎么传回来(关键)直觉例子(一个中文token)还有第二股梯度:负载均衡loss更新公式(和普通训练一样)MoE就是把这1套MLP复制成N份(N个专家),再加1个Gate门控。一、先固定:几个专家、选几个(人工超参,不是模型决定)这两个数字训练前写死,模型不会自己变:num_experts:总专家数,比如8个(专家E0~E7,每个都是你截图里那套 w1+gelu+w2 的MLP)top_k:每个token激活几个专家,比如Top2(Switch Transformer是Top1)专家数量 = 代码配置,不是MLP算出来的;门控只负责"从N个里挑哪K个"。二、内部逐层流转(一个token,从输入到输出)设:隐藏维d=4,8个专家,Top2,输入token向量x = [ 0.1 , 0.2 , 0
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/9/25 18:54:55
3DGS高斯泼溅项目环境搭建(传统Windows版)和ooosplat直接安装使用
2026/9/25 18:54:55
计算机二级 Python 备考路线:考点分值分布、高频易错点与冲刺计划
2026/9/25 18:54:55
高分子材料燃烧的化学机理是什么?从热分解到自由基链式反应
2026/9/25 19:34:57
评测打分校准:LLM 裁判长度惩罚项设计与多项式非线性校正
2026/9/25 19:34:57
手写 LRU 缓存踩坑记:淘汰端写错被断言当场抓出
2026/9/25 19:34:57
科研论文从 ArXiv 预印本推介到学术影响力传播:GitHub、Twitter 与学术社区运营
2026/9/25 19:34:57
论文复现工坊 No.25:从零复现 CPO 对比偏好优化机器翻译对齐
2026/9/25 19:34:57
Stable Diffusion部署全攻略:官方、整合包、Docker与ComfyUI对比
2026/9/25 19:29:57
A.每日一题:3498. 字符串的反转度
2026/9/25 0:03:37
AI元人文:从工具使用到思维重构的深度探索
2026/9/25 0:03:37
Python+CNN车牌识别实战:从数据预处理到模型训练与部署
2026/9/25 0:03:37
Vim基础操作全攻略:保存退出、模式切换与高频命令实战
2026/9/25 5:41:44
深入解析Transformer多头注意力机制与工程优化
2026/9/25 5:41:44
OpenClaw 的 Skills 跑学习任务,模型通道改到 TaoToken 通道行不行?
2026/9/25 5:41:44
ChatGPT报错Oops, an error occurred! 全链路排查指南