WideNet:让网络更宽而不是更深

这是新加坡国立大学在2022 aaai发布的一篇论文。WideNet是一种参数有效的框架,它的方向是更宽而不是更深。通过混合专家(MoE)代替前馈网络(FFN),使模型沿宽度缩放。使用单独LN用于转换各种语义表示,而不是共享权重。

 

https://avoid.overfit.cn/post/fd66d50b81fc4e4e83bb3bba42f41dee

posted @ 2023-07-05 10:11  deephub  阅读(15)  评论(0编辑  收藏  举报