摘要: 引言 基于 transformer 的模型已被证明对很多 NLP 任务都非常有用。然而,O(n2) 的时间和内存复杂度 (其中 n 是序列长度) 使得在长序列 (n>512) 上应用它们变得非常昂贵,因而大大限制了其应用。最近的几篇论文,如 Longformer 、Pe 阅读全文
posted @ 2023-11-24 01:41 HuggingFace 阅读(719) 评论(0) 推荐(0) 编辑
点击右上角即可分享
微信分享提示