首页 >科技周边 >人工智能 >Easy and Efficient Transformer(网易超大模型线上推理引擎)

Easy and Efficient Transformer(网易超大模型线上推理引擎)

王林
王林转载
2024-01-24 10:45:05452浏览

Easy and Efficient Transformer(网易超大模型线上推理引擎)

网易开源的针对transformer-based模型的推理加速框架,支持在中低端Ampere架构上单卡高性能推理百亿级模型。

项目背景

基于变压器的大规模模型在许多领域的各种任务中被证明有效。然而,将其应用于工业生产需要付出大量的努力来降低推理成本。为了填补这一空白,我们提出了一种可扩展的推理解决方案:Easy and Efficient Transformer (EET)。 EET是一个包含算法和实现层面的一系列Transformer推理优化的系统。通过优化Transformer的计算和数据流程,EET能够显着降低推理成本,提高模型的效率和性能。我们的实验结果表明,EET在不损失模型精度的情况下,能够显着提高推理速度和资源利用率,为工业生产中的大规模模型应用提供了一种简单有效的解决方案。

首先,我们为长输入和大隐藏尺寸设计了高度优化的内核。

此外,我们还提出了一种灵活的CUDA内存管理器,以降低大型模型部署时的内存占用。与最先进的Transformer推理库(Faster Transformer v4.0)相比,EET在A100 GPU上能够实现平均1.40-4.20倍的解码层加速。

论文地址

https://arxiv.org/abs/2104.12470

Github地址

https://github.com/NetEase-FuXi/EET

以上是Easy and Efficient Transformer(网易超大模型线上推理引擎)的详细内容。更多信息请关注PHP中文网其他相关文章!

声明:
本文转载于:163.com。如有侵权,请联系admin@php.cn删除