首页>国内 > 正文

改变几行代码，PyTorch炼丹速度狂飙、模型优化时间大减

2023-03-13 16:08:19来源：机器之心

如何提升 PyTorch「炼丹」速度？

最近，知名机器学习与 AI 研究者 Sebastian Raschka 向我们展示了他的绝招。据他表示，他的方法在不影响模型准确率的情况下，仅仅通过改变几行代码，将 BERT 优化时间从 22.63 分钟缩减到 3.15 分钟，训练速度足足提升了 7 倍。

(资料图)

作者更是表示，如果你有 8 个 GPU 可用，整个训练过程只需要 2 分钟，实现 11.5 倍的性能加速。

下面我们来看看他到底是如何实现的。

让 PyTorch 模型训练更快

首先是模型，作者采用 DistilBERT 模型进行研究，它是 BERT 的精简版，与 BERT 相比规模缩小了 40%，但性能几乎没有损失。其次是数据集，训练数据集为大型电影评论数据集 IMDB Large Movie Review，该数据集总共包含 50000 条电影评论。作者将使用下图中的 c 方法来预测数据集中的影评情绪。

基本任务交代清楚后，下面就是 PyTorch 的训练过程。为了让大家更好地理解这项任务，作者还贴心地介绍了一下热身练习，即如何在 IMDB 电影评论数据集上训练 DistilBERT 模型。如果你想自己运行代码，可以使用相关的 Python 库设置一个虚拟环境，如下所示：

相关软件的版本如下：

现在省略掉枯燥的数据加载介绍，只需要了解本文将数据集划分为 35000 个训练示例、5000 个验证示例和 10000 个测试示例。需要的代码如下：

代码部分截图

完整代码地址：

https://github.com/rasbt/faster-pytorch-blog/blob/main/1_pytorch-distilbert.py

然后在 A100 GPU 上运行代码，得到如下结果：

部分结果截图

正如上述代码所示，模型从第 2 轮到第 3 轮开始有一点过拟合，验证准确率从 92.89% 下降到了 92.09%。在模型运行了 22.63 分钟后进行微调，最终的测试准确率为 91.43%。

使用 Trainer 类

接下来是改进上述代码，改进部分主要是把 PyTorch 模型包装在 LightningModule 中，这样就可以使用来自 Lightning 的 Trainer 类。部分代码截图如下：

完整代码地址：https://github.com/rasbt/faster-pytorch-blog/blob/main/2_pytorch-with-trainer.py

上述代码建立了一个 LightningModule，它定义了如何执行训练、验证和测试。相比于前面给出的代码，主要变化是在第 5 部分（即 ### 5 Finetuning），即微调模型。与以前不同的是，微调部分在 LightningModel 类中包装了 PyTorch 模型，并使用 Trainer 类来拟合模型。

之前的代码显示验证准确率从第 2 轮到第 3 轮有所下降，但改进后的代码使用了 ModelCheckpoint 以加载最佳模型。在同一台机器上，这个模型在 23.09 分钟内达到了 92% 的测试准确率。

需要注意，如果禁用 checkpointing 并允许 PyTorch 以非确定性模式运行，本次运行最终将获得与普通 PyTorch 相同的运行时间（时间为 22.63 分而不是 23.09 分）。

自动混合精度训练

进一步，如果 GPU 支持混合精度训练，可以开启 GPU 以提高计算效率。作者使用自动混合精度训练，在 32 位和 16 位浮点之间切换而不会牺牲准确率。

在这一优化下，使用 Trainer 类，即能通过一行代码实现自动混合精度训练：

上述操作可以将训练时间从 23.09 分钟缩短到 8.75 分钟，这几乎快了 3 倍。测试集的准确率为 92.2%，甚至比之前的 92.0% 还略有提高。

使用 Torch.Compile 静态图

最近 PyTorch 2.0 公告显示，PyTorch 团队引入了新的 toch.compile 函数。该函数可以通过生成优化的静态图来加速 PyTorch 代码执行，而不是使用动态图运行 PyTorch 代码。

由于 PyTorch 2.0 尚未正式发布，因而必须先要安装 torchtriton，并更新到 PyTorch 最新版本才能使用此功能。

然后通过添加这一行对代码进行修改：

在 4 块 GPU 上进行分布式数据并行

上文介绍了在单 GPU 上加速代码的混合精度训练，接下来介绍多 GPU 训练策略。下图总结了几种不同的多 GPU 训练技术。

想要实现分布式数据并行，可以通过 DistributedDataParallel 来实现，只需修改一行代码就能使用 Trainer。

经过这一步优化，在 4 个 A100 GPU 上，这段代码运行了 3.52 分钟就达到了 93.1% 的测试准确率。

DeepSpeed

最后，作者探索了在 Trainer 中使用深度学习优化库 DeepSpeed 以及多 GPU 策略的结果。首先必须安装 DeepSpeed 库：

接着只需更改一行代码即可启用该库：

这一波下来，用时 3.15 分钟就达到了 92.6% 的测试准确率。不过 PyTorch 也有 DeepSpeed 的替代方案：fully-sharded DataParallel，通过 strategy="fsdp" 调用，最后花费 3.62 分钟完成。

以上就是作者提高 PyTorch 模型训练速度的方法，感兴趣的小伙伴可以跟着原博客尝试一下，相信你会得到想要的结果。

关键词：

相关新闻

改变几行代码，PyTorch炼丹速度狂飙、模型优化时间大减

如何提升PyTorch「炼丹」速度？最近，知名机器学习与AI研究者SebastianRaschka向我们展示了他的绝招。据...
提升开发人员水平的十种优秀方法

通过利用本指南详细介绍提高开发技能的十大方法，确保您作为程序员遵循最佳实践。作为一名开发人员，您...
清华朱军团队开源首个基于Transformer的多模态扩散大模型，文图互生、改写全拿下

据悉GPT-4将于本周发布，多模态将成为其一大亮点。当前的大语言模型正在成为理解各种模态的通用接口，能...
石家庄市鹿泉区扎实推动“两新”党建工作高质量发展

石家庄市鹿泉区为做好新形势下新经济组织、新社会组织、新就业群体党建工作，深入学习党的二十大精神，...
微软赢麻了！数十亿文本-图像对训练，多模态Florence开启免费体验，登上Azure

2021年11月，微软发布了一个多模态视觉基础模型Florence（佛罗伦萨），横扫超过40个基准任务，轻松适用...
数字化转型的真正关键：文化，而非技术

研究表明，单凭技术投入并不足以带来有意义的数字化转型。但是，如果能在文化层面给予等同于技术变革的...
如何向服务器添加 ssh 公钥

使用用户账号进行ssh连接认证有密码被泄露的风险，为了规避这个风险，可以使用密钥的方式进行身份认证。...
ChatGPT开源平替来了，开箱即用！前OpenAI团队打造，GitHub刚发布就揽获800+星

本文经AI新媒体量子位（公众号ID:QbitAI）授权转载，转载请联系出处。ChatGPT的开源平替来了，源代码、...
ChatGPT老板撒钱救难：百万美元帮硅谷银行受害公司，不要借条不用承诺，能还时再还

本文经AI新媒体量子位（公众号ID:QbitAI）授权转载，转载请联系出处。受硅谷银行倒闭事件波及的科技公司...
传统物联网用户的新机遇

在过去的几个月里，多个云行业参与者做出了艰难的决定，决定关闭他们的物联网平台。鉴于技术和数字基础...
英国大选时间2019_英国大选是什么

欢迎观看本篇文章，小勉来为大家解答以上问题。英国大选时间2019，英国大选是什么很多人还不知道，现在...
Web 集群如何共享 Html Php 程序

Web集群是指一组独立的服务器，它们通过某种方式协同工作来提供对外服务。在Web应用程序中，多台服务器...
Yann LeCun：不在乎社会规范，ChatGPT离真正的人还差得远

2022年底OpenAI推出ChatGPT，其爆火程度一直持续到今天，这个模型简直就是行走的流量，所到之处必将引起...
Java基础入门篇—Java注释、关键字和标识符

一、注释1 Java注释有3种：（1）单行注释。例如：publicclassHelloWorld{publicstaticvoidmai
人力资源应用ChatGPT的七个优秀示例

人力资源部门现在可以利用ChatGPT等AI工具来简化流程并提高效率。ChatGPT可以通过多种方式成为HR专业人...

聚焦

IT

科技

Copyright 2015-2020 三好网版权所有联系邮箱：435 22 640@qq.com 备案号：京ICP备2022022245号-21