随笔分类 -  216_Horovod

Horovod相关
摘要:本文以 PyTorch on Horovod 为切入点,分析一下 Horovod 弹性训练的恢复流程,具体涉及知识点有:ElasticSampler与PyTorch 原生DistributedSampler 的区别,Horovod 弹性训练如何恢复等。 阅读全文
posted @ 2021-09-18 15:47 罗西的思考 阅读(661) 评论(0) 推荐(0) 编辑
摘要:本文是 horovod on k8s 的最后一篇,看看 MPI-Operator 可能被如何改进。 阅读全文
posted @ 2021-07-28 19:43 罗西的思考 阅读(883) 评论(0) 推荐(0) 编辑
摘要:Horovod 是一款基于 AllReduce 的分布式训练框架。本文是 Horovod on k8s 第二篇,介绍MPI-Operator。 阅读全文
posted @ 2021-07-26 14:21 罗西的思考 阅读(2258) 评论(0) 推荐(0) 编辑
摘要:Horovod 是一款基于 AllReduce 的分布式训练框架。本文是 Horovod on k8s 第一篇,介绍kubeflow tf-operator。 阅读全文
posted @ 2021-07-23 17:02 罗西的思考 阅读(1685) 评论(0) 推荐(0) 编辑
摘要:Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是系列第十七篇,看看horovod 的容错机制。 阅读全文
posted @ 2021-07-21 20:29 罗西的思考 阅读(929) 评论(4) 推荐(0) 编辑
摘要:Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是第十六篇,看看 horovod **弹性训练**中 worker 的生命周期。 阅读全文
posted @ 2021-07-19 20:19 罗西的思考 阅读(640) 评论(2) 推荐(0) 编辑
摘要:Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是系列第十五篇,看看horovod 弹性训练如何广播和发送通知。 阅读全文
posted @ 2021-07-16 20:24 罗西的思考 阅读(817) 评论(0) 推荐(0) 编辑
摘要:Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是系列第十四篇,看看horovod 如何动态发现节点 和 处理状态信息。 阅读全文
posted @ 2021-07-14 19:18 罗西的思考 阅读(759) 评论(1) 推荐(0) 编辑
摘要:Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是系列第十三篇,看看 horovod 弹性实现中 的 Driver 角色。 阅读全文
posted @ 2021-07-12 19:43 罗西的思考 阅读(810) 评论(0) 推荐(0) 编辑
摘要:Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是系列第十二篇,看看horovod 如何实施弹性训练。 阅读全文
posted @ 2021-07-09 21:02 罗西的思考 阅读(1361) 评论(2) 推荐(0) 编辑
摘要:Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是系列第十一篇,看看horovod 如何运行在 spark 之上(GLOO实现)。 阅读全文
posted @ 2021-07-07 19:22 罗西的思考 阅读(696) 评论(0) 推荐(0) 编辑
摘要:Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本文是系列第十篇,看看horovod 如何运行在 spark 之上。 阅读全文
posted @ 2021-07-05 06:25 罗西的思考 阅读(883) 评论(0) 推荐(0) 编辑
摘要:Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本文是系列第九篇,介绍 horovod on spark 如何启动。 阅读全文
posted @ 2021-07-03 09:01 罗西的思考 阅读(637) 评论(0) 推荐(0) 编辑
摘要:Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。接下来几篇介绍 horovod 如何运行在 spark 之上。本文是第八篇,介绍 horovod on spark 的总体架构。 阅读全文
posted @ 2021-06-30 08:22 罗西的思考 阅读(1196) 评论(0) 推荐(3) 编辑
摘要:Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是系列第七篇,看看 Horovod 如何与 TensorFlow 融合。 阅读全文
posted @ 2021-06-28 08:06 罗西的思考 阅读(2193) 评论(0) 推荐(0) 编辑
摘要:Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本文是系列第六篇,看看 Horovod 后台线程架构。 阅读全文
posted @ 2021-06-24 07:39 罗西的思考 阅读(2052) 评论(0) 推荐(0) 编辑
摘要:Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本文是系列第五篇,看看 Horovod 如何融合各个机器学习框架。 阅读全文
posted @ 2021-06-21 08:39 罗西的思考 阅读(1938) 评论(0) 推荐(0) 编辑
摘要:Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是系列第四篇,看看如何获取 host 之间的路由等网络信息。 阅读全文
posted @ 2021-06-17 19:15 罗西的思考 阅读(1409) 评论(0) 推荐(0) 编辑
摘要:Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是系列第三篇,从 python 开始进入 Horovod 世界,看看 Horovodrun 背后做了什么。 阅读全文
posted @ 2021-06-15 08:22 罗西的思考 阅读(3201) 评论(1) 推荐(0) 编辑
摘要:Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。系列大约有15 ~ 18 篇,本文是系列第二篇,从用户角度切入 Horovod。 阅读全文
posted @ 2021-06-10 09:16 罗西的思考 阅读(4341) 评论(1) 推荐(1) 编辑

点击右上角即可分享
微信分享提示