上一页 1 ··· 8 9 10 11 12 13 14 15 16 ··· 30 下一页
摘要: Paracel是豆瓣开发的一个分布式计算框架,它基于参数服务器范式来解决机器学习的问题,本文介绍其主体结构。 阅读全文
posted @ 2021-08-10 19:26 罗西的思考 阅读(563) 评论(0) 推荐(0) 编辑
摘要: 本文是参数服务器的第四篇,介绍KVWorker, KVServer。 阅读全文
posted @ 2021-08-07 10:31 罗西的思考 阅读(613) 评论(0) 推荐(0) 编辑
摘要: 本文是参数服务器第三篇,介绍ps-lite的Customer模块。 阅读全文
posted @ 2021-08-04 20:26 罗西的思考 阅读(788) 评论(0) 推荐(0) 编辑
摘要: 本文是参数服务器系列第二篇,介绍ps-lite的通信模块 Van。 阅读全文
posted @ 2021-08-02 20:11 罗西的思考 阅读(970) 评论(0) 推荐(0) 编辑
摘要: 参数服务器是机器学习训练一种范式,是为了解决分布式机器学习问题的一个编程框架。本文是参数服务器系列第一篇,介绍ps-lite的总体设计和基础模块 Postoffice。 阅读全文
posted @ 2021-07-30 15:40 罗西的思考 阅读(2076) 评论(0) 推荐(0) 编辑
摘要: 本文是 horovod on k8s 的最后一篇,看看 MPI-Operator 可能被如何改进。 阅读全文
posted @ 2021-07-28 19:43 罗西的思考 阅读(852) 评论(0) 推荐(0) 编辑
摘要: Horovod 是一款基于 AllReduce 的分布式训练框架。本文是 Horovod on k8s 第二篇,介绍MPI-Operator。 阅读全文
posted @ 2021-07-26 14:21 罗西的思考 阅读(2138) 评论(0) 推荐(0) 编辑
摘要: Horovod 是一款基于 AllReduce 的分布式训练框架。本文是 Horovod on k8s 第一篇,介绍kubeflow tf-operator。 阅读全文
posted @ 2021-07-23 17:02 罗西的思考 阅读(1637) 评论(0) 推荐(0) 编辑
摘要: Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是系列第十七篇,看看horovod 的容错机制。 阅读全文
posted @ 2021-07-21 20:29 罗西的思考 阅读(883) 评论(4) 推荐(0) 编辑
摘要: Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本系列将通过源码分析来带领大家了解 Horovod。本文是第十六篇,看看 horovod **弹性训练**中 worker 的生命周期。 阅读全文
posted @ 2021-07-19 20:19 罗西的思考 阅读(607) 评论(2) 推荐(0) 编辑
上一页 1 ··· 8 9 10 11 12 13 14 15 16 ··· 30 下一页