一个低级问题导致vLLM加载大模型时ray卡死

　　这两天一直被一个问题困扰，用vLLM加载千问时不能开并行（tensor_parallel_size>1），一开就会卡在ray阶段，最初是提示Started a local Ray instance，后来手工启动ray集群，就提示connected to Ray cluster。无论怎样调都无法跑下去，根本不会加载模型，换了各种版本的vllm、transformer、ray、显卡、甚至是用本来可以跑的docker，都不行，直到发现一个偶尔爆出的错误：ray pthread_create failed: Resource temporarily unavailable。一搜，第一条建议就是检查系统线程数设置。最终定位是系统设置的用户最大线程数太小（ulimit -u）,设定为4096，修改到unlimited（/etc/security/limits.conf中增加app用户的nofile、nproc设置），顺利解决问题。

posted @ 2024-05-12 17:35 badwood 阅读(2004) 评论(3) 编辑收藏举报

刷新页面返回顶部

一个低级问题导致vLLM加载大模型时ray卡死

公告