大语言模型量化方法对比：GPTQ、GGUF、AWQ

在过去的一年里，大型语言模型(llm)有了飞速的发展，在本文中，我们将探讨几种(量化)的方式，除此以外，还会介绍分片及不同的保存和压缩策略。

说明：每次加载LLM示例后，建议清除缓存，以防止出现OutOfMemory错误。

如果在jupyter中无法释放显存，请重启这个jupyter notebook。

模型加载

加载LLM的最直接、最普通的方式是通过🤗Transformers。HuggingFace已经创建了一个套件，我们能够直接使用

安装完成后，我们可以使用以下管道轻松加载LLM:

我们这里使用zephyr-7b-beta作为示例

这种加载LLM的方法通常不会执行任何压缩技巧。我们来做个使用的示例

使用内部提示模板生成的提示是这样构造的:

然后，我们可将提示传递给LLM来生成答案:

posted @ 2023-11-16 10:59 deephub 阅读(856) 评论(0) 编辑收藏举报

刷新页面返回顶部