学术论文提出在低内存设备上运行大模型的方法,突破了硬件瓶颈。对边缘计算和模型部署的程序员意义重大。
在有限DRAM的设备上,通过优化闪存的数据传输和访问方式,实现大语言模型的高效推理。
大语言模型(LLM)是现代自然语言处理的核心,在各类任务中表现出色。然而,它们密集的计算和内存需求带来了挑战,尤其是在DRAM容量有限的设备上。本文解决了一个难题:将模型参数存储在闪存中,但按需将其加载到DRAM,从而高效运行超过可用DRAM容量的LLM。
我们的方法包括构建一个与闪存行为相协调的推理成本模型,指导我们在两个关键领域进行优化:减少从闪存传输的数据量,以及以更大、更连续的块读取数据。在这个闪存感知的框架内,我们引入了两项主要技术。首先,"windowing"通过重用先前激活的神经元来战略性地减少数据传输;其次,"row-column bundling"针对闪存的顺序访问特性,增加从闪存读取的数据块大小。这些方法共同实现了运行大小达可用DRAM两倍的模型,相比简单加载方法,CPU和GPU上的推理速度分别提升了4-5倍和20-25倍。我们对稀疏性感知、上下文自适应加载和硬件导向设计的整合,为在有限内存的设备上进行LLM的有效推理铺平了道路。
Apple终于采取行动了🚀
这是来自图书馆员Bot的自动消息。我找到了以下与本论文相似的论文。
以下论文由Semantic Scholar API推荐:
如果您觉得这个评论有帮助,请给它点赞!
如果您想获得Hugging Face上任何论文的推荐,请查看这个Space
👉 订阅:https://www.youtube.com/@Arxflix 👉 Twitter:https://x.com/arxflix 👉 LMNT (合作方):https://lmnt.com/
· 登录或注册以发表评论
在您的agent中获取本论文:
引用本论文的模型 0
没有模型链接此论文
引用本论文的数据集 0
没有数据集链接此论文
引用本论文的Spaces 1
包含本论文的Collections 91