Apple 研究将模型权重编码为伪随机生成器种子,可显著降低存储和推理成本。
作者:Rasoul Shafipour、David Harrison、Maxwell Horton、Jeffrey Marker、Houman Bedayat、Sachin Mehta†、Mohammad Rastegari†、Mahyar Najibi、Saman Naderiparizi
大语言模型(LLM)已经彻底改变了自然语言处理,但其高昂的运行成本,给大规模部署带来了重大挑战。在本文中,我们提出 SeedLM,这是一种新颖的训练后压缩方法,使用伪随机生成器的种子对模型权重进行编码和压缩。具体来说,对于每个权重块,我们都会找到一个种子;在推理过程中,该种子会被输入线性反馈移位寄存器(LFSR),从而高效生成一个随机矩阵。随后,将该矩阵与压缩后的系数进行线性组合,以重建权重块。SeedLM 减少了内存访问,并利用推理过程中的空闲计算周期,通过增加计算来换取更少的内存访问,从而有效加速受内存带宽限制的任务。与依赖校准数据的最先进方法不同,我们的方法不需要数据,并且能够很好地泛化到各种不同的任务。我们在极具挑战性的 Llama3 70B 上进行的实验表明,在 4-bit 和 3-bit 压缩下,SeedLM 的 zero-shot 准确率保持能力与最先进的方法相当或更好,同时性能仍可媲美 FP16 基线。此外,基于 FPGA 的测试表明,随着模型规模增大,4-bit SeedLM 相比 FP16 Llama 2/3 基线的加速比逐渐接近 4 倍。
Compress and Compare:以交互方式评估不同 ML 模型压缩实验的效率与行为
2024 年 9 月 27 日
研究领域:Human-Computer Interaction
研究领域:Tools, Platforms, Frameworks
会议:IEEE Visualization
为了在设备端部署机器学习模型,从业者会使用压缩算法缩小模型并提升其运行速度,同时保持高质量的输出。在实践中,模型压缩的一个关键环节是模型比较,其中包括跟踪大量压缩实验、识别模型行为的细微变化,以及权衡复杂的准确率与效率取舍。然而,现有的压缩工具无法充分支持……
Efficient Private Local Randomizers 的无损压缩
2021 年 7 月 9 日
研究领域:Methods and Algorithms
研究领域:Privacy
会议:ICML
本文被 ICML 2021 会议以及 ICML 2021 的 Theory and Practice of Differential Privacy workshop 接收。
本地差分隐私(Locally Differentially Private,LDP)报告通常用于联邦场景下的统计数据收集和机器学习。在许多情况下,目前已知效果最佳的 LDP 算法要求从客户端设备向服务器发送大到难以承受的消息(例如在构建……时)。
我们的 Machine Learning 研究每天都在开辟新的疆域。