讲师中心微信公众号

首页

文章

后端开发 web前端数据库开发工具 php框架常见问题科技 Java 系统教程电脑教程硬件教程手机教程软件教程游戏教程自媒体新闻

专题

后端开发 web前端数据库开发工具 php框架科技 Java 系统教程电脑教程硬件教程手机教程软件教程游戏教程新闻

AI工具

AI 聊天问答 Agent智能体 AI 文本写作 AI 绘画作图 AI 设计工具 AI 视频创作 AI 音频制作 AI 办公学习 AI 编程开发 Prompt指令

学习

大前端后端开发数据库移动端运维开发计算机基础

编程手册

大前端后端开发数据库移动端运维开发计算机基础

下载

js特效网站源码工具下载类库下载网站素材学习资源插件扩展手机游戏

最近更新

0

0

让大模型“瘦身”90%！清华&哈工大提出极限压缩方案：1bit量化，能力同时保留83%

WBOY

发布时间：2024-03-11 12:04:15

|

1202人浏览过

|

来源于51CTO.COM

转载

对大模型进行量化、剪枝等压缩操作，是部署时最常见不过的一环了。

不过，这个极限究竟有多大？

清华大学和哈工大的一项联合研究给出的答案是：

90%。

他们提出了大模型1bit极限压缩框架OneBit，首次实现大模型权重压缩超越90%并保留大部分（83%）能力。

可以说，玩儿的就是“既要也要”～

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

让大模型“瘦身”90%！清华&哈工大提出极限压缩方案：1bit量化，能力同时保留83%

一起来看看。

大模型1bit量化方法来了

从剪枝、量化，到知识蒸馏、权重低秩分解，大模型已经可以实现压缩四分之一权重而几乎无损。

权重量化通常是将大型模型的参数转换为低位宽的表示形式。这可以通过对经过充分训练的模型进行转换（PTQ）或在训练过程中引入量化步骤（QAT）来实现。这种方法有助于减少模型的计算和存储需求，从而提高模型的效率和性能。通过量化权重，可以显著减少模型的大小，使其更适合在资源受限的环境中部署，同时也有

然而，现有量化方法在低于3bit时面临严重的性能损失，这主要是由于：

现有的参数低位宽表示方法在1bit时存在严重的精度损失。基于Round-To-Nearest方法的参数以1bit表示时，其转换的缩放系数s和零点z会失去实际意义。
现有的1bit模型结构没有充分考虑到浮点精度的重要性。浮点参数的缺失可能影响模型计算过程的稳定性，严重降低其本身的学习能力。

为了克服1bit超低位宽量化的阻碍，作者提出一种全新的1bit模型框架：OneBit，它包括全新的1bit线性层结构、基于SVID的参数初始化方法和基于量化感知知识蒸馏的深度迁移学习。

这种新的1bit模型量化方法能够以极大的压缩幅度、超低的空间占用和有限的计算成本，保留原模型绝大部分的能力。这对于实现大模型在PC端甚至智能手机上的部署意义非凡。

整体框架

OneBit框架总体上可以包括：全新设计的1bit模型结构、基于原模型初始化量化模型参数的方法以及基于知识蒸馏的深度能力迁移。

这种全新设计的1bit模型结构能够有效克服以往量化工作在1bit量化时严重的精度损失问题，并且在训练、迁移过程中表现出出色的稳定性。

量化模型的初始化方法能为知识蒸馏设置更好的起点，加速收敛的同时获得更加的能力迁移效果。

1、1bit模型结构

1bit要求每个权重值只能用1bit表示，所以最多只有两种可能的状态。

作者选用±1作为这两种状态，好处就是，它代表了数字系统中的两种符号、功能更加完备，同时可以通过Sign(·)函数方便地获得。

作者的1bit模型结构是通过把FP16模型的所有线性层（嵌入层和lm_head除外）替换为1bit线性层实现的。

这里的1bit线性层除通过Sign(·)函数获得的1bit权重之外，还包括另外两个关键组件—FP16精度的值向量。

△FP16线性层与OneBit线性层的对比

这种设计不仅保持了原始权重矩阵的高秩，而且通过值向量提供了必要的浮点精度，对保证稳定且高质量的学习过程很有意义。

从上图可以看出，只有值向量g和h保持FP16格式，而权重矩阵则全部由±1组成。

作者通过一个例子可以一观OneBit的压缩能力。

假设压缩一个40964096的FP16线性层，OneBit需要一个40964096的1bit矩阵和两个4096*1的FP16值向量。

这里面总的位数为16,908,288，总的参数个数为16,785,408，平均每个参数占用仅仅约1.0073 bit。

这样的压缩幅度是空前的，可以说是真正的1bit LLM。

2、参数初始化和迁移学习

为了利用充分训练好的原模型更好地初始化量化后的模型，作者提出一种新的参数矩阵分解方法，称为“值-符号独立的矩阵分解（SVID）”。

这一矩阵分解方法把符号和绝对值分开，并把绝对值进行秩-1近似，其逼近原矩阵参数的方式可以表示成：

让大模型“瘦身”90%！清华&哈工大提出极限压缩方案：1bit量化，能力同时保留83%

秩-1近似可以通过常用矩阵分解方法实现，例如奇异值分解（SVD）和非负矩阵分解（NMF）。

作者在数学上给出，这种SVID方法可以通过交换运算次序来和1bit模型框架相匹配，进而实现参数初始化。

文心快码

文心快码

文心快码（Comate）是百度推出的一款AI辅助编程工具

下载

此外，符号矩阵在分解过程中对近似原矩阵的贡献也被证明，详情见论文。

作者认为，解决大模型超低位宽量化的有效途径可能是量化感知训练QAT。

因此，在SVID给出量化模型的参数起点后，作者把原模型作为教师模型并通过知识蒸馏从中学习。

具体而言，学生模型主要接受教师模型的logits和hidden state的指导。

训练时，值向量和参数矩阵的值会被更新，而在部署时，则可以直接使用量化后的1bit参数矩阵进行计算。

模型越大，效果越好

作者选择的基线是FP16 Transformer、GPTQ、LLM-QAT和OmniQuant。

后三个都属于量化领域中经典的强基线，特别是OmniQuant是自作者之前最强的2bit量化方法。

由于目前还没有1bit权重量化的研究，作者只对OneBit框架使用1bit权重量化，而对其他方法采取2bit量化设置。

对于蒸馏数据，作者仿照LLM-QAT利用教师模型自采样的方式产生数据。

作者从1.3B到13B不同大小、OPT和LLaMA-1/2不同系列的模型来证明OneBit的有效性。在评价指标上，使用验证集的困惑度和常识推理的Zero-shot准确度。详情见论文。

让大模型“瘦身”90%！清华&哈工大提出极限压缩方案：1bit量化，能力同时保留83%

上表展示了OneBit相比于其他方法在1bit量化时的优势。值得注意的是，模型越大时，OneBit效果往往越好。

随着模型规模增大，OneBit量化模型降低的困惑度比FP16模型降低的困惑度要多。

以下是几种不同小模型的常识推理、世界知识和空间占用情况：

让大模型“瘦身”90%！清华&哈工大提出极限压缩方案：1bit量化，能力同时保留83%

作者还比较了几种不同类型小模型的大小和实际能力。

作者发现，尽管OneBit-7B平均位宽最小、占用的空间最小、训练的步数也相对少，但它在常识推理能力上不逊于其他模型。

同时作者也发现，OneBit-7B模型在社会科学领域出现较严重的知识遗忘。

让大模型“瘦身”90%！清华&哈工大提出极限压缩方案：1bit量化，能力同时保留83%

△FP16线性层与OneBit线性层的对比一个OneBit-7B指令微调后的文本生成例子

上图还展示了一个OneBit-7B指令微调后的文本生成例子。可见，OneBit-7B有效地受到了SFT阶段的能力增益，可以比较流畅地生成文本，尽管总参数只有1.3GB（与FP16的0.6B模型相当）。总的来说，OneBit-7B展示出了其实际应用价值。

分析与讨论

作者展示了OneBit对不同规模LLaMA模型的压缩比，可以看出，OneBit对模型的压缩比均超过惊人的90%。

让大模型“瘦身”90%！清华&哈工大提出极限压缩方案：1bit量化，能力同时保留83%

特别是，随着模型增大，OneBit的压缩比越高。

这显示出作者方法在更大模型上的优势：以更高的压缩比获得更大的边际收益（困惑度）。此外，作者的方法在大小和性能之间做到了很好的权衡。
让大模型“瘦身”90%！清华&哈工大提出极限压缩方案：1bit量化，能力同时保留83%

1bit量化模型在计算上具有优势，意义十分重大。参数的纯二进制表示，不但可以节省大量的空间，还能降低矩阵乘法对硬件的要求。

高精度模型中矩阵乘法的元素相乘可以被变成高效的位运算，只需位赋值和加法就可以完成矩阵乘积，非常有应用前景。

此外，作者的方法在训练过程中保持了出色的稳定学习能力。

事实上，二值网络训练的不稳定问题、对超参数的敏感性和收敛困难一直受到研究人员关注。

作者分析了高精度值向量在促进模型稳定收敛过程中的重要意义。

有前人工作提出过1bit模型架构并用于从头训练模型（如BitNet[1]），但它对超参数敏感并且难以从充分训练的高精度模型中迁移学习。作者也尝试了BitNet在知识蒸馏中的表现，发现其训练还不够稳定。

让大模型“瘦身”90%！清华&哈工大提出极限压缩方案：1bit量化，能力同时保留83%

总结

作者提出了一种用于1bit权重量化的模型结构和相应的参数初始化方法。

在各种大小和系列的模型上进行的广泛实验表明，OneBit在代表性的强基线上具有明显的优势，并实现了模型大小与性能之间的良好折中。

此外，作者进一步分析了这种极低比特量化模型的能力和前景，并为未来的研究提供了指导。

论文地址： https://arxiv.org/pdf/2402.11295.pdf

相关文章

小米汽车公布车载多连屏显示专利可提升显示稳定性

小鹏X9超级增程女性用户占22% 超70%选择Ultra版

小鹏X9单月交付超5400辆同比增长289.1% 破多项记录

怎么用ai制定商业计划书_AI市场分析与融资方案框架生成指南

深蓝汽车回应61亿元融资：用于技术研发和全球化建设

相关标签:

ai 架构 transformer https llama

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：如何管理生成式AI 下一篇：1.3ms耗时！清华最新开源移动端神经网络架构 RepViT

作者最新文章

夸克浏览器一键启用AI搜索_带你体验夸克AI搜索的强大之处

2025-10-19 18:42

玩转夸克浏览器的AI搜索模式_夸克AI搜索新手入门操作指南

2025-10-20 09:50

夸克浏览器AI搜索最新版教学_探索夸克AI搜索的隐藏功能

2025-10-24 20:48

夸克浏览器怎么用AI搜索_夸克AI搜索正确提问方式教学

2025-10-25 23:12

微信朋友圈怎么设置定时发布微信朋友圈定时发送图文教程

2026-01-02 09:14

微信朋友圈怎么定时发送微信朋友圈定时发布设置方法【教程】

2026-01-06 09:59

苹果手机怎么定时发朋友圈 iPhone微信朋友圈自动发布方法【步骤】

2026-01-08 11:11

微信朋友圈能定时发送吗微信朋友圈定时发送功能开启方法

2026-01-09 08:15

微信朋友圈草稿箱怎么用微信朋友圈定时发送隐藏技巧

2026-01-10 08:41

微信朋友圈定时发送是真的吗微信朋友圈预约发布实现方法

2026-01-15 10:19

热门AI工具

更多

DeepSeek

DeepSeek

幻方量化公司旗下的开源大模型平台

AI大模型

开放平台

豆包大模型

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI大模型

通义千问

通义千问

阿里巴巴推出的全能AI助手

AI大模型

腾讯元宝

腾讯元宝

腾讯混元平台推出的AI助手

文档处理

Excel 表格

文心一言

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI大模型

中文写作

讯飞写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

中文写作

写作工具

即梦AI

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接

图画生成

ChatGPT

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI大模型

中文写作

智谱清言 - 免费全能的AI助手

智谱清言 - 免费全能的AI助手

智谱清言 - 免费全能的AI助手

AI大模型

PDF 文档

相关专题

更多

http与https有哪些区别

http与https有哪些区别

http与https的区别：1、协议安全性；2、连接方式；3、证书管理；4、连接状态；5、端口号；6、资源消耗；7、兼容性。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

1992

2024.08.16

xml格式相关教程

xml格式相关教程

本专题整合了xml格式相关教程汇总，阅读专题下面的文章了解更多详细内容。

0

2026.01.19

PHP WebSocket 实时通信开发

PHP WebSocket 实时通信开发

本专题系统讲解 PHP 在实时通信与长连接场景中的应用实践，涵盖 WebSocket 协议原理、服务端连接管理、消息推送机制、心跳检测、断线重连以及与前端的实时交互实现。通过聊天系统、实时通知等案例，帮助开发者掌握使用 PHP 构建实时通信与推送服务的完整开发流程，适用于即时消息与高互动性应用场景。

13

2026.01.19

微信聊天记录删除恢复导出教程汇总

微信聊天记录删除恢复导出教程汇总

本专题整合了微信聊天记录相关教程大全，阅读专题下面的文章了解更多详细内容。

86

2026.01.18

高德地图升级方法汇总

高德地图升级方法汇总

本专题整合了高德地图升级相关教程，阅读专题下面的文章了解更多详细内容。

109

2026.01.16

全民K歌得高分教程大全

全民K歌得高分教程大全

本专题整合了全民K歌得高分技巧汇总，阅读专题下面的文章了解更多详细内容。

155

2026.01.16

C++ 单元测试与代码质量保障

C++ 单元测试与代码质量保障

本专题系统讲解 C++ 在单元测试与代码质量保障方面的实战方法，包括测试驱动开发理念、Google Test/Google Mock 的使用、测试用例设计、边界条件验证、持续集成中的自动化测试流程，以及常见代码质量问题的发现与修复。通过工程化示例，帮助开发者建立可测试、可维护、高质量的 C++ 项目体系。

79

2026.01.16

java数据库连接教程大全

java数据库连接教程大全

本专题整合了java数据库连接相关教程，阅读专题下面的文章了解更多详细内容。

44

2026.01.15

Java音频处理教程汇总

Java音频处理教程汇总

本专题整合了java音频处理教程大全，阅读专题下面的文章了解更多详细内容。

20

2026.01.15

热门下载

更多

网站特效

/

网站源码

/

网站素材

/

前端模板

相关下载

更多

php商城系统

淘源码商城PHP淘宝查信誉

PHP房产程序[BBWPS]

PHP简约自动发卡平台个人版

ERMEB域名PHP离线网络授权系统

Difeye-敏捷的轻量级PHP框架

大泉州汽车网PHP整站程序

精品课程

更多

相关推荐

/

热门推荐

/

最新课程

Django 教程

Django 教程

共28课时 | 3.2万人学习

Go 教程

Go 教程

共32课时 | 3.9万人学习

TypeScript 教程

TypeScript 教程

共19课时 | 2.3万人学习

最新文章

更多

怎么用ai做视频剪辑_AI智能识别高光时刻与自动卡点教程

Pika接入ChatGPT如何编AI动画脚本_Pika接ChatGPT编AI动画脚本技巧【锦囊】

怎么用ai起名字_AI品牌命名与产品Slogan创意生成法

怎么用ai做服装设计_AI时尚款式草图与面料效果生成技巧

强！曝上汽通用某经销商集团2025年盈利或超2500万元

StableDiffusion怎样用ControlNet定形_StableDiffusion控网定型法【窍门】

怎么用ai写文案_AI营销文案生成与爆款标题创作秘籍

AI绘画ICBINP怎么配冷暖对比_AI绘画ICBINP配对比法【心得】

FotorAI怎么智能渐变填色_FotorAI智能渐变填色优势在哪【亮点】

CanvaAI怎么合并图层_CanvaAI合并图层便捷招法【贴士】

关于我们免责申明举报中心意见反馈讲师合作广告合作最新更新: php中文网：公益在线php培训，帮助PHP学习者快速成长！; 关注服务号技术交流群

PHP中文网订阅号: 每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号

PHP学习

技术支持

返回顶部