资讯动态
首页 / Our Projects /32.2K Star!无需顶级显卡,一台笔记本就能跑千亿参数大模型32.2K Star!无需顶级显卡,一台笔记本就能跑千亿参数大模型
想本地跑大模型,硬件配置往往跟着模型规模一起攀升。 参数越大,对显存、算力和整机性能的要求就越高。 至于千亿参数级别的旗舰模型,在家用电脑上跑,那更是想都不敢想 今天介绍的开源项目:Colibri 则提出了不一样的思路。 01 项目介绍 Colibri 是一个用纯 C 写的专跑 MoE 大模型推理引擎。 MoE 架构特点: 744B 参数的模型,每生成一个 token,真正激活的参数只有约 400 亿。 而激活这一部分,相邻的两个 token 之间被换掉的大约只有 11 GB。 02 项目亮点 1.磁盘流式加载专家: Colibri 把显存、内存和硬盘看成同一层存储。 模型权重以 int4 格式躺在 NVMe 上,需要哪层专家就按路由热度流式读上来。 它还会把我们常用的专家记一个学习缓存,每次对话更新,并把最热门的专家记在内存里。 2.压缩状态,不篡改模型: KV 缓存比原来压缩了 57 倍。 每个 token 为 576 个 浮点数,而非原本的 32768 个。 并支持跨重启持久保存 : 对话可暖启恢复,不需重新预填充,结果与之前相同。 3.原生 MTP 推测解码: GLM-5.2 原生 MTP head 会起草 token,再由主模型一次前向验证 2.2 到 2.8 个 token。 PS:MTP head 必须是 int8,选错就不会有作用。 4.OpenAI 兼容 API: 上述命令可以起一个 OpenAI 兼容的 API。 任何支持自定义 OpenAI 端点的客户端都能接入。 03 快速入门 1.前置: 程序(几百 KB)和模型(372 GB)。 2.安装: 从 Releases 下载对应平台的预编译包,Linux、macOS、Windows 都有: mkdir colibri && tar xzf colibri-v1.8.0-linux-x86_64.tar.gz -C colibri && cd colibri python3 coli info # engine ready ✓ 解压即用,只需装好 Python 3 就行(Python 只负责启动器和 API 网关)。 至于模型,在 Hugging Face 上有转好的 int4 版本,约 372GB: 也支持自己从 FP8 源转换,无需一次性腾出 756GB: ./coli convert --model /nvme/glm52_i4 # 逐 shard 下载并转换(仅此一次需要 python) 3.运行: COLI_MODEL=/nvme/glm52_i4 ./coli chat # 自动检测 RAM 预算、缓存与 MTP COLI_MODEL=/nvme/glm52_i4 ./coli plan # 查看规划的 VRAM/RAM/磁盘配置 COLI_MODEL=/nvme/glm52_i4 ./coli doctor # 只读就绪检查 ./coli web --model /nvme/glm52_i4 # 在同一端口提供 API 与网页仪表盘 ./coli serve --model /nvme/glm52_i4 # 仅提供 OpenAI 兼容 API 04 结语 Colibri 价值在于:25 GB 内存也可以跑千亿参数大模型。 如果你也硬件有限,但又想持有而非租用智能,不妨试试。 谢谢你阅读我的文章~ 我们下期再见! 特别
搜索
最新内容
不吃不喝「白干」36年,房价下跌让多少人直接破防……
吴签找肖奈玩集体做头发!鹿晗不愿降价拍戏!
杰弗森称73胜消耗勇士,追梦回应:别说了RJ,我们都知道原因
梅西入选国家队名单,将参加告别战
32.2K Star!无需顶级显卡,一台笔记本就能跑千亿参数大模型