25GB笔记本硬跑744B大模型,SSD当显存GitHub狂揽32k星

25GB笔记本硬跑744B大模型,SSD当显存GitHub狂揽32k星

AI 资讯 来源:新闻/公众号 发布时间:2026-09-26 更新于 2026-09-26 预计阅读 4 分钟

GitHub上最火热的大模型开源推理框架Colibrì已获32k Star。它纯C实现、零引擎依赖,采用分层推理思路,让普通笔记本无需GPU即可运行超大MoE模型。

其核心逻辑是:内存装不下就不全装。模型暂时用不到的部分放在SSD,推理需要哪个专家再现场读取。GLM-5.2经int4处理后约372GB权重,可在最低16GB、推荐24GB RAM的机器上运行,GPU并非必需。作者最初开发机仅12核CPU+25GB RAM。

笔记本跑7000亿参数GLM!无GPU也行? SSD当显存用火爆GitHub

Colibrì已覆盖9个模型家族,从GLM-5.2/5.3、DeepSeek V4 Flash、Qwen,到975B的Inkling及2.8T参数的Kimi K3。后者需约1.6TB硬盘,但RAM要求仅32GB起步。

这得益于MoE架构。以GLM-5.2为例,总参数744B,但每token仅激活约40B。Colibrì将模型拆为常驻和临时调用两部分:Attention、Embedding、共享专家等Dense部分约17B参数,int4后仅占约9.9GB,常驻RAM;19456个路由专家int4后仍占约370GB,全部放NVMe SSD。生成token时,Router先选所需专家,未命中缓存才从SSD临时读取,算完一层再处理下一层。作者将其类比为针对模型权重的JIT。

笔记本跑7000亿参数GLM!无GPU也行? SSD当显存用火爆GitHub

为避免每token都读SSD,Colibrì将VRAM、RAM和NVMe SSD组织成分层内存系统:越常用专家住得越近。已驻VRAM或RAM的直接计算;近期用过的尽量留RAM缓存;不常用的留SSD。它加入LRU缓存,记录专家使用次数,高频专家获更高缓存优先级。相邻层专家路由相关性明显,提前一层预测可预测性达71.6%,当前层计算时后台可预读下一层专家,重叠计算与I/O。若有两块SSD,可放置第二份模型副本分摊读取。

这套思路被称为AI memory multitiering。关键原则是:专家放在哪里只决定速度,不改变模型本身,Router选择和权重精度完全相同。

笔记本跑7000亿参数GLM!无GPU也行? SSD当显存用火爆GitHub

实测中,128GB RAM纯CPU桌面机速度约1.8 token/s;6张RTX 5090让全部专家常驻高速存储层,解码速度达5.8~6.8 token/s。

使用上,需几百KB的Colibrì程序及约372GB模型。已提供Linux、macOS、Windows预编译版本,源码编译仅需gcc或clang配合OpenMP。项目提供预转换GLM-5.2 int4模型,一条coli chat即可对话。Web Dashboard可实时查看Token速度、阶段耗时及各层专家分布,“Brain”页面可视化全部19456个专家。

目前支持九个模型,每个模型单独一套C适配文件,底层IO、缓存、tokenizer等公共组件复用同一核心。小尺寸有Qwen3.8-Flash-Next、Qwen3.6和OLMoE;DeepSeek V4 Flash为284B;GLM-5.2/5.3为744B;GLM-5.3-Flash为321B;Inkling为975B;Kimi K3为2.8T总参数、104B激活参数,权重需约1.6TB存储,RAM 32GB+即可起跑,不强制GPU。

项目地址:https://github.com/JustVugg/colibri

标签: AI 资讯 AI

更多推荐阅读

模型不够强,灵巧手才要卷性能?源升智能杨思成谈机器人操作

模型不够强,灵巧手才要卷性能?源升智能杨思成谈机器人操作

灵巧操作的最高境界,是“无剑胜有剑”。在源升智能创始人杨思成看来,灵巧手之于机器人操作能力,就像兵刃之于剑术,模型越强,就越不依赖末端执行工具;反之,模型能力不够强时,就需要灵巧手加持才能更好完成任务。 杨思成在清华时期便专门研究灵巧操作,2018年加入腾讯Robotics X实验室,担任灵巧手项目总负责人。2024年,他成立源升智能,开启灵巧手创业。他认为,现在行业都在打造“神兵利器”——更多...

2026-09-27
中国最强AI芯片发布,平头哥再开源软件栈

中国最强AI芯片发布,平头哥再开源软件栈

9月22日云栖大会上,阿里巴巴CEO吴泳铭介绍新一代真武V900,称其是目前中国算力性能最强的AI芯片,性能达M890的3倍。但客户换用真武,还需确认原有代码、工具和开发经验能否迁移。芯片之外,软件生态同样决定客户选择。 9月23日,平头哥公布AI软件栈T-Head SAIL最新开源进展,扩大框架适配、加速库、工具链和通信库等开放范围。平头哥将AI芯片比作发动机,软件栈则是“变速箱+传动系统+驾...

2026-09-27
华为大模型双子星创业,要做物理世界的Scaling Law

华为大模型双子星创业,要做物理世界的Scaling Law

数亿元资金,投向了一场物理世界的基模实验。Physical AI创业公司息壤开物宣布,已连续完成数亿元种子轮及天使轮融资,由敦鸿资产领投,华控基金、三花控股、银杏谷资本、泽然资本、本坚基金、天使基石、标朴投资等跟投,估值达5亿美金。 公司创始人、CEO李寅,前华为云大模型CTO,华为大模型0-1阶段核心成员;联合创始人张含望教授,前华为多模态首席科学家。二人联手,瞄准具身智能尚未解决的底层难题:...

2026-09-27
前OpenAI研究员:Jev出现前AI世界是悲剧

前OpenAI研究员:Jev出现前AI世界是悲剧

“它会逐渐退到软件背景中,像数据库、正则表达式或其他基础设施一样,成为开发者随手调用的普通能力。”这是 TypeSafe CEO、Jev 创始人 Diogo Almeida 对 AI 的设想:当智能真正融入软件,用户甚至不必意识到它的存在。但怎样才能让开发者放心地把判断交给 AI,而不用守在旁边反复检查? 几个月前,在 AI Engineer 大会的演讲中,这位曾参与 OpenAI Instru...

2026-09-27
Opus 5.5与GPT-6被指偷师中国AI团队

Opus 5.5与GPT-6被指偷师中国AI团队

所谓“天下文章一大抄”。刚发布的Opus 5.5和GPT-6 Luna,身上满是姚顺雨和梁文锋的影子。两家公司预训练已做到极致,为提升智能、降低算力成本,都选择开辟新战场:Opus 5.5对上下文动手,GPT-6 Luna对缓存动手。 **阿莫迪偷师姚顺雨** 在Artificial Analysis智能指数中,Claude Opus 5.5在max档位下平均每题输出11.9万token,其中...

2026-09-27
OpenAI Codex负责人揭秘:从内部工具到顶流,终极目标不只是写代码

OpenAI Codex负责人揭秘:从内部工具到顶流,终极目标不只是写代码

过去两年,AI编程最明显的变化,不是“代码写得更快”,而是软件开发本身正在被重新定义。从只能补全几行代码的Copilot,到今天能读懂代码库、调用工具、执行测试、提交修改,甚至持续运行数小时乃至数天的Coding Agent,模型正从“辅助工程师写代码”进入软件工程的完整生命周期。真正变化的已不只是效率,而是人和代码之间的关系:当正确性检查、安全审查、依赖升级、重构乃至部分架构工作逐渐自动化,人类...

2026-09-27
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部