郭震 AI公众号:郭震AI

实时 AI 消息

笔记本跑 7000 亿参数 GLM:SSD 当显存,开源项目 Colibrì 火爆 GitHub

名为 Colibrì 的开源项目正在 GitHub 上快速升温,让“笔记本跑 7000 亿参数 GLM”第一次有了可上手的现实路径,而且不依赖 GPU。其做法是内存里只保留约 9.9GB,744B 权重其余部分放在 SSD 上,让固态硬盘充当“显存”。

发布时间

一个名为 Colibrì 的开源项目正在 GitHub 上快速升温。量子位报道称,它让“笔记本跑 7000 亿参数 GLM”这件事第一次有了可以上手的现实路径——而且不依赖 GPU。

做法本身相当直接:744B 规模的模型权重并不需要全部塞进内存,内存里只保留约 9.9GB,其余部分放在 SSD 上,让固态硬盘充当“显存”。

这实际上是把存储层级重新纳入推理路径。传统做法里,模型必须装进显存或内存;当权重体量远超可用内存时,推理根本跑不起来。把 SSD 变成权重存放层,等于用带宽换容量,先把“能不能跑”的门槛降下来。

代价也很清楚。SSD 的带宽与延迟和显存不在一个量级,来源强调的是“快速上手”和可行性,并没有给出吞吐速度指标。最终体验如何,很大程度取决于本地硬盘的性能与访问模式,实际可用性仍要等社区实测。

对生态而言,这类项目的意义在于本地推理的边界被推进了:更低的硬件门槛、更好的数据私密性,以及不依赖云端算力的试验空间。当超大模型只能在数据中心运行时,个人和小团队很难参与验证,而把权重放到本地存储层,至少让“先跑起来”成为可能。

接下来值得观察的是社区实测——包括不同硬件上的实际速度、是否扩展到更多开源模型,以及缓存与预取策略能否把 SSD 方案进一步拉近可用线。对开源项目来说,首发热度之后能否持续维护,往往比一夜爆红更能说明问题。

为什么重要

用 SSD 换显存是一条“以速度换容量”的路线,短期内难以替代显存推理,但它显著降低了超大规模模型的本地体验门槛,可能推动更多围绕存储层优化的本地推理方案出现。

微博邮件

GLMOpen SourceLocal Inference
返回实时消息

附近消息

全部

09/26 17:00

亮出“中国最强 AI 芯片”之后,平头哥再推开源举措

智源社区的报道显示,阿里巴巴旗下芯片公司平头哥在展示被称为“中国最强 AI 芯片”的产品之后,又拿出了一项开源动作。报道强调芯片本身只是第一步,开源被视为决定其能否被真正用起来的第二个环节。

09/26 17:07

AI 开始研究 Physical AI:FSD 级团队亮出首版模型 Simate-beta,空降 RoboDojo

一支被形容为 FSD 级的团队首次亮出面向 Physical AI 的模型 Simate-beta,并直接将其“空降”到 RoboDojo 平台。据量子位报道,Simate 把训练、推理与评测全流程接入自研 Infra,通过任务编排与资源调度并行推进数十条相互独立的研究路线。

09/26 16:21

阿里发布 Qwen-Audio 3.1,语音 API 价格最高下调 95%

阿里巴巴发布新一代语音模型 Qwen-Audio 3.1,并同步将语音 API 的价格最高下调 95%。如此幅度的降价把语音能力的调用成本压低了一个量级,可能让此前因成本搁置的语音产品重新具备落地条件。

09/26 17:40

Tether 切入 AI Agent 赛道:自托管钱包让 USDT 直连自动化代理

据区块周刊 9月26日报道,稳定币发行方 Tether 切入 AI Agent 赛道,推出一款自托管钱包工具,使 USDT 可以直接与自动化代理连接。报道强调用户自持私钥,同时让 AI 代理在自动化流程中处理 USDT 支付,但未披露工具名称、支持的链与上线时间等细节。