北大系公司押注端侧AI:27B模型装进电脑,断网也能干活

北大系公司押注端侧AI:27B模型装进电脑,断网也能干活

AI 资讯 来源:新闻/公众号 发布时间:2026-09-13 更新于 2026-09-13 预计阅读 6 分钟

一个27B参数的模型原生存在于电脑里,关掉Wi-Fi照样能读取本地文件、翻数据库、处理Excel、写PPT,连续跑过去通常需要调用云端大模型的复杂任务。公司财务数据不用上传,自己的知识经验留在本地,跑得再多也不用盯着随Agent工作时间不断上涨的Token账单。电脑买了,电费交了,剩下的Token随便用。

过去端侧AI唯一麻烦的是模型不太行。1B、3B模型装进手机已不稀奇,但让它读几千条银行流水、自己找文件、写脚本、调工具、检查结果并交出可用报告,小模型很快露馅。最近一年边界开始前推。9月3日,北大系背景的元空智能和惠普公布了一套端侧AI方案。元空发布Boxer系列模型及AI Work、AI Science两套Agent,进入惠普的笔记本、基于NVIDIA GB10的桌面算力盒子及工作站,模型和Agent直接预装,并推动企业部署和服务。

「设备即环境」:这个北大系公司想告诉所有人,端侧模型才是未来

发布会demo环节,展示者先关掉Wi-Fi。元空AI Work在完全离线情况下扫描本地文件夹里的几十张发票,完成解析、分类和归档,最后生成Excel;另一个demo离线读完数千条银行流水,寻找短时间资金快进快出等异常特征。从模型推理到文件处理,数据没有离开本地。

很多人第一次知道元空是因为ChatExcel。2023年2月28日测试版上线,用户把Excel扔进去,不用记函数,直接告诉它“把销售额按地区汇总”或“找出异常数据”,它替你操作表格。半个月后公测网页日活峰值达15万,累计独立IP访问超千万。那时豆包和Kimi都还没出现。最早做这件事的是北京大学宁鲲鹏和姚佳雨,两人在ChatGPT爆火前就研究AI处理Excel和数据,后在导师袁粒指导下用Transformer重做技术路线,逄大嵬随后加入,把实验室项目往产品和商业化推。今天元空正式员工仍只有十人左右,连着北大实验室、学生和实习生,过去几年从语言、视觉做到多模态和不同尺寸模型。

「设备即环境」:这个北大系公司想告诉所有人,端侧模型才是未来

ChatExcel后来从表格扩到数据库、数据清洗和分析,再变成完整Data Agent。元空披露产品已积累数百万用户。逄大嵬开玩笑说,大厂声量很高,他们则在“偷偷地赚钱”。这几年留下来的不只是用户。一个人处理Excel时先找哪张表,看到异常后往哪里查,中间调用多少次工具,什么时候失败,最后交付什么结果,这些真实操作轨迹全留了下来。当Agent开始真正替人干活,这批数据意义完全变了。模型公司最缺的恰恰是这些互联网上找不到的工作过程。这些数据资源与元空团队过往模型经验结合,Boxer系列模型诞生。

过去端侧AI长期卡在尴尬位置:小模型装得进去,重活干不了;大模型足够聪明,本地又装不下。元空模型在中间这一层。Boxer包括27B稠密模型和35B-A3B稀疏模型,团队划出的范围约20B到100B。逄大嵬说,3B以下适合Chatbot,但长链路生产力任务对上下文理解、Planning和工具调用要求很快会把它压垮;千亿参数以上能力更强,放到个人设备成本又太高。几十B参数刚好进入“能干活,也装得下”的区域。元空喜欢用“智能密度”解释:同样几十B参数,今天能装进去的能力比一年前多得多。他们判断35B这一档已能覆盖不少一年前还要交给更大云端模型的生产力任务。模型架构、MoE、量化、算子优化不断下压,PC的GPU、NPU、内存带宽继续上长,两条曲线开始交汇。

「设备即环境」:这个北大系公司想告诉所有人,端侧模型才是未来

Boxer已可从十几GB内存的个人电脑部署到桌面算力盒子和工作站。官方工程数据显示,经硬件优化后,Prefill达数百Token/s,Decode达数十Token/s,交互延迟压到百毫秒乃至更低。生产力任务对模型要求不止“聪明”。Agent连续工作两小时断掉怎么办?昨天做到一半今天能否接着做?调用十几个工具后出错,能否知道从哪里退回?元空AI Work做了Harness和长期Memory,把执行过程结构化保存,任务可从检查点恢复。姚佳雨形容它像版本控制,保存的是一项工作真正走过的轨迹。这也是元空没急着和手机小模型抢聊天、修图的原因。

模型能装进去后,端侧AI可以算清成本账。过去电脑已买,真正干活的算力还得按Token付钱。Chatbot时代这笔钱不扎眼,Agent一来账本迅速变厚。一次任务可能连续跑几小时,反复读取文件、搜索、调用模型、写代码、验证结果,用户越愿意把工作交给AI,Token烧得越快。“组织是永远在算账的。”逄大嵬说。惠普和元空的办法很传统:把持续发生的OPEX换成一次CAPEX。企业先买机器,模型跑在自己CPU、GPU和NPU上,本地推理增加一次任务,除电费外几乎不再产生新API账单。

这笔账不适合所有人。普通用户一天聊几十轮,云端仍最方便;真正敏感的是投行、律所、药企、制造企业和科研机构,它们通常同时满足两个条件:AI用得足够多,数据又足够贵。审计底稿、律师文件、实验数据、公司财务和工厂工艺参数,有些从制度上就不能进入公有云。本地模型刚好同时处理这两件事:算力买断,数据留下。但这也带来老问题:谁把模型装进每

标签: AI 资讯 AI

更多推荐阅读

Kimi全球招人:辍学、创业失败者优先

Kimi全球招人:辍学、创业失败者优先

本周三,Kimi首次面向全球开启公开招聘。此前K3火爆出圈,Kimi此时开闸招人,不仅招算法,也大规模招募产品、运营、设计、销售、市场及国际化等业务岗位,业务团队首次面向2027届、2028届毕业生和在校实习生开放校招。同时,Kimi计划在全球招募7名“Wild Card”,定位为下一代接班人/未来业务合伙人。 更值得关注的是其用人信号。招募材料明确列出几类不会成为减分项的经历:休学或辍学、连续...

2026-09-13
Kimi K2.8上线:性能逼近K3,百万上下文全员开放

Kimi K2.8上线:性能逼近K3,百万上下文全员开放

9月11日,Kimi K2.8 Preview在Kimi Code和Kimi Work全量上线,官方称综合性能接近旗舰K3,Coding和Agent能力进一步提升。最实质的变化是权限:所有会员档位都能用上1M上下文,而K3的百万上下文仍需Allegretto及以上会员。 就在前一天,外界获悉月之暗面ARR在8月突破10亿美元,6月这一数字还是3亿。这轮增长的直接催化剂是7月发布的K3,曾凭借SO...

2026-09-13
模型越强Harness越轻还是越重?OpenAI与Anthropic工程师给出相反答案

模型越强Harness越轻还是越重?OpenAI与Anthropic工程师给出相反答案

模型越来越强后,Harness 会变重还是变轻?OpenAI 和 Anthropic 工程师给出不同判断。OpenAI Codex 团队 Tibo 认为,随着模型进步,开发者消息会越来越短,Harness 会越来越轻。Anthropic Claude Code 团队 Thariq Shihipar 则认为,模型越强,Harness 反而越复杂,因为要让模型做更多事。 Tibo 表示,Codex ...

2026-09-13
OpenClaw之父复盘生死8个月:被断供、围剿与18000人提交

OpenClaw之父复盘生死8个月:被断供、围剿与18000人提交

图片来源:Peter Steinberger 我常反省:是不是我设计的循环有问题?是不是没给Agents提供验证工作所需的一切?是不是思路有误?是不是在要求不可能的事? 我们不应再考虑“会话”或“上下文压缩”。我们正进入一个新世界,终于要从纯文本界面转向语音和多模态。昨天我们跑通一个hack,现在你的Claw可以给你打FaceTime。这才是OpenClaw存在的意义。 八个月里,超过18,...

2026-09-13
Meta新AI应用Muse美区下载量破8万,登App Store第二

Meta新AI应用Muse美区下载量破8万,登App Store第二

Meta的新AI应用Muse于周二上线后,正开始赢得华尔街青睐。这家科技巨头进军Agentic AI领域,也成为业内人士在X平台上热议的话题。早期数据为了解Muse在美国消费者中的实际受欢迎程度提供了参考。 市场情报公司Sensor Tower数据显示,Muse在美国iOS平台下载量已超过83,000次。该应用目前仅限美国地区使用。尽管这一成绩使Muse登上App Store热门榜单第二位,但与...

2026-09-13
GPT-6经营售货机年赚1.5万美元,3倍碾压Claude

GPT-6经营售货机年赚1.5万美元,3倍碾压Claude

给AI 500美元、一台自动售货机,放手让它经营一个模拟年,结果如何?GPT-6 Astra交出了一份亮眼成绩单:平均账户余额15,515美元,接近Claude Fable 5.1的3倍。Astra最差的一轮都超过了Claude最好的一轮。这是OpenAI模型首次登顶Vending-Bench 2。 Vending-Bench规则直白:模型拿500美元启动资金,自行寻找供应商、谈采购价、补库存、...

2026-09-13
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部