Muse爆火背后:个人Agent如何获得持久记忆
Meta个人智能体Muse的爆火让95后沈俊潇有些兴奋。三年前他曾在Meta Reality部门,负责为Meta Ray-Ban背后的AI助手提供智能服务。当时还没有Muse项目,但Meta做消费级个人助手的想法早有迹可循。Muse上线5天下载量突破73万,第10天登顶美国App Store免费应用总榜第一,上涨速度超过早期ChatGPT。
沈俊潇博士毕业于剑桥大学,是Memories.ai创始人。2024年底公司创立,押注为个人助手及其他硬件构建视觉记忆层。不同于当前大模型记忆主要依赖上下文窗口、偏向短期文本记忆,他希望让AI像人一样真正看见物理世界并形成持久记忆。
他认为未来个人助手有三大壁垒:视觉记忆、智能和action。action是各种Agent,智能是模型,这些都在大厂射程范围内,而视觉记忆更像人类真正意义上的情景记忆,视觉信息更原始,一直是AI看见和检索上需要攻克的难题。
过去两年多,Memories.ai发布全球首个视频理解模型LVMM,随后不到半年签下高通、英伟达两个大单。今年9月,全模型栈已可在高通骁龙平台原生运行,实现手机、PC与智能眼镜上的端侧持续感知。这意味着搭载骁龙芯片的设备上的AI智能体,都能以较低成本“看见”物理世界,辅助做出个性化决策。
沈俊潇说,他们是全球第一个提出视觉记忆概念的团队。早在2023年,Meta Reality Labs就在为AI眼镜提供时序视觉理解。他们预判未来是Agent大爆发时代,会有数百万智能体取代APP和网站,但最大缺陷是没有个性化。因此提出在终端用户与各种Agents之间,必须存在一个足够个性化的中间层,承接用户记忆、context,再调度背后百万级Agents完成任务。
AI进入物理世界是大势所趋,一旦进入物理世界,记忆形态就变了,不再是你敲下的文字,而是你眼睛看到的画面、走过的场景、接触过的物体。终局的记忆一定是视觉记忆。
当前大部分Agent核心交互靠文本,只有极个别场景利用视觉。沈俊潇说,但凡拥有20%的视觉记忆,对AI能力提升效果都会非常显著。原本期待沿途下蛋的商业思路也在变化,短期商业化落地场景包括安防、监控摄像头、工厂零售运营巡检和媒体视频创作,但后来发现具身、个人助手比想象中进展更快。
关键节点是2025年11月,团队发布视觉模型LVMM2.0,首次将视觉模型参数量做到只有几B级别,意味着世界模型具备在端侧运行的可能。但真正落地还有许多工程难题。硬件行业有不可能三角定律:算力、功耗、效果很难同时实现最好。团队试图在算力和功耗变低的情况下,还能达到视觉快速检索的效果。
模型最初只能跑在CPU上,能耗比很差。若要设备7×24小时低功耗持续运行,只有NPU能扛住。高通派驻工程师和Memories.ai一起做算子对齐。最终思路是将模型栈感知拆成两个成本结构截然不同的阶段:采集时刻运行高效视频语言模型OmniCaptioner,把设备所见所闻转化为紧凑、结构化、带时间锚点的瞬间描述;多模态检索模型OmniRetriever负责把这些描述索引成可查询的个人记忆,并以交互级延迟响应自然语言查询。这种架构可实现视觉信息采集时成本一次性摊销,下游处理的是紧凑表示而非视频本身。
9月24日,在2026年骁龙峰会上,高通和Memories.ai共同官宣,视觉模型栈已实现手机、PC与智能眼镜上的端侧持续感知。用户无需按下拍摄按钮,设备可以每天低耗持续感知周围环境。沈俊潇演示,当用户询问租车地点和酒店时,无需上传文件或输入文字,智能体能够自动利用此前接触过的信息作答。用户也无需担心隐私画面被泄露,架构上确保画面信息不会离开设备本身。
进入9月,个人消费端应用迎来爆发。Muse把Personal Agent带到舆论中心,主打主动替你干活的能力。AI办公面向职场,Muse则主打生活场景,如帮助发邮件、网购、取消流媒体订阅、比价、打电话和保险公司讨价还价等。Meta已梳理出近400种Muse应用场景。截至9月29日,OpenAI、字节豆包、阿里千问等都被爆出正在加速推进个人Agent产品计划。Manus于9月28日推出个人Agent应用CUE,前豆包PC端负责人齐俊元创办的Today AI正式开启公测。
沈俊潇认为,Memories在终端实现可持续感知,有助于个人应用真正爆发。扎克伯格对Muse的设想是“给世界上每一个人配备足够强大的个人智能体,它能理解用户的目标,并全天候代表用户工作”。Meta Connect 2026宣布把Muse延伸到AI眼镜,一旦Agent长在眼镜上,第一人称视觉的持续感知与记忆就成了必须解决的问题。

沈俊潇称,物理智能整体上需要的正是同一套技术栈。对于可穿戴设备、机器人同样如此,拥有持续感知技术栈的机器人相当于拥有了视觉记忆的大脑。今年3月GTC大会上,Memories.ai的视觉记忆技术被接入英伟达的Cosmos-Reason 2和Metropolis平台。两年前“给视频做记忆”听上去像基础设施里的苦活,如今当Muse们纷纷站上App Store榜首,机器人和AI眼镜开始走进真实世界,视觉记忆越来越被行业关注。这块所有人都需要却少有人愿意低头去修的地基,正是Memories.ai做的。它未必会成为下一个家喻户晓的助手品牌,但很可能
更多推荐阅读

何恺明团队让AI摘掉眼罩,Claude满分打穿AGI考试
何恺明团队新论文VISTA在X上引发关注。论文显示,过去半年顶尖大模型在ARC-AGI-3测试中表现不佳,原因是官方只给模型一张64×64的数字表,相当于让人闭眼听坐标玩游戏。VISTA团队将数字表换回图片,GPT-5.6 Sol分数从13.33跳至47.32;同时看图更省算力,文本版一局烧7190万Token,图片版仅3070万,分数更高。 VISTA核心是给模型配一本无损视觉记忆“相册”,每...
2026-10-05
DeepSeek弹性计算团队扩招资深工程师
DeepSeek弹性计算团队再次大规模招聘,尤其需要资深工程师。三周前刚招过一轮,此次未发岗位JD,而是发布技术分享《DeepSeek弹性计算(DSec):面向大规模Agent训练的沙盒基础设施》。 DSec是支撑DeepSeek-V4全部训练、评测和数据预处理流程的沙盒基础设施。从V3.2到V4.1,Agent训练、评测和数据预处理产生的全部沙盒负载均已运行在DSec上。目前一套DSec扩展分...
2026-10-05
2026年了,AI旅游攻略为何仍不靠谱
国庆前的9月,Personal Agent成为热点。扎克伯格将Muse定位为“personal superintelligence”,称其拥有云端和浏览器,可跨应用完成任务、记住偏好,并在用户退出App后继续工作。OpenAI的Dots也强调主动接管邮件、账单、购物和旅行规划。然而,无论是通用AI助手还是Personal Agent,做旅游攻略都差些意思——看似会做,却不会以人的思路去做。 作者...
2026-10-05
Hinton等20余位AI大牛联合警告:智能爆炸时代将至
由剑桥大学人工智能科学与政策项目发布、二十多名研究者共同撰写的报告,作者包括 OpenAI 首席科学家 Jakub Pachocki、Anthropic 联合创始人 Jack Clark、微软首席科学官 Eric Horvitz,以及 Geoffrey Hinton、Yoshua Bengio 和 Dawn Song 等人。报告并未宣布“智能爆炸”已经发生,而是试图回答:当越来越多 AI 研发工作...
2026-10-05
AI破译433年前教皇密信,50万金币改写法国王室历史
GPT-6 Astra与Claude Opus 5.5几乎同时破译了两封1593年天主教联盟的绝密信件,这是433年来无人能解的密码。信件揭示:法兰西国王亨利四世改宗天主教、登上王座的背后,是一笔高达50万埃居(约合当时法国王室数月财政收入)的政治献金。信中牵出教皇、西班牙王室、法国天主教联盟及罗马权力核心的内部背叛。 两封信写于1593年7月22日,作者是天主教联盟领袖马耶讷公爵的秘书蒂博·德...
2026-10-05
GPT-5.5突然全线下线,用户被要求强制迁移
ChatGPT官宣:10月14日起,GPT-5.5将在ChatGPT、ChatGPT Work以及Codex全套餐中彻底下线。没有缓冲期,消费端、企业端、编程端一刀切。官方指路迁移至GPT-5.6 Sol或GPT-6 Astra,并附敬礼表情致谢。 GPT-5.5今年4月高调登场,被誉为“专为干脏活累活而生的真·生产力智力”,生命周期不到半年。此次清退范围包括免费版、Plus版及高客单价Chat...
2026-10-05