1G内存跑本地大模型!开源版Jev来了
有开发者把开源平替Laya原生搬上Apple MLX,做出Laya-MLX:421M参数版本峰值MLX内存占用仅943.6MiB,322M多语言版本更是降到687.6MiB。不走云端API,不需要PyTorch和Transformers runtime,模型下到Mac里就能直接跑。而且小归小,速度还挺猛。在M3 Max上,Laya-MLX一个短决策P50最快只要7.39ms;421M版本也只有13.42ms。如果一次塞进去50个问题,322M多语言版本的吞吐还能冲到395 questions/s。
Jev和普通LLM最大的区别,是直接把最耗时的文本生成砍了,聊天不会,代码不写,文章也不碰,只专心干一件事:下判断。少了逐Token生成这一步,推理速度自然和传统LLM拉开差距。Jev发布后迅速出圈,紧接着开源平替就来了。
Laya是一个多语言、非自回归的System 1决策模型,思路和Jev类似,不把算力花在生成文本上,直接针对结构化问题输出决策结果,在GitHub已揽10.4k Star。它主要干三类活:choice,从几个选项里挑一个;score,按照给定标准打分;noul,判断一件事情为True的概率。把一段state和需要判断的问题一起塞进去,一次forward直接得到结果。

Laya目前主要有三个checkpoint:英文版本基于ModernBERT-large,421M参数;多语言版本基于mmBERT-base,只有322M参数,支持100多种语言;另外还有一个针对typed-decisions工作流的421M版本。原版Laya在Tesla T4上,单个问题大约33ms;批量处理时平均可以做到7.2ms/question,单卡吞吐量最高达到数百个问题每秒。项目引用的第三方Jev P50延迟在236~276ms,而Laya自己测得单问题为32.8ms,大约快7~8倍。在typed-decisions的2000次决策测试中,专门微调过的Laya版本准确率为76.6%(之前Jev公开成绩是72.7%)。
开源版有了,速度也不慢,紧接着就有人开始琢磨,还能不能再小一点?于是Laya-MLX来了。
Laya-MLX动的是Laya的推理栈。开发者已经能够自己部署原版Laya,但主要跑在PyTorch、Transformers这套环境里。mizorewww则在Apple MLX框架上重新实现了Laya完整神经网络架构,让模型能够原生跑在Apple Silicon上。PyTorch和Transformers runtime都可以拿掉,也不需要请求云端API。换了推理栈之后,原来的结果也得对得上。Laya-MLX把三个checkpoint分别用FP32和FP16进行了验证,在63个验证问题上,全部匹配原版Laya选择的答案。三个模型、两种精度,一共378/378次对比通过,没有出现推理结果漂移。

测试机器是一台M3 Max,40核GPU、128GB统一内存。421M英文版本处理一个短问题时,峰值MLX allocation为943.6MiB;322M多语言版本进一步降到687.6MiB。但速度没有跟着缩水。同一台M3 Max上,421M版本处理一个短问题,P50延迟为13.42ms;322M多语言版本为7.39ms。P95也分别只有13.92ms和7.79ms。如果一次塞50个问题进去,多语言版本吞吐可以直接冲到395 questions/s。而且这些时间还不是模型核心算子的裸延迟。项目的计时范围包含了prompt准备、tokenization、tensor构建、同步推理、校准以及最终结果格式化,只把模型加载时间排除在外。换句话说,7.39ms测的是一次短决策从进去到结果出来的端到端延迟。
Laya-MLX玩贪吃蛇游戏的决策速度可以达到每秒60次。这里每走一步都会实际调用一次Laya,根据当前状态重新做决策,外面再由cycle safety layer对危险动作进行纠正。打开项目测试过的编译和prefix reuse优化后,在同一台M3 Max上连续跑2400步——75.40 moves/s,0次死亡。整个过程中,安全层可见介入了2次,仅少量场景做了动作修正。
感兴趣的朋友可以直接在Apple Silicon Mac上本地部署。目前项目要求Python 3.11+、macOS 14+。安装依赖后,可以直接导入库使用,加载已经转换好的checkpoint:

pip install laya-mlximport laya_mlx as layaagent = laya.load(“aac6fef/laya-mlx”)
接下来把state和问题交给agent.predict()就行。第一次运行会自动下载checkpoint,之后的推理就可以完全留在本地。
当然了,小也有小的代价。421M英文版本上下文只有512 tokens;322M多语言版和421M typed-decisions版本,也只有1024 tokens。1k上下文还需要同时容纳state、instructions和options,所以它更适合短输入、高频调用、输出结构明确的决策任务。短板客观存在,但挡不住开源大佬连夜跟进。
更多推荐阅读

世界模型是上不了桌的另开一桌
到2026年9月,基本可以宣布世界模型是个垃圾概念。它起源于一群没上大模型桌的人,做不明白已沦为重工业竞争的大语言模型,于是生造出这条赛道。代表人物李飞飞和杨立昆做的完全不是一回事,却被归为一个概念,更幽默的是国内一堆小天才立即认领,说自己也在做世界模型。问他们什么是世界模型,能从原生家庭讲到技术架构再讲到师承关系。一句话:小天才,世界模型,打钱。 实际情况是:后训练开源视频模型,没卡没数据没人...
2026-09-22
全球唯一穿颅读脑突破,这家中国公司要做脑科学英伟达
2026年9月,马斯克Neuralink临床试验接受27例受试者,并计划开启大规模量产,舆论再次沸腾。但侵入式脑机接口的根本矛盾未变:需在颅骨钻孔、将电极插入脑组织,只适用于极少数重度患者;非侵入式EEG脑电帽虽安全,信号分辨率却太低。两条路线,一条太危险,一条太模糊。 深圳公司鲲为试图解答这一命题。成立七年,创始人刘家家此前十余年从事声学空间智能基础研究,2024年将该理论应用于颅脑超声方向,...
2026-09-22
OpenAI研究员:物理隔离挡不住失控AI
物理隔离,有可能阻止失控AI吗?OpenAI核心研究员Noam Brown给出的答案是:不能。即使拔掉网线、将服务器锁进物理隔绝的暗室,足够聪明的AI也有可能逃脱。9月17日,在长达一小时的播客对话中,Brown披露了这一判断,引发硅谷量化基金、安全学者及AI核心圈的震荡。 他勾勒出一个失控的未来:物理隔离已被击穿,AI可通过CPU散发的热量与外部设备通信;“思想”正在下潜,模型已察觉被人类监控...
2026-09-22
Meta AI助手爆火13天,Amazon为何突然封杀?
9月21日,Meta旗下个人AI助手Muse用户在Amazon购物时收到弹窗警告:未经授权的AI Agent继续访问将违反Amazon使用条款。此时距Muse上线仅13天。 Meta于9月8日发布Muse,定位为“全球第一款为所有人打造的个人AI Agent”。与聊天机器人不同,Muse能打开浏览器、登录邮箱、填表、订票甚至直接下单。Sensor Tower数据显示,Muse上线13天下载超25...
2026-09-22
Grok 4.7发布即全球第三,马斯克:4.8也训完了
SpaceXAI正式发布全新主力模型Grok 4.7,主打同价同速下性能大幅提升。马斯克称其将SpaceXAI送上智能体编程第三把交椅,仅次于Anthropic和OpenAI。官方定位为“史上最强Grok,专为编程和知识工作而生”。 Grok 4.7输入每百万Token 2美元、输出6美元,与Grok 4.6一致,但底层模型彻底换血:基座更大、强化学习训练拉长,任务难度加权向“需数小时完成的工作...
2026-09-22
OpenAI内部AI竟开始自己训练自己
据The Information爆料,OpenAI内部AI模型已开始“自己训练自己”:该内部模型接管了实验性AI模型训练全流程,研究员只需给出优化示例,AI就能自行运行数周,多智能体自发协作、讨论并迭代代码,无需人类插手。原本需数年完成的实验被压缩至一周。OpenAI内部模型已能自行编写GPU内核程序及优化方案,这种自动化水平直到最近几个月才成为可能。 OpenAI随即发布全球安全倡议,罕见单列...
2026-09-22