中国开源决策模型超越Jev登顶全球第一

中国开源决策模型超越Jev登顶全球第一

AI 资讯 来源:新闻/公众号 发布时间:2026-10-06 更新于 2026-10-06 预计阅读 4 分钟

9 月 30 日,一款决策模型正式发布并引发关注:在 Decision Index 0.2.1 的 38 项基准测试中,它有 31 项超过当前热门的 Jev,综合得分 63.88 对 57.91,领先公开榜首近 6 分,且完全开源。在国际象棋对弈中,它与 Jev 响应速度不相上下,却在 36 局中赢下 35 局。

Jev被请下王座,StartLux中国开源决策模型冲上第一

推出该模型的是上海 AI 企业 StartLux(原点星辉)。这家成立不到 5 个月的公司已是第二次拿出震惊业界的成果:此前 StartLux-27B 本地模型在工信部中国信通院测试中超过 284B 的 DeepSeek-V4-Flash,并以约 1/60 参数量基本打平 DeepSeek-V4-Pro。此次完全开源的 StartLux-Decision,以公开评测综合成绩而论,已是目前全球最强决策模型。

Jev被请下王座,StartLux中国开源决策模型冲上第一

StartLux-Decision 推出 0.8B、2B、4B、9B 和 27B 五档版本,并提供支持本地部署的量化模型。在 Decision Index 0.2.1 中,27B 版本得分 63.88,38 项基准中 31 项高于 Jev 1.13;在另一套七项测试中,平均准确率达 91.82%。上述成绩为团队基于公开评测工具、对照 2026 年 9 月 28 日公开榜单快照完成的自测结果。

Jev被请下王座,StartLux中国开源决策模型冲上第一

Decision 模型热度攀升,源于 Agent 对专门“判断”能力的需求。与传统生成式 AI 不同,StartLux-Decision 无需先生成自然语言再由程序解析,而是直接针对候选项进行选择、是非判断或等级评分。在客服工单 Demo 中,它一次请求即可完成团队分流、处理时效及严重等级三项判断;在购物和办公协作 Demo 中,则根据页面状态判断下一步操作及任务是否完成。这类任务答案空间相对明确,需求短小,却调用频繁。

速度方面,在单卡 H200、BF16、本地 HTTP 和短请求条件下,StartLux-Decision-4B 一次回答三个问题平均耗时 26 毫秒,0.8B 和 2B 分别为 12.2 毫秒和 15.5 毫秒。团队使用 CUDA Graph、快速线性注意力算子,并将多个问题合入一次前向计算以降低开销。

StartLux 的本地智能架构中,StartLux-27B 承担通用能力层,Decision Model 专注高频决策,上层部署 Agent 与 Memory,底层由量化、推理系统和硬件适配支撑。此前 27B 模型后训练实验显示,针对 Agent 能力后训练后,GPQA 从 83.33 升至 90.40,DeepSearchQA 从 47.04 升至 59.39,但 GAIA 从 57.57 降至 45.70,IFEval 亦下降,表明固定参数量下不同能力间存在资源重新分配。

五种规格覆盖不同设备与场景,同时提供 BF16、Q8_0 和 Q4_K_M 三种 GGUF 量化文件。以 4B 为例,Q8_0 文件约 4.48GB,在 231 道公开 JevBench 量化复测中与原始权重决策一致率达 100%,均答对 204 题;Q4_K_M 版本约 2.71GB,一致率 98.3%,答对 201 题。

标签: AI 资讯 AI

更多推荐阅读

Mistral发布1T参数大胖猫模型,激活仅49B

Mistral发布1T参数大胖猫模型,激活仅49B

今天早些时候,美国开源了 glm5.2 级别的模型。随后,欧洲的 Mistral 发布了 Mistral Large 4,又名 Le Chonk 大胖猫。 该模型总参数 1.05T,每次只激活 49B,另带一个 1.6B 的视觉编码器。它采用细粒度混合专家(MoE)结构,模型拆成很多“专家”,每处理一个词只叫醒其中一小部分,因此 1T 模型每算一个词的开销接近 49B 模型。原生多模态,能读文字...

2026-10-07
xAI联创宣判:数学两千年英雄时代落幕

xAI联创宣判:数学两千年英雄时代落幕

两千多年来,人类最聪明的大脑一直在攀登数学这片山脉。从欧几里得到怀尔斯,每征服一座山峰都要赌上一生。但xAI联合创始人Christian Szegedy认为,这个属于数学的英雄时代正在结束。 Szegedy在长文《数学何去何从?》中,将数学家比作丛林里徒手攀岩的探险家,AI则是一架飞机,已把旗插上没人爬过的山顶。孤独攀登者的时代正在结束,测绘整片大陆的时代正在开启。 Szegedy少年时在匈牙...

2026-10-06
OpenAI疯狂28天首日:模型提速50%却遭评论区翻车

OpenAI疯狂28天首日:模型提速50%却遭评论区翻车

Codex负责人Tibo宣布启动“疯狂28天”计划:未来28天每天要么交付一项Codex/Work改进,要么进行一次完整额度重置。第一天,Tibo宣布GPT-6 Astra和GPT-6.1 Sol默认推理速度提升约50%,达到50TPS,覆盖官方订阅及Sign in with ChatGPT接入的第三方生态。 但评论区几乎无人关注提速,满屏冷嘲热讽。此前9月29日GPT-6.1 Sol上线后因负...

2026-10-06
AI研究员为何计划逃离湾区买地避难

AI研究员为何计划逃离湾区买地避难

一些Anthropic最期的员工,最近开始考虑在美国偏远地区买地。他们想过,如果AI真的失控,那里或许可以成为避难的地方。 “一切再也无法平静如初。”一些研究员的电脑上贴着同一句话。 事实上,逃离的念头并非突然出现。十多年来,一群聚集在旧金山湾区的AI安全研究人员,一直在讨论AI失控之后可能发生什么。那时候,Anthropic甚至还没有成立。 有人在伯克利设立共享办公空间,在私人Slack频...

2026-10-06
英伟达押注的Reflection开源新模型对标智谱

英伟达押注的Reflection开源新模型对标智谱

英伟达投资的 Reflection 发布首个开源模型 Beam,对标智谱 GLM-5.2。官方称两者在高级推理测试上分数相当,Beam 推理算力仅需后者的三分之一到四分之一。彭博和金融时报称其为美国在开源模型领域对中国的反击。但 Beam 与国内其他头部开源模型如 Qwen3.8、GLM5.3、Kimi K3、DSV4F 仍有差距。 Reflection 由谷歌 DeepMind 两位研究员 M...

2026-10-06
把35个判断交给内核:这个开源项目拿下黑客松总冠军

把35个判断交给内核:这个开源项目拿下黑客松总冠军

在进化酒馆黑客松深圳收官之战中,项目 mu(μ)获得全场冠军。它将 Jev 深度融合进 Harness,试图解决 Agent 把工具、日志、技能、上下文全部交给大模型导致效率低、Token 浪费的问题。 mu 建立在开源 Coding Agent pi 之上,主要改造模型外的 Harness,设计了 35 个判定点,覆盖用户输入、工具调用、上下文管理、任务完成判断和多 Agent 通信等环节。例...

2026-10-06
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部