AI操控游戏新选择:Jev模型到底能做什么?
Jev 是 TypeSafe AI 推出的决策模型,创始人 Diogo Almeida 曾在 OpenAI 参与指令跟随与对话研究。TypeSafe 开发两年后发布该系统,官方称为 System One Models。其使用方式是把当前情况和问题输入,模型返回程序可直接使用的结果,本质上是分类模型,接口主要有三种类型。
在游戏场景中,可每一步询问它:当前血量、怪物和金币位置、出口位置,目标是拿金币并活着出去,现在按哪个键?可选项提前定义为上、下、左、右、攻击、喝药,Jev 返回其中一个动作,游戏执行后再把新局面发回。其优势是无幻觉,严格按预定义输出标签执行。

我用 Codebuddy 做了调用 demo。视频中每步多停留几秒,是为看清右侧三部分:看到什么、选了哪个动作、执行后发生什么,停留时间不是模型响应时间。这一局 Jev 先攻击挡路怪物,再右移拿金币,最后到出口,共 6 次真实 API 调用。第一步返回“攻击”概率约 95%,界面置信度约 93%,二者不同,也都不是通关概率。视频说明模型选择确实驱动游戏,响应足以支持回合制交互,但不能说明 Jev 比 GPT 更会玩。我们已搭相同地图和规则的对比版本,但未完成有效双模型实测,因此不放胜负和性能结论。一次低血量测试中,角色剩 20 点血,Jev 第一手选攻击,怪物反击后剩 5 点血。该动作是否最优要看后续局面,不能只凭“没喝药”下结论。它提醒我,模型会作取舍,演示不应改成预设答案。
demo 分工是:地图、伤害、碰撞由游戏代码处理,每一步按哪个键由 Jev 返回。Jev 是拿手柄的玩家,普通代码是游戏本身。它不负责画地图,也不生成整个游戏,我们也没写自动通关路线。代码把局面整理成文字和数据,再把模型选出的动作交给游戏引擎执行。它看到的是状态描述,不是屏幕截图。

Browser Use 的航班查询例子把“判断”和“生成”分得很直观。页面先整理成带编号元素,Jev 决定操作什么、点哪个目标;需填城市名时再调用生成模型产生文字。作者记录一次查询用 7.073 秒,其中 17 次 Jev 请求、2 次文字生成调用。初始打开网页和最后独立结果校验不在计时内。这是一次具体任务记录,没有购票,不能推广为“所有浏览器任务都能七秒完成”。该例中,选择下一步的次数明显多于写文字次数,展示了一种可实际搭出来的分工。
其他社区例子也值得看。看游戏演示时要记住:每秒做十次决策不等于接管每一帧物理和控制,渲染、碰撞、动画、执行仍是游戏系统的工作。

为什么还要专门做 Jev?自回归大模型当然能分类,也能只返回一个动作,Structured Outputs 还能约束输出字段和枚举值,所以不能拿“通用模型总要写一大段话”作比较前提。真正区别在调用频率和整个使用场景。偶尔分一条工单,多花几百毫秒可能没感觉;但 Agent 系统反复判断几十次,或系统每天处理百万条内容,单次多花的时间和钱就会累积。
Jev 基于这一假设收窄训练任务。按 TypeSafe 官方描述,它采用面向决策的架构、并行采样和 RLCD 训练方法,重点优化判断和概率校准。公开资料能让我们理解方向,但不足以完整还原模型内部实现。
总体看,目前三个方向可能有收益。一是更适合反复调用线上场景。官方公布响应约 70—500ms,输入每百万 tokens 0.042 美元,输出免费。这是厂商口径,实际延迟受网络、输入和负载影响。按每次总输入 1,000 tokens 粗算,一百万次请求模型费用约 42 美元,其他服务和回退成本另算。二是减少没必要的串行步骤。比如收到反馈,可同时判断业务类别、紧急程度和信息是否齐全,再由代码组合结果。若只依赖同一份输入,就不必排队问三次。官方智能家居例子也如此:一次判断设备、范围和动作,再挑出相关结果执行。三是让程序有机会识别犹豫。同样选 A,“明显偏向 A”和“A、B 很接近”,后续处理可不同。程序可补充信息、换模型,或交给人。
但有个易混淆细节:confidence 是从答案概率分布计算出的统计量,不是“这次一定有多大概率正确”。我们视频里攻击概率约 95%,confidence 约 93%,也都不是通关概率。若要拿它决定是否自动执行,得先用自己的数据检验。概率校准是看一批样本中模型给出的概率和实际结果是否相符,不能看到 0.9 就替业务定通用自动执行规则。
应用场景主要有四类。一是游戏 NPC 与高频回合/实时决策。在每秒多次决策、但底层物理和渲染交给游戏引擎的场景中,用大模型逐字生成成本极高且延迟不可接受。回合制或轻量实时操作,如驱动 DOOM、Mario 或星际争霸小范围战斗中的 AI 动作:游戏把地图状态、血量、敌我距离整理成结构化文本发给 Jev,Jev 在预设动作中瞬间挑选。轻量级智能体操控,如无人机避障模拟、跑酷小游戏,高频输入传感器或游戏状态数据,输出导航操作。二是复杂 Agent 内部的高频路由与
更多推荐阅读

平头哥真武V900发布:AI算力从单卡走向千卡互联
从真武 V900 到新一代磐久超节点服务器,平头哥八年来布局的 AI 芯片、CPU、scale up 互联、scale out 网络和存储芯片,开始被装进同一套算力系统。9 月 22 日 2026 杭州云栖大会上,平头哥被完整推到主论坛台前,副总裁高慧发表题为「Agentic 时代卓越算力基石」的演讲,发布从真武 V900 芯片到 ICN Switch 互联芯片、磐脉智能网卡、镇岳 SSD 主控、...
2026-09-23
陆川用AI五天复原明代大爆炸,阿里全模态模型兜底影视生产
不用搭景,不用等演员,导演陆川和团队用AI把一场400年前的明代灾难现场做了出来。宫廷、火药库,以及史料中烟云如黑灵芝的大爆炸,按传统影视工业做法往往需要数月时间和千万级投入,这次只用了5天。 人物的脸、皮肤、神态已相当逼真,爆炸的烟尘、碎片、火光也稳稳接住。过去光是一场爆炸戏就要耗费19天。陆川团队把史料文字翻译成现代视觉概念,前后做了约四轮提示词优化,再参考真实爆炸影像校准。阿里视频生成模型...
2026-09-23
OpenAI新模型24天攻克100+数学难题
数学界正被AI迅速逼近。OpenAI一篇重磅博文披露,一款8月28日才开始训练的内部新模型,已攻克100多道世界级数学难题,横跨数学大部分领域,其中包括困扰学界多年的“纳维–斯托克斯”千禧年难题。从开训到9月21日官宣仅24天,进化速度令OpenAI内部数学家都感到意外。 9月8日,OpenAI称该内部模型在88小时内攻克NS千禧年难题,给出NS方程存在性与光滑性问题的证明,并公开166页论文和...
2026-09-23
国产AI生图新高度:真假难辨,还能精修到商用
两张图都是AI生成的,来自商汤科技正式上线的SenseNova U1 Pro,目前可在商汤小浣熊平台使用,API已向企业客户开放。 实测在SenseNova Studio平台进行,模型支持2K起步、最高4K清晰度。第一轮测试将一张生活照重构为纸质风格,随后仅修改人物外套内的黑色圆领T恤为白色,要求严格限定在可见内搭区域。由于T恤、皮带、裤子均为黑色且有胸牌遮挡,边界易混淆,但U1 Pro精准拿捏...
2026-09-23
剪映发布全新AI创作能力:从专业剪辑到普通用户全面提效
剪映在2026 AI新创作发布会上发布全新AI能力,覆盖PC专业版与App端,分别聚焦“提效”与“省心”。 PC专业版推出剪映Hub,一站式AI创作平台,将AI创作与多轨道剪辑连接,让脚本、素材与创作上下文在同一项目中延续,减少跨工具切换的断点与重复操作。剪映助手Agent介入专业创作流程,承担素材整理、粗剪、包装等工作,可根据创作目标规划任务、串联模型工具并自动运行,用户也可自定义工作流,沉淀...
2026-09-23
阿里云栖大会:吴泳铭为何用经济学讲AI未来
9月22日,杭州云栖大会,阿里巴巴集团CEO吴泳铭发表开场主旨演讲。过去几年,云栖大会演讲常被视为技术风向标,但这次吴泳铭花了很多时间讲工业革命、电和经济学,重心不在AI会变成什么样,而在AI会让世界变成什么样。他提出核心观点:上一次类似变化是工业革命把动力变成规模化商品,人类发明蒸汽机、内燃机和电,并围绕它们建立现代产业,这一次轮到思考。当一个CEO用经济学语言描述未来,说明他思考的已不仅是产品...
2026-09-23