1小时微调专属Jev模型,单卡实测准确率78%
开源版 Jev 教程发布后,不少读者反馈模型在演示用例上表现顺畅,但接入实际业务时意图判不准、分类标签对不上。原因在于开源复刻版本提供的是在公开通用数据上训练的权重,学习到的是特定业务场景与候选描述,而不同团队的 Agent 处理状态、路由类别和判断口径各不相同,直接套用通用权重准确率必然下降。
根本解决办法是基于自己的数据训练。本篇教程带大家在本地从零走通完整训练流水线,涵盖下载底座与数据、预处理切分、全参数微调、选优校准以及启动本地接口。整套流程使用公开权重与公开数据,一张显卡即可运行。在 DGX Spark 上实测,600 步训练耗时约 49 分钟,峰值显存约 34 GB,在测试集 2000 道决策题上达到 78.05% 的准确率。配套脚本已整理至开源实验仓库,可直接 clone 到本地操作。
训练前厘清模型架构与数据输入
Jev 属于判别式决策模型,与 Qwen、ChatGPT 等自回归生成式大模型存在根本差异。给定系统当前状态、决策问题及一组候选选项,它不逐 token 生成解释性文本,而是在网络末层直接计算各候选选项的标量得分,经归一化后输出概率分布。这种一次前向推理即可得出结论的机制,避开了文本生成与后续解析开销,推理延迟通常维持在数十毫秒以内。
模型结构由两部分拼接而成。一部分是特征底座,选用移除因果语言模型头的预训练模型 Qwen3-0.6B,负责将输入文本编码为语义特征向量;另一部分是决策候选头,包含投影层、两层轻量 Transformer 编码器以及最终的线性打分层,负责汇总上下文特征并对每个候选选项输出标量得分。训练阶段,特征底座与候选头同时参与梯度更新,属于全参数微调,而非只更新旁路的 LoRA 方案。

开源社区目前有若干复刻项目,本教程选取 AgentJev 作为主线。选择依据有三点:训练、选优、校准与测试全套代码完整公开并整合于单一脚本链,单卡环境即可执行;配套数据集与官方基准同源且无需申请权限;底座采用 Qwen3-0.6B,权重文件仅 1.5 GB,国内网络环境可平稳获取。
数据集格式与输入字段
模型训练使用 HuggingFace 上的公开数据集 LocalLLaMA/typed-decisions。数据按独立案例组织,训练部分包含 1200 个案例,测试部分包含 400 个案例。每个案例固定设置 5 道决策题,即对应训练集 6000 题、测试集 2000 题。该数据集主分支近期已更新扩充至 3200 个案例,为保证复现结果完全一致,本教程全程锁定特定 revision,本文引用的数据规模均以此版本为准。
数据集仅包含两个轻量 parquet 文件。算上 1.5 GB 的预训练底座以及约 2.3 GB 的训练生成文件,整套实验在本地磁盘占用不到 4 GB。
样本输入由三个核心部分构成。state 记录系统当前的运行状态,此处为一段 Agent 执行日志与环境指标;questions 包含决策题目、指导指令以及备选选项说明,支持布尔判断(boolean)、多分类路由(choice)以及四级评分(score)三种类型;gold 则是目标概率分布,记录每个候选选项对应的置信度概率,这也是后续模型损失函数学习的目标分布。数据集中还包含一个名为 factors 的辅助字段,记录生成该案例时的底层控制因子。数据集文档明确指出该字段不作为输入。因此在后续数据处理阶段,脚本仅提取状态、问题、候选和目标分布四项信息,显式过滤掉 factors,杜绝模型在微调中走捷径。

本地训练与部署全流程
整个训练与部署流水线包含准备环境与资源、切分数据、执行训练、选优校准评测以及启动本地服务五个步骤。
第一步,环境配置与资源下载。建议在独立的 Python 虚拟环境中配置依赖:
git clone https://github.com/li-xiu-qi/XiaokeAILabs.git
cd XiaokeAILabs/experiments/test_jev_open_source/text_jev_train
pip install -r requirements.txt
PyTorch 需根据本机实际 CUDA 版本单独安装。以 CUDA 12.x 为例:

pip install torch --index-url https://download.pytorch.org/whl/cu121
依赖配置完成后,运行下载脚本获取数据集与底座权重。国内网络环境可附带 --mirror 参数走镜像源。
python scripts/download_data.py --mirror
python scripts/download_backbone.py --mirror
download_data.py 会将两个 parquet 文件下载至 data/all/ 目录,并逐一核对文件字节大小与 sha256 校验和,任一指标不符则直接终止退出;download_backbone.py 则将 Qwen3-0.6B 底座权重拉取至 models/Qwen3-0.6B-Base 目录。
第二步,数据集切分与防泄漏。数据下载完成后,运行数据预处理脚本:
python scripts/prepare_data.py
该脚本将原始 parquet 数据转换为主训练脚本读取的 jsonl 文件,并执行训练集、验证集与校准集的切分。这一步的关键准则在于必须在案例层级进行划分,随后再展开各自包含的题目。如果直接打散所有题目并随机分配,同一案例衍生出的多道题目会同时出现在训练集和测试集中
更多推荐阅读

Sonnet 5.5六天反超Opus,中杯追平旗舰
说好的未来几周,Anthropic只等了6天。上周Opus 5.5发布时官方剧透Sonnet 5.5和Haiku 5.5都在后面,如今Sonnet 5.5先到了,Claude家的“中杯”已经撵着刚发布的旗舰追了。 上周Opus 5.5发布时,Terminal-Bench 4.0的66.4%还是挺能打的成绩。Sonnet 5.5一来直接干到70.6%,上一代Sonnet 5只有10.3%。在覆盖4...
2026-09-29
AI员工接管企业SaaS,Ema融资7700万估值翻4倍
AI 初创公司 Ema 正试图让 AI 智能体团队接管企业内部的人力资源、IT 和财务等业务流程。随着 AI 开始承担过去由企业软件和 IT 服务完成的工作,Ema 宣布完成新一轮 7700 万美元融资。本轮 B 轮融资由印度班加罗尔风投机构 Creaegis 领投,现有投资者 Accel、Section 32 和 Prosus 继续加码。融资完成后,Ema 累计融资额达 1.4 亿美元,估值较 ...
2026-09-29
可灵4.0内测:30秒一镜到底,支持10关键帧与HDR
可灵AI宣布最新旗舰视频生成模型Kling 4.0开启内测,将于10月正式上线,同时推出生成速度更快、性价比更高的Kling 4.0 Flash。两款模型API价格暂未公布,Flash已于昨日面向可灵最高档会员(每月916元起)开放体验。 这是Kling系列时隔8个月的大版本更新,上次为今年1月31日的Kling 3.0。Kling 4.0升级集中在视听质感、创意控制和叙事能力三方面。 Kli...
2026-09-29
百万月活AI热点网站AIHOT正式开源
今天,我决定将月活百万的AI热点资讯网站AIHOT正式开源,网址为https://aihot.news/。它最初只是公司内部用于监控热点、寻找选题的飞书机器人,后来发展为拥有百万月活、近10万Skill用户,以及众多基于其API二次开发的项目。从年前借助AI开发第一版至今,已过去七八个月。很多人问我为何不商业化、一直免费,其实我只是单纯喜欢做产品,大家的鼓励和正反馈是我深夜坚持的最大动力。 开源...
2026-09-29
AI造AI时代来了?代季峰团队开源新模型
Naive AI 正在探索让当前 AI 模型承担下一代模型研发的路径,使每一代模型都能比上一代承担更多研发工作。 10 天前,Anthropic 公布内部数据:AI 研发工作中已有 26% 由 Claude「主导」完成,研究员只需给出高层指令,Claude 即可端到端完成大部分任务,人类负责监督;今年 2 月这一比例还不到 1%。更早几天,OpenAI 宣布去年定下的「自动化研究实习生」目标已达...
2026-09-29
腾讯秘密内测AI游戏搭子“鹅次元”
腾讯正在秘密内测AI游戏陪伴产品“鹅次元”,主打数字人AI搭子,提供语音对话、画面实时识别、游戏陪伴等能力。产品内置多位人设各异的男女虚拟角色,玩家选定后可闲聊互动或激活游戏陪伴模式,适配多款主流网游。全部功能限时免费,界面已露出星币兑换能量的付费框架。 实测中,进入产品后首先看到AI角色选择界面,可切换男女分类,女性角色有谷雨、沈露白、夏夏三位可选。选定“夏夏”后进入主交互界面,中间是数字人形...
2026-09-29