Jev 被请下王座:StartLux 中国开源决策模型冲上第一,3 天做出五档规格

9 月 30 日,上海 AI 公司 StartLux(原点星辉)发布了完全开源的决策模型 StartLux-Decision,一次性推出 0.8B、2B、4B、9B、27B 五档版本。按团队公布的评测,它的旗舰 27B 版本在 Decision Index 0.2.1 上拿到 63.88 分,超过此前榜单第一的 Jev 1.13(57.91),把这位决策模型赛道的新王请下了王座。

StartLux-Decision

更有意思的是研发速度:整个模型只用了 3 天完成研发与验证。这背后是 StartLux 自建的 Auto Research 研发管线——按官方说法,这是他们推进 RSI(递归式自我改进)的核心路径之一。

先把话说在前面:这是”团队自测”,不是官方上榜

这条必须讲清楚,否则容易被标题带偏。

StartLux 的成绩是用 Decision Index 的官方评测工具、对照 2026 年 9 月 28 日的公开榜单快照完成的团队自测。换句话说:

  • 他们用的是榜单的评测工具和同一天的对照数据,方法上是讲得通的
  • 但他们的成绩本身还没有登上官方榜单,官方文章里也明确写了”不表示已获官方上榜认证”
  • 对照的 Jev 1.13 是公开榜单上的最高分(2026-09-28 快照)

所以准确的说法是:“按团队自测,StartLux-Decision 已经超过了当前公开榜单的榜首”。这不是贬低——能自测出这个分数本身就说明实力,但读者心里要有一杆秤。下文所有数字,都请默认带着”团队自测”这个前提来看。

它到底是什么:一个”不生成文本”的决策模型

理解 StartLux-Decision,先要理解它和普通大模型的根本区别。它不是生成式模型,不写自然语言。

用法是这样:你给它一个状态(state)加一组问题(questions)——选择题(从几个选项里挑一个)、是非题、或等级评分。状态可以是文本、JSON 或图片,最长 256K token。每个问题返回每个选项的概率。

关键在最后一句:它什么都不生成。答案是在一次前向传播(forward pass)之后,直接从选项字母上读出来的。所以一个短问题只要几毫秒,而且概率可以直接当置信度用。

这解决的是智能体里一类特定的活儿:高频、候选集明确的判断。比如客服工单来了——”订单被重复扣费但仍显示未支付”——同一条信息可以同时问三个问题:交给哪个团队、今天要不要处理、影响多严重。传统做法是让生成式模型写一段话再解析,又慢又容易解析出错;StartLux-Decision 一次请求就能把三个判断一起做完。

决策模型接口

成绩单:63.88 对 57.91,38 项里赢 31 项

Decision Index 0.2.1 的对比(均为 2026-09-28 快照口径):

  • StartLux-Decision-27B:63.88
  • Jev 1.13:57.91(榜首)
  • Rune 26B-A4B:57.44
  • Decider chat 31B:57.33
  • AutoJev-27B:56.40
  • StartLux-Decision-9B:58.63——9B 也超过了 Jev

27B 比 Jev 高 5.97 分,在指数包含的 38 项基准里,有 31 项得分更高。

但请注意官方自己点出的一句话:“综合得分领先不等于所有能力都更强”。这句话值得展开看。

赢在哪,输在哪:分领域看更清楚

Decision Index 的领域得分里,27B 在四个领域全面领先,但在”知识与推理”上输给了 Jev:

  • 语言理解:74.5 vs Jev 62.0(高 12.5)
  • 检索与分类:66.8 vs 55.4(高 11.4)
  • 工具与自动化:82.2 vs 75.1(高 7.1)
  • 艺术与人类偏好:47.9 vs 37.7
  • 知识与推理:44.3 vs Jev 51.4(落后 7.1)

这个分布很能说明问题。StartLux-Decision 强在“理解条件、在候选里区分、选下一步操作”——恰好是智能体日常执行最需要的三类能力;而它在纯知识推理上不占优。所以结论不是”谁全面碾压谁”,而是选型要看你的智能体最常遇到哪种判断。

单项上也有类似的分化。比如 API-Bank 它没领先,Home appliances 却从 Jev 的 52.3 拉到 77.3,POP909 从 15.9 拉到 50.6。官方特别提醒:这些是 Decision Index 经随机基线校正的分数,不能直接当作各基准原版的准确率或完整 Agent 成功率。

七套公开测试:平均 91.82%,难题少错 8 道

除了 Decision Index,团队还跑了上海人工智能实验室发布 Intern-Decision 时采用的七套测试(JevBench Easy/Original/Hard、Typed Decisions、ToolACE、AG News、WildJailBreak):

  • StartLux-Decision-27B 平均准确率 91.82%
  • Jev 1.13:88.74%
  • Intern-Decision-4B:90.02%

公开 JevBench 共 231 题,三者分别答对 208 / 199 / 201 题——27B 比 Jev 多对 9 题。在最难的 JevBench-Hard(111 道公开难题)里,27B 错 23 题,比 Jev 的 31 题少错 8 题。

这里同样有口径要留意:公开 JevBench 的 208/231 只是公开题,不是包含保密测试、速度与成本的官方总分;另外训练数据用了其中 14 项基准的公开训练集,对应的测试题已被过滤掉(官方用 † 标注)。

速度:毫秒级,一次前向算完所有问题

决策模型的价值一半在准,一半在快。单卡 H200、BF16、本地 HTTP 的短请求测试中,一次回答三个问题的耗时:

  • 0.8B:12.2 ms
  • 2B:15.5 ms
  • 4B:26.0 ms
  • 9B:35.7 ms
  • 27B:102.3 ms
  • 35B-A3B(MoE):52.5 ms——35B 里每 token 只激活约 3B,反而比 27B 快一倍

只回答一个是非题时,4B 平均只要 14.7 ms。而同一模型内部的优化更能说明工程收益:4B 未启用 CUDA Graph 时是 90.3 ms,启用后降到 26.0 ms——三倍多的提升全靠工程。项目还用了快速线性注意力算子,并把多个问题合并到一次前向计算,减少重复调用。

作为参照,Jev 1.13 在同类三问题请求上,其 API 网关报告的服务端耗时是 64.0 ms。但官方很克制地提醒:双方硬件和服务栈不同,不能据此得出严格的同硬件倍速结论,而且这些毫秒数也不是整项网页任务的完成时间(输入长度、页面加载、工具执行都会影响)。这种自我设限的表述,反而是这篇发布里可信度较高的部分。

时延对比

实战演示:从浏览器操作到打游戏

官方放出的演示覆盖了好几个方向,核心都是”模型做决策、执行系统做动作”:

浏览器/网页操作:每一步问两个问题——下一个操作哪个控件、任务是否完成。演示里完成了”买最便宜、免运费、8 节装 AA 电池寄到家”的筛选下单,以及把指定成员邀请进 Design 团队并设为 Editor。注意官方声明:这些是受控环境下的连续操作,不等同于任意网站的自由输入能力,输入框也是通过候选建议项完成选择的。

国际象棋:StartLux-Decision-27B 与 Jev 1.13 对弈,双方都不搜索,代码也从不覆盖模型的选择(Stockfish 只画评估条)。按仓库说明,256 局比赛里 27B 得分率 58.4%。

游戏:Mario(先模拟 11 种候选动作、把结果写成文字再选)、StarCraft II(每 12 秒游戏时间问三个问题:造什么、优先出什么兵、进攻/防守/采集)、DOOM(每 4 个 tic 判断目标、开火、移动)、JevBall(一次请求为球附近多名球员分别选动作)。官方同样说明:这些不是统一的”直接读屏”测试,感知与执行各有脚本承担,模型只负责接口定义的那部分决策。

还有一个细节演示挺有意思——”汉娜,你今天见过杰夫吗?”这句话里同时出现汉娜和杰夫,系统要判断被询问的对象是汉娜,而不是因为出现”杰夫”就让另一个角色回应。把它单独拎出来测,才能分清模型是在理解对话、还是只在匹配名字。

五档规格 + MoE + 量化,本地部署友好

StartLux-Decision 提供五档稠密模型(0.8B / 2B / 4B / 9B / 27B),外加一个 35B-A3B 的混合专家(MoE)版本。10 月 3 日又补上了图片输入和 256K token 上下文,每一档都能把图片作为证据读入。

本地部署是重点:每档都提供面向 llama.cpp 的 GGUF 文件,包括保留原精度的 BF16,以及 Q8_0、Q4_K_M 两种量化格式,共 15 个 GGUF 条目。以 4B 为例:

  • Q8_0 文件 4.48 GB,在 231 道公开 JevBench 上与原权重决策一致率 100%(同样答对 204 题)
  • Q4_K_M 压到 2.71 GB,一致率 98.3%,答对 201 题

许可要特别注意:代码采用 Apache-2.0,但模型权重采用 CC BY-NC 4.0——仅限研究和非商业用途,商业使用需另行取得 StartLux Labs 授权。这一点跟”完全开源”的宣传口径是有区别的,商用前务必确认。

接口兼容 Jev,概率可做分流

接入层面有个很聪明的设计:StartLux-Decision 采用 TypeSafe 的 /v1/systemone 接口格式,为 Jev 写的客户端可以原样使用,业务程序保留现有的”状态+问题”调用方式、改一下服务地址就行。GGUF 部署也保留这套接口(llama.cpp 承载模型,配套决策服务负责组织问题并读出选项)。

另一个值得关注的机制是概率分流:因为每个候选项都有概率,系统可以在”经过验证的常规场景”里直接执行决策;当候选项难以区分、状态不充分或操作风险较高时,再补充观察、交给大模型分析,或者请求人工确认。

官方也提醒得挺实在:概率输出不等于真实成功率,分流阈值要结合业务数据校准;支付、删除、权限修改这类操作仍应遵守原有授权与确认规则——决策模型是帮系统判断下一步,不是替代这些约束。

背后的 Auto Research 与 RSI

3 天做出五档模型,靠的是 StartLux 的 Auto Research 研发管线(由联合创始人兼 CTO 郭权玮带队建设)。按机器之心此前的专访介绍,这套方法里 AI 不只执行预设实验,还会根据上一轮结果分析失败、提出新假设、参与决定下一步研究什么;而研究目标、评价标准和关键规则仍由人把关。

在 StartLux 的系统划分里,StartLux-27B 承担通用能力层,Decision 模型专注高频决策层,上面是 Agent 与 Memory,底层由量化、推理系统和硬件适配支撑。所以 Decision 不是追热点做的孤立发布,而是这张架构图里按计划补上的一块。

郭权玮把 Auto Research 定义为实现 RSI 的核心元件:先让 AI 参与研究和模型改进,之后进一步要求”被改进后的 AI,连改进 AI 的能力本身也得到提升”。StartLux-Decision 是这条路线上的一个具体成果。

怎么看这件事

把 Jev 请下王座这个说法,本质上是中国团队在 Agent 底层”决策层”上的一次卡位。Jev 带来的思路——用专用模型承接高频、候选明确的判断,而不是让生成式模型既当裁判又当运动员——正在被验证是一条真需求。StartLux 用开源、五档规格、本地部署和 Jev 兼容接口,把这条路走得更”可落地”。

但三个提醒仍然成立:

  • 成绩是团队自测,未经官方榜单认证,看数字时要带上这个前提
  • 综合领先 ≠ 全面领先,它在知识推理上仍落后 Jev,选型要看自己的任务分布
  • 权重是 CC BY-NC 4.0,”完全开源”仅限非商业场景,商用要单独授权

不管怎样,一个成立不久的上海团队,3 天做出五档决策模型并在公开口径上超过当前榜首,这件事本身就值得记住。Agent 的”判断层”正在成为一个独立的、值得下注的技术赛道。

决策模型不是要取代大模型,而是让大模型少做那些不该它做的琐碎判断。

暂无介绍....

延伸阅读:

VAPT 到底是做什么的?NIST SP 800-115 拆解漏洞评估与渗透测试的边界

安全圈里 VAPT(Vulnerability Assessment and Penetration Testing,漏...

itadol5j
2026年10月6日
AIAIA 是什么?港府《伦理人工智能框架》里的 AI 应用影响评估模板拆解

做 AI 治理文档的人大概都见过这个词:AIAIA——AI Application Impact Assessment,...

itadol5j
2026年10月6日
安全圈都在谈Agentic SOC:CrowdStrike 凭什么敢让 AI 做判断?

最近半年,安全圈的会议圆桌、厂商发布会、甲方 CISO 的朋友圈,出现频率最高的词大概就是 Agentic SOC(代理...

itadol5j
2026年10月6日
ChatGPT 推出文字水印,GPT-6 提速 50%

很少有 AI 厂商敢笃信「以数量换质量」,OpenAI 偏偏是其中之一。继当年连开 12 天发布会之后,10 月 5 日...

itadol5j
2026年10月6日
Jev 被请下王座:StartLux 中国开源决策模型冲上第一,3 天做出五档规格

9 月 30 日,上海 AI 公司 StartLux(原点星辉)发布了完全开源的决策模型 StartLux-Decisi...

itadol5j
2026年10月6日