DataLearner 标志
JE

Jev

预览版基础大模型结构化输出JevJev

Jev

别名:jev-latest

发布时间: 2026-09-15更新于: 2026-09-19浏览量: 451
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
64K
多语言支持
暂无数据
推理能力
暂无数据

Jev 不生成文本,只在预设选项上输出概率;独立工单测试中的响应时间中位数约为 0.4 秒。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Jev

模型基本信息

推理过程
暂无数据
思考模式
不支持思考模式
上下文长度
64K tokens
最大输出长度
暂无数据
模型类型
基础大模型
输入/输出模态
文本 → 文本
发布时间
2026-09-15
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
暂无数据
Jev

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
Jev

官方介绍与博客

DataLearnerAI博客
暂无
Jev

API接口信息

接口速度
暂无数据
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$0.042/ 1M tokens$0.0000/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Jev

发布机构

Jev

模型解读

Jev 是 TypeSafe AI 在 2026 年 9 月 15 日以早期访问形式发布的第一款模型。它不是一个更小或更便宜的聊天模型。它放弃了逐 token 生成文本,只在调用方预先定义好的选项上输出概率。TypeSafe 把这类模型称为 System One Model,名字取自卡尼曼对快思考和慢思考的区分。创始人 Diogo Almeida 曾在 OpenAI 参与指令遵循方向的研究,这部分工作后来成为 ChatGPT 的基础。公司的判断是:聊天模型已经足够聪明,但字符串输出不适合直接嵌进软件流程。模型名 Jev 则来自杰文斯悖论,意思是智能的成本每降一个数量级,都会释放出更多的使用需求。来源:TypeSafe 发布文章。

放弃生成文本,换来并行打分和类型安全

按官方说明,Jev 用了新的模型架构和并行采样器,一次查询就给出所有候选项的概率,不需要自回归地一个字一个字往外写。训练方法叫 RLCD(Reinforcement Learning for Calibrated Decisions),目标不是让人类评审更喜欢它的回答,而是让它给出的概率和实际准确率对得上。因为输出空间事先由调用方定义,所以 Jev 不会返回格式错误的结果,也不会编造一个不在选项里的答案。单个问题最多支持 255 个选项;选项更多时,官方做法是先逐个打分,再做一次选择。

这种设计也解释了本页 API 价格表里输出价格为 0 的原因:Jev 只按输入收费,每百万 token 0.042 美元。这不是数据缺失。同理,页面上“文本→文本”“不支持思考模式”这些字段是按生成式模型的框架填的,并不能准确描述 Jev:它的输出不是文本,而是一组带概率的结构化值。模型权重和参数规模都没有公开。

官方“快两个数量级”的对比基准选得很有利

官方给出的端到端响应时间在 70 到 500 毫秒之间,并宣称相比前沿模型快 40 到 200 倍。主要证据是一套自建的 workflow 评测:让每个模型跑同一段业务流程代码,然后把 GPT-6 Astra 和 Fable 5.1 的平均判断当作参考答案,看其他模型和它们有多接近。这套方法测的是“像不像最强模型”,而不是对人工标注的正确率。对比对象也主要是高价前沿模型。TypeSafe 在原文中自己列出了这些局限:评测流程由内部团队编写,参考答案偏向 OpenAI 和 Anthropic 的模型,宣传中的 193.6 倍提速、444.6 倍降本属于真实场景收益的上限。

独立测试:延迟优势很稳,碰上廉价 Flash 模型时成本优势所剩不多

目前最完整的第三方数据来自 devx AI labs 在 9 月 20 日发布的测试,代码和原始输出都已开源。在 100 条工单、5 个队列的分流任务上,Jev 的准确率是 92%,在 19 组可用结果里排第 12;排第一的 DeepSeek v4.1 Flash(关闭推理)是 97%。由于样本只有 100 条,Jev 的 95% 置信区间是 85% 到 96%,和大部分对手重叠,所以准确率排名并不稳定。差距真正清楚的是速度:Jev 的中位延迟是 385 毫秒,是全场最快的。成本上 Jev 也最低,每千条 0.018 美元,但 DeepSeek v4.1 Flash 和关闭推理的 GLM 5.3 Flash 分别是 0.026 美元和 0.021 美元,差距远没有官方宣传的几百倍那么大。这组数据说明,Jev 的价格优势主要是相对前沿模型而言的;和同一价位的 Flash 模型相比,它主要赢在延迟上。

在检索重排任务上,Jev 的打分模式在 350 个问题上的 recall@5 是 0.349,比 BM25 基线高出约 9 个百分点,和排名第一的模型相差约 2 个百分点。它的中位延迟不到 1 秒,而其他领先模型普遍在 3 到 4 秒。不过,devx 也发现,如果把 100 段候选文本一次性塞进一个 Choice 请求,350 个问题里有 85 个直接被拒。改成分批提交之后,Noul 模式每个问题的调用次数从 100 次降到 2 次,延迟从约 6.8 秒降到 0.6 秒,质量没有明显下降。所以,Jev 能不能用好,很大程度上取决于调用方怎么拆分请求。

这里还有一处容易误读的数字。TypeSafe 文档写的是整次请求最多 64K token,但另有限制:输入内容加上最长的单个问题,最多 32K token。devx 的 Choice 测试里,最大的成功请求是 32,850 token;他们没有测出精确上限。这不能直接证明官方的 64K 数字有错,却说明只看“64K 上下文”就把大量候选项塞进一次请求,可能收到拒绝而不是答案。

confidence 分数和对抗输入是目前最大的风险

Jev 每次 Choice 或 Score 输出都带一个 confidence 分数,官方称它经过校准。但 devx 文章转述的另一项独立评估发现,86% 的答案 confidence 都是 1.00:在客服工单上校准良好,在逻辑题上几乎失效,而使用方从分数本身看不出自己属于哪种情况。同一项评估中,在工单里加一句冒充权威的话,200 条里有 147 条的判断被改变。devx 没有注明这项评估的原始出处,这两个数字目前只能作为转述看待。TypeSafe 的已知问题文档也承认,Jev 容易受对抗文本干扰,不擅长计数、算术和日期比较。这些问题意味着它目前不适合直接决定简历筛选或内容审核,也不宜只看 confidence 就自动执行。

适合谁用

当任务可以拆成一组边界清楚的选择题,并且延迟是硬约束时,Jev 的优势最明显,例如实时交互、每秒多次调用的流程判断,或者在大批量数据里先筛一遍再交给贵模型处理。如果任务对延迟不敏感,关闭推理的廉价 Flash 模型在上述工单测试中准确率略高、成本相近,而且还能处理开放式输出。目前公开测试都基于英文语料,中文效果还没有第三方数据。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码