每一步选哪个操作、点哪个页面元素
让 Jev 判断这个长任务 20 道只做对 1 道
60 个真实案例,按「让它判断什么」分成 7 类。往下滑,一类一类看:它判断什么、最亮眼的数字、在哪翻的车。别人照着做的开源复刻和竞品另列在后面(20 个)。
这件事交给谁做、用哪个模型、要不要升级
让 Jev 判断这个theo 实测编码路由:耗时约 5 倍
这条内容属于哪类、值几分、过不过
让 Jev 判断这个嵌入+逻辑回归 94.25% 反超 Jev 87.0%
这条命令或内容危险吗、要不要拦
让 Jev 判断这个命令换成 hex 编码就能绕过拦截
哪段代码、哪个技能、哪条记忆该进上下文
让 Jev 判断这个检索重排没打赢 bge-m3
点按钮本质是离散多选题,Jev 每步只选操作和元素,单步快、成本低,短任务 demo 普遍在 7 秒级。但转述的长任务实测 Jev 1/20 vs GPT Luna 17/20:零推理、遇弹窗或验证码不会回退。适合短链路和高并发测试,不适合长链路自主操作。
每步只做两个决策:选操作、选页面元素
网页 agent 查苏黎世—伦敦航班
20 道真实长任务网页操作
Jev 做决策,Lightpanda 浏览器执行点击
用模糊指令(新建看板)驱动浏览器测试
在页面状态+预设动作中 100ms 选一个,并发轰炸前端
用 Jev + Cua Driver 做快速 computer use
AI 找一次页面控件并记录,之后照记录回放测试
这一类没有符合筛选条件的案例。
路由是在固定候选里挑一个,正好是 Jev 的题型:firstmate 派单 25 个任务与 Fable 判断全同,派单成本降 71%。但把 Jev 当整条编码链路的路由器时,theo 实测耗时约 5 倍、成本略高,Magpie 作者也自述内部测试效果差。路由分错不报错只变差,上线前要先配评测集。
派单:读规则、查额度、选 harness×模型×推理力度
每轮请求前判难度,决定沿用、加推理强度或换模型
自费 $1,000 用 Jev Router 跑编码任务
fx 默认 auto 模式用 Jev,每条命令另有安全评审模型把关
事件插队或入队、关联工作项、唤醒睡眠 agent、丢弃过期结果
主模型前面先分诊,大模型只做兜底
typed Choice + 校准概率决定是否要第二意见
按语义给请求选模型
这一类没有符合筛选条件的案例。
类目固定、量大的分类和打分是 Jev 最稳的场景:多份第三方实测都是快几倍到几十倍、便宜几十到几百倍。准确率则只是持平或略高:verysmallwoods 实测 Banking77 为 81.6% vs Haiku 80.1%,而嵌入+逻辑回归能到 94.25%。类目固定时经典小模型可能更准更便宜,用前应先对可信标注验证。
当 judge 给自己写过的全部内容打分
两个 Kaggle 分类数据集,对照 Claude Haiku 4.5
回放 500 个真实 agent 决策,对比 LLM judge
AI 相关性预筛分类,对照 GLM 5.3 Flash 等
DeepSeek V4 Flash 先摘要,再由 Jev 分到 24 个主题
替换线上判断接口原用的 Gemini 3.5 Flash-Lite
生产环境用开关把分类器从 LLM 切到 Jev
锁死 Jev,只改输入侧 harness,给多音字「还」注音
Banking77 意图分类:嵌入+逻辑回归对比 Jev 零样本
同题粗测 Jev 与 OpenAI Decisions,简单分类两者打平
同为 prompt 工程、不训练,对比 Jev 与 Claude 做商品推荐分类
这一类没有符合筛选条件的案例。
监控和初筛要求量大、便宜,Jev 在成本上优势明显(CoT 监控便宜 566x、漏扫约 $0.02/次)。但两份第三方实测指向同一边界:Southbridge 发现编码绕过即可漏拦,LessWrong 实测对有害样本漏报风险更高;另有红队自报间接注入成功率 43.5%。适合防手滑,不适合单独防蓄意攻击。
筛查 2,200 条 ReasoningShield 标注思维链
在 22 万次真实工具调用上判进度、判危险命令
红队测试 Jev 1.13 驱动的 agent 工具调用
漏洞扫描初筛,难例升级给前沿模型
装前零执行检查 Agent Skill/MCP 有无可疑行为
在 Postgres 里做内容感知的 PII 脱敏
这一类没有符合筛选条件的案例。
单次几百毫秒、输出免费,让「每一步都问一次模型」变得可负担:贪吃蛇 $1 走一万步,Doom 约 $7/小时。能落地的形态是分层:高频控制留给代码、低频判断给模型、安全层握否决权(jev-drone)。直接拿去做需要预测的交易,转述案例 14 小时亏 300%+。
让 Jev 实时玩 Doom
实时打 Doom、Minecraft 自动生存
在 Pipecat 语音管线里当 operator 角色
仿真无人机每秒约 3 次战术判断,安全层握否决权
LLM 先写任务专属决策流程,冻结后只跑代码+Jev 判断
用 Jev 的决策速度玩宝可梦红
2,029 通真实电话,不接音频、只输入对话结构,逐轮预测
这一类没有符合筛选条件的案例。
Jev 在这里做「留谁、选谁」:Jevgrep 逐层缩小代码范围,10 个任务成本 $7.62→$5.44。但纯检索和压缩并不稳:GoSail 实测重排没打赢 bge-m3,Teknium 发现 Jev 即时压缩等价于一条删工具调用的规则,而且每次压缩都会打断缓存。
在 Hermes 公开压缩评测上跑 Jev 即时压缩
给 33,047 条技能目录做检索重排
轻量控制器全权做记忆存取,LLM 只在最后作答
按用户指令挑出高置信度命中的技能再注入
给工具调用打分、丢弃无关项做即时压缩
在 2B 决策模型上用 RL 学把正确记忆排在前面
描述需求,让 Jev 给内容做相关性排序
这一类没有符合筛选条件的案例。
发布两周内,Jev 从 waitlist 变成主流基础设施的标准件:OpenRouter、Vercel 与 Pydantic 两个网关可直调,pydantic-ai、DSPy 原生支持,LangChain 官方把它写进 harness 指南。这一类证据多来自官方 release notes 和官方账号,可信度较高,但只证明「能接」,不证明「好用」。
官宣 Jev 上架 OpenRouter beta
pydantic-ai v2.45.0 新增 TypeSafeModel
新增 Noul/Choice/Score 三种实验性决策类型
把 Jev 当 agent 决策层写进 harness 指南
Jev 进 Vercel AI Gateway,免排队直调
Pydantic AI Gateway 上架 Jev
做成 DuckDB 扩展,SQL 里逐行给 CSV/parquet 分类
模板与数据源字段名不一致时一键映射
这一类没有符合筛选条件的案例。
下面不是 Jev 本身的落地,而是 Jev 发布后别人跟着做的同类东西:开源复刻、竞品接口和本地运行环境。它们的数字大多是作者或厂商自报,单独列出,不和落地效果混在一起。
Jev 的核心手法(只读候选答案的概率、不逐字生成)用几十行代码就能在本地模型上复现,自训复刻成本在 $17 到 $42 之间,最小的做到 0.5B、CPU 可跑。自报成绩多数接近但略低于 Jev(Nimble 90.1% vs 93.2%),也有自称反超的(Eikos 困难档 82.9% vs 73.0%)。几乎所有数字都是作者自报,尚无中立横评。
$17 25 分钟自训一个同类模型Together AI · 作者自报翻车自报成绩多略低于 Jev,还没有中立横评
25 行 Python 读本地小模型的选项 logits 复现 Jev
用普通模型 logprobs 做限选项分类,含摄像头画面
Qwen3.5-9B LoRA 复刻,数据、权重、配方全公开
vLLM 补丁把 DiffusionGemma 当本地 Jev 跑
Qwen3.5 4B 自训 Jev 式决策模型并上架
Qwen3.5-4B + rank-8 LoRA + RLCD 复刻
团队不是人人有 Jev 权限,用本地推理拼「穷人版 Jev」
用 Jev 答案蒸馏本地小模型抢答,拿不准回落 Jev
Qwen2.5-0.5B 底座,兼容 TypeSafe API 的决策模型
开源 2B/9B LoRA adapter、decision head 和数据集
这一类没有符合筛选条件的案例。
Jev 发布两周内,OpenAI 和 LiquidAI 推出了同类决策接口,LangChain、Ollaya、Unsloth、Ollama 把开源决策模型接进托管和本地运行环境,这四家都兼容 TypeSafe 的接口,换过去只改配置。性能说法几乎都是厂商自报;目前唯一的对照是 gunta85 粗测:文本 Jev 占优,图像 OpenAI Decisions 占优。
约 10ms 本地 4090 跑 5 问的中位延迟Ollaya · 作者自报翻车「超过 Jev」的说法都是厂商自报,分数和口径未公布
DevDay 发布,Luna 驱动的单次决策接口,支持视觉输入
首个自家决策模型,API 已上线,OpenRouter 即将上架
免费托管开源决策模型 SemIf(基于 Qwen3.5)一周
开源本地运行器跑决策模型,兼容 /v1/systemone 接口
本地跑 Laya Decision 系列,提供 Jev 兼容接口
ollama pull nimble 即用,新增本地 systemone 接口
这一类没有符合筛选条件的案例。
Jev 是 TypeSafe 在 9 月 14 日发布的模型。它不写文字,只做选择题:给它一段内容和几个选项,它直接返回每个选项的概率。所以它快、便宜,适合 agent 里「选哪个」「过不过」「危不危险」这类小判断。
判断题,别让 AI 写作文。
Vonng《无嘴模型:AI 的 OLTP 时刻》
哪类场景该交给 Jev、哪类别碰、怎么先配评测集再上线。AI 编程工程化的实操,微信扫码或搜索「小郎碎碎念」关注。