jev-cases
新模型案例 · 第 1 册 · JEV

Jev
落地图鉴

60 个真实案例,按「让它判断什么」分成 7 类。往下滑,一类一类看:它判断什么、最亮眼的数字、在哪翻的车。别人照着做的开源复刻和竞品另列在后面(20 个)。

01 / 078 例

浏览器与 Computer Use

每一步选哪个操作、点哪个页面元素

让 Jev 判断这个
7 秒
查完一次航班
Browser Use · 转述未核
翻车!

长任务 20 道只做对 1 道

看这一类全部 8 个案例 ↓
02 / 078 例

Agent 路由与调度

这件事交给谁做、用哪个模型、要不要升级

让 Jev 判断这个
−71%
派单成本,25 个任务与 Fable 判断全同
firstmate · 作者自报
翻车!

theo 实测编码路由:耗时约 5 倍

看这一类全部 8 个案例 ↓
03 / 0712 例

分类·打分·Judge

这条内容属于哪类、值几分、过不过

让 Jev 判断这个
600×
比 Fable 级模型便宜,给文章打分
Every · 第三方实测
翻车!

嵌入+逻辑回归 94.25% 反超 Jev 87.0%

看这一类全部 12 个案例 ↓
04 / 077 例

安全·合规·监控

这条命令或内容危险吗、要不要拦

让 Jev 判断这个
566×
比 Sonnet 便宜,监控思维链
LessWrong · 第三方实测
翻车!

命令换成 hex 编码就能绕过拦截

看这一类全部 7 个案例 ↓
05 / 079 例

游戏与实时控制

每秒几次:下一步动作做什么

让 Jev 判断这个
$1
贪吃蛇走一万步
@chenchengpro · 第三方实测
翻车!

链上自动交易 14 小时亏 300%+

看这一类全部 9 个案例 ↓
06 / 078 例

上下文·记忆·检索

哪段代码、哪个技能、哪条记忆该进上下文

让 Jev 判断这个
−29%
Jevgrep 跑 10 个任务的成本:$7.62→$5.44
dzhng · 作者自报
翻车!

检索重排没打赢 bge-m3

看这一类全部 8 个案例 ↓
07 / 078 例

框架与平台接入

在常用框架和网关里直接调用 Jev

让 Jev 判断这个
6 家
框架和网关两周内接入
官方 release notes / 官方账号
翻车!

只证明能接,不证明好用

看这一类全部 8 个案例 ↓

全部 60 个案例

正面反面中性 / 有保留标签是证据强度,说明见页脚

浏览器与 Computer Use8 例

点按钮本质是离散多选题,Jev 每步只选操作和元素,单步快、成本低,短任务 demo 普遍在 7 秒级。但转述的长任务实测 Jev 1/20 vs GPT Luna 17/20:零推理、遇弹窗或验证码不会回退。适合短链路和高并发测试,不适合长链路自主操作。

  • 09-24

    每步只做两个决策:选操作、选页面元素

    同任务耗时中位数 9.45s→7.09s,通信次数 1092→101(作者自测三轮)
    作者自报
  • 09-18
    Jev × Browser Use 7 秒查航班 ↗#Browser Use(@0xTykoo 转述)

    网页 agent 查苏黎世—伦敦航班

    约 7.1 秒、成本 4 厘美金;计时从初始页面观察完成后开始
    转述未核
  • 09-20
    jev-ultrafast 长链路 20 题实测 ↗#Browser Use 创始人(@SUOHA_AI 转述)

    20 道真实长任务网页操作

    Jev 1/20 vs GPT Luna 17/20;零推理,遇弹窗/验证码不会回退
    转述未核
  • 09-26

    Jev 做决策,Lightpanda 浏览器执行点击

    单机 129 个 agent(Chrome 约 12),内存省 11 倍,6.7s vs 14.1s
    作者自报
  • 09-26

    用模糊指令(新建看板)驱动浏览器测试

    比 Playwright MCP 插件便宜 98%、快一倍
    第三方实测
  • 09-20
    百路无头浏览器对抗测试 ↗#Rafal Wilinski(前 Zapier AI Agent 负责人)

    在页面状态+预设动作中 100ms 选一个,并发轰炸前端

    上百路无头浏览器一轮几美分;输出免费使并发边际成本近零
    转述未核
  • 09-18
    jev-use(Jev + Cua Driver)#Cua(@trycua)

    用 Jev + Cua Driver 做快速 computer use

    三平台 dev preview(trycua/cua Draft #3943),无效果数据
    作者自报
  • 09-29
    jevwright ↗#Ice-Hazymoon

    AI 找一次页面控件并记录,之后照记录回放测试

    7★ 早期项目,作者称成本极低、速度快,无实测数据
    作者自报

Agent 路由与调度8 例

路由是在固定候选里挑一个,正好是 Jev 的题型:firstmate 派单 25 个任务与 Fable 判断全同,派单成本降 71%。但把 Jev 当整条编码链路的路由器时,theo 实测耗时约 5 倍、成本略高,Magpie 作者也自述内部测试效果差。路由分错不报错只变差,上线前要先配评测集。

  • 09-17

    派单:读规则、查额度、选 harness×模型×推理力度

    25 任务与 Fable 决策全同,单次~200ms;派单成本 -71%、耗时 -90%
    作者自报
  • 09-28

    每轮请求前判难度,决定沿用、加推理强度或换模型

    官方自测 423 个 agent 任务 237 vs Auto Router 130(约 +82%)
    转述未核
  • 09-26
    theo 自费实测 Jev Router ↗#theo(t3.gg 创始人)

    自费 $1,000 用 Jev Router 跑编码任务

    DeepSWE 上与 GPT-6 Astra low 档基本持平、成本略高、耗时约 5 倍
    第三方实测
  • 09-17
    Vercel fx auto 模式#Vercel(rauchg)

    fx 默认 auto 模式用 Jev,每条命令另有安全评审模型把关

    Jev p95 快 18x 且更准(厂商口径)
    作者自报
  • 09-21

    事件插队或入队、关联工作项、唤醒睡眠 agent、丢弃过期结果

    好于预期并重启方案;自训分类器因过度保守失败;无量化数据
    作者自报
  • 09-24
    主模型前置分诊台 ↗#一线用户(@realchendahuang 汇总 60 多条反馈)

    主模型前面先分诊,大模型只做兜底

    有团队把 LLM 参与压到约 10%;有人全流程实测 $0.0036
    转述未核
  • 09-16
    MLforge 置信度门#CoreWeave Hacks 参赛仓 MLforge

    typed Choice + 校准概率决定是否要第二意见

    置信度 <0.40 触发 second_opinion;无效果数据
    作者自报
  • 09-27

    按语义给请求选模型

    作者自述内部测试效果差,因大量用户要求仍上线
    作者自报

分类·打分·Judge12 例

类目固定、量大的分类和打分是 Jev 最稳的场景:多份第三方实测都是快几倍到几十倍、便宜几十到几百倍。准确率则只是持平或略高:verysmallwoods 实测 Banking77 为 81.6% vs Haiku 80.1%,而嵌入+逻辑回归能到 94.25%。类目固定时经典小模型可能更准更便宜,用前应先对可信标注验证。

  • 09-16

    当 judge 给自己写过的全部内容打分

    实测约一周,对比 Fable 级模型快 25x、便宜 600x
    第三方实测
  • 09-22

    两个 Kaggle 分类数据集,对照 Claude Haiku 4.5

    准确率 96.5% vs 93.5%、81.6% vs 80.1%;千次$0.08 vs $2.47
    第三方实测
  • 09-19

    回放 500 个真实 agent 决策,对比 LLM judge

    单次约 0.44 秒/$0.00035,质量波动比 LLM judge 低 92~913 倍
    转述未核
  • 09-18

    AI 相关性预筛分类,对照 GLM 5.3 Flash 等

    GLM 5.3 Flash 全对但最慢最贵;Jev 准确性第二、便宜很多
    第三方实测
  • 09-17

    DeepSeek V4 Flash 先摘要,再由 Jev 分到 24 个主题

    总价 $0.08,单篇端到端中位 256ms
    转述未核
  • 09-18

    给邮件分类,拿不准的升级给 Kimi K3

    1.42 秒分完 100 封,96/100 正确,约 $0.07
    作者自报
  • 09-24
    AI 问卷后台换掉 Flash-Lite ↗#匿名团队(@realchendahuang 汇总)

    替换线上判断接口原用的 Gemini 3.5 Flash-Lite

    速度 x2、成本 -85%
    转述未核
  • 09-18
    Notra 生产分类器切换#Notra(170⭐)

    生产环境用开关把分类器从 LLM 切到 Jev

    目标 300ms p50
    转述未核
  • 09-27

    锁死 Jev,只改输入侧 harness,给多音字「还」注音

    错误减半、成本 1/7
    转述未核
  • 09-27
    嵌入+逻辑回归压过 Jev ↗#gist 作者 nicobrenner

    Banking77 意图分类:嵌入+逻辑回归对比 Jev 零样本

    bge-large+LR 94.25% vs Jev 零样本 87.0%;分类器 642KB
    作者自报
  • 09-30

    同题粗测 Jev 与 OpenAI Decisions,简单分类两者打平

    多选项、细微差别 Jev 占优,160ms vs 300ms;图像/OCR 输给 Decisions
    第三方实测
  • 09-30

    同为 prompt 工程、不训练,对比 Jev 与 Claude 做商品推荐分类

    速度、成本差距显著(未给数字);还快到能每次按键调一次 API 实时玩游戏
    第三方实测

安全·合规·监控7 例

监控和初筛要求量大、便宜,Jev 在成本上优势明显(CoT 监控便宜 566x、漏扫约 $0.02/次)。但两份第三方实测指向同一边界:Southbridge 发现编码绕过即可漏拦,LessWrong 实测对有害样本漏报风险更高;另有红队自报间接注入成功率 43.5%。适合防手滑,不适合单独防蓄意攻击。

  • 09-24
    Jev 当 CoT 监控器 ↗#llmpsychosis(LessWrong)

    筛查 2,200 条 ReasoningShield 标注思维链

    精确匹配 71.5%≈Sonnet 5,542ms,便宜 566x;Harmful 级 F1 落后
    第三方实测
  • 09-21

    在 22 万次真实工具调用上判进度、判危险命令

    测进度/估耗时最准;拦危险命令会漏,hex/Python 可绕过、约 1% 重试翻供
    第三方实测
  • 09-27
    DTap 红队 Jev 1.13 ↗#自称 DecodingTrust 团队(@zrrrr_cn)

    红队测试 Jev 1.13 驱动的 agent 工具调用

    直接滥用 ASR 70.1%、间接提示注入 43.5%;自门控可显著降 ASR
    作者自报
  • 09-26

    漏洞扫描初筛,难例升级给前沿模型

    约 $0.02/次、约 2 秒,称接近 GPT-5.6 Luna 找洞数(自有基准)
    作者自报
  • 09-21

    用 Jev 破验证码,对标真人打码市场

    市场约 1 美分/个 vs Jev 0.68 美分/100 个,自算毛利 99.32%
    作者自报
  • 09-19

    装前零执行检查 Agent Skill/MCP 有无可疑行为

    本地静态检查 + Jev 判定,不启动服务;1★ 新仓,无效果数据
    作者自报
  • 09-18
    pg-redact#pg-redact 作者(Show HN)

    在 Postgres 里做内容感知的 PII 脱敏

    Show HN 2-3 分低热度,无效果数据
    作者自报

游戏与实时控制9 例

单次几百毫秒、输出免费,让「每一步都问一次模型」变得可负担:贪吃蛇 $1 走一万步,Doom 约 $7/小时。能落地的形态是分层:高频控制留给代码、低频判断给模型、安全层握否决权(jev-drone)。直接拿去做需要预测的交易,转述案例 14 小时亏 300%+。

  • 09-16

    让 Jev 实时玩 Doom

    The Register 报道 plays Doom demo;端到端 70-500ms(厂商口径)
    官方
  • 09-17

    实时打 Doom、Minecraft 自动生存

    Doom 每秒约 10 次决策、约 $7/小时;Minecraft 2 分钟约 1 分钱
    转述未核
  • 09-20
    Pipecat 语音管线 operator ↗#@jonptaylor(@kwindla 转述)

    在 Pipecat 语音管线里当 operator 角色

    指令准确率 92.6%、中位 296ms vs GPT-5.6 Luna 81.3%、1008ms
    转述未核
  • 09-27

    仿真无人机每秒约 3 次战术判断,安全层握否决权

    0 碰撞,目标可见率 19%→82%,安全反射介入 65-71%→9%
    作者自报
  • 09-21

    LLM 先写任务专属决策流程,冻结后只跑代码+Jev 判断

    宝可梦 5 轮迭代胜率 25%→75%(@NFT_Chen 推文口径)
    转述未核
  • 09-17

    贪吃蛇每走一步问一次 Jev

    200 请求 $0.02,$1 可走一万步
    第三方实测
  • 09-25
    jev-pokemon ↗#christianmat

    用 Jev 的决策速度玩宝可梦红

    开源,全程直播 token 与成本;无胜率数据
    作者自报
  • 09-18
    链上自动交易 ↗#Monad 团队 @jarrodwatts(@SUOHA_AI 转述)

    纯 AI 原生链上自动交易系统

    demo 跑 14 小时亏 300%+
    转述未核
  • 09-30
    电话对话 turn 级预测#muratcan(产品方)

    2,029 通真实电话,不接音频、只输入对话结构,逐轮预测

    38,012 次 turn 级预测,中位延迟 118ms;产品方营销数据,无准确率
    作者自报

上下文·记忆·检索8 例

Jev 在这里做「留谁、选谁」:Jevgrep 逐层缩小代码范围,10 个任务成本 $7.62→$5.44。但纯检索和压缩并不稳:GoSail 实测重排没打赢 bge-m3,Teknium 发现 Jev 即时压缩等价于一条删工具调用的规则,而且每次压缩都会打断缓存。

  • 09-28

    逐层缩小代码搜索范围,给 coding agent 带行号片段

    10 个任务成本 $7.62→$5.44;v0.4 称与 subagent 持平、省 30%
    作者自报
  • 09-21

    在 Hermes 公开压缩评测上跑 Jev 即时压缩

    结果等价于直接删工具调用的程序化规则;每次压缩打断缓存
    第三方实测
  • 09-18

    给 33,047 条技能目录做检索重排

    164 条查询、9,831 对标注、总成本 $2.6;Jev 单独重排没打赢 bge-m3
    第三方实测
  • 09-26
    Jev-Mem 记忆控制器 ↗#报告作者未核(@omarsar0 转述)

    轻量控制器全权做记忆存取,LLM 只在最后作答

    构建快 6.6x、查询延迟降 36.7%,LoCoMo 0.777、较最强基线 +11%
    转述未核
  • 09-21
    Jev Skill Suggestion ↗#claude-code-templates Mod(@realfxw 推荐)

    按用户指令挑出高置信度命中的技能再注入

    技能常态零占用上下文;无独立效果数据
    转述未核
  • 09-18
    Instant compaction 插件#@tamarajtran

    给工具调用打分、丢弃无关项做即时压缩

    插件已开源;@NFT_Chen 演示 156k→62k(该号有炒作前科)
    转述未核
  • 09-29

    在 2B 决策模型上用 RL 学把正确记忆排在前面

    59 个 RL 实验多数失败;有效做法使长记忆基准 +60%
    作者自报
  • 09-18
    Custom Relevance 排序#jev.foglight.co

    描述需求,让 Jev 给内容做相关性排序

    Show HN 2-3 分低热度,无效果数据
    作者自报

框架与平台接入8 例

发布两周内,Jev 从 waitlist 变成主流基础设施的标准件:OpenRouter、Vercel 与 Pydantic 两个网关可直调,pydantic-ai、DSPy 原生支持,LangChain 官方把它写进 harness 指南。这一类证据多来自官方 release notes 和官方账号,可信度较高,但只证明「能接」,不证明「好用」。

  • 09-18

    官宣 Jev 上架 OpenRouter beta

    waitlist 期结束,可直接调用
    官方
  • 09-18
    pydantic-ai TypeSafeModel#Pydantic

    pydantic-ai v2.45.0 新增 TypeSafeModel

    release notes 核实;19,869★ 框架原生接入
    官方
  • 09-25
    DSPy 3.4.0 决策类型#DSPy

    新增 Noul/Choice/Score 三种实验性决策类型

    ReAnchor 优化器按任务指标校准决策置信度(release notes 核实)
    官方
  • 09-18

    把 Jev 当 agent 决策层写进 harness 指南

    官方账号官宣「LangChain 🤝 Jev!」;登上 Interrupt 主题演讲
    官方
  • 09-18
    Vercel AI Gateway#Vercel

    Jev 进 Vercel AI Gateway,免排队直调

    Arcturus 转述:Vercel 称其为 AI Gateway 史上采用最快模型
    转述未核
  • 09-26

    Pydantic AI Gateway 上架 Jev

    一个 key 统一管用量与护栏;价格、限流未披露
    官方
  • 09-17
    DuckDB 扩展 ↗#hamiltonulmer

    做成 DuckDB 扩展,SQL 里逐行给 CSV/parquet 分类

    1k 行约 10 秒,作者称优于通用 LLM 分类
    作者自报
  • 09-18
    Bannerbear 字段映射#Bannerbear(@yongfook)

    模板与数据源字段名不一致时一键映射

    首个公开上线用例;无效果数据
    作者自报

跟进与复刻 20 个

下面不是 Jev 本身的落地,而是 Jev 发布后别人跟着做的同类东西:开源复刻、竞品接口和本地运行环境。它们的数字大多是作者或厂商自报,单独列出,不和落地效果混在一起。

开源复刻与自部署14 例

Jev 的核心手法(只读候选答案的概率、不逐字生成)用几十行代码就能在本地模型上复现,自训复刻成本在 $17 到 $42 之间,最小的做到 0.5B、CPU 可跑。自报成绩多数接近但略低于 Jev(Nimble 90.1% vs 93.2%),也有自称反超的(Eikos 困难档 82.9% vs 73.0%)。几乎所有数字都是作者自报,尚无中立横评。

$17 25 分钟自训一个同类模型Together AI · 作者自报翻车自报成绩多略低于 Jev,还没有中立横评

  • 09-23

    25 行 Python 读本地小模型的选项 logits 复现 Jev

    Qwen3-0.6B GGUF 钓鱼分类给出 Phishing 0.885;HN 329 分
    作者自报
  • 09-28

    用普通模型 logprobs 做限选项分类,含摄像头画面

    本地 Gemma 4 12B 三问判断约 1 FPS,gpt-6-luna 约 0.2 FPS
    作者自报
  • 09-19

    Qwen3.5-9B LoRA 复刻,数据、权重、配方全公开

    324 条自建评测 Nimble 90.1% vs Jev 93.2%(原始 9B 66.4%)
    作者自报
  • 09-20

    vLLM 补丁把 DiffusionGemma 当本地 Jev 跑

    与云端 Jev 智能大致打平,暖机后本地 DGX Spark 多数任务更快
    作者自报
  • 09-25
    CLM-8B ↗#斯坦福+NVIDIA(@jackyk02 牵头)

    对比学习把「状态→动作」决策做成向量检索

    自称比 Jev 推理快最多 9 倍、效果相当;微调后 DeepSWE 81.6%
    作者自报
  • 09-24
    Together tev1-4B ↗#Together AI(nutlope)

    Qwen3.5 4B 自训 Jev 式决策模型并上架

    训练 $17、约 25 分钟、37,840 条示例;输入 $0.042/M、输出免费
    作者自报
  • 09-21

    Qwen3.5-4B + rank-8 LoRA + RLCD 复刻

    3.2 万题、9 GPU 小时约 $42;自称 JevBench 120 题逐题打平
    作者自报
  • 09-26
    Kev 4B ↗#Jared Palmer

    开源 Kev 4B,走与 Jev 相同的 /v1/systemone 契约

    OpenRouter 在架,$0.042/M 输入、$0 输出,约 $0.019/千次决策
    官方
  • 09-19

    团队不是人人有 Jev 权限,用本地推理拼「穷人版 Jev」

    对比评测 diffusiongemma/Qwen MoE/Gemma 4;174★,结论数字未读
    作者自报
  • 09-29
    Jevstiller ↗#Jevstiller 作者(Show HN)

    用 Jev 答案蒸馏本地小模型抢答,拿不准回落 Jev

    本地 CPU 约 15ms、Jev API 约 300ms;用公式约束与 Jev 一致率下限
    作者自报
  • 09-19
    Kev-0.5B ↗#jaredpalmer

    Qwen2.5-0.5B 底座,兼容 TypeSafe API 的决策模型

    称 MacBook Pro 上可训练和运行;Apache-2.0,无基准数据
    作者自报
  • 09-21
    Open-Jev ↗#Zefan Cai(学术团队)

    开源 2B/9B LoRA adapter、decision head 和数据集

    MIT;与 Jev 的准确率对比未公布
    作者自报
  • 09-24
    Eikos ↗#@0xCVYH

    MIT 开源决策模型,4B/27B 两档,上下文 64k

    自报 JevBench 困难档 82.9% 超 Jev 73.0%;权重地址未核
    作者自报
  • 09-28
    Julia-1 ↗#Supersonic Labs

    mmBERT-small 底座的小决策模型,做分类、路由、打分

    称 1.44 亿参数、550MB、CPU 可跑;成绩未独立复现
    作者自报

竞品与运行环境6 例

Jev 发布两周内,OpenAI 和 LiquidAI 推出了同类决策接口,LangChain、Ollaya、Unsloth、Ollama 把开源决策模型接进托管和本地运行环境,这四家都兼容 TypeSafe 的接口,换过去只改配置。性能说法几乎都是厂商自报;目前唯一的对照是 gunta85 粗测:文本 Jev 占优,图像 OpenAI Decisions 占优。

约 10ms 本地 4090 跑 5 问的中位延迟Ollaya · 作者自报翻车「超过 Jev」的说法都是厂商自报,分数和口径未公布

  • 09-30
    OpenAI Decisions API ↗#OpenAI(@thsottiaux)

    DevDay 发布,Luna 驱动的单次决策接口,支持视觉输入

    官方称端到端数百毫秒内;Latent Space 称是 Luna 轻封装、无校准层
    官方
  • 09-30

    首个自家决策模型,API 已上线,OpenRouter 即将上架

    自称首个在 HF Decision Index 上超过 Jev;分数、价格未公布
    作者自报
  • 09-22
    LangSmith Gateway 托管 SemIf ↗#LangChain(@hwchase17)

    免费托管开源决策模型 SemIf(基于 Qwen3.5)一周

    兼容 TypeSafe SDK,改一个字符串即可从 Jev 切换;与 Jev 的差距未测
    官方
  • 09-26

    开源本地运行器跑决策模型,兼容 /v1/systemone 接口

    称 RTX 4090 上 5 问中位约 10ms,托管 Jev API 236-276ms(含网络)
    作者自报
  • 09-29

    本地跑 Laya Decision 系列,提供 Jev 兼容接口

    最低 4GB 内存,CPU/Mac/Win/Linux 通用;基准与 license 未核
    官方
  • 09-30

    ollama pull nimble 即用,新增本地 systemone 接口

    接口与 TypeSafe 托管版同形;nimble 来源、本地延迟均未核
    官方
附录

Jev 是什么

Jev 是 TypeSafe 在 9 月 14 日发布的模型。它不写文字,只做选择题:给它一段内容和几个选项,它直接返回每个选项的概率。所以它快、便宜,适合 agent 里「选哪个」「过不过」「危不危险」这类小判断。

发布
2026-09-14 官方博客发布(waitlist 制);09-18 上架 OpenRouter beta;09-22 前后取消候补名单全面开放
价格与速度
厂商口径:输入 $0.042/M token、输出免费;端到端 70-500ms,自称快 40-200x(另有「快 194 倍/便宜 445 倍」口径);注册送 $5 额度
注意
除框架接入类有官方 release notes 核实外,大部分效果与成本数字为作者自报或转述,尚无独立复现。
判断题,别让 AI 写作文。
Vonng《无嘴模型:AI 的 OLTP 时刻》

↑ 回到案例清单

示意 · 一次调用长这样
你问这封邮件该转给哪个团队?
选项:账单 / 技术支持 / 销售 / 垃圾邮件
Jev 答
账单0.81
技术支持0.12
销售0.05
垃圾邮件0.02
不写一个字,只给每个选项的概率输出 0 token

这些案例背后的判断,我写在公众号里

哪类场景该交给 Jev、哪类别碰、怎么先配评测集再上线。AI 编程工程化的实操,微信扫码或搜索「小郎碎碎念」关注。

公众号「小郎碎碎念」二维码
小郎碎碎念微信扫码关注

关注公众号

这些案例背后的判断,我写在公众号里。

公众号「小郎碎碎念」二维码
小郎碎碎念微信扫码,或搜索公众号名称