awesome-jev-zh

agent
Security Audit
Pass
Health Pass
  • License — License: CC0-1.0
  • Description — Repository has a description
  • Active repo — Last push 0 days ago
  • Community trust — 16 GitHub stars
Code Pass
  • Code scan — Scanned 4 files during light audit, no dangerous patterns found
Permissions Pass
  • Permissions — No dangerous permissions requested

No AI report is available for this listing yet.

SUMMARY

Jev / TypeSafe System One 中文精选列表:官方资料、SDK、爆款应用、Agent 工具、开源复现与独立评测,附中文上手指南,每日自动收录 GitHub 热门项目。

README.md

Awesome Jev ZH

Awesome
PRs Welcome
License
自动收录

Jev 不生成文本。 第一次看到这句话时我以为是个缺陷,后来才发现这正是它的设计核心。

它的用法是:给它一段 state(一封邮件、一行日志、一个工单),再给它几个带类型的问题,它在 70–500ms 内一次性答完——从你给的选项里选一个、在你给的量表上打一个分、或者给出一个 0 到 1 的概率,每个答案都附带一个置信度。输入 $0.042 / MTok,输出不计费。

它的边界也很清楚:要写文案、要总结文章、要解释判断理由,LLM 仍然是更合适的工具。这一条后面还会出现好几次。

那它解决了什么?整理这份列表的过程中,我越来越确信一件事:我们今天写的很多 LLM 调用,本质上只是在做选择题。 拼 prompt、逐 token 生成、剥掉 markdown 代码块、json.loads、校验 schema、失败了再重试——绕这么大一圈,只为了拿回 "billing" 这一个词。这段代码我自己写过不止一次。Jev 想省掉的就是这一圈。

另外有两个数字想先摆出来,免得看完才发现:「快 193 倍」来自 TypeSafe 自己的评测,官方也标注了那是收益上限;而独立评测里,在钓鱼邮件这个具体任务上,直接问它一句只有 62.6% 的准确率,两行正则规则能到 91.8%。完整数据在 冷静看待 一节。

这是 Jev 生态的中文精选列表,外加两份中文指南和一份 图解说明

非官方整理,与 TypeSafe AI 无隶属关系 · Jev 于 2026-09-15 开放 early access · 所有厂商自评数据都标注了出处


目录

入门官方资源 · Jev 是什么 · 上手 · 规格与定价 · 该用与不该用 · 中文指南

项目热门自动榜 · SDK · 应用 · Demo · Agent 工具 · 复现与评测

资料Cookbook 与模式 · 文章 · 社区 · 冷静看待


📘 官方资源

官方文档写得相当清楚。真要弄懂这个模型,这里是最短的路径;二手解读(包括这份列表)只能算补充。

资源 说明
TypeSafe 官网 官网、waitlist、产品介绍
文档首页 入门、原语、模式、API、SDK
Quick start 最短上手路径,下面 上手 一节是它的中文版
Playground 浏览器里粘 state、加问题、看类型化结果
API Keys 控制台 TYPESAFE_API_KEY
HTTP API 参考 POST https://api.typesafe.ai/v1/systemone
Models 模型 ID、价格、上下文与速率限制
Confidence 置信度的语义与用法,必读
State 概念 怎么组织喂进去的状态
System One 概念 这类模型到底是什么
How to build with TypeSafe 官方的架构心法
用例地图 官方列的适用场景全景
AI 入门读本 给非 ML 背景工程师的铺垫
Jev 1.13 能力毛边 官方公布的已知失败模式,上生产前必读
Workflow evals 官方公开的评测方法与结果,属厂商自评
Agent skill 文档 给 Claude Code / Codex 等编程 Agent 的技能包
GitHub 组织 typesafe-ai 官方开源仓库
法务条款 数据使用与合规

官方博文,四篇立场文章:

博文 内容
Introducing System One Models and Jev 发布博文。架构、RLCD、定价、Doom 与 Wikiracing demo、FAQ
The Bitterest Lesson 它的核心论点:优化错了任务,规模再大也盖不过去
AI: too good to be true, too bad to be useful 为什么自动化不该用偏好对齐过的聊天模型
Manifesto 主张给软件用的机器原生智能,而不是聊天

🧠 Jev 是什么

它针对一份 state——一封邮件、一行日志、一个工单、一坨游戏坐标 JSON——评估一组带类型的问题,返回代码能直接 if、能排序、能路由的值。就这么简单。

TypeSafe 管这类模型叫 System One,取自卡尼曼的「系统一」,快速直觉的那套。训练方法叫 RLCD,优化目标是概率诚实而不是人类偏好——RLHF 那套「让人满意」的训练会毁掉校准,因为犹豫的回答不讨喜。对聊天这是优点,对自动化这是灾难:你没法拿一个假的 90% 去写门控。

这套说法目前没有公开论文。 校准好不好,在你自己的数据上量,别信任何人的 slide。

大语言模型 Jev
输出 字符串,逐 token 生成 类型化的值 + 概率 + 置信度
幻觉 可能编造,可能违反 schema 结构上不可能,合法输出已在 schema 里穷举
延迟 秒级 70–500ms,一次并行 pass 答完所有问题
输入价格 通常 $0.1–$15 / MTok $0.042 / MTok
输出价格 按 token 计费 不计费
写代码、写文章 完全不会,这是设计
擅长 生成、推理、对话 分类、路由、打分、抽取、过滤、选下一步动作

一句话:一次前沿智能的函数调用。非结构化状态进,类型化概率决策出。

三个原语

原语 问它什么 返回 典型用途
Choice 从这些选项里选一个 choice + probabilities + confidence 意图路由、工单分派、选下一个点击的元素、function calling
Score 按这个量表给它打分 score + probabilities + confidence 质量打分、情绪强度、优先级、重排序
Noul 这句话是真的吗 noul(0–1 的概率) 护栏、是非校验、语义检索、内容审核

同一次请求里的问题对同一份 state 并行求值、彼此隔离——它们互相看不见对方的答案。所以别指望它做多步推理,那不是它的活。

核心心法就一句,记不住别的也得记住这句:问题尽量原子,组合逻辑写在你自己的代码里。 后面有数据证明这句话值 32 个百分点。

术语对照(读英文文档前先统一一下词)
英文 本列表译法 说明
System One model 系统一模型 与「系统二」(会推理会生成的 LLM)相对
state 状态 你丢给模型的那坨上下文,字符串 / JSON / 文本数组均可
typed question 带类型的问题 Choice / Score / Noul 三选一
Noul 保留原词 TypeSafe 生造词,指 0–1 的是非真值概率,不译
criteria 判据 / 选项 Choice 是选项字典,Score 是量表档位
calibrated probabilities 校准概率 模型说 70%,长期就该有 70% 对
confidence 置信度 告诉你「要不要动手」,答案告诉你「是什么」
RLCD 校准决策强化学习 TypeSafe 自研训练方法
speculative fan-out 投机扇出 一次多问几题(含用不上的),在代码里筛
cardinality 候选基数 单个 Choice 最多 255 个选项
jaggedness 能力毛边 官方主动公布的失败模式清单

⚡ 上手

官方直连需要排 waitlist,不过不必干等——下面几条路现在就能动手:

路径 模型 ID 要不要 waitlist 适合谁
Vercel AI Gateway typesafe-ai/jev 不用 最省事,已官方上线,走 AI SDK 的 experimental_evaluate
官方 adapter 不用 没 key 也能先写代码:接口一致的替身,后端换成普通 LLM
TypeSafe 官方 API jev-latest / jev-1.13.0 要排队 完整 SDK、最低延迟、企业配额
Playground 看账号 不写代码,粘一段 state 点几下
OpenRouter typesafe/jev-1.13 待确认 有模型页,但其 /api/v1/models 尚未列出,调用前请自行确认
pip install typesafe-sdk        # 或 uv add typesafe-sdk
export TYPESAFE_API_KEY=sk-...  # SDK 自动读取
from typesafe_sdk import Choice, Noul, Score, TypeSafeClient

client = TypeSafeClient()

response = client.system_one(
    state="你好,我的 Stripe 账号连了三天都连不上,再不行我就退订了。",
    questions={
        "department": Choice(
            instructions="这个工单该给哪个组",
            criteria={
                "billing":   "支付或订阅问题",
                "technical": "Bug 或集成问题",
                "sales":     "定价或账号咨询",
            },
        ),
        "frustration": Score(
            instructions="客户的不满程度",
            criteria=["平静陈述事实", "有情绪但还讲道理", "非常愤怒,措辞激烈"],
        ),
        "is_urgent": Noul(
            instructions="这条消息表达了紧急或时间压力",
        ),
    },
)

返回长这样。有两处值得一提:output_tokens 记了 48 但不计费;还有那个 confidence: 0.596,下面马上会用到。

{
  "model": "jev-latest",
  "answers": {
    "department":  { "type": "choice", "choice": "billing", "confidence": 0.596 },
    "frustration": { "type": "score",  "score": 1.035,      "confidence": 0.842 },
    "is_urgent":   { "type": "noul",   "noul": 0.999 }
  },
  "usage": { "input_tokens": 312, "output_tokens": 48 }
}

回到那个 confidence: 0.596——这是官方文档自己的示例。0.596 其实是在说:这一条不适合直接路由。 原因也很直观:这条工单同时提到了扣款和没人理,本来就跨 billing 与 technical 两类,换成人也会犹豫。

我自己第一次用的时候就栽在这里——拿着 choice 直接执行,没看 confidence。这两个字段的分工是:choice 告诉你是什么,confidence 告诉你要不要动手。完整讲解见 中文上手指南

npm install @typesafe-ai/sdk                           # 官方 JS/TS
claude plugin marketplace add typesafe-ai/skills       # Claude Code 技能包
npx skills add typesafe-ai/skills --skill typesafe-ai  # 其他 Agent

📐 规格与定价

后面判断「值不值得用」的时候,这几个数字会反复用到:

模型 Jev 1.13 · jev-1.13.0,别名 jev-latest / jev-preview
输入 $0.042 / MTok
输出 免费(官方称 too cheap to meter)
上下文 64k / 次请求,其中 state + 最长问题 ≤ 32k
Choice 候选上限 255
速率 250,000 token/秒 · 1,200 请求/分钟
模态 纯文本,不支持图像 / 音频 / 视频
端点 POST https://api.typesafe.ai/v1/systemone
延迟 70–500ms(官方数据)

比起「快 N 倍」,具体场景的开销更能说明问题:官方 Doom demo 跑 10 次查询/秒约 $7/小时;browser-use 订一张机票全程 7 秒 / $0.0039。这个价格意味着可以对页面上每一个 DOM 元素都问一遍——真正改变做法的是这一点,而不是某个倍数。

来源:Models 文档 · 发布博文


🧭 该用与不该用

没有哪个模型适合所有场景。跑 benchmark 之前先对照一下这张表,能省不少时间。

场景 为什么
高频、重复、答案空间已知的判断 主场 一次调用几十题并行,便宜到每个 DOM 元素都能问一遍
Agent 的每一步「选哪个元素 / 调哪个工具」 主场 browser-use、mobile-jev 全在干这件事,把 LLM 从决策回路里摘出去
LLM 的输入输出护栏 / 内容审核 推荐 阈值写在代码里,比让 LLM 判断自己稳定
无 embedding 的语义检索与重排序 推荐 逐条问 Noul 按概率排序,省掉一整套向量库
上下文剪枝 推荐 fast-jev-compaction、winnow、yoshi 都是这个思路
开放式抽取(候选未知) 要改写 先用正则出候选再让它选,见 Cookbook
低频调用(一天几十次) 不值当 省下的钱抵不过多一个供应商
窄任务 + 有标注数据 先量一下 传统基线(正则 / TF-IDF)在某些任务上更准,见 冷静看待
输出文字、代码、摘要 不会 这是设计,不是缺陷
多步推理、要解释理由 不合适 它只给概率,不给理由

📈 热门项目自动榜

这一段由脚本每天重抓重排,人工精选区不受影响。收录与去噪逻辑都在 collect_hot.py,发现误收可以补进 denylist.txt。星数高只说明关注度高,不代表质量好,把它当作「大家在往哪个方向探索」的信号更合适。

🤖 由 scripts/collect_hot.py 每日自动抓取并排序,最后更新:2026-09-20(UTC)。收录规则:2026-09-10 之后创建、名称/描述/README 命中 Jev 生态关键词、Star ≥ 3,外加 typesafe-ai 官方组织全量。🆕 = 本周新进榜, = 相比上次抓取的 Star 增量。

# 项目 Star 变化 语言 一句话
1 browser-use/jev-ultrafast 🆕 ▲ 2937 Python i. am. speed.
2 tamaratran/fast-jev-compaction 🆕 ▲ 996 TS Claude Code plugin that replaces the compaction summary with Jev decisions: every tool call and…
3 TheoLeeCJ/SemIf 🆕 ▲ 347 Python Semantic ifs from open models, on a 3090 at home. Independent; not affiliated with Jev or TypeS…
4 jarrodwatts/jev-trader 🆕 ▲ 398 TS One AI trade decision every Monad block. Jev on Kuru MON-USDC.
5 vinnylarouge/jevlike 🆕 ▲ 94 Python
6 TianyuCodings/NanoJev 🆕 ▲ 508 Python A nano replica of Jev: parallel decisions, dynamic candidates, and an end-to-end training pipel…
7 typesafe-ai/skills 官方 🆕 ▲ 378 Agent skills for building with TypeSafe's System One API
8 jaredpalmer/kev 🆕 ▲ 385 Python tiny Jev-like model built on top of Qwen2.5-0.5B you can train and run on your MacBook
9 awlevin/typesafe-computer-use 🆕 ▲ 289 Python Computer use for about $0.0002 a step: OCR the screen, classify the next action with TypeSafe,…
10 githubnext/localjev 🆕 TS
11 thruwire/foreman 🆕 ▲ 88 Python Software factory foreman based on TypeSafe's Jev model
12 yibie/awesome-jev 🆕 ▲ 197 Python A curated list of public projects, integrations, and discussions built on Jev — TypeSafe AI's S…
13 devagrawal09/jev-review 🆕 ▲ 80 TS A staged code-review workflow and local dashboard built with TypeSafe Jev.
14 AbdelStark/awesome-typesafe 🆕 ▲ 115 CSS A curated list of official resources and community projects for TypeSafe, System One models, an…
15 dabit3/jev-experiments 🆕 ▲ 80 TS
16 Sac-Y/Jev-cu 🆕 JS
17 featherless-ai/simple-jev 🆕 ▲ 224 Python Turn any open model into a classifier/jev endpoint
18 fhshaik/typesafe-mario 🆕 ▲ 21 Python A TypeSafe/Jev agent that plays Super Mario Bros. from structured emulator state.
19 kyotofin/tax-doc-classifier 🆕 ▲ 139 TS Tax document page classifier built on Jev decisions. 100% strict accuracy across 261 IRS forms,…
20 superagents-lab/jev-search 🆕 ▲ 115 TS Search the web with TypeSafe's Jev: source selection, query understanding and relevance ranking…
21 droidrun/mobile-jev 🆕 ▲ 82 JS
22 realZachi/pg-jev 🆕 ▲ 48 Shell Ask your Postgres tables questions in plain language. A PostgreSQL extension powered by TypeSaf…
23 gargpratyush/jev-router 🆕 ▲ 66 JS Route to the cheapest model in claude code for your task using jev-router
24 cobanov/awesome-jev 🆕 ▲ 83 A curated, source-backed list of projects built with Jev, TypeSafe AI's System One model for ty…
25 kitze/skillbox 🆕 ▲ 35 TS Self-hosted, versioned skills library for AI agents. MCP, scoped clients, and optional Jev reco…
26 v-modal/awesome-jev-tools 🆕 A curated list of tools built for Jev — TypeSafe AI's System One model for typed decisions.
27 ekzhang/openjev-sglang 🆕 ▲ 38 Python Jev-compatible API endpoint based on open models (prefill-only)
28 wy-coliney/jev-browser-use 🆕 ▲ 86 JS 5–10x faster browser operations: Jev clicks, Codex thinks and verifies. Built at EZCollegeApp.
29 typesafe-ai/system-one-adapter-python 官方 🆕 ▲ 44 Python Drop-in TypeSafeClient replacement backed by LLM APIs
30 typesafe-ai/typesafe-sdk-js 官方 🆕 ▲ 36 TS The official TypeScript/JavaScript library for the TypeSafe API
31 NiazMorshed2007/jev-review 🆕 ▲ 41 TS Local-first MCP plugin for continuous software-quality review by AI coding agents, powered by J…
32 lakeday-org/perch 🆕 ▲ 87 JS Semantic code linting with Jev
33 fatwang2/awesome-jev 🆕 ▲ 44 JS A source-backed Jev project directory with a reusable Jev-only GitHub review workflow.
34 hr98w/jev-visual 🆕 ▲ 36 Python An educational Jev-like visual inference experiment on Apple Silicon: shared context, direct ca…
35 jkudish/jev-browser 🆕 ▲ 39 TS Browser use using Typesafe's Jev model
36 kitze/unclutter 🆕 ▲ 36 TS WXT browser extension: Jev-powered page clutter removal with reusable template rules.
37 kunchenguid/compact-adviser 🆕 ▲ 80 TS "Work appears completed or recorded. Run /compact to save tokens."
38 razorback16/openjev 🆕 ▲ 90 Python Open, Jev-compatible System One decision server on DiffusionGemma
39 sutro-sh/jev-align 🆕 Python Build calibrated AI classifiers from human feedback using Jev and GEPA.
40 moritzkremb/jev-voice-browser 🆕 ▲ 47 JS Control a real browser by voice. Jev (TypeSafe System One) decides intent + target in ~300 ms p…
41 typesafe-ai/typesafe-sdk-python 官方 🆕 ▲ 33 Python The official Python library for the TypeSafe API
42 dbreunig/building-with-jev-skill 🆕 ▲ 12 A skill for writing and improving programs that call Jev, TypeSafe's System One model
43 tamaratran/jev-pruner 🆕 ▲ 103 TS Claude Code plugin: trim long Bash output with TypeSafe Jev before the model sees it
44 logicrw/awesome-jev-projects 🆕 ▲ 82 JS Awesome Jev: source-backed open-source ecosystem radar, plain-language project discovery, and a…
45 logan-markewich/jeff 🆕 Python A self-hosted drop-in replacement for TypeSafe's jev, powered by GliFormer.
46 itsmostafa/typesafe-mcp 🆕 ▲ 39 Go mcp connector to give your AI agent direct access to typesafe ai's jev model
47 jkudish/jev-mcp 🆕 ▲ 33 TS Fast, cheap, typed judgments from TypeSafe's Jev model, as MCP tools.
48 standardagents/jevpilot 🆕 ▲ 26 JS A playable Three.js driving simulator with Jev-powered autopilot
49 Mapika/decider 🆕 ▲ 68 Python One-pass typed decisions with calibrated probabilities (System One style model), fine-tuned fro…
50 vinilana/jev-eval-agent 🆕 ▲ 8 HTML
51 DevMortimer/pi-warden 🆕 ▲ 28 TS Guardrails for Pi built on pi-typesafe that steer the agent instead of interrupting you: Jev ju…
52 BillionsBobby/JevRouter 🆕 ▲ 79 TS A lightweight Jev-powered router for models, tools, and subagents
53 mmastrac/djev-spark 🆕 ▲ 62 HTML DiffusionGemma NVFP4 structured decisions on a DGX Spark: container recipe
54 pithings/advocaat 🆕 ▲ 10 TS A small, type-safe client for asking AI questions about your data, powered by TypeSafe Jev.
55 AnotiaWang/awesome-jev 🆕 ▲ 16 A curated list of awesome Jev / TypeSafe System One applications, libraries, and resources.
56 uehaj/jev-semgrep 🆕 JS grep by meaning, across languages. TypeSafe Jev scores every line against a meaning; combine me…
57 y0usaf/pi-jev 🆕 ▲ 13 TS TypeSafe Jev as a decision layer for the Pi coding agent: a measured tool-call gate plus jev_as…
58 giuliosmall/pg_typesafe 🆕 ▲ 2 C Pre-alpha PostgreSQL extension for TypeSafe AI (Jev) categorical classification
59 kshetrajna12/reflex 🆕 ▲ 15 Python A small open decision model: state + typed questions -> calibrated probabilities. A Jev / Syste…
60 RomanSlack/jev-drone 🆕 ▲ 10 Python Camera-only autonomous drone in MuJoCo with a small judgment model (TypeSafe Jev) in the loop a…

🧰 SDK 与客户端

多数情况下官方那两个 SDK 就够用。社区版本主要补官方还没覆盖的语言,质量参差不齐,接入前翻一下源码比较稳妥。

官方

项目 Star 安装 说明
typesafe-ai/skills claude plugin install typesafe@typesafe-ai 官方 Agent 技能包:原语、模式、怎么组织 evaluation
typesafe-ai/typesafe-sdk-js npm i @typesafe-ai/sdk 官方 TS/JS 客户端,类型定义完整
typesafe-ai/system-one-adapter-python pip install system-one-adapter 官方出的 TypeSafeClient 替身,后端走普通 LLM API。没拿到 waitlist 也能先写代码,还能用同一套问题横向对比 Jev 与聊天模型
typesafe-ai/typesafe-sdk-python pip install typesafe-sdk 官方 Python 客户端,同步/异步双版本,自带重试
Vercel AI SDK provider npm i @ai-sdk/typesafe-ai experimental_evaluate + typeSafeAi.evaluationModel('jev-latest')

社区

语言 项目 Star 说明
TypeScript pithings/advocaat 小而美的 TS 客户端,给三原语打了 tagged helper
Ruby kieranklaassen/ruby_llm-typesafe RubyLLM 2 的 TypeSafe provider,带离线模型元数据
Rust Twister915/typesafe-ai 另一个 Rust 客户端,异步 + 阻塞传输、可观测重试
Erlang/OTP dannote/jev 从 GenServer 回复 Jev,直接模式匹配答案
Shell shiftynick/jev-axi 面向 Agent 的 CLI:pick / rate / check / rank / triage
.NET saibimajdi/typesafeai-dotnet-sdk 类型化问题 + 带置信度的答案
Ruby joshmn/typesafe-sdk Ruby 3.1+ 客户端,线程安全连接池;无异步客户端
Shell y0usaf/typesafe-cli 命令行直接问 noul/choice/score,返回数字不返回废话
Rust gilljon/typesafe-ai-rs 独立的异步 / 阻塞 System One 客户端
Go Gaurav-Gosain/jev-go go get github.com/Gaurav-Gosain/jev-go,返回类型化判断与校准概率
Rails GenieRobot/typesafe-ai-rails Rails 集成:配置、用量/成本遥测、可选置信度策略
PHP Butochnikov/typesafe-sdk-php 类型化 DTO、Promise 与异常
Laravel Butochnikov/laravel-typesafe-jev Laravel 12/13 集成:Facade、scoped DI、recording fake
Elixir nshkrdotcom/typesafe_sdk Hex 包,支持 system_one 与模型列表
Scala/ZIO jamesward/zio-typesafe-ai ZIO 客户端,带 noul/choice/score 小 DSL
Python AboveColin/jevclient 非官方异步 Python 客户端 pip install jevclient
Rust AbdelStark/s1-rs derive 宏层:Choice/Score/Noul、类型化问题集、置信度门控、无网络测试

包名容易看错:PyPI 上要装的是 typesafe-sdktypesafe-ai 是社区注册的占位包,用来挡蹭名字的恶意包,本身不是官方 SDK。


🛠 应用

这些项目已经把 Jev 放进了真实的循环里。整份列表我自己读得最久的就是这一栏——别人踩过的坑,可以直接绕开。

项目 Star 说明
browser-use/jev-ultrafast 全生态第一爆款。Browser Use 官方出品的浏览器 Agent:一次请求里让 Jev 同时选出「做什么操作」和「操作哪个 DOM 元素」,只有真要打字时才叫小模型。Google Flights 苏黎世→伦敦订票 7 秒 / $0.0039。附库、本地 inspector 与测时
tamaratran/fast-jev-compaction Claude Code 插件:把上下文压缩的「总结」换成 Jev 判断——每次工具调用和结果都打分,决定留不留。上下文工程的新范式
jarrodwatts/jev-trader 每个 Monad 区块对 Kuru 的 MON-USDC 做一次买卖决策。在线:jev-trader.vercel.app
thruwire/foreman 软件工厂循环:Codex 负责写,Jev 独立判断「做完没 / 测试够不够 / 要不要叫人」。把「谁来验收」这件事从 LLM 手里拿走
devagrawal09/jev-review 分阶段代码审查工作流 + 本地 dashboard,由一串聚焦的 Jev 调用驱动
awlevin/typesafe-computer-use macOS computer-use:OCR 屏幕 → Jev 分类下一步动作 → 点击。约 $0.0002/步
kitze/skillbox 自托管、带版本的 Agent 技能库,MCP + 作用域客户端,可选用 Jev 做技能推荐
realZachi/pg-jev PostgreSQL 扩展:直接在 SQL 里用自然语言问你的表WHERE jev_noul(comment, '这是投诉') > 0.8 这种写法
droidrun/mobile-jev Android Agent,每次点击由 Jev 决定。打开 Uber、旧金山机场→金门大桥,21 秒 / 9 步到支付页,不需要 ADB
RomanSlack/jev-drone MuJoCo 四旋翼:控制与安全留在代码里,Jev 只做 2.5Hz 的战术判断
kitze/unclutter Chrome / Firefox 扩展:Jev 标出页面上不重要的元素,本地按页面模板记住,下次访问直接藏
ChetasLua/jevmeter 给任意视频挂实时 Jev 仪表:逐句打分,导出 16:9 成片
realZachi/typesafe-adblock Chrome 扩展,逐个 DOM 元素问「这是广告吗」。规则库可以退休了
devanshbatham/commit-miner Rust CLI,给 commit diff 分类:修 bug、安全/CWE、变更类型,出 HTML/CSV 报告
ellipsis-dev/blink 代码库语义搜索,Jev 驱动。不用向量库
monteduro/killmyidea 描述你的创业点子,Jev 判决:毙掉、改改、还是发。玩法很毒但很有代表性
jexp/neo4jev 让 Jev 在 Neo4j 图上导航:对邻居节点做分类,一步步走过去
AboveColin/HA-Jev Home Assistant 集成:把「关于家里状态的类型化提问」变成传感器与自动化动作,带每日 token 预算实体
reachjalil/jevlogs OpenTelemetry 日志分流:先让 Jev 打诊断价值和优先级,再决定要不要花钱叫 LLM
lakeday-org/perch AST 驱动的语义 code lint
sufianetaouil/every 语义代码搜索 CLI:对每个函数问一个是非题,按 Noul 概率排序
asfarsadewa/human-compiler 粘贴职场废话,Jev 给「被动攻击 / 紧急感 / 信息密度」打分,代码按 rustc 风格报诊断。在线:human-compiler.asfarlab.fun
santos-sanz/jev-audio-beeper 低延迟脏话检测:Jev 判定后 ffmpeg 在约 466ms 内叠一声 beep
TarunTomar122/jev-askable-arm 仿真 Franka 机械臂:英文目标 zero-shot,Jev 把硬编码原语串起来

🎮 Demo

发布 48 小时内涌现出来的小玩具。我是挑了两三个跑完之后,才真正对它的能力边界有了感觉——比读十页文档快得多。

项目 Star / 链接 说明
fhshaik/typesafe-mario 从结构化模拟器状态玩超级马里奥
standardagents/jevpilot Three.js 驾驶模拟器 + Jev 自动驾驶,可直接玩
sorrycc/typesafe-snake 中文社区出品(sorrycc,umi 作者):贪吃蛇每个 tick 一次 System One 选择,只在合法走法里选
phyous/tsai-sc Jev 用键鼠操作原版星际争霸共享战役,带验证跑次与概率轨迹
opaielsheikh/ai-elo-ranker 高速递归 AI Elo 锦标赛引擎,Jev + 瑞士轮匹配
lukaske/jev-doom-agent 浏览器里的 Doom(Chocolate Doom WASM),空间状态 + 实时决策遥测。官方发布 demo 的同源玩法,约 $7/小时
lbotinelly/jev-little-airways 玩具群岛空管:每架飞机只看得见自己附近,Jev 判断备降 / 紧急 / 谁先落地,约 150ms
phureewat29/got-jev 权力的游戏角色扮演:故事模型写下一场,Jev 回答「他在哪、多危险、配什么音乐」
mizchi/jev-gomoku MoonBit 客户端 + 两个 Jev 互相下五子棋,配套文章带耗时日志
joshlarsen/jev-t-rex-runner Chrome 小恐龙由 Jev 来跳
siroccomask/snake-jev 贪吃蛇,每局几百次类型化转向决策
Jev Tetris 🔗 在线 Jev 按空洞、堆高、起伏选旋转和落点列
Jev Pac-Man 🔗 在线 迷宫做成 JSON,每个路口由 Jev 选转向
Yes / No 🔗 在线 免登录 Noul demo,问一句得到 yes/no/maybe
TypeSafe Typewriter 🔗 在线 Val Town demo:打字时 16 条类型化判断实时更新
Hollow Creek 🔗 在线 村庄 NPC 每个 tick 评判你(在做什么、对你什么感觉),而不是和你聊天
Jev Guard 🔗 在线 评论审核 playground
Jev Room 🔗 在线 一句话 → 六个房间设定,Jev 选,应用渲染
官方智能家居 demo 🔗 官方 演示投机扇出:一次问很多题,代码留下有用的,LLM 只管拆复合指令和闲聊

🤖 Agent 工具

把 Jev 接进 Claude Code、Codex、Cursor、MCP 的工具。这个方向的项目出得最快,原因也不难理解:编程 Agent 的每一步——路由到哪个模型、加载哪个技能、这条工具结果该不该留在上下文里——本质上都是选择题。

项目 Star 说明
vercel/eve Vercel 的 Agent 框架,实验性 autoModel 默认用 Gateway 上的 typesafe-ai/jev 从白名单里挑语言模型
typesafe-ai/skills 官方技能包。Claude Code:claude plugin marketplace add typesafe-ai/skillsclaude plugin install typesafe@typesafe-ai;其他 Agent:npx skills add typesafe-ai/skills --skill typesafe-ai
NiazMorshed2007/jev-review 本地优先 MCP:Claude Code / Codex / Cursor / OpenCode 边写边拿结构化质量审查
gargpratyush/jev-router Claude Code 与 Codex 的每轮路由:简单活走快档,难活走强档。npm i -g jev-router
vlad-terin/jev-use Agent skill + 运行时:Codex 规划,Jev 选元素,runner 执行并逐步校验;已扩到桌面工作流,主打「少跑几轮 Codex」
jkudish/jev-mcp Node MCP,封装三条 cookbook:jev_verify 引文核验、jev_screen 注入护栏、jev_find 无 embedding 语义排序。npx -y github:jkudish/jev-mcp
DevMortimer/pi-warden Pi 护栏:把判决当成 held tool result 而不是弹窗;对照项目规则文件检查写入
dbreunig/building-with-jev-skill 一个专门教 Agent「怎么写调用 Jev 的程序」的 Skill
itsmostafa/typesafe-mcp Go 写的 CLI + 单二进制 MCP,适配 Claude Desktop / Claude Code / Codex
Dicklesworthstone/skillranker Rust CLI,用实时会话上下文给 Agent 技能排序,只加载最该加载的那个
y0usaf/pi-jev Pi 扩展:影子模式工具调用门控、输出评判、类型化 jev_ask
shantanugoel/ask-jev-skill Hermes Skill:Agent 需要有界决策时去问 Jev
0xNatoshi/jev-codex-router Codex 每轮路由:Jev 选模型、思考深度和速度模式
nidhi-singh02/agent-router CLI 按任务挑 Cursor / Claude Code / Codex / OpenCode + 模型档位,然后直接启动
GhalebDweikat/winnow Claude Code 的校准上下文筛子:每个工具结果都被判一次再决定留不留
blakestone-x/jev-mcp Python MCP:classify / score / check / match / screen
compozy/yoshi Claude Code / Codex 的上下文剪枝代理:Jev 判断哪些历史还需要,可量化
jomatsu/pi-jev-auto-mode Pi 自动模式:Jev 按语义批准 bash / write / edit,判断不了就拒绝
Ying-Kai-Liao/jev-browser LLM 规划、Jev 在 Playwright 快照上决定每次点击(约 300ms/次)。含 MCP:npx -y -p jev-browser jev-browser-mcp
sharziki/semdecide 给 Unix 管道和 CI 用的类型化语义决策,cat log | semdecide ...
romaluev/jev-ego ego lite 上的浏览器 Agent,observe / act / suggest / step CLI
samtay32/jev-system-architect 专找代码里脆弱的语义逻辑,改写成 Choice / Score / Noul 边界
AbdelStark/bicameral Pi 编程 harness:LLM 写代码,Jev 提供策略、循环检测与 review 的类型化反射。明确不是沙箱

🔬 复现与评测

这些是受 Jev 接口启发的独立工作,都不是 TypeSafe 的模型。想弄明白它在技术上怎么做到的,这些复现比官方博文讲得清楚。

开源复现

项目 Star 说明
TheoLeeCJ/openjev 最受关注的复现:一张 RTX 3090 能不能跑 Jev 风格的东西?直接读选项 logits,不生成文本
vinnylarouge/jevlike 训练一个小的单次 scorer:上下文 + N 个文本选项 → 每个选项一个概率。含 Doom / 国际象棋视觉 demo 与 Wikispeedia 下一跳例子。明确声明不是 TypeSafe 架构或 RLCD 的复现
ekzhang/openjev-sglang 基于开源模型的 Jev 兼容 API 端点(prefill-only)
hr98w/jev-visual Apple Silicon 上的 Jev 风格视觉推理教学实验:共享上下文、直接给候选打分
TianyuCodings/NanoJev nano 版 Jev:并行决策、动态候选、端到端训练流水线。想搞懂训练的从这个读
kshetrajna12/reflex 小型开放决策模型:state + 类型化问题 → 校准概率
bnsd55/jevmlx Apple Silicon 上给任意 MLX 模型做 Jev 式并行受限决策
rorshopping/jev-on-a-laptop 非官方研究:1.5B–8B 现成模型在 Apple Silicon 上做并行类型化决策
r-ms/mini-jev 冻结的 Qwen3-4B 上,Jev 式类型化决策接口长什么样
Mapika/decider 基于 Qwen3.5-2B 微调:一次前向给出类型化决策和校准概率
siliconkernel/vllm-jev-decison 给 vLLM 加「只分类」模式:有限 schema 候选打分 + 概率
genai-craft/openvons 日文向 open-Jev:文本 / 图像 / 日语语音命令的概率判断层
stephanj/parallelConstraintDecoding Java + Python 双版本的并行受限解码实现
NullPo-jp/PocketJev iPhone 端侧视觉判断:MLX + Qwen3-VL 选项 logits。相机 + 三选一,约 1 秒,不存照片

独立评测

项目 Star 结论摘要
vinilana/jev-eval-agent 早期 Jev 测试的公开评测 harness
iammrduncan/typesafe-ai-benchmark 同一套 System One 问题,对比 Jev 与 Cerebras 上的 Qwen 3.8 27B
AbdelStark/jev-benchmarks 面向类型化决策模型的概率感知评测框架
mahlernim/jev-korean-benchmark 韩语理解与医学文本的可复现 early-access 评测。非英语场景的少有数据点
anessbelbati/jev-rerank-bench 重排序对比:原始 provider 响应、打分代码、不确定区间、写明的局限
Gaurav-Gosain/jev-sec-bench 公开语料盲测:提示注入与漏洞代码检测
TokenTrim/jev-agent-failure-benchmark Who&When Pro(注入的 Agent 故障):预测是谁 / 哪一步 / 哪类错误
anisselbd/jev-phishing-bench 全生态最严谨的一份评测。2000 封钓鱼邮件对比 Claude Haiku 4.5:Jev 直接问「该不该点」只有 62.6% 准确率(Haiku 81.3%),但同一次调用里拆成 5 个信号问题、再做逻辑回归就到 95.0%。作者还在被质疑后补了三组对照(非 AI 正则基线 91.8%、样本切分、同样问题问 LLM)。延迟 239ms vs 687ms,成本 $0.038 vs $0.462 / 千封
bitnovus/jev-spam-eval 18,514 封邮件:一段写出来的垃圾邮件定义拿到 98.3%,和用 ~14,800 条标注训练的 TF-IDF(98.4%)打平,两者平均后 99.2%最关键的是分布漂移——换到 2026 年的新邮件,同一个问题仍有 97.3%,TF-IDF 掉到 72.5%。作者自己标注了「判据是看过错误样本后写的」这一 caveat
teyhouse/jev-secret-detection 测量 Jev 在代码片段里识别真实密钥凭证的能力
jmanhype/jev-dspy-lab DSPy 配套评测:录制并重放调用,测校准、选择性风险、置信度弃权、延迟、成本

中文场景至今没有公开评测。 谁做过中文分类、内容审核或客服工单的对比测试,欢迎把数据发过来——结论对 Jev 有利还是不利都一样有价值。这是这份列表目前最缺的一块。


🍳 Cookbook 与模式

官方整理好的、可以直接照着改的工作流。下面四个核心模式是骨架,读完基本就知道系统该怎么搭了。

模式 一句话
置信度门控路由 答案告诉你是什么,置信度告诉你要不要动手。最重要的一条
投机扇出 一次问很多题(含用不上的),在代码里筛。输出免费,多问不花钱
组合打分 原子分数由模型给,权重由你的代码掌控
意图路由 先分类,再交给确定性逻辑、专用 LLM 或人
官方 Cookbook 全表(可直接照抄的工作流)
Cookbook 解决什么问题
Parallel questions 对同一份 state 批量提问,一次调用代替 N 次
Line-by-line search 用 Choice 给几百行 id 打分,再用 Noul 检查「到底有没有答案」
Re-ranking BM25 出短名单,再对每个 query–候选对问一次
Guardrails for LLMs 筛 LLM 的入站/出站消息,概率阈值写在代码里
Double-checking citations 判断引文上下文是否支撑主张,低置信度交人工
Classifying RAG passages 回答之前保留 / 标记 / 丢掉检索段落(矛盾、注入等)
Function calling 把自然语言请求映射到普通类型化函数与闭集参数
Skill suggestion 给 Agent 技能目录排序,只细读前几名
Hierarchical classification 在深层分类树上用 Choice 概率做 beam search
SDE cascade 两阶段结构化抽取级联(mini → 校验 → 推理)
Date extraction 先问文档里点名的日期部件,再在代码里解析校验
Pre-parsed value extraction 正则出候选,再让 Jev 选出目标片段。开放式抽取的标准解法
Entity alignment 知识图谱实体对齐:合并 / 不链接 / 交给策展人
Autoresearch feature discovery 把问题当成数值特征,喂给监督学习
Classification using confidence 置信度够才报细分类,否则上爬一层
Structure recovery 从丢掉格式的纯文本重建 Markdown
Self-consistency: nouls / choices 不确定的走人工审核,同时保留原始数值

完整目录:console cookbooks · llms.txt


📰 文章

媒体报道大多基于同一份发布稿,挑一篇看背景就够。下面的「技术走读」信息量大得多。

媒体报道

文章 来源
TypeSafe AI debuts model for machines that plays Doom The Register
ChatGPT pioneer launches Jev model for programmatic logic AI News
TypeSafe AI Emerges From Stealth With $40M in Funding Yahoo Finance
Jev: TypeSafe's System One Model That Never Hallucinates DataCamp
TypeSafe JEV Explained: AI Decisions Without a Chatbot The Neuron
AINews: a "System One Model" that only decides/classifies/routes/scores Latent Space

技术走读

文章 说明
A deep dive into Jev Flavio Copes 的技术拆解,结构清楚
How to Use Jev: A practical guide DEV 上的实战指南
AI That Doesn't Talk: A Plain-English Guide 从 Playground 到裸 HTTP 到 agent skill 的全路径
TypeSafe Jev: the First Decision-Only Model Class 发布周技术综述:API、评测、adapter、skill
Typed Decisions, Not Chat 把官方主张和公开证据分开列,本列表最推荐的一篇冷静文
Mini-Vibe Check: Jev Judged Everything I've Written in 0.7 Seconds Every 的 Mike Taylor 用 Jev 扫自己的全部写作语料
Jev: The Language Model That Won't Talk Substack 长文评论
Is the 200x Faster Decision Model Too Good to Be True? 质疑向,和上面那篇对着读

日文

文章 说明
TypeSafeのJevを正しく驚く、それってLLMでできませんか? Jev 是什么、不是什么,边界画得很准
jev 同士に五目並べで対戦させた mizchi 让两个 Jev 下五子棋,带源码和耗时日志

中文一手内容目前几乎是空白,docs/ 就是为了补这一块。写了中文实践文章的话,欢迎提 PR 进来。


💬 社区

渠道 说明
Discord TypeSafe 官方服务器,Builder demo 集中在 Show and Tell 频道
X @typesafeai 官方账号,出 stealth 那条
LinkedIn 公司公告与招聘
Hacker News 发布讨论 1500+ 分,评论区的质疑比正文更值得读
Vercel 上线公告 AI Gateway 接入公告
OpenRouter 模型页 价格、限流、provider 状态

X 上值得关注的几条(发布周传播量最大的):

推文 看点
@typesafeai 出 stealth 官方发布原帖
@stevekrouse 的 Typewriter demo Val Town 作者,16 条判断实时更新,直观演示「并行提问」
@thdxr SST 作者的上手体感
@testingcatalog 的拆解 把「不是 LLM」这件事讲清楚了
@iamMrDuncan 的对比视频 Jev vs Cerebras 上的 Qwen 3.8 27B
@chetaslua 的 JEVMETER 实时视频打分仪表,视觉冲击最强的一条

其他 awesome 列表

列表 Star 说明
Anil-matcha/awesome-jev-by-typesafe 偏用例、模式、prompt 与起步代码
AbdelStark/awesome-typesafe 覆盖整个 TypeSafe / System One,不只 Jev
yibie/awesome-jev 收录讨论与集成,含社区争论
AnotiaWang/awesome-jev 结构最完整的一份,本列表的选品参考了它,有 README_zh
hellogumbo/awesome-jev 社区目录站形态

🧊 冷静看待

这个生态才几天大,讨论的热度远远跑在验证的前面。下面五点是我整理这份列表时反复撞到的,放在这里供参考。

「快 193 倍」是厂商自评 数据出自 TypeSafe 自己的 workflow evals,官方也标注了那是收益上限。HN 讨论里提出的质疑值得重视:拿一个只做分类的模型和一个要生成完整回答的模型比延迟,口径本身并不对等
官方公布了能力毛边 Jev 1.13 jaggedness 列出了已知的失败模式。厂商愿意主动公开这些是好事,同时也说明一件事:它在不同任务上的表现并不均匀,上生产前用自己的数据跑一遍不算多余
中文场景零公开数据 训练语料未公开,中文任务的校准质量也还没有任何公开评测。英文场景的结论直接迁移到中文工单和内容审核上,风险是未知的
「不可能幻觉」有边界 它的准确含义是:输出不可能违反 schema、不可能编出你没定义的选项。这不等于判断一定正确——选错依然会发生,兜底要靠你的置信度门控,而不是模型本身的保证
早期生态风险 依赖单一新供应商、配额不稳定、API 可能随版本变化。官方的 adapter 可以当降级方案用,一开始就接上成本很低

两份独立评测,十分钟能读完

jev-phishing-bench(2000 封钓鱼邮件)是目前最严谨的一份。结论对 Jev 有不利的一面,也有有利的一面:

用法 准确率
直接问 Jev「该不该点这个链接」 62.6%
Claude Haiku 4.5 问同一个问题 81.3%
两行正则规则 91.8%
同一次调用拆成 5 个信号 + 代码里做回归 95.0%

同样的分解,Jev 便宜约 27 倍,延迟 239ms 对 687ms。作者还补了一组对照:把这 5 个问题原样拿去问 Haiku,回归后能到 93.2%,与 Jev 在统计上没有显著差异。这组对照让整份评测的可信度高了不少。

jev-spam-eval(18,514 封邮件)展示了它擅长的一面:仅凭一段写出来的垃圾邮件定义就拿到 98.3%,和用约 14,800 条标注训练出的 TF-IDF(98.4%)基本持平。更有意思的是分布漂移那一组——换到 2026 年的新邮件,Jev 仍有 97.3%,TF-IDF 掉到 72.5%。抗分布漂移,大概才是它真正稳定的优势。

这两份评测让我改变了三个原本的想法:

  1. 它不是万能判断器。 单问一个复合问题是它最弱的用法,62.6% 就是这么来的——我原本以为「问题写清楚就行」,显然不是。
  2. 拆成原子信号、组合逻辑留在自己代码里,差别比想象中大得多。 同一个模型、同一批数据、同一次调用,62.6% 到 95.0%。组合打分模式讲的就是这件事,看数据之前我没当回事。
  3. 传统基线依然很能打。 两行正则 91.8% 这个结果挺让人清醒的。Jev 稳定的优势在成本、延迟和抗分布漂移,不在绝对准确率——谁要是说它在所有任务上都更准,问一句数据在哪儿是合理的。

📖 中文指南

英文资料已经相当丰富,所以这两份只补中文世界缺的那一块:怎么写第一段代码,以及怎么用自己的数据把阈值量出来。

文档 内容
上手指南 接入路径、三原语讲透、置信度门控怎么定阈值、一个能上线的工单分类器、报错对照
图解说明 16 页幻灯片:真实请求、真实返回、真实数字。转给同事看,比你解释半天管用
概念与心法 System One 新在哪、RLCD vs RLHF、为什么问题要原子、校准概率怎么读、LLM 流程改造四步法

🤝 贡献

欢迎 PR。三条约定:项目确实基于 Jev、链接可以打开、用一句中文说清它做什么。 精选表按 Star 降序,新条目插到对应位置;拿不准就跑一下 scripts/sort_tables.py

暂不收录空仓库、纯 API 中转服务,以及只有 landing page、没有可读代码的项目。细则见 CONTRIBUTING.md

许可

CC0 1.0 — 本列表贡献到公有领域,随便用。


这份列表如果帮上忙了,欢迎点个 Star

云中江树 维护 · 微信公众号「云中江树」

Star History Chart

Reviews (0)

No results found