名字源自 Kahneman《思考,快与慢》:System 1 快而直觉,System 2 慢而深思。LLM 是 System 2——擅长生成,但被拿来当分类器用时又慢又贵还得解析。Jev 是第一个 System One 模型:只做快速、结构化的判断,概率经过校准(说 0.8 的事,约 80% 会发生)。
RLHF 造出聊天机器人,RLVR 造出推理模型,而 TypeSafe 用 RLCD(RL for Calibrated Decisions)训练模型输出「决策 + 校准概率」而非文本。CEO Diogo Almeida 正是 RLHF 的共同发明人(InstructGPT)。
所有问题在同一请求内并行且互相隔离评估,一个前向算完所有答案,所以输出 token 免费、延迟以毫秒计。实测 11 个问题一次调用约 0.3 秒、0.0002 美元。
TypeSafe 的赌注:未来 AI 自动化 99% 是机器对机器。问题必须原子化(专家几秒可判断),复杂判断拆成多问、权重逻辑放在你的代码里。
问题三要素:id(仅代码用,不发给模型)、instructions(要判断什么)、criteria(选项/量表定义)。三类可自由混在一个请求里,加问题几乎不增加耗时。
从固定选项中选一个,返回 choice + 每选项概率 + confidence。适合路由、分类:工单分派、文档类型、意图识别。答案永远约束在你给的选项内。
沿有序量表定位,返回 score(可落在两档之间)+ 分布 + confidence。适合严重度、情绪强度、质量分级——档位含义由你定义。
返回「是」的概率(0–1)。适合概率本身有用的场景:是否退款请求、是否包含 bug 报告。注意:Noul 没有独立 confidence 字段,概率即信号。
当前版本 jev-1.13.0,别名 jev-latest。只收输入 token,输出免费。
| 项目 | 规格 |
|---|---|
| 价格 | $42 / Btok(即 $0.042 / Mtok),仅输入计费,输出免费 |
| 限速 | 250,000 tokens/秒 · 1,200 请求/分钟(官方称动态调整中) |
| 上下文 | 64k 总预算;state + 最长问题 ≤ 32k(约 15 万字符英文) |
| 输入 | 纯文本:string / JSON object / array;不支持图像、音频、视频 |
| 语言 | 英文最准;中文等 CJK 可用但精度偏低,务必自测 |
| 微调 | 不做客户级微调,靠 state 塞领域材料 + criteria 写规则 + 代码加权 |
去 console.typesafe.ai 拿 API key,一个 POST 就能跑起来。
curl -X POST https://api.typesafe.ai/v1/systemone \
-H "Authorization: Bearer $TYPESAFE_API_KEY" \
-H "Content-Type: application/json" -d @- <<'EOF'
{
"state": "Our Stripe integration has been
failing for 3 days and we can't ship
any orders!",
"model": "jev-latest",
"questions": {
"department": {
"type": "choice",
"instructions": "Which team should
handle this",
"criteria": {
"billing": "Payment issues",
"technical": "Bugs / integration",
"sales": "Pricing questions"
}
},
"is_urgent": {
"type": "noul",
"instructions": "Does this convey
urgency?"
},
"frustration": {
"type": "score",
"instructions": "How frustrated is
the customer",
"criteria": ["Calm", "Frustrated",
"Very angry"]
}
}
}
EOF
# 返回:类型化答案,代码直接用
{
"answers": {
"department": {
"choice": "technical",
"probabilities": {
"technical": 0.93,
"billing": 0.05, "sales": 0.02 },
"confidence": 0.88
},
"is_urgent": { "noul": 0.999 },
"frustration": {
"score": 1.62, "confidence": 0.79 }
},
"usage": { "input_tokens": 312 }
}
官方 Patterns 文档总结的高频用法——把大判断拆成原子问题,组合逻辑留在代码里。
把所有可能用到的问题一次发出(含投机问题),代码按需取用答案。反正并行、便宜,宁滥勿缺。
confidence 是第二决策轴:高置信自动执行、中置信请人确认、低置信转人工。阈值随风险分级——转账要 0.9+,查余额 0.5 就够。
复杂评级拆成多个 Score(如 bug 严重度 × 客户情绪 × 可复现性),在代码里加权合成。调权重改代码即可,不用改 prompt。
先 Choice 分类用户意图,再路由到确定性代码 / 专家 LLM / 人工。让 90% 的简单请求根本不碰大模型。
TypeSafe 公开了 jev-1.13 的 jaggedness(能力毛边)清单——这份坦诚在业界少见,也是用好它的关键。
发布一个月内 GitHub 上已涌现一批项目(星数为 2026-09 中旬快照)。
用开源模型在本地 3090 上复刻 semantic if,独立项目。
官方精选:用例、模式、prompt、起步代码合集。
用 Jev 做分级代码审查的工作流 + 本地面板。
Jev agent 玩超级马里奥:结构化模拟器状态 → 按键决策。
Postgres 扩展:用自然语言查你的数据表。
用 Jev 驱动浏览器操作,一次往返定操作 + 目标。
本站持续追踪 Jev 与 System One 赛道的公开动态。
SemIf、pg-jev、jev-review、typesafe-mario、foreman 等项目集中出现;开源复刻(mini-jev、Qwen-2.5-1B-RLCD)也相继跟进。
lindfors.no 用 24 篇挪威语听证信实测:0.31 秒、约 $0.0002/次;关键发现是「它答错的题,恰好也是它 confidence 最低的题」——不确定性信号值得信任。
「Introducing System One Models and Jev」登顶 Hacker News;实时打 Doom 的 Demo 引发热议,也有对延迟对比口径的质疑。官方回应:coding 场景(state 工程)尚未开做。
jev-1.13.0 上线,定价 $42/Btok、输出免费;官方同步放出文档、Python/JS SDK、四大 Patterns 与 Playground。
不能,也不打算。它是生成层的互补:LLM 负责生成,Jev 负责路由、验证、打分、门控这些「每秒成千上万次的小判断」。官方建议用 confidence 门控决定什么时候升级到 LLM 或人工。
三个字:快、便宜、稳。单次前向毫秒级返回;$0.042/Mtok 约为最便宜聊天模型的零头;概率是训练目标(校准)而非副产物,且带现成的 confidence 供门控。
意图路由、内容审核、工单分类、RAG 重排、风控打分、agent 动作门控、数据抽取校验——凡是「规则写不死、LLM 又太贵」的判断点。
可用但官方明说英文最准,CJK 精度偏低。生产使用前务必用自己的中文数据实测,并重点盯 confidence 做路由兜底。