定价与成本测算:什么时候 Jev 胜过 LLM + JSON
先给结论数字,再给算法。当前版本 jev-1.13.0(别名 jev-latest):每 10 亿输入 token 收 42 美元——即每百万 0.042 美元——输出免费。限速 250,000 tokens/秒、1,200 请求/分钟(官方称动态调整中)。上下文总预算 64k;state 加最长问题控制在 32k 以内(约 15 万英文字符)。
规格表
| 项目 | 规格 |
|---|---|
| 价格 | $42 / Btok($0.042 / Mtok),仅输入计费,输出免费 |
| 限速 | 250,000 tokens/秒 · 1,200 请求/分钟 |
| 上下文 | 64k 总预算;state + 最长问题 ≤ 32k |
| 输入 | 纯文本:string / JSON object / array。不支持图像、音频、视频 |
| 语言 | 英文最准;CJK 可用但精度偏低——务必用自己的数据测 |
| 微调 | 不做客户级微调;靠 state 塞领域材料、criteria 写规则、代码加权 |
批量效应:为什么一次调用胜过很多次
因为问题在单次前向里并行评估,问题数量几乎不改变成本和延迟。一个社区基准把它说得很具体:13 个问题合并成一次调用,比拆成 13 次单独调用便宜 12.2 倍、快 10 倍,答案完全一致。这一条就重塑了设计:过度提问几乎是免费的,所以把你可能需要的每个问题都发出去,让代码挑(见 投机式扇出)。
每百万次判断的成本(推演)
真正的问题是"一百万次判断要花多少"。下面是一个透明、假设驱动的对比。所有数字都是示意性估算——Jev 用的是其公开价,LLM 价只是常见档位的代表值,不是报价单。请用你真实的 token 量自己算。
| 假设 | Jev | 廉价 LLM(JSON) | 前沿 LLM(JSON) |
|---|---|---|---|
| 价格(输入/输出 每 Mtok) | $0.042 / 免费 | ~$0.10 / ~$0.40 | ~$3 / ~$15 |
| state + prompt tokens / 次 | ~300 | ~300 | ~300 |
| 输出 tokens / 次 | 0(免费) | ~50 | ~50 |
| 每次调用判断数(批量) | 13 | ~4 | ~4 |
| 每次调用成本 | ≈ $0.0000126 | ≈ $0.000050 | ≈ $0.00165 |
| 每百万次判断成本 | ≈ $1.3 | ≈ $50 | ≈ $410 |
| 每次调用延迟 | 毫秒级 | ~1–3 秒 | ~3–30 秒 |
怎么读:在大规模下,Jev 大约比廉价聊天模型便宜一个数量级,比前沿模型便宜两到三个数量级,同时低 100–1000 倍延迟。每次调用批量塞的判断越多,差距越大。
数学会反咬的地方。Jev 只收输入,所以你的state 大小就是全部成本故事。把 30k token 的 state 塞进每次调用来"给它上下文",既抹掉成本优势,又掉精度(context rot)。state 要最小且相关——先在代码里过滤再发。并且记住:如果任务需要生成,Jev 干不了;那条路上你仍然在为 LLM 付钱。
让这些概率在生产里真正有用的阈值逻辑,见 置信门控路由。