AI Tools

TypeSafe AI 的 Jev:那个连一句话都写不出来的模型,正在改变营销流水线的成本曲线

TypeSafe AI 的 Jev:那个连一句话都写不出来的模型,正在改变营销流水线的成本曲线
目录

上周二我在调试一个 Make.com 场景:每天把 12,000 封客服邮件丢给 Claude 做分类。每封邮件耗时约 4 秒、单价约 $0.01,输出三个标签中的一个:billing(账单)、technical(技术)、sales(销售)。一天 $120,做的事情本质上是一个 200 行的 if/elif 就能搞定 —— 如果我们敢自己写规则的话。我们不敢。于是花钱买了"智能"。

然后 TypeSafe AI 发了 Jev,这一个场景的费用从 $120/天 降到 $2.40/天。调用耗时降到 180 毫秒。执行这个任务的模型,一个完整的句子都写不出来。

这就是 Jev 全部卖点。Jev 不生成文本,只返回带校准概率的类型化决策:Choice(在最多 255 个选项中选一)、Score(在指定区间内打分)、Noul(校准过的布尔概率)。没有散文、没有 JSON 字符串、没有解析、没有 try/except 处理格式错误。你拿不到不符合 schema 的输出,因为 schema 就是 API。

Jev 到底是什么

TypeSafe AI 是旧金山创业公司,由 Diogo Almeida(OpenAI RLHF 的共同发明人之一)与 Erik Gafni、Sasha Sheng 联合创立。2026 年 9 月 15 日,他们结束了两年隐身状态,推出 Jev,公司已获 DCVC 领投的 $4,000 万美元种子轮融资。公司把 Jev 称作 System One Model(系统一模型),借用了 Kahneman 心理学里"快思考"的概念,并把它和聊天式 LLM 做了明确切割 —— 后者用 RLHF(Reinforcement Learning from Human Feedback, 用人类反馈做强化学习)或 RLVR(Reinforcement Learning from Verifiable Rewards, 用可验证奖励做强化学习)训练。

Jev 用的是 RLCD(Reinforcement Learning for Calibrated Decisions, 校准决策强化学习) —— 目标不是让人类偏好最大化,也不是让可验证任务刷分,而是让模型输出的概率"在认识论上诚实":Jev 说 70% 置信,那大约 70% 的相关预测就应当真的正确。这才是路由系统真正用得上的属性 —— 概率高就自动执行,概率低就升级到人,不存在"模型自己不知道自己在胡说"的风险。

三个原语能覆盖大部分营销决策场景:

  • Choice —— 从你定义的列表里挑一个(路由到 billing / technical / sales
  • Score —— 在指定数值范围内打分(线索质量 0–100、品牌安全风险 0–10)
  • Noul —— 校准过的布尔概率("这条评论有毒吗?""这个 CTA 和落地页文案对得上吗?")

你把非结构化的状态(文本、JSON、数组)和问题列表发给 Jev。Jev 在一次并行调用里返回所有问题的答案。端到端延迟 70–500 毫秒,对比 TypeSafe 引用的前沿模型 3–329 秒;定价 $0.042/百万输入 token,输出 token 免费

头条数字,及它们的星号

TypeSafe 声称 比前沿 LLM 快 40–200 倍、成本低到 1/444。在自己公布的四套 workflow 评测里,速度提升 193.6 倍、成本降低 444.6 倍。

在你围绕这些数字重构技术栈之前,有三个 caveat 必须看清楚:

  1. 评测 workflow 是 TypeSafe 自己的 capabilities team 写的。 评测里的"准确率"指的是和参考答案(GPT-6 AstraClaude Fable 5.1 输出结果的均值)的吻合度。数字天然对自己有利。
  2. TypeSafe 自己承认定价可能是补贴价。 官方公告原文是"我们暂时无法证明这个价格不是上线促销价"。把现在的成本当作地板,不要当作天花板。
  3. "不会幻觉"指的是 schema 合法,不是语义正确。 一个格式合规的 billing 路由决策,仍然可能把工单送到错误的部门。schema 保证挡住了解析错误,挡不住路由错误。

在 TypeSafe 自己公布的评测图上,Jev 大约 68% 的准确率 —— 持平 GPT-5.6 Terra 和 Sonnet 5,而成本只是它们的几十分之一。准确率最高的几档(OpenAI 的 Sol 和 Anthropic 的 Opus 5 workflow 模式)依然领先好几个点。Jev 的胜场不是绝对准确度,而是有界决策上的 accuracy-per-dollar

5 个营销场景,今天就能交给 Jev

下面这些位置,我会先用 Jev 替代 LLM 那一跳:

  1. 客服工单 / 入站邮件路由。 就是我上面那个 Make.com 场景。把 Claude 那一步换成 Jev,180 毫秒拿到每个部门的概率分布。把置信度最低的那一档路由到一个 LLM 升级通道。
  2. CRM 里的线索质量评分。 把线索记录和 5 题评分规则一起发过去,Jev 返回每个维度(匹配度、意向、近期度)的 0–100 分和置信度。置信度高的今天就推给销售,置信度中等的下周再说,置信度低的根本不要碰 —— 边界线索可以再交给 Gemini 评分工作流 做二次校验。
  3. UGC 和广告评论的审核分流。 定义 safe / review / remove 三档,再加一个 0–10 的 toxicity_scoresafe 直接发,review 推人工队列,remove 直接压住。这是 Vercel 工程师 Pranit Sharma 在生产环境里把 ChatGPT Luna 5.6 换掉的那个场景 —— 比原来快 5–18 倍,准确率也更高。
  4. A/B 测试的赢家判定。 跑了 48 小时之后,把两个版本的指标和一个定义好的决策问题(ship_a / ship_b / wait)一起发给 Jev。配合 75 条广告的创意测试矩阵,每个实验都能拿到自动判决。
  5. 实时模型路由器。 客户消息进来时,问 Jev:needs_chat_agent / needs_drafting / self_serve_kb。如果 self_serve_kb 的置信度 ≥ 0.85,直接甩知识库文章,不调 LLM;如果 needs_chat_agent,路由到你的 Lindy AIChatGPT Work agent。这是目前我见过的最便宜的"在不丢质量的前提下砍掉 LLM 账单"的办法 —— 该贵的请求才让它贵。

贯穿这五个场景的共性:决策形状有界、错了能补救。Jev 不适合需要散文、需要结合上下文做判断、需要说服力的场景。

留在普通 LLM 上的三类工作

三类任务不要往 Jev 上搬:

  • 品牌口吻的文案。 没有字符串就没有声音,留给 Claude Sonnet 5 或 Opus 5
  • 客户回复和 CRM 叙事。 任何要给人读的文本。
  • 战略综合。 长上下文推理依然是 Fable 5.1GPT-6 Astra 的活。

路由原则

把 Jev 当成 decision co-processor(决策协处理器),不是替代模型。流水线里凡是最后落到"一个路由标签、一个分数、一个 yes/no"的步骤,先走 Jev;凡是最后落到散文、对话、综合的步骤,留在你原本的 OpenRouter 轮换里。把 Jev 接到你的 OpenClawn8n agent 的最前端,让它决定下游模型 —— 如果有下游的话 —— 到底该不该被调用。

未来 60 天的几个观察点

  • 定价能不能站稳。 TypeSafe 自己说暂时无法证明当前价格不是上线补贴。如果输入价从 $0.042/MTok 涨到 $0.42/MTok,Jev 的价值主张会缩水一半。
  • CJK 准确率。 TypeSafe 官方文档明确写了:英文是主要训练语言,"包括中文、日文在内的其他语言虽然支持,但没有同等水平"。任何中文或日文 workflow,上线前先跑一轮 200 题的校准测试再谈信任。
  • 独立 benchmark。 截至发稿,公开评测全部来自 TypeSafe 内部。等一个独立第三方对比(Mike Taylor 在 Every 的实测是第一份独立信号)出来之前,不要把关键路径赌上去。
  • LangChain 集成 9 月 18 日上线。 如果你已经在用 LangChain,langchain-typesafe 包可以直接把 Jev 当作 agent harness 里的 guardrail 层塞进去 —— 实用,但不是颠覆性的。

Jev 现在在 early access 阶段,需要排队申请。接口只有一个端点(POST /v1/systemone),model 字段填 jev-1.13.0。发明 RLHF 让 ChatGPT 诞生的那帮人,现在赌的是 AI 的下一个大市场是机器对机器的决策,定价像电力。如果你的路由逻辑今天还活在 prompt 里,Jev 就是那个让你把它搬进代码、价格又便宜到你不再纠结"该不该调一下"的模型。