AI Tools

Claude Fable 5.1 营销人上手一周:75% 缓存读取降价、长期上下文代理的胜利,以及今晚必须修的 400 报错

Claude Fable 5.1 营销人上手一周:75% 缓存读取降价、长期上下文代理的胜利,以及今晚必须修的 400 报错

Fable 5.1 上手五天(9 月 1 日发布),对营销人最重要的那条新闻,不在任何跑分表上。是缓存读取价格——降到 0.25 美元每百万 token,降幅 75%。这改变了哪些 agent 循环值得做。品牌指南文档、风格手册、40 万 token 的内容档案,现在可以跨数百轮 agent 循环保持开启,成本只有原来的四分之一,而不是被 RAG 切片硬塞进预算。标价(1000 万 token 输入 10 美元、输出 50 美元,跟 Fable 5 一致)把这个变化盖住了。

简单介绍一下 Fable 5.1:Anthropic 最新前沿模型,排在 Opus 5 之上。知识截止日期 2026 年 6 月——所有 Claude 模型里最新的。上下文 105 万 token 输入 / 12.8 万 token 输出,整个窗口不收长上下文溢价(不像 GPT-6 Astra 在 27.2 万 token 以上输入收 2 倍、输出收 1.5 倍)。永远开启自适应思考,延迟"较慢",约 53 token/秒,首字延迟约 3.1 秒。文本、图像、PDF 输入;文本输出。30 天数据保留是强制的——除非另有授权,否则不能走零保留方案。

Anthropic 自己的定位建议:先用 Opus 5;只有 Opus 5 高算力也不够时,才换 Fable 5.1。 这不是委婉,是成本路由指令。Fable 5.1 标价是 Opus 5 的 2 倍,只在更窄的一类工作上划得来。

本周我切到 Fable 5.1 的四个工作:

  1. 多轮品牌上下文 agent。 把 80 页品牌声音手册和 12 个月的归档内容丢进提示词上下文。让 agent 跨 200+ 轮起草 50 条 LinkedIn 动态、Notion 页面、newsletter 变体。品牌文档每轮都要重读,新的缓存读取价让这个循环成立——5.1 之前,同样的循环到第 30 轮就烧穿预算了。
  2. 整季度活动综合分析。 "读完 Q3 所有活动 brief 和创意素材,写出复盘。" 单会话 105 万上下文,不用切片、不用 RAG 来回调用。整个窗口内定价不变,我不会因为真的用上上下文而被惩罚。供应商报告的判官偏好对比 Fable 5 是 2:1,在知识工作产出物上。
  3. 从高密度 PDF 产出文档。 Fable 5.1 的视觉模型专门针对图表和密集页面做了调优。丢一份 200 页的分析师报告,让它把每家厂商的对比字段抽到 Notion 表,然后起草执行摘要,再产出 12 封跟进邮件。单会话。OSWorld 2.0(77.9%,Fable 5 是 72.9%)和 GDPval-AA v2(1853 Elo,#1,Opus 5 是 1824)的提升都体现在这里。
  4. 长上下文召回。 "读完这 1000 份客户访谈转写,告诉我反复出现的五个痛点是什么。" 105 万 token 单会话在召回上胜过切片 RAG 流水线,而新的缓存读取价让你迭代提示词时不会被账单劝退。

两个继续留在 Opus 5、Sonnet 5 或 Haiku 4.5 上的工作:

  1. 大批量短文本。 每周 100+ 个 RSA 候选、邮件标题生成、社媒文案刷新。延迟比峰值质量更重要。Fable 5.1 的"较慢"评级和约 3 秒的首字延迟会拖累交互体验。Opus 5 或 Sonnet 5 更合适;低风险场景下 Haiku 4.5 成本只有十分之一,够用。
  2. 实时聊天窗口和 Slack /research 命令。 同样的原因——3 秒首字延迟会打断来回节奏。继续走更快的层级。

本周必须修的三个 API 不兼容变更。 这一段如果不读,你现有的流水线会悄无声息地挂掉。

  1. tool_choice: anytool 现在直接返回 400。 你的管线强制 JSON 输出或指定工具调用,会静默失败。换成 auto + 显式指令、strict: true,或结构化输出。今晚就测一遍。
  2. 思考块是模型绑定的。 旧模型读不到 Fable 5.1 的思考块。如果你的管线把推理历史穿过老模型检查点,请求会失败,或推理会被丢弃。
  3. 编辑早前的轮次会让思考块失效。 如果你的 agent 修改了前面的步骤,那一轮的思考上下文就没了。重跑必须从头开始——多出来的延迟和成本你要算进去。如果你在搭带编辑能力的 agent,提前预留这块预算。

路由原则,跑了一周之后:让 Fable 5.1 读那些一直打开的东西;让 Opus 5 写那些要发出去的东西。 凡是你的 agent 在一个会话里重读 40 万 token 上下文超过 10 次,Fable 5.1 的缓存数学更划算。结尾是"产出一份 200 字 brief 然后发出去"的,Opus 5 仍然是更对的选择;短交互工作交给 Sonnet 5 或 Haiku 就行。

更大的图景。Anthropic 比 GPT-6 Astra 早五天发布了 Fable 5.1,标价一样(10/50 美元),但成本曲线明显不同。在 200 轮 agent 会话上,算上缓存读取,Fable 5.1 比 Astra 便宜约 32%。这两个不是替代品,是互补品。Fable 5.1 是长上下文、持久上下文那一层;Astra 是 Computer Use、浏览器驱动那一层。同时用上两者的营销人真正要回答的路由问题是:每个表面对应的最佳选择是什么,成本曲线到底重叠多少。

本周大多数人的答案:Astra 管"表面",Fable 5.1 管"持久上下文",Opus 5 管"文字",Sonnet 管"交互"。 然后今晚把三个 API 不兼容变更修好,在明早 9 点 Slack 报警之前。