DeepSeek V4 Flash Vision Exp 营销人实测:V4 系列首个原生视觉端点,5 个能天天跑、3 个仍该留在 Opus 4.x 上的活儿
目录
昨天下午两点,我在给一个客户做 PMax 素材审计——240 张图片素材,需要每张都标出:展示的是哪个产品、文字叠加层是什么文案、CTA 是什么、是否和库里其它素材重复。这一年下来,这活儿用 Opus 4.x 大概要 40 分钟。昨天下午用刚出的 DeepSeek V4-Flash-Vision-Exp,22 分钟跑完,花了大约一毛钱,输出直接能用。同样的"该审的还要审"。价格大概是原来的 1/30。
两天前——2026 年 8 月 21 日——DeepSeek 把 V4-Flash-Vision-Exp 推上了他们的 API(model=deepseek-v4-flash-vision-exp)。官方标注为"实验性质",是 V4 系列里第一个原生视觉端点,DeepSeek 自己的更新日志说,它的多模态 Agent 基准已经接近 Opus 4.8。定价与纯文本版 V4-Flash 完全相同。视觉,第一次变成了 Flash 一档的成本,而不是 Opus 一档的成本。
下面是我会把哪些活儿交给它、哪些仍留在 Opus 4.x、以及在它还是实验版时唯一要盯紧的注意点。
这次发的是什么
三个 API 入口,首日全部可用:
- Chat Completions(兼容 OpenAI)
- Messages(兼容 Anthropic)
- Responses
三种传图方式:base64 内联、公网 URL、以及新出的免费 Files API——上传一次,通过 file_id 多次复用。支持 JPEG、PNG、GIF、WebP。单张图片最多按 384 token 折算,所以一张截图不会把你的上下文预算撑爆。上下文窗口 1M token,最大输出 384K。工具调用、JSON 模式、结构化输出全部接好。
纯文本能力与 V4-Flash 正式版完全持平——同样的 Agent 表现、同样的推理、同样的世界知识。DeepSeek 宣称真正飞跃的是需要视觉的 Agent 基准。官方更新日志给出的数字:
- Terminal Bench 2.1:83.9
- Chartography:64.3
- DeepSWE:59.3
- DSBench-Hard:63.6
- ZeroBench(Pass@5):35.0
注脚:在我查资料的这个时间窗口内,这些数字还没上 Artificial Analysis 或 LMArena 的独立排行榜。先按厂商自报处理。等独立评测用同样的图跑一遍,我们才知道 64.3 的 Chartography 是不是真的能站住。模型上线的同一天,DeepSeek Harness 推送了 v0.1.1-rc.1,原生支持多模态——这套框架是什么、能干什么、还不能干什么,在我之前写的 DeepSeek Harness 营销人实测 里讲过。
成本那点事
和 V4-Flash 同价。这就是重点。如果你已经在按 V4 峰谷定价那篇 那样把 V4-Flash 路由到谷值时段,视觉等于零额外成本——一张图最多 384 token,加进账单里就是几毛钱人民币的事。
OpenRouter 上的国际版定价是 $0.44/M 输入、$1.32/M 输出(OpenRouter 一套钥匙打 300+ 模型的工作流)。对比 Opus 4.x 一档 $15/$75 每百万 token,这个差距是实打实的。我开头那个 240 张图的 PMax 审计,跑下来不到 $0.10——同样的活儿用 Opus 要贵 25-30 倍。
5 个今天就可以天天跑的活儿
以下是视觉能力配上 Flash 定价,值得每天跑一轮的工作流。
1. PMax 素材规模化审计。 我开头那个场景。把 200-500 张广告图丢给 DeepSeek,让它标出产品类型、文案叠加层、CTA,以及近似重复。每张图约 384 token;谷值时段,整个审计几块钱人民币。Opus 在这件事上本来也是杀鸡用牛刀。
2. 竞品落地页截图转规格文档。 把竞品定价页截图丢进 Files API,让它输出章节结构、主视觉文案、社会证明模式、CTA 层级。直接拿去给你的设计师做简报。这套审计模式和我用 Computer Use 跑过的流程一致——可参考 Screaming Frog + Claude 抓取分析 那篇爬虫侧的同类工作流。
3. Slack 截图分诊。 同事们整天往你的 Slack 贴仪表盘、报错、奇奇怪怪的 UI 状态。把 Files API 接到 Slack 监听器上(把 Reddit 监听代理 的源频道换掉),让模型分类:bug 报告 / 数据异常 / 广告创意问题 / 忽略。便宜到一天跑 5 次都不需要开会批预算。
4. 图表转表格。 从客户发的 Looker 截图或 Tableau 仪表盘里把数字抠出来,对方没给 API 也能用。专治"他给我发了张 PNG 而不是一个 CSV"。
5. 视觉品牌审计。 把最近 20 条 Instagram 帖子丢进去,让它输出色板漂移、字体一致性、Logo 处理方式的差异。输出是一页纸的审计,以前这事要花品牌策略师一下午。
3 个仍该留在 Opus 4.x 上的活儿
Flash 价位的视觉有它的取舍。下面这几件事,我还是愿意付 Opus 一档的费用。
1. 大量图片的对比。 "把这 12 个竞品落地页放一起,告诉我规律是什么。"Opus 一档在多图同时保留视觉+文本上下文上仍然更稳。DeepSeek 处理一两张没问题;再多几张,答案就脆了。
2. 拒答敏感的图像分析。 受监管的行业——药品宣传语、金融免责声明、儿童向内容。Opus 一档的拒答控制更紧。Vision-Exp 还是实验版,把它当草稿材料,不要直接当可发版成品。
3. 视觉本身就是品牌的广告创意。 工作重点是细颗粒度的审美判断——"这张主视觉是否和参考情绪板的情感重量一致"——这种情况下 Opus 还是赢。DeepSeek 会描述;Opus 会感受。
它在轮换表里的位置
国际读者,最干净的入口是 OpenRouter——同一个 API Key,model ID 是 deepseek/deepseek-v4-flash-vision-exp。国内读者和峰时路由,用 DeepSeek 官方 API + 谷值时段排程。这个模型也接进了刚更新的 DeepSeek Harness 0.1.1-rc.1——如果你已经在跑 Harness 的 Agent 栈,什么都不用改,直接多模态。
我今天的轮换表是这样的:
- 规模化截图审计 → Vision-Exp 谷值时段
- 需要稳定性的视觉 Agent 基准类任务 → Opus 4.x 一档
- 纯文本 → V4-Flash 谷值时段
- 视觉 R&D 和情绪板判断 → Opus 4.x 或 Sonnet 4.6
唯一要盯紧的注脚
"实验性质"是 DeepSeek 自己用的词。模型 8 月 21 日才上,基准是厂商自报,Files API 刚推出,峰谷定价才生效一周。这四件会动的东西里,三件会在未来 30 天稳定下来;定价是其中我最会盯的那一件。
如果你打算把任何营销生产流量路由到它,先做这一件事:拿 100 张图在 Vision-Exp 上跑一遍审计,在 Opus 4.x 上跑同样的审计,比一比输出差距是否值 30 倍的成本。多数我手上的活儿,不值。品牌判断类的活儿,值。
视觉以 Flash 价位跑出来才是这次真正的解锁。在 V4-Flash-Vision-Exp 出现之前,你 Agent 栈里的每一张截图要么花 Opus 的钱,要么干脆跳过。现在一张截图一毛钱人民币。这不是一个"AI 又要革命了"的故事——这是一个单位经济学的故事。以前因为每张截图的成本让人不愿自动化的那些营销活儿,现在都可以自动了。这才是值得盯紧的部分。