Grok 语音智能体搭建器:营销人该派它做的 5 类活儿和不该交的 3 类
目录
周五早上,一位 SDR(销售开发代表)打电话请了病假。到 10:15,我客户的收件箱里已经堆了 47 条没人处理的 demo 申请,日历像被打了孔的纸一样千疮百孔,唯一能接电话的人是增长负责人——而她本来应该跟手头那笔单子收尾。所以我做了一件 2024 年还会觉得疯狂的事:我把一个 Grok 语音智能体接到了那位 SDR 原来用的同一份日历、同一个 CRM、同一份"我们卖什么"页面,让它接了 4 个小时的呼入电话。到午饭时间,它筛完了 47 个里边的 31 个、约好了 22 个,只交回了 8 个它解决不了的。增长负责人继续安心收尾她的单子。没人分得清哪些电话是谁接的。
那个差距——"会说话的聊天机器人"和"能在你工具栈里真的动手做事的智能体"——就是 xAI 的 Grok Voice Agent 在营销团队身上真正改变的东西。它不是更聪明的 TTS(语音合成)工具。它是一个 WebSocket 端点(你代码和模型之间一条长期在线的双向通道),能在同一个会话里听、说、调用你的工具,支持 100+ 种语言、7 种内置声音、约 0.78 秒就开始回应。底层是一个为 full-duplex(双向同时通话——模型和你同时听同时说,像真人对话一样,不需要先转文字再合成语音那种串联往返)训练过的 Grok 3 模型。对营销人来说,这代表着本季度它能真正扛起来的一小批活儿,以及几件你绝对不该让它碰客户的活儿。
这东西到底是什么
产品是 Grok Voice Agent API,端点是 wss://api.x.ai/v1/realtime。它双向流式传输音频,由服务端做声音活动检测,提供三个可调参数(threshold、prefix_padding_ms、silence_duration_ms),自带 web_search、x_search、file_search,还配一个 @function_tool() 钩子让你可以把它接进自己的栈。浏览器和移动端用短期"client secret"代替直接的 API key。
营销场景里要留意的几个具体点:
- 七种声音:Eve、Ara、Leo、Sal、Rex、Mika、Valentin。每个智能体定一种,不要每轮都换——听多了耳朵会累。
- 100+ 种语言,通话中途可以自动切换。不用再为"西班牙语版本"维护一个独立智能体。
- 价格够透明到能算账:语音会话
$0.05/min,工具调用$5.00/1k次,搜索调用$2.50/1k次。叠上 LiveKit(一个实时语音部署平台)大概到$0.06/min上下。每个会话 30 分钟上限、每个团队 100 个并发——做容量规划时这俩数要放进计算器。 - 兼容,不是相同。xAI 整体上对 OpenAI Realtime 兼容,但事件命名不完全一样(例如
response.text.delta对应 OpenAI 的response.output_text.delta),所以"移植"并非零工。
对营销人来说,这一串事实翻译成人话就是:你搭一个 WebSocket 应用、接两三个工具,就有一个不吃午饭、不请病假、打电话成本差不多等于长途计费电话费的呼入电话智能体。
本季度我会交给它的 5 类活儿
1. 呼入 demo 或线索资质筛选。 这是最显然的那一类,也是我上面亲手测过的那一类。把它接到那位 SDR 原本用的同一份日历、CRM 和"我们卖什么"页面。它赢在那些无聊的小胜上:从不漏接电话、周五下午 5 点听起来不会带着情绪、问的资质问题永远是同一套同样的顺序。一旦对方回答里出现"我们是企业采购组",立刻把它交回给真人。
2. Webinar 和活动的再触达。 从 CRM 拉出没到场的人列表,给智能体一份回顾和一个 CTA,让它在活动结束一小时内回拨。数据上,"60 分钟内复访"比"次日邮件"的转化率显著更高——人类不想拨这种电话,是因为量太大、节奏太狠。
3. NPS(净推荐值)和购后调研。 5 个题的小问卷,没人想在邮件里读;但你打过去,很多人愿意聊两分钟。当天就把转写文本送到分析团队手里。
4. 多语种一线客服分流。 同一套部署接待英文用户的同时,也能接中文、德语、越南语用户,没有排队,没有"按 1 选英语"。它在某个明确的节点把对话交回人类。
5. 死过一遍的免费试用再激活。 把 ElevenLabs 风格的语音塞进再激活邮件是一部分;更要紧的是:一个语音智能体打给试用用户,陪着他们重新走一遍激活步骤,如果卡住了再约一次复访。配一个之前我搭的线索评分表,就是一个闭环。
我会拴住、不放手的 3 类活儿
1. 任何涉及谈判、给折扣或对外承诺的事。 语音智能体是可以被诱导的。它会报出一个页面里没有的折扣。让真人守在智能体和价格对话之间。
2. 任何涉及情绪激动、受监管或未满 18 岁来电者的事。 医疗、金融、未成年人。都不要碰。这既是伦理线,也是品牌风险线;翻车的样子都是同一个。
3. "催"类电话——催收、挽留、劝退。 这些得有人声去读现场。机器人能帮你省人头,但它救不了你——它本身就是用户取消订阅的理由。
"能不能给"和"不该给"之间那根线,是客户的情绪状态是否真的影响结果。如果是——B2B(企业对企业)谈判、监管业务、所有跟挽留相关的——就别放话让机器人接手。
90 分钟的无代码走一遍
90 分钟内想跑出能 demo 的东西?把每一步都做得无聊就行。
- 注册一个 xAI 账号,复制 API key(新号有 $25 免费额度)。
- 开 LiveKit Cloud 免费档。跑一次
lk agent create --secrets-file,里面只放一行XAI_API_KEY。 - 一个 Python 文件,定义一个
@function_tool(),输入是日历 URL,输出是开放时段。把智能体接到你已有的预约页 URL 和 CRM 的 webhook(CRM 暴露出来接收外部实时更新的那个接口)。 - 选一种声音。选一个脚本。用自己手机测 5 通,每一遍都录下来听。
- 加一条"转人工"分支——只要智能体撞上"谈价格、谈退款、连续四次听不清",就打你手机。
这不算生产可用。但这是"生产可用"之前能证明这个用例到底是不是真的那一段。
我的结论
真正新的是"智能体在闭环里,不是聊天机器人在闭环里"。真正被吹过头的是"让智能体把客户全打一遍"。对的做法,和两周前我推荐 ChatGPT Work 那篇一个口径:挑活儿,别挑工具。Grok Voice Agent 是处理通话流量里那一半无聊活儿的合适工具——资质筛选、再触达、调研、多语种一线。它不是处理那一半"人声本身就是产品一半"活儿的合适工具。跟更宏观的 Grok vs ChatGPT vs Claude vs Gemini 对比一样,赢的方法是为活儿挑模型——这里的活儿是"不用把 SDR 累垮也能跟陌生人说上话"。
0.78 秒首响、100 语种这套数字、跟 OpenAI Realtime 兼容这一整套事实,合起来只意味着一件事:"放到你网站上、够用的语音智能体"这道门槛今年掉了一大截。把这件事当成"可以裁掉人"的营销人,会重演每一波能力跳跃里那些冲得太猛的团队都演过的剧本——把"这门技术是真的"误读成"这门技术就是战略"。