深度 · 小互解读

Hugging Face 与 Cerebras 让 Gemma 4 的语音交互变得像真人聊天一样流畅自然

它跟豆包、GPT-Live 不在一条赛道:那几家的模型你只能租,这条链四道工序全是 Apache 2.0,可商用可改可搬回自己机器;代价是聊天节奏比不过。
一分钟速览
  • 现在的语音 AI 不笨,就是慢。说完一句要卡几秒,聊天不像跟人说话。
  • Hugging Face 和 Cerebras 把最慢的那一环换成了极速推理硬件,每秒吐 1851 个字,是普通 GPU 的 35 倍。
  • 但现在豆包、GPT-Live、Gemini Live 都是端到端全双工,能边听边说、听得出语气。这套是四段接力、半双工,聊天节奏比不过。
  • 它的价值在另一头:四段全开源、每段可换,能整条搬回自己机器断网跑,中间那层文字你拿得到。
  • 为了补上节奏差距,它不等你说完就抢先想答案,猜错了整段重来。默认那套识别只认 25 种欧洲语言,中文要另配。
联合发布内容,速度数字为其引用的第三方测试;机制细节取自公开仓库源码。
痛点

语音 AI 现在卡的是速度

模型的水平早就够用了,答得也对。真正卡住体验的是延迟:你说完一句,它要停几秒才出声。一来一回都这样,对话就僵,不像在跟人说话。

更难受的是它时快时慢。十次里九次一秒出头,第十次拖到三秒,你以为它没听见,又说了一遍,结果两个人一起开口。工程上量的就是这个:一百次响应里最慢那几次有多慢,叫 P95 延迟。平均值好看没用,卡顿感全是那几次给的。

这么理解

像跟一个反应慢半拍的人打电话。他不笨,答得也对,但每句话之间那几秒空白让你没法正常聊天。

方案

他们把最慢的那一环换掉了

先说清楚 Cerebras 是谁,不然「35 倍」这个数字没法判断真假。

它是一家做 AI 芯片的公司,路子跟英伟达不一样:别人把一整张晶圆切成几百颗芯片再拼起来用,它干脆不切,整张晶圆做成一颗巨大的芯片。好处是数据不用在芯片之间来回搬,模型权重直接放在片上内存里,读取快得多。这套东西训练模型不占优势,但拿来做推理,也就是让已经训好的模型吐字,速度非常快。它这几年做的生意主要就是卖这个速度。

语音 AI 从听你说到开口回答,要过四道工序。四道里最慢的是中间那道,模型想答案。前后三道再快也被它拖着。

Hugging Face 和 Cerebras 的做法是把这道工序交给 Cerebras 的推理硬件,模型用的是 Google DeepMind 开放权重的 Gemma 4 31B。

① 听你开口没 Silero VAD v5 本机 ② 把话转成字 Parakeet TDT 本机,共 6 种可选 ③ 想答案 最慢,卡顿出在这 Gemma 4 31B 跑在 Cerebras 可换任意兼容服务 ④ 把字念出来 Qwen3-TTS 本机,共 5 种可选 你说话 它开口

四道工序各跑一个线程。除了中间那道默认走网络,其余三道都在本机跑

Cerebras
1851
典型 GPU 端点
≈ 53

单位为每秒输出的字数。1851 由 Artificial Analysis 测得;典型 GPU 端点这一栏按「35 倍」反推,为示意值

快了 35 倍,那几次特别慢的卡顿也跟着没了。这是 P95 延迟改善的直接来源:想答案这道工序的耗时被压到很小,整条链的波动自然就小。

他们还顺手关掉了模型的「思考」,接入命令里带着 --responses_api_reasoning_effort none。同一个模型拿去写代码时开着思考更聪明,拿来聊天时关掉才跟得上语速。

官方实机演示,可以听一下它接话的节奏。来源 Hugging Face 博客配套素材

Gemma 4 31B 站内写过两回。这次它换了个身份出场:一条开源管线里随时能拆下来换掉的那颗大脑。

站内相关
Gemma 4 技术报告:开源模型怎么用「小参数 + 会思考 + 省内存」硬碰大模型
这颗大脑本身是怎么做出来的。想知道 31B 凭什么扛得住这条链,从这篇看起。
站内相关
LiveKit 针对 Gemma 4 31B 进行优化,在实时语音方面比 GPT-4.1 快 5 倍、成本六分之一
同一颗模型、同样奔着实时语音去,LiveKit 走的是自己优化推理那条路,可以跟这条四段接力的管线对照着看。
背景

那几家的模型你带不走,这套你能

要看懂这套东西的价值,得先分清它跟豆包、GPT-Live 根本不在一条赛道上。那几家比的是谁聊得更像人,这套比的是谁的东西归你。

先说那几家。实时双工语音早就不是新鲜事。豆包的语音模型从 2.0、3.0 起就能实时双工对话,今年 4 月又上了原生全双工的 Seeduplex,在 App 里全量;OpenAI 7 月发布 GPT-Live,边听你讲边回应;Gemini 的 Live 接口更直接,声音进、声音出,中间根本没有识别、大模型、合成这三道工序。