Hugging Face 与 Cerebras 让 Gemma 4 的语音交互变得像真人聊天一样流畅自然
- 现在的语音 AI 不笨,就是慢。说完一句要卡几秒,聊天不像跟人说话。
- Hugging Face 和 Cerebras 把最慢的那一环换成了极速推理硬件,每秒吐 1851 个字,是普通 GPU 的 35 倍。
- 但现在豆包、GPT-Live、Gemini Live 都是端到端全双工,能边听边说、听得出语气。这套是四段接力、半双工,聊天节奏比不过。
- 它的价值在另一头:四段全开源、每段可换,能整条搬回自己机器断网跑,中间那层文字你拿得到。
- 为了补上节奏差距,它不等你说完就抢先想答案,猜错了整段重来。默认那套识别只认 25 种欧洲语言,中文要另配。
语音 AI 现在卡的是速度
模型的水平早就够用了,答得也对。真正卡住体验的是延迟:你说完一句,它要停几秒才出声。一来一回都这样,对话就僵,不像在跟人说话。
更难受的是它时快时慢。十次里九次一秒出头,第十次拖到三秒,你以为它没听见,又说了一遍,结果两个人一起开口。工程上量的就是这个:一百次响应里最慢那几次有多慢,叫 P95 延迟。平均值好看没用,卡顿感全是那几次给的。
像跟一个反应慢半拍的人打电话。他不笨,答得也对,但每句话之间那几秒空白让你没法正常聊天。
他们把最慢的那一环换掉了
先说清楚 Cerebras 是谁,不然「35 倍」这个数字没法判断真假。
它是一家做 AI 芯片的公司,路子跟英伟达不一样:别人把一整张晶圆切成几百颗芯片再拼起来用,它干脆不切,整张晶圆做成一颗巨大的芯片。好处是数据不用在芯片之间来回搬,模型权重直接放在片上内存里,读取快得多。这套东西训练模型不占优势,但拿来做推理,也就是让已经训好的模型吐字,速度非常快。它这几年做的生意主要就是卖这个速度。
语音 AI 从听你说到开口回答,要过四道工序。四道里最慢的是中间那道,模型想答案。前后三道再快也被它拖着。
Hugging Face 和 Cerebras 的做法是把这道工序交给 Cerebras 的推理硬件,模型用的是 Google DeepMind 开放权重的 Gemma 4 31B。
四道工序各跑一个线程。除了中间那道默认走网络,其余三道都在本机跑
快了 35 倍,那几次特别慢的卡顿也跟着没了。这是 P95 延迟改善的直接来源:想答案这道工序的耗时被压到很小,整条链的波动自然就小。
他们还顺手关掉了模型的「思考」,接入命令里带着 --responses_api_reasoning_effort none。同一个模型拿去写代码时开着思考更聪明,拿来聊天时关掉才跟得上语速。
Gemma 4 31B 站内写过两回。这次它换了个身份出场:一条开源管线里随时能拆下来换掉的那颗大脑。
那几家的模型你带不走,这套你能
要看懂这套东西的价值,得先分清它跟豆包、GPT-Live 根本不在一条赛道上。那几家比的是谁聊得更像人,这套比的是谁的东西归你。
先说那几家。实时双工语音早就不是新鲜事。豆包的语音模型从 2.0、3.0 起就能实时双工对话,今年 4 月又上了原生全双工的 Seeduplex,在 App 里全量;OpenAI 7 月发布 GPT-Live,边听你讲边回应;Gemini 的 Live 接口更直接,声音进、声音出,中间根本没有识别、大模型、合成这三道工序。