谷歌正式推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking,全球端到端语音天梯榜随之易主。

Gemini 3.8 Live Extended Thinking (High) 以综合评分 82.6 登顶,击败 OpenAI GPT-Live-1 (Astra)。价格方面,标准版每小时语音仅需 $0.84(全网最便宜),顶配思考版 $3.50,仅为 OpenAI 实时 API 的三分之一。

需要注意图中拿 High 档位的 Gemini 去比 Medium 档位的 OpenAI Astra——原因是 OpenAI 的高思考实时 API 极度昂贵且限额严重,评测机构只能拿同价位或现有稳定开放档位横评。但 Gemini 靠着更低的价格跑出了超越对手顶模的战力,算力性价比已可见。
核心数据一览
Gemini 3.8 Live 标准版:输入音频每小时仅 $0.84,直接腰斩上一代,成为全球工业界最廉价的商用实时语音大模型。
Gemini 3.8 Live 顶配思考:每小时 $3.50,比 OpenAI 便宜 40%~60%(Sol $4.47、Astra $5.83),更是只有 GPT-Realtime 2.1($10.75/小时)的三分之一不到。
语音 Agent 执行力(Tau Voice 权威基准):Extended Thinking 斩获 68.6% 历史最高分,击败 Astra Medium (67.9%) 与 Grok (56.5%),相比上一代 3.1 Flash (37.7%) 实现了翻倍式跳跃。
盲测人类偏好(Arena Elo):标准版 3.8 Live 凭借自然度拿下 Elo 1083(第二),任务成功率达 93.2%;Extended Thinking 因打字/推演语速策略,Elo 降为 990。
首字音频延迟(TTFA):标准版 1.18s、深度版 1.35s,相比老一代 3.1 Flash(2.99s)提速超过一倍,持平 OpenAI(1.24s~1.34s),略输 Grok(0.70s)。

"小脑对话、大脑计算"双轨架构
官方 Demo 聚焦"实时编程私教(Programming Tutor)":实时看开发者在 IDE 里的屏幕敲击,无需打断用户输入流,在后台静默分析 AST 语法树和报错,同时开口进行渐进式引导教学。
3.8 Live 负责下沉普及做"秒级修水管/修自行车的白菜价日常眼睛",而 3.8 Live Extended Thinking 则负责升维死磕"边想边自言自语汇报进度的长程 Agent 总监"——在后台静默调用工具、跑高强度深度思考的同时,嘴上不停顿地向你实时解说进度,消灭了以往 AI 调工具/深思考时令人窒息的数秒死机真空。
原生支持 97 种语言自动语种切换识别,中文(普通话)作为 Google 核心 Tier-1 语种全面覆盖。支持双向即时语种穿梭,甚至支持在 3.5 Transcribe 里注入 1000 个行业黑话/专属名词,字错率降至 2.6%~4.0%。

此前的实时语音助手一旦触发写代码、搜索或调 Tool,语音流必须强行掐断、静音死等几秒甚至十几秒。3.8 引入类似人脑的"小脑对话、大脑计算"双轨架构——前端以近乎零延迟的多模态视觉和自然语言陪聊,后台并行执行代码编译、复杂数学推演,并实时以口语化叙事推进状态,把"等待延迟"直接无缝伪装成了"人类边敲键盘边跟你碎碎念解释"。
五大面向企业级的杀手级 API 能力
- 异步函数调用:一边继续向用户流式吐音频,一边在后台悄悄触发外部业务 API,无需阻塞整个音频管线
- 字母数字精准识别:专攻客服和工业痛点,彻底解决以往语音模型听不清"快递单号、验证码、保单号、UUID"的难题
- 流式增量注入:将实时音频与结构化 JSON 数据库无缝融合返回
- 人格调整:为了压榨低延迟和任务完成率,Google 在后训练中对 3.8 施加了更强的人格约束和更紧凑的会话截断保护

目前,模型已同步在 Gemini App(消费者端)与 Google AI Studio(API 开发者端)全量上线。