2026-09-16 · 来源:{'name': 'Google Blog', 'url': 'https://blog.google/innovation-and-ai/technology/developers-tools/build-real-time-voice-applications-gemini-audio/'}

Google 最新 Gemini 语音双模型 Gemini 3.8 Live 与 Gemini 3.5 Transcribe,今日起可通过 ai.studio/live 体验,瞄准实时语音应用开发者。
Google 把 Gemini 模型家族中两位面向语音的新成员交到了开发者手上:Gemini 3.8 Live 与 Gemini 3.5 Transcribe。该公司在其博客的开发者工具版块中宣布,这两款模型明确瞄准实时语音应用的构建,而且 Google 的行动号召毫不含糊——今天就可以通过 ai.studio/live 上手体验。
这一组合像是一套刻意设计的双层技术栈。'Live'之名指向实时音频交互——即让应用能够即时响应语音所需的对话层;而'Transcribe'则点明转写层,负责把语音音频转换为文字。两款模型在一份关于实时语音应用的公告中并列登场,意味着开发者只需一个供应商,就能凑齐语音管道中'听'与'写'的两半。
分发渠道本身也在传递信息。Google 没有让开发者绕道独立的产品页面,而是直接把他们引向一个地址——ai.studio/live,让 Studio 环境成为动手体验的第一站。对于评估在生产环境中采用语音界面的团队来说,这条入口被刻意做得毫无摩擦:公司给出的邀约就是'今天就来试试'。
对 AI 算力受众而言,这次发布与其说是一条重磅模型上线的头条,不如说是一个标示 Gemini 家族走向的信号:更深地切入专业化、对延迟敏感的模态。实时语音属于对推理要求最苛刻的工作负载之一——音频持续流入,响应即刻返回——而此类模型每向普通开发者开放一步,都在为数据中心规划者和加速器采购者所追踪的需求图景加码。如今,Google 已把这种工作负载变成了开发者的标配供给。
萬安算交所 AIXX · 算力硬件实名会员制交易平台 · 进入货源大厅