谷歌把"思考"塞进实时语音:电话机器人终于不用再装傻了

2026年09月17日 | 来源:Dev.to
#GoogleDeepMind #Gemini #实时语音AI #推理能力 #电话智能体
过去几年,我们和语音 AI 打电话的体验,本质上是在跟一个反应极快、但从不思考的复读机对话。它能听懂"帮我订张机票",却永远搞不定"帮我改签到后天下午,但别动我那趟联程的第二段"。现在,谷歌决定让它先想一想再开口。

Google DeepMind 最近发布了一个在语音 AI 领域颇具分量的更新:Gemini 3.8 Live 以及它的伴生模式 Gemini 3.8 Live Extended Thinking。简单说,谷歌把此前只开放给非实时、纯文本 Gemini 模型的"推理能力",正式搬进了实时语音和视频 API 里。

这句话翻译成人话就是:实时语音 AI 终于可以"先想后说"了。

为什么"实时"和"推理"一直是两条平行线

要理解这次更新为什么重要,得先搞清楚实时语音 AI 长期面临的一个结构性矛盾。

传统的语音助手(包括早期的 Gemini Live)走的是"快通道":语音识别 → 意图理解 → 调用工具 → 生成回复 → 语音合成。整条链路被压缩到几百毫秒内完成,用户体验是"秒回",但代价是没有中间推理环节。模型只能做模式匹配式的浅层决策,遇到需要多步推导、条件约束、上下文权衡的任务,它要么硬答,要么答错。

而真正有"思考能力"的大模型(比如文本版的 Gemini、o 系列推理模型)走的是"慢通道":模型在给出答案前,会先生成一大段内部推理链(chain-of-thought),反复自我检查、拆解子问题、验证约束。这条路推理质量高,但延迟动辄几秒到几十秒——放在电话场景里,对方早就挂断了。

这就是行业里那个尴尬的"三难困境":低延迟、高质量推理、自然对话节奏,三者不可兼得。

Gemini 3.8 Live Extended Thinking 想做的,就是把这个三角往中间拉一拉。

Extended Thinking 到底改了什么

根据谷歌的说明,Gemini 3.8 Live Extended Thinking 允许开发者在实时会话中启用一个"扩展思考"模式。在这个模式下,模型面对复杂请求时,会先在内部进行推理,再输出语音响应。它不是把整个对话都变慢,而是按需触发——简单寒暄照旧秒回,复杂请求才进入"思考态"。

对开发者来说,这个能力通过 Live API 暴露,调用方式和现有的实时会话接口基本一致。一个示意性的伪代码大致长这样:

from google import genai
from google.genai import types

client = genai.Client(api_key="YOUR_API_KEY")

# 建立实时会话,启用扩展思考模式
config = types.LiveConnectConfig(
    response_modalities=["AUDIO"],
    thinking_config=types.ThinkingConfig(
        thinking_budget=2048,        # 内部推理的 token 预算
        include_thoughts=False,       # 是否把推理过程回传(调试用)
    ),
    speech_config=types.SpeechConfig(
        voice_config=types.VoiceConfig(
            prebuilt_voice_config=types.PrebuiltVoiceConfig(
                voice_name="Aoede"
            )
        )
    ),
)

async with client.aio.live.connect(
    model="gemini-3.8-live-extended-thinking",
    config=config,
) as session:
    await session.send_client_content(
        turns=types.Content(
            role="user",
            parts=[types.Part(text="帮我把周五的航班改到周六下午,"
                                   "但联程的第二段别动,另外确认行李额够不够")]
        ),
        turn_complete=True,
    )

    async for message in session.receive():
        if message.server_content and message.server_content.model_turn:
            for part in message.server_content.model_turn.parts:
                if part.inline_data:
                    # 播放返回的音频
                    play_audio(part.inline_data.data)

关键参数是 thinking_budget。它决定了模型在内部"想多久"——预算越大,处理复杂约束的能力越强,但端到端延迟也会上升。这是一个需要开发者根据业务场景自行调优的旋钮,而不是一个开箱即用的固定值。

下图展示了这套架构的核心流程差异:

实时语音 AI:传统路径 vs 扩展思考路径 传统 Live(快通道) 语音输入 意图匹配 直接生成 → 延迟低,但复杂任务易出错 Extended Thinking(按需思考) 语音输入 复杂度判断 简单 → 直接回复 复杂 → 内部推理 推理链生成 语音输出 核心变化:推理不再是文本模型的专利,实时会话中也能按需"想一想"。 代价:复杂请求的端到端延迟上升,需要开发者用 thinking_budget 权衡。

谁最该关心这件事:电话机器人开发者

这次更新最直接的受益者,是电话 AI 智能体(phone agents)这一类应用。

过去两年,客服、外呼、预约、催收等场景大量引入语音 AI。但落地时开发者普遍撞墙:用户一句话里塞了三四个条件,模型就崩了。比如:

这类请求的本质是条件分支 + 多步推理,恰好是浅层语音模型最不擅长的。而 Extended Thinking 让模型可以在开口前把这些约束在内部梳理一遍,再给出一个连贯的语音回应。

这带来的不只是准确率提升,更是交互范式的变化:语音 AI 从"指令执行器"变成"能处理模糊需求的助手"。

冷静一点:三个还没解决的问题

作为一篇有态度的分析,这里必须泼点冷水。

第一,延迟的账还没算清。 谷歌没有公布 Extended Thinking 模式下的具体延迟数据。推理 token 越多,首字响应越慢。在电话场景里,超过 1.5 秒的沉默就会让用户以为掉线。这个平衡点需要大量实测。 第二,成本会显著上升。 内部推理消耗的是实打实的 token。对于高并发呼叫中心,这意味着单次通话成本可能成倍增长。商业模式能不能撑住,是个真问题。 第三,语音的"思考"和文本的"思考"不完全等价。 文本推理链可以展示、可以校验,而语音推理是隐式的。一旦模型想错了,用户很难像看文字那样定位问题。可解释性在语音场景里反而更稀缺。

这是里程碑,但不是终点

把推理能力引入实时语音,方向毫无疑问是对的。它标志着语音 AI 从"语音版命令行"向"能对话的智能体"迈出了实质一步。谷歌这次的动作,很可能会倒逼 OpenAI、Anthropic 以及国内厂商加快在实时多模态推理上的布局。

但真正的分水岭不在于"能不能推理",而在于能不能在几百毫秒内完成高质量推理。谁先解决这个延迟与质量的矛盾,谁就拿下下一代电话智能体的入口。

Gemini 3.8 Live Extended Thinking 是这条路上的一个重要路标。它证明了可行性,但离"聪明到让人忘记对面是 AI",还有一段需要工程和算法一起啃的路。


信息源:Dev.to — "Google Adds Reasoning to Its Real-Time Voice AI, Opening the Door to Smarter Phone Agents"(https://dev.to/mikefluff/google-adds-reasoning-to-its-real-time-voice-ai-opening-the-door-to-smarter-phone-agents-5he8) 查看原文 ↗

📋 多平台草稿预览 (12平台差异化改编)

谷歌把"思考"塞进实时语音:电话机器人终于不用再装傻了

过去几年,我们和语音 AI 打电话的体验,本质上是在跟一个反应极快、但从不思考的复读机对话。它能听懂"帮我订张机票",却永远搞不定"帮我改签到后天下午,但别动我那趟联程的第二段"。现在,谷歌决定让它先想一想再开口。

Google DeepMind 最近发布了一个在语音 AI 领域颇具分量的更新:Gemini 3.8 Live 以及它的伴生模式 Gemini 3.8 Live Extended Thinking。简单说,谷歌把此前只开放给非实时、纯文本 Gemini 模型的"推理能力",正式搬进了实时语音和视频 API 里。

这句话翻译成人话就是:实时语音 AI 终于可以"先想后说"了。


"实时"和"推理",为什么一直是两条平行线

要理解这次更新为什么重要,得先搞清楚实时语音 AI 长期面临的一个结构性矛盾。

传统的语音助手(包括早期的 Gemini Live)走的是"快通道":语音识别 → 意图理解 → 调用工具 → 生成回复 → 语音合成。整条链路被压缩到几百毫秒内完成,用户体验是"秒回",但代价是没有中间推理环节。模型只能做模式匹配式的浅层决策,遇到需要多步推导、条件约束、上下文权衡的任务,它要么硬答,要么答错。

而真正有"思考能力"的大模型(比如文本版的 Gemini、o 系列推理模型)走的是"慢通道":模型在给出答案前,会先生成一大段内部推理链(chain-of-thought),把问题拆开、逐步推演,最后才输出结论。这条路走得更准,但更慢——放在文本对话里无所谓,用户等两秒也就等了;可放在实时语音里,两秒的沉默就是灾难。

所以过去几年,行业基本默认了一个取舍:要实时,就别要推理;要推理,就别指望实时。

谷歌这次做的事,就是在这个取舍上撬开了一道口子。


这次更新到底改了什么

Gemini 3.8 Live Extended Thinking 的核心思路,不是让模型"边想边说"地把推理链念出来——那只会让通话体验更糟——而是让模型在后台完成推理,再以语音形式给出结果。

也就是说,"思考"被藏进了实时链路里。用户听到的仍然是自然的语音回复,但在这句话背后,模型已经完成了一轮原本只有文本模型才有的多步推导。

这对电话智能体(phone agent)这类场景的意义尤其直接。过去语音 AI 处理不了的那些任务——改签同时锁定联程第二段、在多个约束条件下比价、根据对话中途变化的条件重新规划——本质上都不是"听懂"的问题,而是"想清楚"的问题。听懂一句话只要几百毫秒,想清楚一件事需要时间。谷歌现在把这段时间给了它。


为什么这件事值得关注

第一,它打破了一个被默认为"物理定律"的限制。实时和推理并非天然互斥,只是过去的架构没解决这个工程问题。一旦这条路走通,整个实时语音 AI 的能力上限会被重新定义。

第二,它把竞争焦点从"反应快不快"挪到了"想得对不对"。过去几年语音 AI 的比拼基本围绕延迟、打断处理、音色自然度展开,这些是体验层面的优化。而推理能力进来之后,比拼的是任务完成率——这才是电话智能体真正能不能商用的分水岭。

第三,也是最实际的一点:那些过去必须转人工的复杂通话,第一次有了被 AI 独立完成的可能。 客服、订票、改签、预约、账单争议,这些场景的共同点不是语音识别难,而是决策链条长。推理能力补上的,正是这一环。

当然,现在下结论说"电话机器人彻底翻身"还为时过早。Extended Thinking 在实时场景下的延迟表现、成本、以及在多轮对话中的稳定性,都还需要真实场景来验证。但方向已经清楚了:语音 AI 的下一个战场,不在嘴皮子上,在脑子里。


信息源:Dev.to 标签:#GoogleDeepMind #Gemini #实时语音AI #推理能力 #电话智能体

【0-5秒 黄金Hook】

打电话给AI客服,它永远听不懂人话,是不是气到想摔手机?

【5-15秒 痛点共鸣】

你让它改签机票,它只会说"好的帮您查询",然后给你转到人工。

为啥?因为它反应贼快,但压根不带脑子。

【15-30秒 谷歌出手】

Google DeepMind刚发了个狠东西——Gemini 3.8 Live Extended Thinking。

简单说,就是把"推理能力"塞进了实时语音里。

以前的语音AI走快通道,秒回,但只会模式匹配。

现在它能"先想后说"了。

【30-45秒 核心变化】

你再说"改签到后天下午,但别动我联程第二段"——

它能想明白条件、理清约束,再开口回你。

实时语音和推理能力,这两条平行线,终于被谷歌焊一起了。

【45-60秒 CTA】

以后接电话的AI,可能比真人还靠谱。

你觉得这玩意儿会先干掉哪个行业?评论区聊聊。

点个赞,关注我,AI圈大事不错过。

【拍摄建议】

  • 开头摔手机动作+音效,强化Hook
  • "先想后说"四个字打大字幕
  • 讲"联程第二段"时可配机票界面截图
  • 结尾手指镜头,节奏卡点收

🤯谷歌这次真的把"脑子"装进电话机器人了!

以前跟语音AI打电话是什么体验?

说白了就是——反应超快,但从不思考的复读机😤

"帮我订张机票"✅没问题

"帮我改签到后天下午,但别动我那趟联程的第二段"❌直接懵圈

现在谷歌终于让它"先想一想再开口"了!

🔥Google DeepMind刚发布的Gemini 3.8 Live + Extended Thinking模式

把原本只有文本模型才有的"推理能力",正式搬进了实时语音和视频API里

💡为什么这事这么重要?

实时语音AI一直有个死结:

要"秒回"就没法"深度思考"

传统语音助手走快通道,几百毫秒出结果,但只能做浅层匹配

遇到多步推导、条件约束的任务,要么硬答要么答错

而真正会思考的大模型走的是慢通道,先跑一大段内部推理链再给答案

这次谷歌等于把两条平行线接上了⚡️

以后打电话给AI,它真的会"动脑子"了

联程改签这种绕来绕去的需求,终于有救了👏

来源:Dev.to

#科技资讯 #彩虹洋葱AI #GoogleDeepMind #Gemini #实时语音AI #AI推理 #电话智能体 #AI黑科技

如何看待谷歌把「思考」塞进实时语音,Gemini 3.8 Live 支持先想后说?

先说结论:这次更新解决的不是「语音 AI 能不能听懂」的问题,而是「语音 AI 能不能处理复杂约束」的问题。前者早就及格了,后者一直是行业公开的短板。

过去几年我们跟语音 AI 打电话,本质上是在跟一个反应极快、但从不思考的复读机对话。它能听懂「帮我订张机票」,却永远搞不定「帮我改签到后天下午,但别动我那趟联程的第二段」。这不是模型笨,是架构决定的。

实时和推理,长期是两条平行线

传统语音助手走的是「快通道」:语音识别 → 意图理解 → 调用工具 → 生成回复 → 语音合成,整条链路压在几百毫秒内。体验是「秒回」,代价是没有中间推理环节。

模型只能做模式匹配式的浅层决策。遇到需要多步推导、条件约束、上下文权衡的任务,它要么硬答,要么答错——因为留给它的时间窗口里,根本塞不下一段推理链。

而真正有思考能力的大模型走的是「慢通道」:先内部生成一大段推理链,再给答案。质量高,但延迟也高,没法直接塞进实时对话。

这两条线一直平行,谁也不挨着谁。

谷歌这次做了什么

Google DeepMind 发布了 Gemini 3.8 Live 以及伴生模式 Gemini 3.8 Live Extended Thinking,把此前只开放给非实时、纯文本 Gemini 模型的推理能力,正式搬进了实时语音和视频 API。

翻译成人话就是:实时语音 AI 终于可以「先想后说」了。它不再被强制压缩在几百毫秒的反射弧里,而是被允许在开口前先跑一段内部推理。

为什么这件事值得单独拿出来说

第一,它改的是架构层面的取舍,不是参数微调。 过去「实时」和「推理」是互斥选项,现在谷歌试图让两者共存。这比单纯提升识别准确率或音色自然度,意义大一个量级。 第二,真正卡住语音 AI 落地的是复杂任务,不是简单任务。 订机票、查天气这类单步操作早就跑通了。难的是改签、多段联程、条件约束、上下文权衡——这些恰恰是电话智能体最需要、也最容易翻车的场景。 第三,它把「电话机器人」从演示品推向可用品的门槛上。 一个不会思考的语音 AI,永远只能做客服分流;一个能先想后说的语音 AI,才有可能真正接管需要判断力的通话任务。

当然,推理链塞进实时链路,延迟和成本怎么平衡,目前公开信息里还没有明确答案。Extended Thinking 模式具体在什么场景下触发、代价多大,是需要后续观察的关键点。

总结

谷歌这次不是让语音 AI 变聪明了一点,而是把「实时」和「推理」这两条平行线第一次正式接上了。方向是对的,接下来看工程落地能不能扛住延迟和成本这两关。

参考来源:Dev.to 报道,Google DeepMind 发布 Gemini 3.8 Live 及 Gemini 3.8 Live Extended Thinking。

你怎么看实时语音 AI 的「先想后说」?是刚需还是伪需求?评论区聊聊。

谷歌把"思考"塞进实时语音:电话机器人终于不用再装傻了

摘要:Google DeepMind 发布 Gemini 3.8 Live 及 Gemini 3.8 Live Extended Thinking,首次将原本仅限非实时纯文本模型的"推理能力"引入实时语音和视频 API,让实时语音 AI 实现"先想后说"。

过去几年,我们和语音 AI 打电话的体验,本质上是在跟一个反应极快、但从不思考的复读机对话。它能听懂"帮我订张机票",却永远搞不定"帮我改签到后天下午,但别动我那趟联程的第二段"。现在,谷歌决定让它先想一想再开口。

Google DeepMind 最近发布了一个在语音 AI 领域颇具分量的更新:Gemini 3.8 Live 以及它的伴生模式 Gemini 3.8 Live Extended Thinking。简单说,谷歌把此前只开放给非实时、纯文本 Gemini 模型的"推理能力",正式搬进了实时语音和视频 API 里。

这句话翻译成人话就是:实时语音 AI 终于可以"先想后说"了。

为什么"实时"和"推理"一直是两条平行线

要理解这次更新为什么重要,得先搞清楚实时语音 AI 长期面临的一个结构性矛盾。

传统的语音助手(包括早期的 Gemini Live)走的是"快通道":语音识别 → 意图理解 → 调用工具 → 生成回复 → 语音合成。整条链路被压缩到几百毫秒内完成,用户体验是"秒回",但代价是没有中间推理环节。模型只能做模式匹配式的浅层决策,遇到需要多步推导、条件约束、上下文权衡的任务,它要么硬答,要么答错。

而真正有"思考能力"的大模型(比如文本版的 Gemini、o 系列推理模型)走的是"慢通道":模型在给出答案前,会先生成一大段内部推理链,再输出最终结果。这种方式准确率高,但延迟大,无法直接用于实时对话场景。

两条通道各有优劣,却始终无法兼得。而 Gemini 3.8 Live Extended Thinking 要解决的,正是这个矛盾——在实时语音链路中嵌入推理环节,让模型在开口前完成"思考"。

这次更新意味着什么

对普通用户来说,最直接的变化是:电话机器人终于能处理复杂指令了。比如改签机票时保留联程第二段、预约时避开特定时间段、在多条件约束下做出合理取舍——这些过去需要转人工的场景,现在 AI 有可能自己搞定。

对开发者而言,实时语音和视频 API 中正式引入推理能力,意味着可以构建更复杂的语音智能体应用,而不必在"响应速度"和"回答质量"之间二选一。

目前谷歌尚未公布该模式的具体延迟数据和定价细节,但方向已经明确:实时语音 AI 的下一站,是学会思考。

来源:Dev.to

标签:#GoogleDeepMind #Gemini #实时语音AI #推理能力 #电话智能体

本文由彩虹洋葱 AI 自动聚合生成,仅供参考。

【短帖 140 字版】

谷歌把"思考"塞进实时语音了!Gemini 3.8 Live 支持先想后说,电话机器人终于不用再装傻。以前语音AI只会秒回复,复杂改签直接懵;现在推理能力搬进实时API,多步推导也能扛。#Gemini# #实时语音AI# 原文→

【长帖配图版】

谷歌这次把"思考"塞进了实时语音里🧠

以前跟语音AI打电话,本质是在跟一个反应极快、但从不思考的复读机聊天。它能听懂"帮我订张机票",却搞不定"改签到后天下午,但别动联程第二段"。

Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,把原本只给纯文本 Gemini 的"推理能力",正式搬进实时语音和视频 API。

翻译成人话:实时语音 AI 终于能"先想后说"了。

过去实时语音走"快通道",几百毫秒内完成识别到合成,没中间推理,只能浅层决策;遇到多步推导、条件约束就硬答或答错。现在推理链进了实时链路,电话智能体才算真开窍。

#GoogleDeepMind# #Gemini# #实时语音AI# #推理能力# #电话智能体#

原文:Dev.to

【片头】

(画面:手机拨号界面,对面一个机器人声音秒回"好的,已为您办理")

"你有没有想过,跟你打电话的AI,其实根本没过脑子?"

【引子】

大家好,这里是XXX。

今天聊个事儿——谷歌终于决定,让电话机器人先"想一想"再开口。

对,就是字面意思的想。不是那种"秒回但答非所问"的假聪明,是真的在说话之前,先在脑子里过一遍。

【时间轴分镜】

[00:00] 先说个扎心的场景。

你打电话改签机票,说"帮我改到后天下午,但别动我联程的第二段"。

对面那个反应贼快的AI,瞬间就懵了。

它不是听不懂,它是压根没"想"这个动作。

[00:30] 为啥会这样?因为实时语音AI一直有个死结。

以前的语音助手走的是"快通道":识别、理解、调工具、生成、合成,一条龙压进几百毫秒。

体验是秒回,代价是——没有中间推理。

它只能做浅层模式匹配,遇到多步推导、条件约束,要么硬答,要么答错。

[01:20] 而真正会思考的大模型走的是"慢通道"。

先憋一大段内部推理链,想明白了再输出。

问题来了:这俩一直是两条平行线,快的不想,想的不快。

[02:00] 现在谷歌干了啥?

Google DeepMind 发了 Gemini 3.8 Live,还有一个伴生模式叫 Gemini 3.8 Live Extended Thinking。

说人话就是:把之前只给纯文本 Gemini 用的"推理能力",正式塞进了实时语音和视频 API 里。

[02:50] 翻译翻译——实时语音AI,终于可以"先想后说"了。

以前是复读机,现在至少是个会停顿一下、琢磨琢磨再回你的选手。

像改签机票这种带条件、带约束的活儿,理论上它终于能接住了。

[03:40] 当然,具体体验咋样、延迟会不会炸,还得看实测。

但方向很明确:语音AI从"嘴快"卷向"脑子快"。

【结尾】

所以问题来了——如果电话AI真的会思考了,你最想让它帮你处理啥破事?

评论区聊聊。

觉得有点意思的话,别忘了三连,咱们下期见。

【弹幕互动引导】

· 弹幕打个"想",看看有多少人受够了装傻的语音AI

· 你被语音AI坑过最离谱的一次是啥?弹幕飘一下

【标签】

#谷歌 #Gemini #语音AI #人工智能 #科技 #DeepMind

封面字幕:谷歌把“思考”塞进实时语音,电话机器人终于不装傻了

老铁们,以后跟AI打电话,它可真会“先想后说”了!Google DeepMind刚发的Gemini 3.8 Live,带了个Extended Thinking模式,直接把推理能力搬进了实时语音和视频API里。以前语音AI走的是快通道,几百毫秒就得回你,压根没空琢磨;现在它能像文本大模型一样,先跑一段内部推理链再开口。

核心就三点:

① 以前语音AI是“秒回复读机”,只会模式匹配,多步条件一多就翻车;

② 这次Gemini 3.8 Live Extended Thinking,把“慢思考”塞进了实时链路;

③ 以后改签机票这种“别动联程第二段”的复杂活儿,它也能先想明白再回你。

老铁们觉得这波实用不?点个赞,评论区聊聊你最想让AI帮你打哪个电话!

谷歌把"思考"塞进实时语音:电话机器人终于不用再装傻了

前言

过去几年,我们和语音 AI 打电话的体验,本质上是在跟一个反应极快、但从不思考的复读机对话。它能听懂"帮我订张机票",却永远搞不定"帮我改签到后天下午,但别动我那趟联程的第二段"。

Google DeepMind 最近发布了一个在语音 AI 领域颇具分量的更新:Gemini 3.8 Live 以及它的伴生模式 Gemini 3.8 Live Extended Thinking。简单说,谷歌把此前只开放给非实时、纯文本 Gemini 模型的"推理能力",正式搬进了实时语音和视频 API 里。

翻译成人话就是:实时语音 AI 终于可以"先想后说"了。

为什么"实时"和"推理"一直是两条平行线

要理解这次更新为什么重要,得先搞清楚实时语音 AI 长期面临的一个结构性矛盾。

传统的语音助手(包括早期的 Gemini Live)走的是"快通道":

语音识别 → 意图理解 → 调用工具 → 生成回复 → 语音合成

整条链路被压缩到几百毫秒内完成,用户体验是"秒回",但代价是没有中间推理环节。模型只能做模式匹配式的浅层决策,遇到需要多步推导、条件约束、上下文权衡的任务,它要么硬答,要么答错。

而真正有"思考能力"的大模型(比如文本版的 Gemini、o 系列推理模型)走的是"慢通道":模型在给出答案前,会先生成一大段内部推理链(chain-of-thought),再输出最终结果。这条链路质量高,但延迟大,一直没法直接塞进实时语音场景。

于是行业里就形成了一个默认的分工:

  • 实时语音 AI:负责"快",但只能做浅层任务
  • 文本推理模型:负责"深",但没法实时对话

Gemini 3.8 Live Extended Thinking 想做的,就是把这两条平行线拧到一起。

这次更新到底改了什么

从工程视角看,核心变化可以拆成三点:

1. 推理能力下沉到实时 API

以前 Extended Thinking 这类模式只存在于非实时的文本接口里。现在它被接入了实时语音和视频 API,意味着开发者可以在同一个会话流里同时拿到"低延迟响应"和"多步推理"。

2. 双模式并存

  • Gemini 3.8 Live:延续原有的快通道,适合简单问答、指令执行
  • Gemini 3.8 Live Extended Thinking:在需要复杂决策时切换到推理模式,先想后说

这种设计本质上是把"快"和"慢"做成可切换的两档,而不是二选一。

3. 面向电话智能体场景

官方给出的典型场景就是电话智能体(phone agent)。这类任务的难点从来不是"听懂",而是"处理带条件约束的多步操作",比如改签、退订、跨段联程处理——正好是浅层模式匹配最容易翻车的地方。

一个典型调用示例

以下为示意性伪代码,用于说明"快 / 慢"两种模式在调用层的差异(具体 SDK 名称与参数请以官方文档为准):

# 快通道:适合简单指令,追求低延迟
session = client.live.connect(
    model="gemini-3.8-live",
    modality="audio",
)

# 慢通道:开启扩展思考,适合多步推理任务
session = client.live.connect(
    model="gemini-3.8-live",
    modality="audio",
    thinking="extended",   # 启用先想后说
)

session.send_audio(stream)
for event in session.receive():
    print(event.text)

关键点在于:同一个实时会话里,推理不再是外挂,而是内建的一个可选档位。这对电话智能体这类"既要快、又要准"的场景,意义比单纯提升模型分数更大。

对开发者的实际影响

  • 电话客服 / 外呼机器人:终于能处理"改签但别动联程第二段"这类条件约束任务
  • 实时语音助手:可以在复杂问题上少答错,简单问题上不牺牲响应速度
  • 多模态实时应用:视频 + 语音 + 推理的组合,打开了新的交互设计空间

需要注意的是,"先想后说"必然带来延迟上升,如何在快慢之间做调度,会是接下来开发者要自己权衡的工程问题。

总结

Gemini 3.8 Live Extended Thinking 的核心价值,不是把模型变聪明,而是把推理能力从"离线文本"搬进了"实时语音"。它打破了实时语音 AI 长期"快但浅"的天花板,让电话机器人第一次有机会真正处理带条件、多步骤的复杂任务。对做语音智能体的团队来说,这是一个值得跟进的方向。

分类:人工智能 / 语音技术 / Google DeepMind

转载请注明出处。

谷歌把"思考"塞进实时语音:电话机器人终于不用再装傻了

实时语音 AI 长期被卡在"快通道"里,这次 Gemini 3.8 Live Extended Thinking 把推理链搬进了语音 API。对做语音 Agent 的开发者来说,架构上多了个新变量。

过去几年,我们和语音 AI 打电话的体验,本质上是在跟一个反应极快、但从不思考的复读机对话。它能听懂"帮我订张机票",却永远搞不定"帮我改签到后天下午,但别动我那趟联程的第二段"。

Google DeepMind 最近发布了 Gemini 3.8 Live 以及伴生模式 Gemini 3.8 Live Extended Thinking。核心变化一句话:谷歌把此前只开放给非实时、纯文本 Gemini 模型的"推理能力",正式搬进了实时语音和视频 API 里。

翻译成人话——实时语音 AI 终于可以"先想后说"了。

为什么"实时"和"推理"一直是两条平行线

要理解这次更新,得先看实时语音 AI 长期面临的结构性矛盾。

传统语音助手(包括早期 Gemini Live)走的是快通道

ASR → 意图理解 → 调用工具 → 生成回复 → TTS

整条链路被压缩到几百毫秒内完成。用户体验是"秒回",代价是没有中间推理环节。模型只能做模式匹配式的浅层决策,遇到需要多步推导、条件约束、上下文权衡的任务,要么硬答,要么答错。

而真正有"思考能力"的大模型(文本版 Gemini、o 系列推理模型)走的是慢通道:模型在给出答案前,会先生成一大段内部推理链(chain-of-thought),再做决策。质量上去了,但延迟也上去了,根本塞不进实时语音的几百毫秒预算里。

这两条通道,过去几年基本是各走各的。

这次到底改了什么

Gemini 3.8 Live Extended Thinking 的思路,本质上是给实时语音链路加了一个"可插拔的思考层"。

对开发者来说,几个值得关注的点:

1. 推理能力进入实时 API 层。 不再是文本模型的专属。语音、视频 API 都能调用带 Extended Thinking 的模式,意味着你可以在实时会话里显式触发一段推理,而不是只能靠 prompt 硬凑。 2. 快慢通道开始分层。 简单意图("帮我查下天气")依然走快通道保延迟;复杂任务(改签、多条件约束、联程票处理)走 Extended Thinking。这给了架构上一个新的路由维度——你可以在会话中动态决定"这句话要不要想"。 3. 电话智能体是最直接的受益场景。 电话场景的痛点从来不是"听不懂",而是"听不懂复杂意图"。改签、退订、多段行程、条件叠加,这些正是浅层模式匹配最容易翻车的地方。

对做语音 Agent 的开发者意味着什么

如果你正在搭语音 Agent,这次更新值得重新审视几个设计决策:

  • 路由层要重做。 以前是"一句话进来直接生成回复",现在可以判断意图复杂度,决定走快通道还是思考通道。这个判断本身也可以交给模型。
  • 延迟预算要重新分配。 Extended Thinking 会吃掉一部分响应时间,但换来的是复杂任务的成功率。哪些场景值得多等一两秒,需要按业务权衡。
  • 工具调用链可以更复杂。 有了中间推理,多步工具编排(查订单 → 校验约束 → 改签 → 确认)的成功率理论上会明显提升。

当然,具体延迟数据、成本、并发表现,官方还没给全,实际落地还得自己压测。

总结 & 思考

这次更新的真正价值,不是"语音 AI 变聪明了"这种泛泛的说法,而是实时语音架构里第一次有了显式的推理层。快慢通道的分层、动态路由、复杂任务的成功率,这些都会成为语音 Agent 工程上的新课题。

对开发者来说,值得盯的两个问题:一是 Extended Thinking 在实时场景下的实际延迟和成本曲线;二是路由策略怎么设计,才能既保住"秒回"体验,又在复杂任务上不掉链子。

如果这篇对你有帮助,点个赞、收个藏,后面我会继续跟进实际压测数据。

#GoogleDeepMind #Gemini #实时语音AI #推理能力 #电话智能体

谷歌把"思考"塞进实时语音:电话机器人终于不用再装傻了

【导语】 过去几年,我们和语音 AI 打电话的体验,本质上是在跟一个反应极快、但从不思考的复读机对话。它能听懂"帮我订张机票",却永远搞不定"帮我改签到后天下午,但别动我那趟联程的第二段"。现在,谷歌决定让它先想一想再开口。Google DeepMind 发布 Gemini 3.8 Live 及 Gemini 3.8 Live Extended Thinking,把推理能力正式搬进实时语音和视频 API。

本文目录

1. 谷歌 Gemini 3.8 Live 到底更新了什么

2. 为什么"实时"和"推理"一直是两条平行线

3. 先想后说,对电话智能体意味着什么

1. 谷歌 Gemini 3.8 Live 到底更新了什么

Google DeepMind 最近发布了一个在语音 AI 领域颇具分量的更新:Gemini 3.8 Live 以及它的伴生模式 Gemini 3.8 Live Extended Thinking。简单说,谷歌把此前只开放给非实时、纯文本 Gemini 模型的"推理能力",正式搬进了实时语音和视频 API 里。

这句话翻译成人话就是:实时语音 AI 终于可以"先想后说"了。

对于做电话智能体、客服机器人、语音助手的开发者来说,这是一个值得关注的节点。过去要在实时语音场景里用上强推理模型,只能自己拼接多套系统,延迟和稳定性都难保证。现在谷歌把它做进了同一套 API。

2. 为什么"实时"和"推理"一直是两条平行线

要理解这次更新为什么重要,得先搞清楚实时语音 AI 长期面临的一个结构性矛盾。

传统的语音助手(包括早期的 Gemini Live)走的是"快通道":语音识别 → 意图理解 → 调用工具 → 生成回复 → 语音合成。整条链路被压缩到几百毫秒内完成,用户体验是"秒回",但代价是没有中间推理环节。模型只能做模式匹配式的浅层决策,遇到需要多步推导、条件约束、上下文权衡的任务,它要么硬答,要么答错。

而真正有"思考能力"的大模型(比如文本版的 Gemini、o 系列推理模型)走的是"慢通道":模型在给出答案前,会先生成一大段内部推理链(chain-of-thought),把条件拆开、逐步验证,再输出结论。这条路答案质量高,但耗时从几百毫秒涨到几秒甚至更久。

实时语音要的是"快",推理要的是"慢",两者天然打架。这就是为什么电话机器人在复杂任务上一直显得"装傻"——不是它不想答好,是架构上根本没给它思考的时间。

3. 先想后说,对电话智能体意味着什么

Gemini 3.8 Live Extended Thinking 的思路,是在实时语音链路里给模型留出推理空间。用户提出需求后,模型可以先在内部完成多步推导,再开口回应,而不是听到半句就开始抢答。

这对电话智能体的实际意义在于:像"帮我改签到后天下午,但别动我那趟联程的第二段"这类带条件约束、需要多步权衡的任务,终于有了被正确处理的可能。对开发者而言,实时语音 API 里多了一个"可推理"的选项,意味着电话机器人、语音客服、实时视频交互等场景的产品上限被抬高了一截。

当然,推理会带来延迟,如何在"想得清楚"和"答得够快"之间做取舍,仍是接下来要观察的重点。但方向已经明确:实时语音 AI 不再只是复读机,它开始有思考的余地了。

关键词: 谷歌 Gemini 3.8 Live、Gemini 3.8 Live Extended Thinking、实时语音 AI、推理能力、电话智能体、Google DeepMind、语音 API 声明: 本文由彩虹洋葱 AI 智能聚合生成,仅供信息参考。

谷歌把"思考"塞进实时语音:电话机器人终于不用再装傻了

前几天和朋友聊起打电话给客服的糟心经历,他说现在一听对面是 AI 就条件反射地想挂断。我倒觉得,这事儿可能正在起变化。

过去几年,我们和语音 AI 打电话的体验,本质上是在跟一个反应极快、但从不思考的复读机对话。它能听懂"帮我订张机票",却永远搞不定"帮我改签到后天下午,但别动我那趟联程的第二段"。每次遇到稍微绕一点的需求,它就开始车轱辘话来回说,最后礼貌地把你转接给人工。

现在,谷歌决定让它先想一想再开口。

Google DeepMind 最近发布了一个在语音 AI 领域颇具分量的更新:Gemini 3.8 Live 以及它的伴生模式 Gemini 3.8 Live Extended Thinking。简单说,谷歌把此前只开放给非实时、纯文本 Gemini 模型的"推理能力",正式搬进了实时语音和视频 API 里。

这句话翻译成人话就是:实时语音 AI 终于可以"先想后说"了。

为什么"实时"和"推理"一直是两条平行线

要理解这次更新为什么重要,得先搞清楚实时语音 AI 长期面临的一个结构性矛盾。

传统的语音助手(包括早期的 Gemini Live)走的是"快通道":语音识别 → 意图理解 → 调用工具 → 生成回复 → 语音合成。整条链路被压缩到几百毫秒内完成,用户体验是"秒回",但代价是没有中间推理环节。模型只能做模式匹配式的浅层决策,遇到需要多步推导、条件约束、上下文权衡的任务,它要么硬答,要么答错。

而真正有"思考能力"的大模型(比如文本版的 Gemini、o 系列推理模型)走的是"慢通道":模型在给出答案前,会先生成一大段内部推理链,把问题拆开、把条件理清,然后才输出结果。这套机制在文本场景里已经相当成熟,但一直没法直接搬到实时语音里——因为电话那头的人等不了你"想三秒"。

这次的 Extended Thinking 模式,本质上是在这两条通道之间搭了一座桥。模型仍然保持实时响应,但在遇到复杂任务时,可以调用一段额外的推理时间,把"改签"这种带条件约束的需求先捋清楚,再开口回复。

我不敢说这就能让电话机器人瞬间变得像真人一样靠谱。毕竟语音场景里的噪声、口音、打断、情绪,都是文本模型不用面对的麻烦。但至少,谷歌这次动的是"思考"这个层面,而不只是把语音合成做得更自然一点。

作为一个经常被 AI 客服绕晕的人,我挺期待哪天打过去,对面能真的听懂我在说什么,而不是急着把话说完。

写于彩虹洋葱 AI 聚合平台

#GoogleDeepMind #Gemini #实时语音AI #推理能力 #电话智能体

🚀 多平台发布

点击「复制」获取平台专属文案,到各平台编辑器(App/网页)粘贴即可发布。
有密钥的 4 个平台(微信服务号 / 头条 / 百家号 / 微博)可自动发布,密钥填好后自动点亮。

平台状态操作
💬 公众号🔑 待配置密钥
🎵 抖音📋 手动复制
📕 小红书📋 手动复制
🤔 知乎📋 手动复制
📰 今日头条🔑 待配置密钥
🐦 微博🔑 待配置密钥
📺 B站📋 手动复制
快手📋 手动复制
💻 CSDN📋 手动复制
⛏️ 掘金📋 手动复制
📝 百家号🔑 待配置密钥
✍️ 简书📋 手动复制