推出 Gemini 3.8 Live 与 3.8 Live Extended Thinking

推出 Gemini 3.8 Live 与 3.8 Live Extended Thinking

推出 Gemini 3.8 Live 与 3.8 Live Extended Thinking

📰 来源:DeepMind | 📅 翻译日期:2026年9月18日
🔗 原文查看原文
🤖 翻译:DeepSeek AI · 仅供参考

今天,我们推出两款新模型,将接近实时的推理能力(near real-time reasoning)引入其中,更有效地赋能语音代理,并让与 AI 的对话体验变得更加直观、智能。

两款模型,各司其职

  • Gemini 3.8 Live:为规模化与成本效率而生,融合对话智能、流畅交流与视觉锚定(visual grounding)能力。
  • Gemini 3.8 Live Extended Thinking:面向高复杂度任务,具备更强的智能水平与多步推理能力。

对于开发者和企业而言,这两款模型提供了构建可靠、可用于生产的语音代理的核心组件。同时,它们也让用户通过 Gemini appGoogle WorkspaceSearch 与 Gemini 交谈时更加流畅、更具协作性——帮助你仅凭语音就能完成复杂任务。

更流畅、更智能的对话

Gemini 3.8 Live Extended Thinking 提供企业级的任务完成能力与智能水平,在 Artificial Analysis 的 Speech to Speech Quality Index 上以 82.6 分位列总分第一,并在代理任务完成方面领先:在 τ-Voice 上取得 68.6%,在 Sierra 的 τ-Voice-banking 基准上取得 35.1%。它还具备强大的推理能力,在 Big Bench Audio 上得分 97.7%,同时与其他前沿模型相比,仍保持了极具竞争力的价格。

Gemini 3.8 Live 则获得了用户的高度青睐,在 Speech Agent Arena 中位列第二。除性能表现之外,它同样极具成本效益,为开发者和企业提供了一个能力强、效率高、专为规模化而打造的模型。

在 ServiceNow 的 EVA-Bench(一个用于评估语音代理的基准)上,我们的模型通过成功平衡准确性与对话质量,推动了复杂工作流的帕累托前沿(Pareto Frontier)。

注:该测试在 Gemini Enterprise Agent Platform 的 Live API 上运行。

实时视觉与多语言支持

Gemini 3.8 Live 能以接近实时的速度处理视觉输入,用上下文丰富对话,从而给出更有帮助的回应。它能在对话过程中自动检测并切换 97 种支持的语言。它还会在后台执行工具调用和 API 调用,同时继续进行对话——因此模型可以先确认请求,并在任务于后台完成的同时保持交谈。

演示场景:

  • Gemini 3.8 Live 实时指导员工入职,利用视觉上下文回答现场提问。
  • 观看 Gemini 3.8 Live 凭借视觉上下文、推理能力与自然对话流程,近乎实时地下棋。

边推理,边表达

对于需要更深层推理的任务,3.8 Live Extended Thinking 能够同时推理与说话,为复杂工作流带来更强的智能,同时保持……

即刻体验

你可以从今天起通过 Gemini APIGoogle Workspace 以及 Gemini app 开始使用这些功能,让语音交互更加自然、流畅且智能。


📌 *本文自动翻译排版,如有不准确之处欢迎指正* 🏠 [返回首页](https://www.suiyuanlu.cn) · 📖 [查看原文](https://deepmind.google/blog/introducing-gemini-3-8-live-and-3-8-live-extended-thinking/)
©版权声明
THE END
喜欢就支持一下吧
点赞0 分享
评论 抢沙发

评论已关闭