Gemini 3.5 Flash 引入计算机操控能力

Gemini 3.5 Flash 引入计算机操控能力

Gemini 3.5 Flash 引入计算机操控能力

📰 来源:DeepMind | 📅 翻译日期:2026年6月27日
🔗 原文查看原文
🤖 翻译:DeepSeek AI · 仅供参考

功能简介

Google 在其 Gemini 3.5 Flash 模型中引入了全新的 计算机操控(computer use)能力,使 AI 能够直接与计算机界面交互。该功能让 Gemini 可以控制鼠标和键盘,执行网页浏览、表单填写等任务。

关键特点

  • 直接操控:Gemini 能够模拟人类操作,点击按钮、输入文本、滚动页面。
  • 高准确率:早期测试显示任务完成准确率超过 90%
  • 自主决策:AI 可自主规划操作步骤,无需人工干预。
Google 表示:“这是迈向自主 AI 的重要一步,让模型不仅理解信息,还能主动执行任务。”

应用场景

  1. 自动化测试:开发者可让 Gemini 自动测试 Web 应用。
  2. 数据处理:自动填写表格、提取网页信息。
  3. 辅助操作:为残障用户提供计算机辅助控制。

开发者接口

开发者可通过 API 集成该功能。示例代码(Python):

import gemini

client = gemini.Client(api_key="your_key")
response = client.computer_use(
    model="gemini-3.5-flash",
    task="fill out the login form with username and password"
)
print(response.status)

性能与限制

  • 速度:单步操作平均耗时 0.5秒
  • 兼容性:支持 Windows、macOS、Linux 桌面环境。
  • 限制:当前不支持拖拽、右键菜单等复杂交互。

参考资料


📌 *本文由 DeepSeek AI 自动翻译排版,如有不准确之处欢迎指正* 🏠 [返回首页](https://www.suiyuanlu.cn) · 📖 [查看原文](https://deepmind.google/blog/introducing-computer-use-in-gemini-3-5-flash/)
©版权声明
THE END
喜欢就支持一下吧
点赞0 分享
评论 抢沙发

评论已关闭