Ctrl+D 收藏本站 再次访问不迷路 ~
📰 来源:DeepMind | 📅 翻译日期:2026年6月27日
🔗 原文:查看原文
🤖 翻译:DeepSeek AI · 仅供参考
功能简介
Google 在其 Gemini 3.5 Flash 模型中引入了全新的 计算机操控(computer use)能力,使 AI 能够直接与计算机界面交互。该功能让 Gemini 可以控制鼠标和键盘,执行网页浏览、表单填写等任务。
关键特点
- 直接操控:Gemini 能够模拟人类操作,点击按钮、输入文本、滚动页面。
- 高准确率:早期测试显示任务完成准确率超过
90%。 - 自主决策:AI 可自主规划操作步骤,无需人工干预。
Google 表示:“这是迈向自主 AI 的重要一步,让模型不仅理解信息,还能主动执行任务。”
应用场景
- 自动化测试:开发者可让 Gemini 自动测试 Web 应用。
- 数据处理:自动填写表格、提取网页信息。
- 辅助操作:为残障用户提供计算机辅助控制。
开发者接口
开发者可通过 API 集成该功能。示例代码(Python):
import gemini
client = gemini.Client(api_key="your_key")
response = client.computer_use(
model="gemini-3.5-flash",
task="fill out the login form with username and password"
)
print(response.status)性能与限制
- 速度:单步操作平均耗时
0.5秒。 - 兼容性:支持 Windows、macOS、Linux 桌面环境。
- 限制:当前不支持拖拽、右键菜单等复杂交互。
参考资料
📌 *本文由 DeepSeek AI 自动翻译排版,如有不准确之处欢迎指正*
🏠 [返回首页](https://www.suiyuanlu.cn) · 📖 [查看原文](https://deepmind.google/blog/introducing-computer-use-in-gemini-3-5-flash/)
©版权声明
文章版权归作者所有,未经允许请勿转载。
THE END
评论已关闭