UI-TARS Desktop实战:三步用自然语言跑通第一个GUI自动化任务
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
你要把 VS Code 的自动保存打开并设置 500 毫秒延迟。手动要做的是:开设置、搜关键词、改选项、设数值,四步鼠标键盘来回。UI-TARS Desktop 是一个跑在本机的原生 GUI 代理,你用自然语言把任务说一遍,它靠截图识别加动作执行替你点完全部步骤。它省掉的是"找按钮—点—等响应"的重复循环,而且不用写一行脚本。
一分钟看懂 UI-TARS Desktop
UI-TARS Desktop 是基于 UI-TARS 多模态模型的桌面应用,Windows 和 macOS 都有。它的原理不复杂:每一轮把当前屏幕截图,发给视觉语言模型(VLM)分析,模型预测出类似点击坐标、输入文本这样的动作,再由内置的操作器(Operator)真实执行,循环直到任务完成。整个过程不依赖网页 DOM,所以只要是画面上能看到的按钮,理论上都能操作。
- 适合:不想写脚本、想把跨应用的重复 GUI 操作甩出去的人
- 适合:已经能部署或调用 UI-TARS-1.5-7B、Doubao-1.5-UI-TARS 模型端点的人
- 不适合:多显示器用户,快速开始明确提示多屏可能导致任务失败
- 不适合:期待开箱即离线使用的人,应用不内置模型,必须先配好 VLM 的 API 端点
跑通最小闭环
获取应用
macOS 上装了 Homebrew 的话直接执行:
brew install --cask ui-tars其他情况按 快速开始 里"Download"一节,从官方发布页下载对应系统的安装包即可。
安装并授予两个权限
macOS 用户把 UI TARS 图标拖进 Applications 文件夹:
你会看到拖拽安装的窗口,UI-TARS 出现在应用程序列表里
然后在"系统设置 → 隐私与安全性"里为它同时打开辅助功能(Accessibility)和屏幕录制(Screen Recording):一个负责控制鼠标键盘,一个负责截屏。两个都缺会让任务直接跑不起来。
两个权限开关都要打开
Windows 用户双击安装包按向导走完即可:
配置模型端点
打开左下角齿轮进入设置,核心参数就四个:VLM Provider、VLM Base URL、VLM API KEY、VLM Model Name。用火山引擎的 Doubao-1.5-UI-TARS 可以直接填:
Language: cn VLM Provider: VolcEngine Ark for Doubao-1.5-UI-TARS VLM Base URL: https://ark.cn-beijing.volces.com/api/v3 VLM API KEY: YOUR_API_KEY VLM Model Name: doubao-1.5-ui-tars-250328走 Hugging Face 的则选 Provider 为 "Hugging Face for UI-TARS-1.5",Base URL 和 Model Name 在部署后的 endpoint 页面查看,注意 Base URL 必须以/v1/结尾。填完点一下 Check Model Availability,提示可用才算配好。
设置页四个参数填齐后,点按钮验证模型连通性
第一次运行输入什么
主界面是两张卡片,先选本地操作方式:
左卡是 Computer Operator,右卡是 Browser Operator
在左侧底部的对话框里输入并发送:
Please help me open the autosave feature of VS Code and delay AutoSave operations for 500 milliseconds in the VS Code setting.
运行期间,右侧 Screenshot 面板会随每一步刷新屏幕画面:你看它自己打开 VS Code、在设置里搜索关键词、切换自动保存选项、修改延迟数值,全程不接管你的鼠标。任务结束后,这一轮完整的截图、预测和动作记录可以导出成 HTML 报告逐条回看。
想换任务,只需换一句话:
- 让它在 GitHub 上查某个项目最新的 issue
- 在访达里新建一个名为"项目文档"的文件夹
- 打开天气网站查一下北京本周天气
输入指令回车后,右侧开始逐轮展示执行截图
选 Browser Operator 时同理,但前提是本地已装好 Chrome、Edge 或 Firefox 三者之一,否则浏览器模式起不来。
进阶玩法
用预设一键切换整套配置
它能做什么:预设是一份打包的全部设置,支持从本地 YAML 文件或远程 URL 导入,远程预设会在每次启动时自动拉取更新。怎么打开:设置页里选 Import Preset,指定文件或粘贴 URL。什么时候你会用到它:团队里几个人共用同一套模型参数,把预设放在远程仓库,大家启动应用就是同一份配置,不用逐台手填。
导入成功会直接刷新设置项,内容非法会给出明确报错
导出执行报告回看每一步
它能做什么:记录每轮的截图、模型预测与执行结果,生成完整 HTML 报告。怎么打开:任务结束后点 Export as HTML;不配 Report Storage Base URL 就本地下载,配了则上传并把链接复制到剪贴板。什么时候你会用到它:任务跑歪了,你需要判断是哪一步的判断开始出错,而不是重跑一遍碰运气。
调执行节奏避免抢拍
它能做什么:Max Loop 控制单轮最多走多少步(25~200,默认 100);Loop Wait Time 是每次截屏前的等待时间(0~3000 毫秒,默认 1000)。怎么打开:设置页 Chat Settings 区域两个数字框。什么时候你会用到它:操作加载慢的网页应用时,把 Loop Wait Time 调大,防止页面还没渲染完它就动手点击。
避坑指南
| 现象 | 原因 | 解法 |
|---|---|---|
| 发任务后立刻报错,模型不可用 | Base URL 没以/v1/结尾,或 Key 抄错 | 回 endpoint 页面核对两个值,再点 Check Model Availability |
| 动作解析错,点的位置和行为都不对 | VLM Provider 与模型来源不匹配 | Provider 按模型来源选:Hugging Face 配 UI-TARS-1.5,火山引擎配 Doubao-1.5-UI-TARS |
| 多显示器下部分任务莫名失败 | 官方仅支持单显示器环境 | 收成单屏使用;quick start 已明确警告多屏会出问题 |
| Browser Operator 无法启动 | 本机没装 Chrome / Edge / Firefox | 装任意一个,重启应用 |
| 找不到可用的远程 Operator 入口 | 官方 Remote Operator 服务已于 2025-08-20 停用 | 改用 Local Computer / Local Browser Operator |
| 把 Language 改成 zh 后界面还是英文 | 该参数只影响 VLM 的输出语言,不影响应用界面 | 应用界面语言另行处理,别指望这个开关 |
想继续深入
快速开始 有完整的模型获取与配置流程,设置文档 逐字段解释了每个选项,想把 Agent 嵌进自己的程序则看 SDK 文档 和 packages/ui-tars/operators/ 下的操作器实现,examples/presets/default.yaml 是一份可直接改造的预设样例。
收尾:接下来可以做的三件事
先跑一个浏览器任务:选 Local Browser Operator,让它在你常用的站点上完成一次查询,再打开 HTML 报告看它实际走了几轮。然后写一份自己的预设:照 examples/presets/default.yaml 的结构改掉模型参数,从设置页导入,验证切换是否生效。最后如果你不想依赖桌面应用,用 SDK 文档里的npx @ui-tars/cli start从终端控制电脑,同一个模型端点直接复用。能说一句自然语言就交出去一个完整任务,这就是 UI-TARS Desktop 给你的东西——省下的不是一次点击,而是那整段攥着鼠标等页面响应的时间。
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考