news 2026/9/2 13:57:01

UI-TARS Desktop实战:三步用自然语言跑通第一个GUI自动化任务

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
UI-TARS Desktop实战:三步用自然语言跑通第一个GUI自动化任务

UI-TARS Desktop实战:三步用自然语言跑通第一个GUI自动化任务

【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop

你要把 VS Code 的自动保存打开并设置 500 毫秒延迟。手动要做的是:开设置、搜关键词、改选项、设数值,四步鼠标键盘来回。UI-TARS Desktop 是一个跑在本机的原生 GUI 代理,你用自然语言把任务说一遍,它靠截图识别加动作执行替你点完全部步骤。它省掉的是"找按钮—点—等响应"的重复循环,而且不用写一行脚本。

一分钟看懂 UI-TARS Desktop

UI-TARS Desktop 是基于 UI-TARS 多模态模型的桌面应用,Windows 和 macOS 都有。它的原理不复杂:每一轮把当前屏幕截图,发给视觉语言模型(VLM)分析,模型预测出类似点击坐标、输入文本这样的动作,再由内置的操作器(Operator)真实执行,循环直到任务完成。整个过程不依赖网页 DOM,所以只要是画面上能看到的按钮,理论上都能操作。

  • 适合:不想写脚本、想把跨应用的重复 GUI 操作甩出去的人
  • 适合:已经能部署或调用 UI-TARS-1.5-7B、Doubao-1.5-UI-TARS 模型端点的人
  • 不适合:多显示器用户,快速开始明确提示多屏可能导致任务失败
  • 不适合:期待开箱即离线使用的人,应用不内置模型,必须先配好 VLM 的 API 端点

跑通最小闭环

获取应用

macOS 上装了 Homebrew 的话直接执行:

brew install --cask ui-tars

其他情况按 快速开始 里"Download"一节,从官方发布页下载对应系统的安装包即可。

安装并授予两个权限

macOS 用户把 UI TARS 图标拖进 Applications 文件夹:

你会看到拖拽安装的窗口,UI-TARS 出现在应用程序列表里

然后在"系统设置 → 隐私与安全性"里为它同时打开辅助功能(Accessibility)屏幕录制(Screen Recording):一个负责控制鼠标键盘,一个负责截屏。两个都缺会让任务直接跑不起来。

两个权限开关都要打开

Windows 用户双击安装包按向导走完即可:

配置模型端点

打开左下角齿轮进入设置,核心参数就四个:VLM Provider、VLM Base URL、VLM API KEY、VLM Model Name。用火山引擎的 Doubao-1.5-UI-TARS 可以直接填:

Language: cn VLM Provider: VolcEngine Ark for Doubao-1.5-UI-TARS VLM Base URL: https://ark.cn-beijing.volces.com/api/v3 VLM API KEY: YOUR_API_KEY VLM Model Name: doubao-1.5-ui-tars-250328

走 Hugging Face 的则选 Provider 为 "Hugging Face for UI-TARS-1.5",Base URL 和 Model Name 在部署后的 endpoint 页面查看,注意 Base URL 必须以/v1/结尾。填完点一下 Check Model Availability,提示可用才算配好。

设置页四个参数填齐后,点按钮验证模型连通性

第一次运行输入什么

主界面是两张卡片,先选本地操作方式:

左卡是 Computer Operator,右卡是 Browser Operator

在左侧底部的对话框里输入并发送:

Please help me open the autosave feature of VS Code and delay AutoSave operations for 500 milliseconds in the VS Code setting.

运行期间,右侧 Screenshot 面板会随每一步刷新屏幕画面:你看它自己打开 VS Code、在设置里搜索关键词、切换自动保存选项、修改延迟数值,全程不接管你的鼠标。任务结束后,这一轮完整的截图、预测和动作记录可以导出成 HTML 报告逐条回看。

想换任务,只需换一句话:

  • 让它在 GitHub 上查某个项目最新的 issue
  • 在访达里新建一个名为"项目文档"的文件夹
  • 打开天气网站查一下北京本周天气

输入指令回车后,右侧开始逐轮展示执行截图

选 Browser Operator 时同理,但前提是本地已装好 Chrome、Edge 或 Firefox 三者之一,否则浏览器模式起不来。

进阶玩法

用预设一键切换整套配置

它能做什么:预设是一份打包的全部设置,支持从本地 YAML 文件或远程 URL 导入,远程预设会在每次启动时自动拉取更新。怎么打开:设置页里选 Import Preset,指定文件或粘贴 URL。什么时候你会用到它:团队里几个人共用同一套模型参数,把预设放在远程仓库,大家启动应用就是同一份配置,不用逐台手填。

导入成功会直接刷新设置项,内容非法会给出明确报错

导出执行报告回看每一步

它能做什么:记录每轮的截图、模型预测与执行结果,生成完整 HTML 报告。怎么打开:任务结束后点 Export as HTML;不配 Report Storage Base URL 就本地下载,配了则上传并把链接复制到剪贴板。什么时候你会用到它:任务跑歪了,你需要判断是哪一步的判断开始出错,而不是重跑一遍碰运气。

调执行节奏避免抢拍

它能做什么:Max Loop 控制单轮最多走多少步(25~200,默认 100);Loop Wait Time 是每次截屏前的等待时间(0~3000 毫秒,默认 1000)。怎么打开:设置页 Chat Settings 区域两个数字框。什么时候你会用到它:操作加载慢的网页应用时,把 Loop Wait Time 调大,防止页面还没渲染完它就动手点击。

避坑指南

现象原因解法
发任务后立刻报错,模型不可用Base URL 没以/v1/结尾,或 Key 抄错回 endpoint 页面核对两个值,再点 Check Model Availability
动作解析错,点的位置和行为都不对VLM Provider 与模型来源不匹配Provider 按模型来源选:Hugging Face 配 UI-TARS-1.5,火山引擎配 Doubao-1.5-UI-TARS
多显示器下部分任务莫名失败官方仅支持单显示器环境收成单屏使用;quick start 已明确警告多屏会出问题
Browser Operator 无法启动本机没装 Chrome / Edge / Firefox装任意一个,重启应用
找不到可用的远程 Operator 入口官方 Remote Operator 服务已于 2025-08-20 停用改用 Local Computer / Local Browser Operator
把 Language 改成 zh 后界面还是英文该参数只影响 VLM 的输出语言,不影响应用界面应用界面语言另行处理,别指望这个开关

想继续深入

快速开始 有完整的模型获取与配置流程,设置文档 逐字段解释了每个选项,想把 Agent 嵌进自己的程序则看 SDK 文档 和 packages/ui-tars/operators/ 下的操作器实现,examples/presets/default.yaml 是一份可直接改造的预设样例。

收尾:接下来可以做的三件事

先跑一个浏览器任务:选 Local Browser Operator,让它在你常用的站点上完成一次查询,再打开 HTML 报告看它实际走了几轮。然后写一份自己的预设:照 examples/presets/default.yaml 的结构改掉模型参数,从设置页导入,验证切换是否生效。最后如果你不想依赖桌面应用,用 SDK 文档里的npx @ui-tars/cli start从终端控制电脑,同一个模型端点直接复用。能说一句自然语言就交出去一个完整任务,这就是 UI-TARS Desktop 给你的东西——省下的不是一次点击,而是那整段攥着鼠标等页面响应的时间。

【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/2 13:55:17

AI辅助开发像素风俯视角射击游戏:从美术生成到代码实现

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/2 13:50:35

农产品识别落地实战:CNN选型、数据治理与轻量化部署

简介:本资源是一套完整的基于卷积神经网络(CNN)的水果蔬菜图像识别系统,面向计算机、人工智能及相关专业本科生,适用于Python期末大作业、课程设计及毕业设计实践。项目聚焦图像分类核心任务,提供从数据预处…

作者头像 李华
网站建设 2026/9/2 13:50:26

内容很相关却不被AI引用?问题出在可信度

内容相关的文章不被AI引用,问题不一定出在内容本身,而是你的内容在AI的可信度评估体系里不达标。这篇文章会从AI引用机制的三个环节讲清楚“相关”和“可信”的区别,并给出诊断和落地方案。不知道你有没有遇到过这种情况:你在自己…

作者头像 李华
网站建设 2026/9/2 13:49:36

论文的摘要到结论信息一致性怎么保证?一篇讲透

导语 写论文时你可能遇到过这种情况:摘要里写的样本量是 320 份,正文方法部分却是 310 份;摘要结论说"干预显著改善了指标",正文结果里 p 值并不显著;退修意见里导师批了一句"结论与摘要口径不一致&quo…

作者头像 李华