UI-TARS-desktop:4 步上手,用一句自然语言替你操作电脑与浏览器
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
每天早上打开浏览器、登录后台、导出报表,同样的鼠标点击重复几十次。UI-TARS-desktop 让你用一句自然语言完成这些事:它是一个开源的 GUI Agent 桌面应用,靠视觉大模型看懂屏幕,自动完成点击、输入、滚动等图形界面操作,替你操控本地电脑和浏览器。
项目定位:它替你解决的,是"重复点击"这件事
一句话:把"用鼠标和键盘完成的 GUI 操作"交给 AI,你只负责用自然语言下指令。
它和传统自动化工具(写脚本、找控件、维护坐标)的核心差异:
- 视觉驱动,不依赖 DOM—— 通过实时截屏识别界面元素,所以不仅能在网页里操作,也能操作 VS Code、Finder 这类原生桌面应用
- 零脚本的自然语言交互—— 不用写任何代码,直接说"把自动保存延迟设为 500 毫秒",模型自行拆解步骤
- 双操作器模式—— 本地计算机操作器直接控制你的电脑;本地浏览器操作器控制已安装的 Chrome/Edge/Firefox
- 跨平台—— 提供 Windows 与 macOS 版本
- 本地执行—— 截屏与操作都在你自己的机器上完成,屏幕内容不出本机
快速上手路径:4 步跑通第一个 GUI 自动化任务
整条主线是:装应用 → 给权限 → 接模型 → 下指令。
第 1 步:安装应用。macOS 有 Homebrew 时一条命令即可,没有则从发布页下载后拖入 Applications;Windows 直接运行安装程序。
brew install --cask ui-tars第 2 步:授予系统权限(macOS 必须)。进入 系统设置 → 隐私与安全性,分别打开"辅助功能"和"屏幕录制"两项 UI TARS 权限——前者让它可以控制鼠标键盘,后者让它能截屏读屏。
第 3 步:接入视觉语言模型。打开设置界面,在右上角点击Deploy from Hugging Face部署UI-TARS-1.5-7B端点,拿到 Base URL、API Key 和模型名称填入设置(中文用户也可以改用火山引擎的 Doubao-1.5-UI-TARS,下一节会给现成配置)。
填完点一下Check Model Availability,能连通就可以开工了。
第 4 步:发起任务。点击"开始新任务",选择本地计算机或浏览器模式,输入指令,AI 开始逐步操作。
关键配置:最省事的 4 个必填项
真正需要理解的只有 4 个配置项,其余全部保持默认即可。
| 配置项 | 默认值 | 推荐值 | 说明 |
|---|---|---|---|
| VLM Provider | 无默认,必填 | 与模型来源一致,如Hugging Face for UI-TARS-1.5 | 选错会导致动作解析错位,这是最常见的配置失误 |
| VLM Base URL | 必填 | Hugging Face 端点地址 | HF 端点必须以/v1/结尾 |
| Language | en | 中文用户改zh | 只影响模型输出语言,不影响应用界面语言 |
| Max Loop | 100 | 常规任务可降到50 | 单轮任务的最大步数,范围 25-200 |
如果你走火山引擎路线,直接把下面这份配置贴进设置即可,来自官方文档的现成示例:
Language: cn VLM Provider: VolcEngine Ark for Doubao-1.5-UI-TARS VLM Base URL: https://ark.cn-beijing.volces.com/api/v3 VLM API KEY: YOUR_API_KEY VLM Model Name: doubao-1.5-ui-tars-250328完整参数说明见 docs/setting.md。
典型使用场景:3 条照着就能成功的自然语言指令
选对模式(本地计算机 or 浏览器),然后把指令原样输入,就是可复现的最小任务。
场景一:修改桌面应用设置(本地计算机模式)
请帮我在 VS Code 设置中打开自动保存功能,并将自动保存操作延迟设置为 500 毫秒
预期效果:应用自动打开 VS Code、进入设置、找到自动保存选项、打开开关并修改延迟值。这是官方展示的经典用例。
场景二:网页信息抓取(浏览器模式)
帮我查看一下 GitHub 上 UI-TARS-desktop 项目的最新 open issue
预期效果:自动唤起已安装的 Chrome/Edge/Firefox,导航到 issues 页面,读取并汇报最新问题。
场景三:组合操作(浏览器模式)
打开浏览器,在天气网站查询今天北京的天气,并把最高温度告诉我
预期效果:打开浏览器 → 进入天气站 → 定位北京 → 读屏提取最高温,全程你只需看结果。
执行过程中你可以在应用里实时查看每一步的截图与动作,随时叫停。
进阶玩法:SDK、操作器与预设管理
桌面应用之外,仓库里还有三块值得看一眼的生态。
① SDK:把 GUI Agent 装进你自己的程序。@ui-tars/sdk支持 Node.js 和浏览器环境,一行命令就能在命令行里体验:
npx @ui-tars/cli start填入模型配置后即可控制电脑。SDK 源码在 packages/ui-tars/sdk/,文档见 docs/sdk.md。
② 多操作器:同一个模型,驱动不同设备。packages/ui-tars/operators/ 内置 NutJS 桌面操作器(鼠标/键盘/滚动/截屏)、ADB 操作器(Android 设备)、浏览器操作器与 browserbase 云端操作器,你也可以基于 Operator 接口扩展自己的设备。
③ 预设管理:一套配置,多机同步。支持从 YAML 文件或 URL 导入预设,URL 预设每次启动应用时自动拉取更新,适合团队共享同一套模型配置。示例文件见 examples/presets/default.yaml,机制说明见 docs/preset.md。
另外,每轮任务结束后可以把执行过程"导出为 HTML",得到带截图的完整操作报告,方便复盘或分享。
常见问题:权限、模型连接与多显示器
Q1:macOS 为什么必须给"辅助功能"和"屏幕录制"两个权限?"屏幕录制"负责截屏读屏,"辅助功能"负责控制鼠标键盘,缺任何一个任务都无法执行。授权后建议重启应用。
Q2:点击Check Model Availability连接失败,怎么排查?按顺序查三处:Hugging Face 的 Base URL 是否以/v1/结尾;VLM Provider 是否与模型来源一致(HF 模型必须选Hugging Face for UI-TARS-1.5);API Key 是否从对应端点页面复制。
Q3:浏览器模式用不了?浏览器操作器控制的是你本机安装的浏览器,需要先装好 Chrome、Edge 或 Firefox 的任一稳定版。
Q4:支持多显示器吗?目前仅支持单显示器环境,多显示器配置可能导致部分任务执行失败,见 docs/quick-start.md 的前置说明。
Q5:复杂任务跑不完或步骤失控怎么办?把 Max Loop 调小限制步数,并把大任务拆成"打开某应用""完成某设置"这样的子任务分次执行,成功率更稳定。
资源导航与下一步
- 快速开始:docs/quick-start.md
- 设置详解:docs/setting.md
- 预设管理:docs/preset.md
- SDK 文档:docs/sdk.md
- 示例预设:examples/presets/default.yaml
- 操作器源码:packages/ui-tars/operators/
- 桌面应用源码:apps/ui-tars/src/
- 从源码构建可执行
git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop后按仓库说明安装依赖
下一步很简单:装好应用、配好模型后,先跑一个最小任务——"打开浏览器并搜索今天的新闻"。它能成功,你就已经具备了用自然语言自动化一切重复操作的能力。
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考