UI-TARS-desktop 安装配置教程:用自然语言控制电脑,三步跑通第一个任务
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
当你需要"把 VS Code 自动保存调成 500 毫秒"或"查看某个项目最新 issue"这类重复操作时,UI-TARS-desktop 能把一句自然语言变成真实的鼠标键盘动作。它是字节跳动出品的开源多模态 AI Agent 桌面应用,基于 UI-TARS 视觉语言模型,靠截图看懂界面、用自然语言下达指令,让你免去写脚本,直接驱动 Windows 与 macOS 完成 GUI 自动化。
先认识这个桌面应用
UI-TARS Desktop 是一个原生 GUI Agent 桌面程序:输入任务描述,它循环执行"截图—模型推理—执行动作",直到任务完成。官方同时提供两条执行路径:本地 Operator 直接操作你这台电脑,远程 Operator 在云端电脑或浏览器里执行。应用本身跨平台,支持 Windows 和 macOS。
能力速览:它和传统脚本差在哪
| 维度 | 传统 GUI 自动化脚本 | UI-TARS Desktop |
|---|---|---|
| 任务表达 | 编写选择器与坐标代码 | 一句自然语言 |
| 界面理解 | 依赖 DOM 或控件树 | 直接读截图,视觉定位 |
| 适配成本 | 界面改版就改脚本 | 换任务不用改代码 |
- 你说清任务,它拆解成点击、输入、滚动等动作序列。
- 它通过截图理解界面,你不用写选择器或维护坐标。
- 动作落到像素级,你得到确定、可复现的执行结果。
- 同一个应用跑在 Windows 和 macOS 上,跨平台配置基本一致。
- 全程在本地执行,右侧面板实时展示每步截图与状态。
三步完成安装与首次配置
最省事的方式:macOS 上装好 Homebrew 后,一条命令完成安装:
brew install --cask ui-tars备选方式:从 Releases 页下载对应平台的安装包。macOS 把应用拖入应用程序文件夹后,到系统设置的隐私与安全性中授予辅助功能与屏幕录制两项权限;Windows 双击安装包按向导完成即可。
接下来配置模型。它需要一个 OpenAI 兼容的视觉语言模型端点:在 Hugging Face 部署 UI-TARS-1.5-7B,或在火山引擎接入豆包 UI-TARS,拿到 Base URL、API Key 和模型名,填入设置面板。两个容易踩的坑:Base URL 必须以/v1/结尾;VLM Provider 必须与模型版本匹配,否则动作解析会出错。
VLM Provider: Hugging Face for UI-TARS-1.5 VLM Base URL: https://your-endpoint/v1/ VLM API KEY: your_api_key VLM Model Name: UI-TARS-1.5-7B配置完成后点 Check Model Availability 验证连通,然后点 New Chat 开始对话。
跑两个任务看完整执行链路
任务一:本地改设置。选择 Use Local Computer 模式,输入:Open the autosave feature of VS Code and delay AutoSave operations for 500 milliseconds。它先启动 VS Code,打开设置面板,定位到 Auto Save 下拉项,选择 After Delay 并写入 500ms,最后输出完成说明。整个过程在右侧逐帧展示截图与动作。
任务二:浏览器查 issue。选择 Use Local Browser 模式,输入:Could you help me check the latest open issue of the UI-TARS-Desktop project on GitHub?。它打开本机浏览器,进入项目 issues 列表,按时间排序读出最新一条,把标题和摘要回传给你。
任务结束后点 Share 可把执行记录导出为 HTML 报告,方便回看或分享。
进阶能力:预设、SDK 与 Operator
- 用预设一键切换环境:预设是一组设置的打包,支持从本地 YAML 文件或远程 URL 导入;远程预设带自动同步,应用每次启动都会拉取最新配置。团队共享环境参数时,发一个 URL 即可。
- 用 SDK 自建 GUI Agent:
@ui-tars/sdk把"模型 + Operator"封装成GUIAgent,Node.js 与浏览器里都能跑,约十行代码就能接管你的电脑:
const guiAgent = new GUIAgent({ model, operator: new NutJSOperator() }); await guiAgent.run('open Chrome and check the weather');- 扩展执行环境:仓库内置四种 Operator——nut-js(桌面鼠标键盘)、browser(本机浏览器)、browserbase(云端浏览器)、adb(Android 设备)。自定义 Operator 只需实现
screenshot()与execute()两个方法,即可把 Agent 接进新的环境。
五个高频问题的直接答案
- 为什么必须给屏幕录制权限?它靠截图理解界面,没有这项权限就无法感知屏幕,任务会直接失败。
- 任务执行失败先查什么?按顺序排查:模型连通性、VLM Provider 与模型版本是否匹配、屏幕是否为单显示器设置。
- 支持多显示器吗?目前只支持单显示器,多屏环境可能导致部分任务失败。
- 浏览器模式有什么前置条件?本机需先装好 Chrome、Edge 或 Firefox 之一。
- VLM 提供商怎么选?国际网络用 Hugging Face 的 UI-TARS-1.5 端点,国内网络用火山引擎的豆包端点;选对提供商才能正确解析动作。
延伸资源
- 快速开始指南—docs/quick-start.md
- 设置配置说明—docs/setting.md
- 预设管理指南—docs/preset.md
- SDK 使用指南—docs/sdk.md
- 模型部署说明—docs/deployment.md
- 示例预设文件—examples/presets/default.yaml
下一步动作
先跑通一个具体任务:在设置里点 Check Model Availability 确认模型连通,选 Use Local Browser,输入"打开某个网页并总结页面内容"。跑通后把 Max Loop 调高重试更长的任务,最后用预设固化你的模型配置,或打开 packages/ui-tars/sdk 把同样的能力接进自己的工具链。
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考