UI-TARS-desktop 安装配置教程:用自然语言控制电脑,三步跑通第一个任务
2026/9/20 10:46:05 网站建设 项目流程

UI-TARS-desktop 安装配置教程:用自然语言控制电脑,三步跑通第一个任务

【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop

当你需要"把 VS Code 自动保存调成 500 毫秒"或"查看某个项目最新 issue"这类重复操作时,UI-TARS-desktop 能把一句自然语言变成真实的鼠标键盘动作。它是字节跳动出品的开源多模态 AI Agent 桌面应用,基于 UI-TARS 视觉语言模型,靠截图看懂界面、用自然语言下达指令,让你免去写脚本,直接驱动 Windows 与 macOS 完成 GUI 自动化。

先认识这个桌面应用

UI-TARS Desktop 是一个原生 GUI Agent 桌面程序:输入任务描述,它循环执行"截图—模型推理—执行动作",直到任务完成。官方同时提供两条执行路径:本地 Operator 直接操作你这台电脑,远程 Operator 在云端电脑或浏览器里执行。应用本身跨平台,支持 Windows 和 macOS。

能力速览:它和传统脚本差在哪

维度传统 GUI 自动化脚本UI-TARS Desktop
任务表达编写选择器与坐标代码一句自然语言
界面理解依赖 DOM 或控件树直接读截图,视觉定位
适配成本界面改版就改脚本换任务不用改代码
  • 你说清任务,它拆解成点击、输入、滚动等动作序列。
  • 它通过截图理解界面,你不用写选择器或维护坐标。
  • 动作落到像素级,你得到确定、可复现的执行结果。
  • 同一个应用跑在 Windows 和 macOS 上,跨平台配置基本一致。
  • 全程在本地执行,右侧面板实时展示每步截图与状态。

三步完成安装与首次配置

最省事的方式:macOS 上装好 Homebrew 后,一条命令完成安装:

brew install --cask ui-tars

备选方式:从 Releases 页下载对应平台的安装包。macOS 把应用拖入应用程序文件夹后,到系统设置的隐私与安全性中授予辅助功能与屏幕录制两项权限;Windows 双击安装包按向导完成即可。

接下来配置模型。它需要一个 OpenAI 兼容的视觉语言模型端点:在 Hugging Face 部署 UI-TARS-1.5-7B,或在火山引擎接入豆包 UI-TARS,拿到 Base URL、API Key 和模型名,填入设置面板。两个容易踩的坑:Base URL 必须以/v1/结尾;VLM Provider 必须与模型版本匹配,否则动作解析会出错。

VLM Provider: Hugging Face for UI-TARS-1.5 VLM Base URL: https://your-endpoint/v1/ VLM API KEY: your_api_key VLM Model Name: UI-TARS-1.5-7B

配置完成后点 Check Model Availability 验证连通,然后点 New Chat 开始对话。

跑两个任务看完整执行链路

任务一:本地改设置。选择 Use Local Computer 模式,输入:Open the autosave feature of VS Code and delay AutoSave operations for 500 milliseconds。它先启动 VS Code,打开设置面板,定位到 Auto Save 下拉项,选择 After Delay 并写入 500ms,最后输出完成说明。整个过程在右侧逐帧展示截图与动作。

任务二:浏览器查 issue。选择 Use Local Browser 模式,输入:Could you help me check the latest open issue of the UI-TARS-Desktop project on GitHub?。它打开本机浏览器,进入项目 issues 列表,按时间排序读出最新一条,把标题和摘要回传给你。

任务结束后点 Share 可把执行记录导出为 HTML 报告,方便回看或分享。

进阶能力:预设、SDK 与 Operator

  • 用预设一键切换环境:预设是一组设置的打包,支持从本地 YAML 文件或远程 URL 导入;远程预设带自动同步,应用每次启动都会拉取最新配置。团队共享环境参数时,发一个 URL 即可。
  • 用 SDK 自建 GUI Agent@ui-tars/sdk把"模型 + Operator"封装成GUIAgent,Node.js 与浏览器里都能跑,约十行代码就能接管你的电脑:
const guiAgent = new GUIAgent({ model, operator: new NutJSOperator() }); await guiAgent.run('open Chrome and check the weather');
  • 扩展执行环境:仓库内置四种 Operator——nut-js(桌面鼠标键盘)、browser(本机浏览器)、browserbase(云端浏览器)、adb(Android 设备)。自定义 Operator 只需实现screenshot()execute()两个方法,即可把 Agent 接进新的环境。

五个高频问题的直接答案

  • 为什么必须给屏幕录制权限?它靠截图理解界面,没有这项权限就无法感知屏幕,任务会直接失败。
  • 任务执行失败先查什么?按顺序排查:模型连通性、VLM Provider 与模型版本是否匹配、屏幕是否为单显示器设置。
  • 支持多显示器吗?目前只支持单显示器,多屏环境可能导致部分任务失败。
  • 浏览器模式有什么前置条件?本机需先装好 Chrome、Edge 或 Firefox 之一。
  • VLM 提供商怎么选?国际网络用 Hugging Face 的 UI-TARS-1.5 端点,国内网络用火山引擎的豆包端点;选对提供商才能正确解析动作。

延伸资源

  • 快速开始指南—docs/quick-start.md
  • 设置配置说明—docs/setting.md
  • 预设管理指南—docs/preset.md
  • SDK 使用指南—docs/sdk.md
  • 模型部署说明—docs/deployment.md
  • 示例预设文件—examples/presets/default.yaml

下一步动作

先跑通一个具体任务:在设置里点 Check Model Availability 确认模型连通,选 Use Local Browser,输入"打开某个网页并总结页面内容"。跑通后把 Max Loop 调高重试更长的任务,最后用预设固化你的模型配置,或打开 packages/ui-tars/sdk 把同样的能力接进自己的工具链。

【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询