如何部署一个替你点鼠标的开源 GUI 智能体:UI-TARS 完全指南
2026/9/15 12:53:35 网站建设 项目流程

如何部署一个替你点鼠标的开源 GUI 智能体:UI-TARS 完全指南

【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS

RPA 脚本写一半,页面换个版本全废;闭源的 Computer Use 又贵又是黑盒。UI-TARS 是字节开源的 GUI 智能体模型家族:给它一张截图和一句人话,它回你 Thought + Action,一行click(start_box='(177,549)')就能被 pyautogui 直接执行。这个仓库里装着部署手册、3 套提示词模板和坐标解析工具包。

定位解决产物上手成本
开源多模态 GUI 智能体(1.5-7B 开源)不用选择器和 DOM,模型直接看截图决定点哪可调 API 的模型 + 可执行 pyautogui 脚本一个云 GPU 实例 + 一次 pip install

部署 7B 模型,几分钟拿到第一个动作

最短路径走 HF Inference Endpoints 部署:选 UI-TARS-1.5-7B,硬件至少 L40S 1×48G(L4/A100 也行);把 3 个 token 上限设为 65536、65536、65537,加 2 个环境变量CUDA_GRAPHS=0PAYLOAD_LIMIT=8000000,模型就以 OpenAI 兼容接口对外服务。

调用时temperature=0.0,把 data/test_messages.json 里的"任务 + 截图 + 历史消息"喂进去,返回是固定两行:

Thought: 我看到 Preferences 窗口已经打开…… 让我点击它看看里面有什么选项 Action: click(start_box='(177,549)')

所以呢:一个能调 API 的"读屏"模型到手,部署细节看 README_deploy.md。

用一句话驱动桌面自动化

你会怎么说:"打开 Documents/Papers 里的文档,在 Word 中打上 hello,保存"——这是COMPUTER_USE模板里的真实示例。背后模型有 9 个动作可选:单击/双击/右键、拖拽、快捷键、输入、滚动、等待、结束。两条硬约束:hotkey最多 3 个键(如 ctrl c);wait()睡 5 秒再截图确认画面变化。

产出是结构化 dict 加 pyautogui 脚本,点击、输入、拖拽都能执行。所以呢:界面只有截图这一种形式,屏幕上看到什么它就能操作什么,跟应用是谁无关。

切换手机与评测场景,只换提示词模板

同一个模型,三种用法,不用重训。手机或安卓模拟器用MOBILE_USE,多了long_pressopen_apppress_homepress_back4 个移动动作;只测"找不找得到元素"就用GROUNDING,只输出 Action 不带 Thought。三套模板全在 codes/ui_tars/prompt.py。所以呢:换提示词就是换设备。

把模型坐标换算回真实屏幕

模型嘴里的坐标不是你屏幕的像素值。Qwen2.5-VL 在 smart-resize 后的图上输出绝对坐标(缩放因子 28,总像素被压在 78400 到 12845056 之间),必须换算回原始分辨率。官方解析包一条命令装好:

pip install ui-tars

parse_action_to_structure_output(factor=1000,model_type='qwen25vl')把原始输出解析成结构化动作,parsing_response_to_pyautogui_code再吐出可执行脚本。仓库里有现成例子:GIMP 的 Preferences 窗口,模型输出 (177,549),可视化代码用红点标出落点:

所以呢:不做这一步,模型只会"说"不会"做"。参数推导见 README_coordinates.md。

拆解它的高跑分:先思考再行动

核心设计是 RL 增强的推理:每个动作前先有 Thought 写出计划和目标元素,让模型多想一会儿,表现就更稳(推理时缩放)。硬数字:

  • OSWorld 桌面基准 42.5,OpenAI CUA 36.4,Claude 3.7 为 28
  • ScreenSpot-V2 定位 94.2,ScreenSpotPro 61.6,此前 SOTA 43.6
  • Android World 64.2;Poki 浏览器游戏 14 个里 13 个满分 100
  • 可验证细节:输出固定 Thought / Action 两行,解析是确定规则,不需要再用 LLM 读一遍

所以呢:"看和判断"是护城河,解析链路完全可控。

别硬用:这 5 种情况先收手

官方 Limitations 写得很实在:

  • 误用风险:模型能过 CAPTCHA,双刃剑,别指向受保护接口
  • 算力:长任务要正经的 GPU,48G 级别实例起步
  • 幻觉:模糊界面会认错元素、走错动作,执行日志还得人工过
  • 版本:能下载的是 1.5-7B(OSWorld 27.5),更强的 1.5 大模型(42.5)只给研究访问
  • ⚠️ 固定界面 + 固定流程:手写脚本更稳更省,别上模型

判断标准就一条:界面经常变、元素写不成选择器、需要"看和判断"→ 用 UI-TARS;流程固定 → 用 RPA。

今天就做:三步跑通最小闭环

最小闭环三步:按部署手册把 7B 端点跑起来;喂样例消息等第一条 Thought + Action;点偏了就去坐标手册查 factor 和分辨率参数。

【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询