如何部署一个替你点鼠标的开源 GUI 智能体:UI-TARS 完全指南
【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS
RPA 脚本写一半,页面换个版本全废;闭源的 Computer Use 又贵又是黑盒。UI-TARS 是字节开源的 GUI 智能体模型家族:给它一张截图和一句人话,它回你 Thought + Action,一行click(start_box='(177,549)')就能被 pyautogui 直接执行。这个仓库里装着部署手册、3 套提示词模板和坐标解析工具包。
| 定位 | 解决 | 产物 | 上手成本 |
|---|---|---|---|
| 开源多模态 GUI 智能体(1.5-7B 开源) | 不用选择器和 DOM,模型直接看截图决定点哪 | 可调 API 的模型 + 可执行 pyautogui 脚本 | 一个云 GPU 实例 + 一次 pip install |
部署 7B 模型,几分钟拿到第一个动作
最短路径走 HF Inference Endpoints 部署:选 UI-TARS-1.5-7B,硬件至少 L40S 1×48G(L4/A100 也行);把 3 个 token 上限设为 65536、65536、65537,加 2 个环境变量CUDA_GRAPHS=0和PAYLOAD_LIMIT=8000000,模型就以 OpenAI 兼容接口对外服务。
调用时temperature=0.0,把 data/test_messages.json 里的"任务 + 截图 + 历史消息"喂进去,返回是固定两行:
Thought: 我看到 Preferences 窗口已经打开…… 让我点击它看看里面有什么选项 Action: click(start_box='(177,549)')
所以呢:一个能调 API 的"读屏"模型到手,部署细节看 README_deploy.md。
用一句话驱动桌面自动化
你会怎么说:"打开 Documents/Papers 里的文档,在 Word 中打上 hello,保存"——这是COMPUTER_USE模板里的真实示例。背后模型有 9 个动作可选:单击/双击/右键、拖拽、快捷键、输入、滚动、等待、结束。两条硬约束:hotkey最多 3 个键(如 ctrl c);wait()睡 5 秒再截图确认画面变化。
产出是结构化 dict 加 pyautogui 脚本,点击、输入、拖拽都能执行。所以呢:界面只有截图这一种形式,屏幕上看到什么它就能操作什么,跟应用是谁无关。
切换手机与评测场景,只换提示词模板
同一个模型,三种用法,不用重训。手机或安卓模拟器用MOBILE_USE,多了long_press、open_app、press_home、press_back4 个移动动作;只测"找不找得到元素"就用GROUNDING,只输出 Action 不带 Thought。三套模板全在 codes/ui_tars/prompt.py。所以呢:换提示词就是换设备。
把模型坐标换算回真实屏幕
模型嘴里的坐标不是你屏幕的像素值。Qwen2.5-VL 在 smart-resize 后的图上输出绝对坐标(缩放因子 28,总像素被压在 78400 到 12845056 之间),必须换算回原始分辨率。官方解析包一条命令装好:
pip install ui-tarsparse_action_to_structure_output(factor=1000,model_type='qwen25vl')把原始输出解析成结构化动作,parsing_response_to_pyautogui_code再吐出可执行脚本。仓库里有现成例子:GIMP 的 Preferences 窗口,模型输出 (177,549),可视化代码用红点标出落点:
所以呢:不做这一步,模型只会"说"不会"做"。参数推导见 README_coordinates.md。
拆解它的高跑分:先思考再行动
核心设计是 RL 增强的推理:每个动作前先有 Thought 写出计划和目标元素,让模型多想一会儿,表现就更稳(推理时缩放)。硬数字:
- OSWorld 桌面基准 42.5,OpenAI CUA 36.4,Claude 3.7 为 28
- ScreenSpot-V2 定位 94.2,ScreenSpotPro 61.6,此前 SOTA 43.6
- Android World 64.2;Poki 浏览器游戏 14 个里 13 个满分 100
- 可验证细节:输出固定 Thought / Action 两行,解析是确定规则,不需要再用 LLM 读一遍
所以呢:"看和判断"是护城河,解析链路完全可控。
别硬用:这 5 种情况先收手
官方 Limitations 写得很实在:
- 误用风险:模型能过 CAPTCHA,双刃剑,别指向受保护接口
- 算力:长任务要正经的 GPU,48G 级别实例起步
- 幻觉:模糊界面会认错元素、走错动作,执行日志还得人工过
- 版本:能下载的是 1.5-7B(OSWorld 27.5),更强的 1.5 大模型(42.5)只给研究访问
- ⚠️ 固定界面 + 固定流程:手写脚本更稳更省,别上模型
判断标准就一条:界面经常变、元素写不成选择器、需要"看和判断"→ 用 UI-TARS;流程固定 → 用 RPA。
今天就做:三步跑通最小闭环
最小闭环三步:按部署手册把 7B 端点跑起来;喂样例消息等第一条 Thought + Action;点偏了就去坐标手册查 factor 和分辨率参数。
【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考