3步上手UI-TARS:让AI替你点击、输入、操控整个电脑
【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS
想象一下:你只需要说一句"打开文档、输入 hello、然后保存",屏幕上的鼠标就自己动起来了。这正是 UI-TARS 在做的事——一个由视觉语言模型驱动的 GUI 自动化智能体,它看着你的屏幕,思考下一步该干嘛,然后真的去点击、拖拽、输入。对想批量操作电脑、跑 UI 自动化测试、或搭建桌面 Agent 的人来说,它把"看图→决策→执行"整条链路都开源了出来。
它是什么,凭什么值得装
UI-TARS 不是传统的按键录制工具,而是一个能理解界面的 Agent。它吃进一张截图和一句自然语言指令,吐出带坐标的动作(点击、输入、滚动等),再由ui-tars这个 Python 包把动作翻译成可执行的 pyautogui 代码。你不需要手写定位逻辑,也不用维护脆弱的控件树,跨分辨率、跨应用都能跑。它适合自动化工程师、测试同学,以及想搭桌面 / 手机 Agent 的开发者。
5分钟跑通第一个动作
先装上解析包,再把模型输出的一句话翻译成真实坐标:
pip install ui-tarsfrom ui_tars.action_parser import parse_action_to_structure_output resp = "Thought: Click the button\nAction: click(start_box='(100,200)')" parsed = parse_action_to_structure_output(resp, factor=1000, origin_resized_height=1080, origin_resized_width=1920, model_type="qwen25vl") print(parsed)到这里,你手里已经握着结构化动作了,剩下的执行交给 pyautogui 就行。
三个核心能力
看懂屏幕,说出"点什么"
UI-TARS 的强项在于"感知 + 决策"。给它一张截图,它会先描述看到了什么——元素、状态、界面结构——再给出 Thought 与 Action。这意味着它能处理"点那个蓝色的确认按钮"这类模糊指令,而不是死板的控件名。
跨分辨率的坐标换算
模型输出的坐标是相对值,ui-tars负责智能缩放与还原,把它映射回你真实屏幕上的像素位置。下面这张图就是坐标可视化效果,红点标出了模型真正瞄准的位置:
拿不准坐标对不对?直接翻官方整理的 坐标处理指南。
一套动作空间,电脑手机通吃
同一套模型,切换 Prompt 模板就能覆盖不同平台:桌面用COMPUTER_USE(点击、双击、拖拽、快捷键、滚动),手机用MOBILE_USE(长按、打开 App、返回、主页),轻量评测用GROUNDING(只输出动作不输出思考)。模板定义见 codes/ui_tars/prompt.py。
感知、动作、推理、学习构成的完整能力闭环,大致是这样的:
一个完整工作流:从截图到自动执行
以"自动填写并保存设置"为例,串起来就是四步:
- 部署模型:用 HuggingFace Inference Endpoints 拉起 UI-TARS-1.5-7B,流程见 部署指南。
- 喂入截图 + 指令:把当前屏幕截图和任务描述发给模型。
- 解析动作:拿到
click/type等结构化动作,坐标已还原到 1920×1080。 - 执行:生成 pyautogui 脚本并运行。
from ui_tars.action_parser import parsing_response_to_pyautogui_code code = parsing_response_to_pyautogui_code(parsed, image_height=1080, image_width=1920) print(code)每执行一步就再截一张图喂回去,Agent 就能多步走到底。
横向对比与适用边界
在公开基准上,UI-TARS-1.5 的成绩大致如下:
| 基准类型 | 基准 | UI-TARS-1.5 | OpenAI CUA | Claude 3.7 |
|---|---|---|---|---|
| 计算机操作 | OSWorld(100步) | 42.5 | 36.4 | 28 |
| 手机操作 | Android World | 64.2 | — | — |
| 界面定位 | ScreenSpotPro | 61.6 | 23.4 | 27.7 |
但它并不适合这些场景:需要 7×24 稳定运行的高并发生产调度(模型算力开销大);对单次点击延迟极度敏感的实时交互;以及你只是想录制一段固定按键序列——那种情况下传统脚本更快更省。此外它偶尔会"幻觉",在陌生或模糊界面上可能点错,关键操作前建议保留人工兜底。
常见问题
Q:坐标总是偏一点?A:确认传入的origin_resized_width / height是原图真实分辨率,别用缩放后的值。
Q:部署 7B 需要多大的卡?A:官方建议单卡 L40S 48G 或 A100;记得加环境变量CUDA_GRAPHS=0防部署失败。
Q:能在手机上用吗?A:可以,切到MOBILE_USE模板即可,支持长按、打开应用、返回等动作。
Q:我的模型输出格式匹配吗?A:model_type支持qwen25vl、doubao等,按你实际用的视觉模型选对即可。
延伸资源
- 部署与推理:README_deploy.md
- 坐标处理详解:README_coordinates.md
- Python 包 API:codes/README.md
- Prompt 模板:codes/ui_tars/prompt.py
- 项目论文:UI_TARS_paper.pdf
【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考