3步上手UI-TARS:让AI替你点击、输入、操控整个电脑
2026/9/15 18:00:21 网站建设 项目流程

3步上手UI-TARS:让AI替你点击、输入、操控整个电脑

【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS

想象一下:你只需要说一句"打开文档、输入 hello、然后保存",屏幕上的鼠标就自己动起来了。这正是 UI-TARS 在做的事——一个由视觉语言模型驱动的 GUI 自动化智能体,它看着你的屏幕,思考下一步该干嘛,然后真的去点击、拖拽、输入。对想批量操作电脑、跑 UI 自动化测试、或搭建桌面 Agent 的人来说,它把"看图→决策→执行"整条链路都开源了出来。

它是什么,凭什么值得装

UI-TARS 不是传统的按键录制工具,而是一个能理解界面的 Agent。它吃进一张截图和一句自然语言指令,吐出带坐标的动作(点击、输入、滚动等),再由ui-tars这个 Python 包把动作翻译成可执行的 pyautogui 代码。你不需要手写定位逻辑,也不用维护脆弱的控件树,跨分辨率、跨应用都能跑。它适合自动化工程师、测试同学,以及想搭桌面 / 手机 Agent 的开发者。

5分钟跑通第一个动作

先装上解析包,再把模型输出的一句话翻译成真实坐标:

pip install ui-tars
from ui_tars.action_parser import parse_action_to_structure_output resp = "Thought: Click the button\nAction: click(start_box='(100,200)')" parsed = parse_action_to_structure_output(resp, factor=1000, origin_resized_height=1080, origin_resized_width=1920, model_type="qwen25vl") print(parsed)

到这里,你手里已经握着结构化动作了,剩下的执行交给 pyautogui 就行。

三个核心能力

看懂屏幕,说出"点什么"

UI-TARS 的强项在于"感知 + 决策"。给它一张截图,它会先描述看到了什么——元素、状态、界面结构——再给出 Thought 与 Action。这意味着它能处理"点那个蓝色的确认按钮"这类模糊指令,而不是死板的控件名。

跨分辨率的坐标换算

模型输出的坐标是相对值,ui-tars负责智能缩放与还原,把它映射回你真实屏幕上的像素位置。下面这张图就是坐标可视化效果,红点标出了模型真正瞄准的位置:

拿不准坐标对不对?直接翻官方整理的 坐标处理指南。

一套动作空间,电脑手机通吃

同一套模型,切换 Prompt 模板就能覆盖不同平台:桌面用COMPUTER_USE(点击、双击、拖拽、快捷键、滚动),手机用MOBILE_USE(长按、打开 App、返回、主页),轻量评测用GROUNDING(只输出动作不输出思考)。模板定义见 codes/ui_tars/prompt.py。

感知、动作、推理、学习构成的完整能力闭环,大致是这样的:

一个完整工作流:从截图到自动执行

以"自动填写并保存设置"为例,串起来就是四步:

  1. 部署模型:用 HuggingFace Inference Endpoints 拉起 UI-TARS-1.5-7B,流程见 部署指南。
  2. 喂入截图 + 指令:把当前屏幕截图和任务描述发给模型。
  3. 解析动作:拿到click/type等结构化动作,坐标已还原到 1920×1080。
  4. 执行:生成 pyautogui 脚本并运行。
from ui_tars.action_parser import parsing_response_to_pyautogui_code code = parsing_response_to_pyautogui_code(parsed, image_height=1080, image_width=1920) print(code)

每执行一步就再截一张图喂回去,Agent 就能多步走到底。

横向对比与适用边界

在公开基准上,UI-TARS-1.5 的成绩大致如下:

基准类型基准UI-TARS-1.5OpenAI CUAClaude 3.7
计算机操作OSWorld(100步)42.536.428
手机操作Android World64.2
界面定位ScreenSpotPro61.623.427.7

但它并不适合这些场景:需要 7×24 稳定运行的高并发生产调度(模型算力开销大);对单次点击延迟极度敏感的实时交互;以及你只是想录制一段固定按键序列——那种情况下传统脚本更快更省。此外它偶尔会"幻觉",在陌生或模糊界面上可能点错,关键操作前建议保留人工兜底。

常见问题

Q:坐标总是偏一点?A:确认传入的origin_resized_width / height是原图真实分辨率,别用缩放后的值。

Q:部署 7B 需要多大的卡?A:官方建议单卡 L40S 48G 或 A100;记得加环境变量CUDA_GRAPHS=0防部署失败。

Q:能在手机上用吗?A:可以,切到MOBILE_USE模板即可,支持长按、打开应用、返回等动作。

Q:我的模型输出格式匹配吗?A:model_type支持qwen25vldoubao等,按你实际用的视觉模型选对即可。

延伸资源

  • 部署与推理:README_deploy.md
  • 坐标处理详解:README_coordinates.md
  • Python 包 API:codes/README.md
  • Prompt 模板:codes/ui_tars/prompt.py
  • 项目论文:UI_TARS_paper.pdf

【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询