三步用上 OmniParser:纯视觉屏幕解析完整指南
【免费下载链接】OmniParserA simple screen parsing tool towards pure vision based GUI agent项目地址: https://gitcode.com/GitHub_Trending/omn/OmniParser
写自动化脚本时,你八成卡在"怎么让程序看懂屏幕"。传统做法靠读页面或应用的内部接口,一升级就失灵。OmniParser 是微软开源的纯视觉屏幕解析工具:它不看代码,只读画面,直接把按钮、菜单、文本框一个个框出来、编上号,再交给视觉模型去操作。
最短路径:克隆、装依赖、跑起来
先拿到结果,原理后面再说。最短路径就是几条命令:
git clone https://gitcode.com/GitHub_Trending/omn/OmniParser cd OmniParser pip install -r requirements.txt装好后运行python gradio_demo.py(到这里正好四条命令)。浏览器会自动打开演示页:左边传一张截图、点 Submit,右边就返回带框选和编号的解析图,以及每个元素的文字描述。首次运行会拉取模型权重,稍等片刻即可。
它为什么不用代码,也能看懂界面
打个比方:你瞄一眼餐厅菜单,并不需要知道菜单用什么字体、什么布局代码做的,扫一眼就知道"牛肉面"在第三行、能点。OmniParser 做的事接近这样。
具体分三步:先用一个 YOLOv9 目标检测模型找出"这里有图标或按钮",再用 OCR 读出框里的字,最后用 caption 模型给每个图标配一句功能描述,比如"搜索""刷新"。全程本地跑,画面不出机器,对界面长什么样没有硬性要求:Word、Excel、网页、Windows 桌面、macOS 都能解析。
看真实解析结果
看这张 Google 股票页面的解析图:搜索框、每个标签页(Finance、News…)、图表上的 1D/5D 切换、右侧公司列表里的涨跌幅箭头,全都被彩色框框住,顶上标了序号。这个序号就是"下一步该点哪"的索引,视觉模型靠它对齐到具体区域。
再进一步,仓库里的 OmniParser+X 演示把它接上 GPT-4o、Claude 等视觉模型:你在聊天框里写"找到 strawberry 里 r 的个数",它自己看带编号的屏幕截图,分析出搜索结果,再决定下一步动作。
什么人适合先用它
两类人最划算:一是做 RPA、自动化测试,不想再维护一堆坐标和 XPath 的;二是想给自己搭"能看屏幕的 AI 助手"、又不想啃 GUI 底层接口的。它解析一张典型桌面或网页截图通常几秒内完成,建议先拿 示例脚本 里那几个样例(Word、Excel、网页)跑通,确认框选准不准,再决定要不要接进自己的 agent 流程。显存够的体验最好,纯 CPU 也能跑,只是慢一些。
【免费下载链接】OmniParserA simple screen parsing tool towards pure vision based GUI agent项目地址: https://gitcode.com/GitHub_Trending/omn/OmniParser
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考