Maestro AI 测试实操:让自然语言替你写移动 UI 自动化测试
【免费下载链接】MaestroPainless E2E Automation for Mobile and Web项目地址: https://gitcode.com/GitHub_Trending/ma/Maestro
产品组改了一个页面,UI 自动化测试套件第二天就集体变红。控件 ID 换了、按钮文案改了,测试同学大半时间在修选择器,而不是在找新 bug。这正是 Maestro 这款移动 UI 自动化测试工具想解决的:用 AI 测试把断言写成自然语言,让视觉缺陷检测直接看截图,一份脚本同时跑 Android 和 iOS。
传统写法里,测试脚本像一台"录像机":记录点哪个坐标、匹配哪个 ID、按什么顺序。界面上任何一个词变动,录像就作废;Android 和 iOS 的控件树又不一致,还得维护两套脚本。页面越多,这种负担越重。
它解决了什么
Maestro 的思路是把"录像机"换成"验收员"。你不再说"点坐标 (320, 512)",而是说"进入登录页后,应该能看到用户名和密码输入框"。执行时模型看着当前界面,结合视图层级和截图来判断这句话是否成立——就像让同事帮你确认"这个页面长得对不对",他理解的是画面含义,不是坐标。
这样一来,按钮文案从"登录"改成"Sign in",写"登录入口可见"的断言大概率依然通过,脚本不用动,因为它持有的是意图而不是坐标。这些能力实现在 maestro-ai/src/ 模块里,同时支持 OpenAI 与 Anthropic 两种模型,只需一个环境变量即可切换。
📸 功能体验
视觉回归测试怎么开
assertNoDefectsWithAI让模型对截图做一次"体检":元素重叠、错位、图片加载失败这类没法写死判定条件的异常,会直接报出来。
- launchApp: clearState: true - tapOn: 缺陷测试 - assertNoDefectsWithAI: optional: true label: 检查页面布局是否正常效果很直接:过去那种"我看着不对劲,但写不出断言"的问题,一行就能覆盖,也不必再维护图片基线去逐像素比对。演示应用的缺陷页就走了这套流程——界面里放了一张兔子图,由模型确认它是否渲染正常。
自然语言测试断言怎么写
assertWithAI是通用断言:把界面应该呈现的样子用一句话写出来,由模型判定通过与否。
- launchApp: clearState: true - assertWithAI: optional: true assertion: 登录入口可见,且没有被弹窗遮挡断言写成句子之后,就是一份可读的自然语言测试脚本:界面措辞变了、只要语义没变,断言照样有效。配合 e2e/workspaces/ 下的现成样例,可以直接照抄它和tapOn、waitUntil等确定性命令混用的写法。
一次描述双平台脚本
同一个 flow 文件在 Android 和 iOS 上原样可跑。遇到平台特有交互时,AI 断言也比较宽容:Android 的返回键和 iOS 的侧滑返回,对模型来说都是"退回上一级"。
- launchApp: clearState: true - assertWithAI: assertion: 主界面导航菜单已显示写一次用例,就不用再维护两份脚本。平台差异较大的页面,可以参考仓库里 Wikipedia 工作区按平台拆 subflows 的做法,把公共步骤留在主流程里。
5 分钟配置 AI 测试
- 获取源码:
git clone https://gitcode.com/GitHub_Trending/ma/maestro - 构建 AI 模块:
./gradlew :maestro-ai:installDist - 配置模型密钥(OpenAI 或 Anthropic 均可):
export MAESTRO_CLI_AI_KEY=sk-... - 跑官方演示:
./maestro-ai/build/install/maestro-ai-demo/bin/maestro-ai-demo --help,传入一张截图即可看到缺陷检测输出 - 写自己的 flow 后用
maestro test运行,可以直接指向 e2e/demo_app/ 里的示例应用验证
工程细节
- 防抖机制。
extendedWaitUntil支持动态等待元素出现,内部还带 40ms 的状态稳定检测,界面没就绪就不会急着操作,这是 AI 断言少报误红的主要原因。 - MCP 服务器。Maestro 的 MCP 服务暴露了 14 种测试工具调用,含
list_devices、tap_on、run_flow、query_docs、cheat_sheet;评测集 maestro-cli/src/test/mcp/full-evals.yaml 用 LLM judge 给工具调用打分,阈值 0.8,保证自动化调用不"乱来"。 - 成本分级。重复场景复用历史分析结果,简单断言走低配模型(如 Claude-3-5-Haiku 级别),只对界面变化区域做增量分析,token 开销不随用例数线性上涨。
⚠️ 避坑指南
- 不要把每条断言都丢给模型。能写
assertVisible、tapOn的就写成确定性命令,assertWithAI留给语义级判断,这是最省 token 的做法。 - 不稳定的页面别忘了
optional: true。广告位、临时弹窗这类元素如果硬断言,整个流程会直接红;设成可选,失败时跳过而不打断主流程。 - 别用 AI 做像素级比对。真要逐像素对比界面,请用
assertScreenshot加图片基线;让 AI 负责"看起来对不对劲",各干各的活。 - 别没起 fixture 服务就跑 web 流程。e2e/workspaces 下的 web 用例依赖本地静态服务,服务没起来时报的是
Element not found,排查方向会完全跑偏。
AI 测试的价值,在于把测试同学的注意力从"追选择器"拉回"业务应该长什么样"。把密钥配好,挑一个最不稳的页面丢一条assertWithAI,看看有多少维护工作能交给模型去做。
【免费下载链接】MaestroPainless E2E Automation for Mobile and Web项目地址: https://gitcode.com/GitHub_Trending/ma/Maestro
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考