如何用WebRPA采集网页数据:从元素定位到Excel导出的3步实操教程
【免费下载链接】WebRPAA powerful no-code automation tool. Build workflows via drag-and-drop modules for web scraping, form filling and automated testing. | 一款功能强大的自动化工具,通过拖拽模块的方式快速构建自动化工作流,无需编写任何代码即可实现网页数据采集、表单填写、自动化测试等任务。【QQ交流群:115069513】项目地址: https://gitcode.com/gh_mirrors/we/WebRPA
WebRPA 是一款零代码的网页数据采集与流程自动化工具,通过拖拽模块即可搭建采集工作流,无需编写任何代码。本教程带你用 3 步走完「元素定位 → 数据收集 → Excel 导出」的完整闭环:打开一个目标网页,用可视化元素选择器点选要采集的内容,数据自动汇入数据表格,最后一条模块导出为 Excel 或 CSV 文件。适合运营、测试、数据录入等被重复采集工作困扰的新手用户。
👉 适合人群:没有编程基础,但需要定期从网站抓取商品、评论、列表数据的普通用户。
准备工作:2分钟启动WebRPA网页采集工具
WebRPA 完全免费、可离线运行,自带 Python 与 Node.js 环境,解压即用:
- 到项目 Releases 页面下载最新版 7z 压缩包并解压(详见 README.md 的快速开始章节)
- 双击
WebRPA启动器.exe,点击"启动 WebRPA"按钮 - 启动器会自动打开浏览器进入前端编辑器(默认 http://localhost:5921)
图:WebRPA 控制中心启动器,一键拉起后端与前端编辑器
启动后如果浏览器未打开,可以点击右上角「打开」按钮进入编辑器。
第1步:用可视化元素选择器定位网页元素
采集网页数据的第一步是"告诉工具要采集哪个元素"。WebRPA 内置的元素选择器让你完全不用手写 CSS 选择器——鼠标点一下就行,原理实现可查看 picker.py。
启动方式(二选一):
- 点击顶部工具栏自动化浏览器→启动选择器
- 在任意模块配置面板中,点击"选择器"输入框右侧的 🎯 按钮
三种选择模式:
| 操作 | 功能 | 使用场景 |
|---|---|---|
| Ctrl + 点击 | 选择单个元素 | 按钮、输入框、"下一页"链接 |
| Alt + 点击 | 选择相似元素 | 列表项、商品卡片、表格行 |
| Esc | 取消选择 | 选错了重新来 |
💡 小技巧:采集列表型数据(如 10 个商品标题)时,用Alt + 点击点两个相似元素,系统会自动识别出所有相似项,生成的选择器自带
{index}变量,正好配合循环模块批量遍历。
详细说明可参考官方教学文档:content-browser.ts。
图:WebRPA 网页数据采集工作流编辑器,左侧拖入模块、画布连线、右侧配置面板
第2步:搭工作流,数据自动收集进数据表格
这是整个采集的核心。在左侧模块栏搜索并拖入以下模块(模块总数 542+,支持中文/拼音模糊搜索):
推荐流程(以采集商品列表为例):
- 打开网页:填入目标网址,等待条件建议选
networkidle(适合动态加载页面) - 获取子元素:父元素选商品列表容器、子元素选商品卡片
- 遍历列表:数据源指向第 2 步的变量
- 获取元素信息:这是数据采集的"心脏"模块——
- 提取类型:文本 / 属性(如
href链接)/ HTML - 关键设置:填写「存储的列名」,如
商品名称、价格,数据就会自动收集到底部数据表格,无需额外写"添加行"模块
- 提取类型:文本 / 属性(如
- 循环体外再串一个点击元素(下一页)+等待元素,即可自动翻页
各模块的完整参数说明见 content-basic.ts。
运行后,点击底部日志面板的数据表格标签页,可以实时预览、手动编辑采集到的每一行数据——这就是 WebRPA 内置的数据收集中心,实现代码位于 table.py。
图:WebRPA 工作流仓库,社区分享的网页数据采集工作流可直接拿来参考
📌 不会从零搭?点击顶部「工作流仓库」,搜索"数据采集"类目,里面有社区分享的现成采集模板,可以直接克隆到自己账号再改参数。
第3步:一键导出Excel或CSV,采集结果落地
数据攒够了,导出只需两种姿势:
方式一:手动导出(适合临时任务)
- 打开底部数据表格面板
- 点击下载CSV按钮
- 选择保存位置即可,UTF-8 编码,Excel 可直接打开中文不乱码
方式二:工作流自动导出(适合定时/批量任务)
拖入导出表格模块,配置两个参数:
| 参数 | 说明 | 示例 |
|---|---|---|
| 文件路径 | 保存位置,支持变量 | C:/data/{日期}_结果.csv |
| 文件格式 | CSV 或 Excel | csv |
这样每次运行工作流都会自动落盘一份文件,配合定时任务可实现无人值守采集。导出与数据表格的完整用法参考:content-excel.ts。
✅ 至此,一个「打开网页 → 元素定位 → 循环采集 → Excel 导出」的自动化采集流程就完整了。
常见问题排查:采集失败怎么办?
Q1:选择器选对了,但获取元素信息拿不到值?大概率是页面还没加载完。把「打开网页」的等待条件改成networkidle,或在获取模块前加一个等待元素模块,等待目标元素出现再提取。
Q2:列表里有的有值、有的空?动态渲染页面的列表常用懒加载,建议在循环体里加一个短等待(如等待 1 秒),或改用 Alt+点击 生成的相似元素选择器统一遍历。
Q3:选择器在别的电脑上失效了?优先使用元素自身稳定的 class/id,避免用纯层级路径;也可以让内置 AI 小助手帮你诊断——在编辑器右下角点开小助手,把报错发过去即可:
图:WebRPA 内置 AI 小助手,对话式排查网页数据采集工作流问题
总结:WebRPA网页数据采集3步速查
| 步骤 | 核心模块 | 关键点 |
|---|---|---|
| 1️⃣ 元素定位 | 元素选择器 | Ctrl+点击选单个,Alt+点击选相似 |
| 2️⃣ 数据收集 | 获取元素信息 + 遍历列表 | 填「存储的列名」自动入表 |
| 3️⃣ 结果落地 | 导出表格 / 下载CSV | 支持 Excel、CSV 双格式 |
更多模块参数与进阶玩法(数据库写入、AI 智能爬虫、定时触发等),可点击工具栏「教学文档」按钮在编辑器内随时查阅,覆盖全部 571 个功能模块。祝你采集顺利!🚀
【免费下载链接】WebRPAA powerful no-code automation tool. Build workflows via drag-and-drop modules for web scraping, form filling and automated testing. | 一款功能强大的自动化工具,通过拖拽模块的方式快速构建自动化工作流,无需编写任何代码即可实现网页数据采集、表单填写、自动化测试等任务。【QQ交流群:115069513】项目地址: https://gitcode.com/gh_mirrors/we/WebRPA
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考