☰
如何用WebRPA采集网页数据:从元素定位到Excel导出的3步实操教程
2026/10/10 2:13:37 网站建设 项目流程

如何用WebRPA采集网页数据:从元素定位到Excel导出的3步实操教程

【免费下载链接】WebRPAA powerful no-code automation tool. Build workflows via drag-and-drop modules for web scraping, form filling and automated testing. | 一款功能强大的自动化工具,通过拖拽模块的方式快速构建自动化工作流,无需编写任何代码即可实现网页数据采集、表单填写、自动化测试等任务。【QQ交流群:115069513】项目地址: https://gitcode.com/gh_mirrors/we/WebRPA

WebRPA 是一款零代码的网页数据采集与流程自动化工具,通过拖拽模块即可搭建采集工作流,无需编写任何代码。本教程带你用 3 步走完「元素定位 → 数据收集 → Excel 导出」的完整闭环:打开一个目标网页,用可视化元素选择器点选要采集的内容,数据自动汇入数据表格,最后一条模块导出为 Excel 或 CSV 文件。适合运营、测试、数据录入等被重复采集工作困扰的新手用户。

👉 适合人群:没有编程基础,但需要定期从网站抓取商品、评论、列表数据的普通用户。

准备工作:2分钟启动WebRPA网页采集工具

WebRPA 完全免费、可离线运行,自带 Python 与 Node.js 环境,解压即用:

  1. 到项目 Releases 页面下载最新版 7z 压缩包并解压(详见 README.md 的快速开始章节)
  2. 双击WebRPA启动器.exe,点击"启动 WebRPA"按钮
  3. 启动器会自动打开浏览器进入前端编辑器(默认 http://localhost:5921)

图:WebRPA 控制中心启动器,一键拉起后端与前端编辑器

启动后如果浏览器未打开,可以点击右上角「打开」按钮进入编辑器。

第1步:用可视化元素选择器定位网页元素

采集网页数据的第一步是"告诉工具要采集哪个元素"。WebRPA 内置的元素选择器让你完全不用手写 CSS 选择器——鼠标点一下就行,原理实现可查看 picker.py。

启动方式(二选一):

  • 点击顶部工具栏自动化浏览器→启动选择器
  • 在任意模块配置面板中,点击"选择器"输入框右侧的 🎯 按钮

三种选择模式:

操作功能使用场景
Ctrl + 点击选择单个元素按钮、输入框、"下一页"链接
Alt + 点击选择相似元素列表项、商品卡片、表格行
Esc取消选择选错了重新来

💡 小技巧:采集列表型数据(如 10 个商品标题)时,用Alt + 点击点两个相似元素,系统会自动识别出所有相似项,生成的选择器自带{index}变量,正好配合循环模块批量遍历。

详细说明可参考官方教学文档:content-browser.ts。

图:WebRPA 网页数据采集工作流编辑器,左侧拖入模块、画布连线、右侧配置面板

第2步:搭工作流,数据自动收集进数据表格

这是整个采集的核心。在左侧模块栏搜索并拖入以下模块(模块总数 542+,支持中文/拼音模糊搜索):

推荐流程(以采集商品列表为例):

  1. 打开网页:填入目标网址,等待条件建议选networkidle(适合动态加载页面)
  2. 获取子元素:父元素选商品列表容器、子元素选商品卡片
  3. 遍历列表:数据源指向第 2 步的变量
  4. 获取元素信息:这是数据采集的"心脏"模块——
    • 提取类型:文本 / 属性(如href链接)/ HTML
    • 关键设置:填写「存储的列名」,如商品名称、价格,数据就会自动收集到底部数据表格,无需额外写"添加行"模块
  5. 循环体外再串一个点击元素(下一页)+等待元素,即可自动翻页

各模块的完整参数说明见 content-basic.ts。

运行后,点击底部日志面板的数据表格标签页,可以实时预览、手动编辑采集到的每一行数据——这就是 WebRPA 内置的数据收集中心,实现代码位于 table.py。

图:WebRPA 工作流仓库,社区分享的网页数据采集工作流可直接拿来参考

📌 不会从零搭?点击顶部「工作流仓库」,搜索"数据采集"类目,里面有社区分享的现成采集模板,可以直接克隆到自己账号再改参数。

第3步:一键导出Excel或CSV,采集结果落地

数据攒够了,导出只需两种姿势:

方式一:手动导出(适合临时任务)

  1. 打开底部数据表格面板
  2. 点击下载CSV按钮
  3. 选择保存位置即可,UTF-8 编码,Excel 可直接打开中文不乱码

方式二:工作流自动导出(适合定时/批量任务)

拖入导出表格模块,配置两个参数:

参数说明示例
文件路径保存位置,支持变量C:/data/{日期}_结果.csv
文件格式CSV 或 Excelcsv

这样每次运行工作流都会自动落盘一份文件,配合定时任务可实现无人值守采集。导出与数据表格的完整用法参考:content-excel.ts。

✅ 至此,一个「打开网页 → 元素定位 → 循环采集 → Excel 导出」的自动化采集流程就完整了。

常见问题排查:采集失败怎么办?

Q1:选择器选对了,但获取元素信息拿不到值?大概率是页面还没加载完。把「打开网页」的等待条件改成networkidle,或在获取模块前加一个等待元素模块,等待目标元素出现再提取。

Q2:列表里有的有值、有的空?动态渲染页面的列表常用懒加载,建议在循环体里加一个短等待(如等待 1 秒),或改用 Alt+点击 生成的相似元素选择器统一遍历。

Q3:选择器在别的电脑上失效了?优先使用元素自身稳定的 class/id,避免用纯层级路径;也可以让内置 AI 小助手帮你诊断——在编辑器右下角点开小助手,把报错发过去即可:

图:WebRPA 内置 AI 小助手,对话式排查网页数据采集工作流问题

总结:WebRPA网页数据采集3步速查

步骤核心模块关键点
1️⃣ 元素定位元素选择器Ctrl+点击选单个,Alt+点击选相似
2️⃣ 数据收集获取元素信息 + 遍历列表填「存储的列名」自动入表
3️⃣ 结果落地导出表格 / 下载CSV支持 Excel、CSV 双格式

更多模块参数与进阶玩法(数据库写入、AI 智能爬虫、定时触发等),可点击工具栏「教学文档」按钮在编辑器内随时查阅,覆盖全部 571 个功能模块。祝你采集顺利!🚀

【免费下载链接】WebRPAA powerful no-code automation tool. Build workflows via drag-and-drop modules for web scraping, form filling and automated testing. | 一款功能强大的自动化工具,通过拖拽模块的方式快速构建自动化工作流,无需编写任何代码即可实现网页数据采集、表单填写、自动化测试等任务。【QQ交流群:115069513】项目地址: https://gitcode.com/gh_mirrors/we/WebRPA

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询