← 返回项目库
数据采集人工智能市场研究企业服务

AI 网页数据采集工具

以隔离浏览器读取动态网页,将页面内容整理为可查询、可预览和可导出的结构化数据,并支持按需接入本地或云端模型。

面向公开网页资料整理的浏览器级数据采集工具,支持动态页面、多页面读取、正文清洗、结构化字段提取和多格式导出。交付版增加完整简体中文安全工作台和访问允许列表,以真实本机公开商品目录验证4条、5字段数据采集链;模型为可选增强,不依赖外部模型也可完成确定性采集。

真实界面

项目截图

共 5 张

安全采集工作台
真实采集完成总览
结构化商品数据
采集页面内容预览
多格式导出中心

Capabilities

核心功能

浏览器级动态网页采集
单页与多页面采集
页面清洗与结构化字段提取
CSV与JSON结果导出
Excel、HTML和SQL格式扩展
OpenAI、Gemini与Ollama适配
采集会话和页面预览
可选Google Sheets集成

适用场景

公开商品目录整理
行业资料与公开信息调研
内容运营素材归档
企业内部公开页面汇总
AI数据提取教学实践

适合谁

数据运营人员、市场研究团队、Python开发者、AI应用团队及需要整理公开网页数据的企业。

商业化思路

适合公开行业资料调研、商品目录整理、内容运营归档、企业内部公开页面汇总,以及AI数据提取教学和原型验证。

你会拿到什么

  • 固定版本完整源码包
  • MIT许可证
  • 中文安全工作台
  • 中文部署与合规说明
  • 五张真实功能截图

部署流程

  1. 1安装Docker与Docker Compose
  2. 2使用交付Compose构建并启动
  3. 3检查Streamlit健康端点
  4. 4使用本机公开测试页验证采集
  5. 5按合规范围配置允许列表和HTTPS认证网关

真实验证结果

隔离环境真实启动Patchright浏览器读取本机公开测试页,提取4条商品、5个字段,并验证总览、结构化表、页面预览、CSV与JSON导出;容器健康且浏览器错误为0。

部署前须知

只应采集有权访问和使用的数据;不得绕过登录、验证码或访问控制获取敏感信息。外部模型和Google Sheets能力需使用者自行配置凭据并承担相关服务成本。

部署难度

中等

最低配置

建议2核CPU、4GB内存、5GB可用磁盘;首次构建会安装隔离浏览器。

开源许可证

MIT

最后验证

2026-08-13

技术栈

Python 3.12StreamlitPatchrightBeautifulSoupPandasDocker Compose

授权说明

源码根目录为MIT许可证;使用、修改和分发时需保留原版权与许可证声明。