数据采集人工智能市场研究企业服务
AI 网页数据采集工具
以隔离浏览器读取动态网页,将页面内容整理为可查询、可预览和可导出的结构化数据,并支持按需接入本地或云端模型。
面向公开网页资料整理的浏览器级数据采集工具,支持动态页面、多页面读取、正文清洗、结构化字段提取和多格式导出。交付版增加完整简体中文安全工作台和访问允许列表,以真实本机公开商品目录验证4条、5字段数据采集链;模型为可选增强,不依赖外部模型也可完成确定性采集。
真实界面
项目截图
共 5 张
Capabilities
核心功能
✓浏览器级动态网页采集
✓单页与多页面采集
✓页面清洗与结构化字段提取
✓CSV与JSON结果导出
✓Excel、HTML和SQL格式扩展
✓OpenAI、Gemini与Ollama适配
✓采集会话和页面预览
✓可选Google Sheets集成
适用场景
公开商品目录整理
行业资料与公开信息调研
内容运营素材归档
企业内部公开页面汇总
AI数据提取教学实践
适合谁
数据运营人员、市场研究团队、Python开发者、AI应用团队及需要整理公开网页数据的企业。
商业化思路
适合公开行业资料调研、商品目录整理、内容运营归档、企业内部公开页面汇总,以及AI数据提取教学和原型验证。
你会拿到什么
- ✓固定版本完整源码包
- ✓MIT许可证
- ✓中文安全工作台
- ✓中文部署与合规说明
- ✓五张真实功能截图
部署流程
- 1安装Docker与Docker Compose
- 2使用交付Compose构建并启动
- 3检查Streamlit健康端点
- 4使用本机公开测试页验证采集
- 5按合规范围配置允许列表和HTTPS认证网关
真实验证结果
隔离环境真实启动Patchright浏览器读取本机公开测试页,提取4条商品、5个字段,并验证总览、结构化表、页面预览、CSV与JSON导出;容器健康且浏览器错误为0。
部署前须知
只应采集有权访问和使用的数据;不得绕过登录、验证码或访问控制获取敏感信息。外部模型和Google Sheets能力需使用者自行配置凭据并承担相关服务成本。
部署难度
中等
最低配置
建议2核CPU、4GB内存、5GB可用磁盘;首次构建会安装隔离浏览器。
开源许可证
MIT
最后验证
2026-08-13
技术栈
Python 3.12StreamlitPatchrightBeautifulSoupPandasDocker Compose
授权说明
源码根目录为MIT许可证;使用、修改和分发时需保留原版权与许可证声明。