一句话htcrawl.org 是一个基于 Puppeteer 的 Node.js 递归爬虫模块,专门用于处理单页应用,可用来开发 DOM XSS 扫描器、爬虫自动化等工具
定价免费开源 遵循 GNU GPL v2 及以上协议开源,完全免费使用
适合谁Node.js 后端开发者、Web 安全研究员、前端自动化测试工程师
核心功能基于无头 Chrome 实现,继承 Puppeteer 全部功能支持单页应用(SPA)递归爬取,可遍历动态更新的 DOM可拦截监听页面所有请求(包括 XHR 异步请求)提供丰富的事件钩子,支持自定义爬虫逻辑支持 npm 或 GitHub 源码两种安装方式可作为基础框架快速开发 DOM-XSS 扫描工具提供官方使用示例,包括 DOM XSS 扫描器、邮箱爬虫等支持自定义输入填充、事件触发等爬取逻辑
功能与用途用于递归爬取单页应用(SPA),通过 Headless Chrome 加载和分析页面。可拦截并记录页面请求,构建安全漏洞检测工具,例如 DOM-XSS 扫描器,也可用于高级 SPA 抓取、UI 与 JavaScript 自动化测试。
支持语言/框架Node.js / JavaScript。基于 Puppeteer,使用 Headless Chrome。文中未说明对特定前端框架的专门支持,但目标场景是单页应用(SPA)。
开源还是闭源开源/自由软件。授权为 GNU General Public License,GPL v2 或更高版本。
自托管选项可通过 npm 安装 htcrawl,或从 GitHub 克隆源码并本地安装依赖运行;属于本地/自管理 Node.js 模块。
定价未提供商业定价。文本说明为 GPL 自由软件,可重新分发和修改。
API/SDK提供 Node.js API。核心包括 launch、load、start、stop、navigate、reload、clickToNavigate、waitForRequestsCompletion、browser、page、newPage、on 等;事件包括 xhr、fetch、jsonp、websocket、formsubmit、fillinput、newdom、redirect、triggerevent 等。
集成与生态建立在 Puppeteer 之上,可访问 Puppeteer 的 Browser 与 Page 实例;提供 npm 安装方式和 GitHub 源码。文本还提到 htcap 是基于 htcrawl 构建的漏洞扫描器。
文档质量提供基础用法、下载方式、API Reference、事件列表和两个较完整示例。文档对参数和事件说明较细,但存在拼写错误、htcrawl/htcap 命名混用,以及缺少维护状态、版本兼容、性能和故障排查等信息。
支付[]
中国访问可直连
适用场景['单页应用高级内容爬取''开发自定义 DOM-XSS 漏洞扫描工具''Web 前端 UI 自动化测试''拦截分析页面所有网络请求''检测 Web 应用安全漏洞']
同类Puppeteer、Playwright、Crawlee、Scrapy Splash、Selenium、htcap