Show HN: PyScrappy,自愈式网页抓取选择器,外加MCP服务器。

PyScrappy 是一个主打“自愈式选择器”的 Python 网页抓取工具,网站改版后能自动重新定位目标元素;同时它提供 MCP 服务器,让 Claude、Cursor 等 AI agent 直接把网页变成结构化数据喂给大模型。值得关注的是,它把爬虫维护成本这个老问题,与当下 AI agent 的工具调用需…

一句话看懂:PyScrappy 是一个主打“自愈式选择器”的 Python 网页抓取工具,网站改版后能自动重新定位目标元素;同时它提供 MCP 服务器,让 Claude、Cursor 等 AI agent 直接把网页变成结构化数据喂给大模型。值得关注的是,它把爬虫维护成本这个老问题,与当下 AI agent 的工具调用需求结合在了一起。

事件核心:发生了什么

PyScrappy 由开发者 mldsveda 发布在 Hacker News 的 Show HN 板块,是一个 AI-native 网页抓取工具包。它有两种使用方式:作为 Python 库嵌入代码,或以 MCP(Model Context Protocol)服务器形式暴露给 AI agent 调用。

核心功能包括:通用抓取器(输入 URL 输出文本、链接、图片、表格和元数据)、.to_markdown() 等 LLM 友好输出格式、可选 Playwright 后端支持 JS 渲染页面、并发抓取、代理与 ScraperAPI/ScrapeOps 支持、curl_cffi 的 TLS 指纹模仿能力,以及 20 多个内置站点爬虫(Wikipedia、IMDB、GitHub、YouTube、Amazon 等)。

最突出的差异化设计是“自适应选择器”:用户记住一个元素后,即使网站修改了 HTML 结构,它也能按相似度重新定位,避免爬虫静默失效。安装方式为 pip install pyscrappy,可选择 browser、mcp、stealth、dataframe 等扩展;MCP 服务器通过 pyscrappy-mcp 命令以 stdio、HTTP 或 SSE 方式运行,支持注册到 Claude Code 和 Claude Desktop。额外提供 pyscrappy chat 命令,可直连 Ollama 本地模型(如 Qwen 2.5),让不具备 MCP 能力的本地模型也能调用同样的 22 个工具。

为什么重要

网页爬虫长期存在两个痛点:网站改版导致选择器失效、反爬机制拦截常规请求。PyScrappy 的“自愈式选择器”针对第一个痛点提供了工程化方案,通过相似度匹配而非固定 CSS 路径定位元素,降低了长期维护成本。

更关键的是它踩中了 MCP 生态的时点。当前 AI agent 普遍缺乏可靠、实时的网页数据获取能力,PyScrappy 选择将抓取工具标准化为 MCP 工具,让 Claude、Cursor 等 agent 能直接调用抓取能力并拿到 Markdown/JSON 格式的内容。相比各家 agent 自己实现抓取逻辑,这种“工具化爬虫”的路径更接近基础设施。目前公开信息显示,该项目尚属早期版本,实际稳定性、站点兼容性以及 20+ 内置爬虫的维护质量仍需实测验证。

对用户/开发者/创作者的影响

对普通用户:命令行提取功能降低了使用门槛,pyscrappy extract <url> out.md 即可把网页内容落盘为 Markdown,适合快速做网页存档或信息收集。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者:可以作为 Scrapy/BeautifulSoup 的补充工具。链式 Selector 支持 CSS/XPath、find_by_textfind_similar 等操作,自愈选择器适合用在监控价格、追踪页面变化等长期运行的爬虫任务中。内置的指数退避重试和按域名限速,减少了并发抓取时的封禁风险。

对 AI 应用开发者:MCP 集成是最大价值点。在 Claude Code 中执行 claude mcp add pyscrappy pyscrappy-mcp 即可让 agent 获得实时抓取能力。对使用 Ollama 本地模型的用户,内置 chat 命令绕开了额外的 MCP host,降低了本地 AI 工具链的搭建复杂度。

值得关注的后续

一是“自愈”的真实效果。相似度定位在复杂前端框架(如 React/Vue 动态渲染)下的表现有待真实项目检验,后续可关注 GitHub issues 中用户对不同网站的实测反馈。

二是 20+ 内置爬虫的维护节奏。站点结构经常变动,内置爬虫是否持续跟进更新,是判断项目长期可用性的重要指标。

三是 agent 生态的竞争方向。MCP 工具正在快速标准化,OpenAI、Anthropic 等厂商的官方抓取能力若增强,项目需要靠自愈选择器和定制爬虫保持差异化。

来源:Hacker News · 24h最热

celebrityanime
celebrityanime
文章: 18819

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注