webclaw SDK实战:TypeScript/Python/Go三种语言调用,5行代码把网页塞进AI应用
发布时间:2026/10/5 8:11:24 作者:尧图编辑部 阅读量:1,286

webclaw SDK实战TypeScript/Python/Go三种语言调用5行代码把网页塞进AI应用【免费下载链接】webclawFast, local-first web content extraction for LLMs. Scrape, crawl, extract structured data — all from Rust. CLI, REST API, and MCP server.项目地址: https://gitcode.com/gh_mirrors/web/webclawwebclaw 是一个用 Rust 编写的本地优先网页内容提取工具它的官方 SDK 支持 TypeScript、Python 和 Go 三种语言让你只需 5 行代码就能把任意网页变成干净的结构化内容直接喂给你的 AI 应用、RAG 流水线或智能体省掉手写 HTML 解析器的麻烦。为什么选 webclaw SDK大多数网页抓取工具给到 AI 应用的是两种坏输出被反爬拦截的空白页面或登录墙塞满导航栏、脚本、广告和重复样板代码的原始 HTMLwebclaw 底层是一套 Rust 提取引擎能把 URL 变成干净的 Markdown、紧凑的 LLM 上下文文本或结构化 JSON三种语言共用同一套行为迁移和对比成本极低。核心提取引擎位于 crates/webclaw-core纯提取逻辑、零网络依赖自托管的 REST 服务在 crates/webclaw-server接口形状与托管版 API 对齐。三种语言一键安装安装命令都是一行选你熟悉的语言即可语言安装命令包TypeScriptnpm install webclaw/sdkwebclaw/sdkPythonpip install webclawwebclawGogo get github.com/0xMassi/webclaw-gowebclaw-go托管 API 需要一个 API Key通过环境变量WEBCLAW_API_KEY提供核心提取能力在本地即可运行不强制绑定账号。5行代码把网页塞进 AI 应用TypeScript 最小示例import { Webclaw } from webclaw/sdk; const client new Webclaw({ apiKey: process.env.WEBCLAW_API_KEY! }); const page await client.scrape({ url: https://example.com, formats: [markdown], only_main_content: true, }); console.log(page.markdown);Python 最小示例from webclaw import Webclaw client Webclaw(api_keywc_your_key) page client.scrape( https://example.com, formats[markdown], only_main_contentTrue, ) print(page.markdown)Go 最小示例Go SDK 与另外两种语言保持同一套语义client : webclaw.New(apiKey) page, err : client.Scrape(ctx, webclaw.ScrapeRequest{ URL: https://example.com, Formats: []string{markdown}, OnlyMainContent: true, }) fmt.Println(page.Markdown)三个示例都是同一个故事实例化客户端 → 调用 scrape → 拿到干净正文然后把它作为上下文传给任何大模型。选对输出格式markdown 还是 llmscrape支持多种输出格式选对格式能直接省 token格式适用场景markdown需要保留标题、链接等结构的干净正文llm面向智能体与 RAG 的紧凑上下文token 更省text最小化排版的纯文本json结构化元数据、链接、图片与提取字段html清洗后的 HTML交给自定义处理逻辑简单记法输出给人看选markdown下一步是切块、向量化或进提示词就选llm。完整的格式与用法可以参考 examples/html-to-markdown-rag/README.md。进阶结构化提取与自动摘要如果目标不只是拿到正文webclaw 还内置了两类高频能力extract结构化提取把杂乱页面转成类型化 JSON直接对接自动化流程。LLM 提供方链Ollama 本地优先 → OpenAI → Gemini → Anthropic实现在 crates/webclaw-llm/src/chain.rssummarize页面摘要抓取后自动摘要适合监控与巡检场景配合crawl同源爬取、batch并行多 URL和diff页面变更追踪一个 SDK 客户端就能覆盖从抓一页到监控一整站的链路。批量抓取与站点地图发现逻辑在 crates/webclaw-fetch 中。本地优先按需上云webclaw 的设计哲学是local-firstCLI 与 MCP 服务端的提取主路径本地运行无需账号需要反爬穿透、JS 渲染、异步爬取任务时再切到托管 API想完全自控crates/webclaw-server 提供可自托管的 REST 服务POST /v1/scrape等接口与托管版对齐SDK 调用的核心路由可参考 crates/webclaw-server/src/routes/scrape.rs想了解提取效果基准数据可以看 benchmarks/README.md。总结三种语言同一体验scrape一下拿到markdown/llm/json等格式5 行代码即可把网页变成 AI 应用的干净上下文本地优先无账号也能跑需要更强能力时再切托管或自托管想快速上手的开发者可以从 examples/ 目录里的 RAG、Firecrawl 兼容 API、代理爬取等示例入手按自己的技术栈直接抄作业。【免费下载链接】webclawFast, local-first web content extraction for LLMs. Scrape, crawl, extract structured data — all from Rust. CLI, REST API, and MCP server.项目地址: https://gitcode.com/gh_mirrors/web/webclaw创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考