wigolo 10大工具速览:search、fetch、crawl、extract一站式网络工具集清单
wigolo 10大工具速览:search、fetch、crawl、extract一站式网络工具集清单
【免费下载链接】wigoloThe go-to web for your AI coding agent — local-first search, fetch, crawl & research over MCP. No API keys, no cloud, $0/query. Public beta.项目地址: https://gitcode.com/GitHub_Trending/wi/wigolo
wigolo 是一个本地优先的 AI Agent 网络工具集:无需 API 密钥、不经过云端、每次查询成本为 $0。它把 search(多引擎搜索)、fetch(网页抓取)、crawl(站点爬虫)、extract(结构化数据提取)等 10 大工具打包成一套 MCP 服务器,直接接入 Claude Code、Cursor、Codex、Gemini CLI 等编码代理,让你的 AI 助手拥有"看遍全网"的能力。
为什么 AI Agent 需要这样一套网络工具
写代码时,AI 代理经常需要"上网办事":查官方文档、读 API 参考、跟踪版本变更。传统做法是给代理接一个按量计费的云搜索 API——要注册账号、要 API key、查询越多账单越高,数据还会经过第三方。
wigolo 的思路是把昂贵部分搬到你自己的硬件上:重排模型和向量嵌入全部在本地运行,搜索走公共引擎直连适配器,所有缓存都存在~/.wigolo/目录里。结果就是:查询无限量,数据不出本机。
10大工具一览:一张清单看懂 wigolo
| 工具 | 一句话说明 |
|---|---|
🔎search | 多引擎网页搜索:18 个直连引擎适配器 + 排序融合 + 本地 ML 重排,返回带评分的证据和引用 |
📄fetch | 抓取单个 URL:先走普通 HTTP,遇到反爬验证或 SPA 空壳自动升级到无头浏览器;支持 PDF、截图、点击/输入等页面操作 |
🕸️crawl | 多页爬虫:BFS/DFS/sitemap/map 四种策略,遵守 robots.txt,按域名限速,自动去重 |
🧩extract | 从页面提取结构化数据:表格、元数据、JSON-LD、品牌信息、自定义 JSON Schema |
💾cache | 查询本地已见内容的持久缓存,支持关键词 + 语义混合检索、统计、变更检测 |
🧲find_similar | 找相似页面:本地向量索引 + 关键词 + 实时网络三路融合排序 |
🧠research | 深度研究:拆解问题 → 并行子查询 → 交叉验证来源 → 生成带引用的报告 |
🤖agent | 自主采集循环:规划 → 搜索 → 抓取 → 提取 → 综合,全程步骤留痕 |
🔁diff | 对比页面新旧版本,输出 git 风格补丁或结构化差异 |
⏱️watch | 注册页面变更监控任务,定期复查并可推送到 webhook |
所有工具在任何接入方式(MCP、REST、SDK、命令行)下参数名完全一致,完整参数表见 docs/tools.md。
核心四件套详解
search:多引擎搜索 + 可解释评分
search是 wigolo 的主力工具。它把查询并行分发给多个搜索引擎,用倒数排名融合(RRF)合并结果,再由本地运行的 ML 重排模型精排。
对新手最友好的两点:
- 返回"证据"而非裸链接:每条结果附带逐字摘录、精确到字节偏移的来源位置、引用 ID,代理可以直接引用而不会张冠李戴;
- 评分可解释:每个结果都有
evidence_score拆解(词法、语义、时效、引擎共识等分量),弱结果还会被打分器主动标记为垃圾。
传一个查询数组还能并行搜多个变体,一次调用获得更宽的覆盖面。
fetch:会"自动升级"的网页抓取器
抓取网页最大的坑是 JS 渲染和反爬验证。fetch采用分级路由:先用最便宜的普通 HTTP,观测到挑战页或 SPA 空壳等真实信号后才升级到无头浏览器,并按域名记住学习结果(哪个站点需要什么级别),而不是靠域名猜。
它还支持只取某个标题下的章节、PDF 解析、复用已登录会话,以及actions参数执行点击、输入、滚动、截图等浏览器操作。遇到挡不过去的墙,它会返回明确标注的blocked_by_challenge失败,而不是把验证壳当内容骗你。
crawl:礼貌而克制的站点爬虫
crawl把整个文档站点灌进本地缓存,供后续cache和find_similar反复查询。四种策略按需选择:bfs(广度优先,默认)、dfs(深度优先)、sitemap(sitemap 驱动,最适合文档站)、map(只发现 URL 不抓内容,最快)。
默认遵守 robots.txt、按域名限速、用 ETag 增量复核——定位是"文档索引器"而非批量采集器。
extract:不用 LLM 的结构化数据提取
extract提供六种模式:structured(表格、键值对、JSON-LD 全都要)、tables(只取表格)、metadata(标题/描述/OG 标签)、schema(按你给的 JSON Schema 匹配页面字段)、selector(CSS 选择器)、brand(logo、配色、字体)。全部纯确定性代码,不需要 LLM;即使配置了 LLM,其补全的字段也会与原文核对,幻觉值一律返回null。
其余六大工具:缓存、相似、研究、自主与监控
cache:所有被 search/fetch/crawl 触达的页面都会落盘。cache工具让你对本地已见内容做秒级关键词/语义检索——重复提问零成本,这是 wigolo "本地记忆"的核心。find_similar:给一个 URL 或概念,融合本地嵌入索引、关键词和实时网络三路信号找相似页面,先crawl预热缓存后效果最好。research:把一个研究问题拆成子查询并行搜索,交叉验证来源后输出结构化简报(含逐条论断的来源、跨源印证、信息缺口)。agent:给它一句自然语言目标,它自主规划查询、并行抓取、按时间预算执行并综合成结果,每一步都有日志。diff:对比缓存版本与实时页面的变化,支持行/词/章节三种粒度。watch:注册定时复查任务,页面变了就产出 diff 并可推送 webhook(webhook 目标有 SSRF 防护)。
最快上手:一条命令接入你的 AI 编码代理
npx wigolo init --agents=claude-code,cursor要求 Node ≥ 20 和约 1.5 GB 磁盘空间。init会下载浏览器引擎和本地模型、跑健康检查,并一步把指定代理的 MCP 配置写好。其他接入方式:
- 任何 MCP 客户端:在配置里注册
npx -y wigolo即可; - REST API:
wigolo serve启动后,POST /v1/{tool}覆盖全部 10 个工具,详见 docs/rest-api.md; - SDK:TypeScript(
wigolo-sdk)和 Python(pip install wigolo)都有嵌入式本地模式,自动发现或拉起守护进程; - LangChain / CrewAI / LlamaIndex / Vercel AI SDK:官方集成包 packages/ 开箱即用。
命令行党也可以直接wigolo search "…" --json单发查询,或用wigolo shell进入交互式管道。
成本对比:为什么是 $0/查询
按量计费的云 API 成本随查询次数线性上涨,而 AI 代理恰恰是"爆发式提问"的——一个任务里连续发几十次查询很常见。wigolo 的重排和嵌入跑在你的硬件上,没有单次查询成本要回收,因此没有计费器:
隐私同样默认拉满:缓存、向量、模型、配置全部在~/.wigolo/,除非你主动为research/agent配置 LLM 做综合写作,否则没有任何数据离开本机。
相关资料速查
- 工具完整参数参考:docs/tools.md
- 安装与全渠道指南(npm / Docker / Homebrew / 二进制):docs/installation.md
- 环境变量与配置详解:docs/configuration.md
- 工具源码入口:src/tools/(
search.ts、fetch.ts、crawl.ts、extract.ts等 10 个文件) - 可运行示例(含 REST curl、SDK、n8n、webhook):examples/
10 个工具覆盖"搜索 → 抓取 → 爬取 → 提取 → 缓存 → 研究 → 监控"的完整链路,全部 $0/查询。跑一条npx wigolo init,你的 AI 代理今天就拥有免费的本地网络层。
【免费下载链接】wigoloThe go-to web for your AI coding agent — local-first search, fetch, crawl & research over MCP. No API keys, no cloud, $0/query. Public beta.项目地址: https://gitcode.com/GitHub_Trending/wi/wigolo
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
