MCP 工具的 AI 好不好使?跑一次测试
MCP 工具的 AI 好不好使?跑一次测试
【免费下载链接】skillsPublic repository for Agent Skills项目地址: https://gitcode.com/GitHub_Trending/skills3/skills
你调了三天 MCP 工具,上线后 AI 就是调不对,你连"到底哪里不行"都说不清。skills3/skills 仓库里有一套现成的 MCP 测试工具:写几道题,让真模型跑一遍,它告诉你工具差在哪。
东西藏在 mcp-builder 技能的 scripts 目录,核心就是一个 evaluation.py。它不是单测框架,是个"驾驶员":把 Claude 放上去,只许用你的工具答题,再给结果打分。
MCP 技能怎么测
你给它一个 XML 文件,每个qa_pair是一道题加一个标准答案:
<evaluation> <qa_pair> <question>Find the user who created the most issues in January 2024. What is their username?</question> <answer>alice_dev</answer> </qa_pair> <qa_pair> <question>Which repository created before 2023 has the most stars? What is its name?</question> <answer>data-pipeline</answer> </qa_pair> </evaluation>仓库自带一份 example_evaluation.xml 可以直接抄。题怎么写是有讲究的,evaluation.md 里写得很全:每道题必须只读、彼此独立,标准答案得是单个、不会变的值。别问"现在有多少个 open issue",这种数字每分钟都在变,下次跑结果就两样了。
文件给进去之后,脚本分三步走。先建连接:stdio 会自动拉起你的服务进程,SSE 或 HTTP 则要先自己把服务跑起来,再把 URL 递过去。然后拉取工具列表,逐题喂给模型。系统提示词逼着模型把输出包进三个标签:<summary>写解题思路,<feedback>写对你工具的看法,<response>写最终答案。模型每次想调工具,脚本都替它执行,并记下这次调用花了多久、调了几次。
你拿到一份 Markdown 报告。头部是总体命中率、平均每题耗时、平均工具调用次数。往下每题一个 ✅ 或 ❌,列出期望答案、实际答案、耗时、每个工具的调用计数,外加模型的自述和吐槽。判分很朴素:<response>里的内容和标准答案逐字比对,一致得 1 分,不一致 0 分,没有半分。
几行命令跑通第一次评估
pip install -r skills/mcp-builder/scripts/requirements.txt export ANTHROPIC_API_KEY=your_key python skills/mcp-builder/scripts/evaluation.py \ -t stdio -c python -a my_mcp_server.py \ -o report.md \ my_evaluation.xml真正跑的只有一条命令,前两行是依赖和密钥。-t是你最常改的参数:本地脚本用 stdio,服务自动拉起;远程服务用-t sse或-t http,-u给 URL,要鉴权就-H挂请求头。-c和-a是启动服务的命令与参数,服务自己需要 token 时用-e KEY=VALUE把环境变量递进去。
评估报告怎么读
报告里数字不少,最值得盯的是这四个:
- 准确率:唯一的硬指标,而且极严。多一个逗号、差一个小数位都算错。所以出题时先把格式锁死——"只答数字""保留两位小数"。
- 每题耗时:从提问到交卷的总时间。哪题明显慢,先去读它的 summary,多半是模型在兜圈子,分页翻数据或者反复试错工具。
- 平均工具调用次数:AI 翻了多少个抽屉才找到东西。高而答对,说明题有深度;高而答错,多半是工具描述不清晰,模型在瞎猜。
- 总调用量与单工具耗时:哪个工具被调最多、最慢,它就是第一优化对象,通常就是返回数据太多的那个。
不过最值钱的其实不是数字,是每题的<feedback>。那是 AI 用你工具的第一手体验:名字看不懂、参数没写全、报错不说怎么修。照着这段改工具,命中率最高。
开始前注意三件事
- 标准答案要稳定,别问实时计数
- 答案格式写死,比对是逐字的
- 工具怎么改,先看 feedback
【免费下载链接】skillsPublic repository for Agent Skills项目地址: https://gitcode.com/GitHub_Trending/skills3/skills
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
