让Claude Scholar从强论文中挖掘知识:paper-miner与kaggle-miner Agent实战
让Claude Scholar从强论文中挖掘知识:paper-miner与kaggle-miner Agent实战
【免费下载链接】claude-scholarSemi-automated research assistant for academic research and software development. Supports Claude Code, Codex CLI, Kimi Code CLI, and OpenCode across ideation, coding, experiments, writing, and publication.项目地址: https://gitcode.com/gh_mirrors/cl/claude-scholar
Claude Scholar 是一款面向学术研究与软件开发的半自动科研助手,支持 Claude Code、Codex CLI、Kimi Code CLI 和 OpenCode。其中内置的paper-miner与kaggle-miner两个 Agent,能自动从强论文中挖掘写作模式、从 Kaggle 竞赛冠军方案中提取工程技巧,并把知识沉淀到可长期复用的"记忆库"里——你读得越多,它写出的论文越像顶会水平。
为什么要从强论文中挖掘知识?
新手写论文最大的痛点:知道"写得不错",却说不出"哪里好、为什么好"。
paper-miner 和 kaggle-miner 解决的正是这个问题——它们把"高手的经验"拆解成结构化知识,存进一个会持续进化的知识库:
- 📚paper-miner:从 PDF / DOCX / arXiv 链接中提取写作模式、结构信号、可复用句式、期刊风格信号,甚至 rebuttal(作者回复信)策略;
- 🏆kaggle-miner:抓取 Kaggle 竞赛 Top 20 获奖方案,提炼核心技术、实现细节、代码模板和常见陷阱,按 NLP / CV / 时序 / 表格 / 多模态分类归档。
两个 Agent 的定义文件分别是:
agents/paper-miner.mdagents/kaggle-miner.md
它们的共同特点是自进化:每挖掘一次,知识库就多一分积累,后续的写作与竞赛技能都会自动引用这些成果。
paper-miner:从强论文中挖掘写作模式
paper-miner 能挖到什么?
paper-miner 会沿 5 个维度分析论文,并带来源标注地写入全局记忆:
| 挖掘维度 | 示例 |
|---|---|
| 写作模式 | 论证推进手法、"论点-证据"框架、相关工作如何融入 |
| 结构信号 | 章节顺序、段落递进、贡献声明如何引出和呼应 |
| 可复用句式 | 过渡句、结果表述模板、便于 rebuttal 的澄清句式 |
| 期刊/会议信号 | 该 venue 如何界定 novelty、技术细节与可读性如何平衡 |
| 对我们的帮助 | 哪些可以借鉴、哪些要谨慎模仿 |
所有挖掘结果只写入一个全局记忆文件(避免知识散落各处):
~/.claude/skills/ml-paper-writing/references/knowledge/paper-miner-writing-memory.md这份记忆会被ml-paper-writing(论文写作)和review-response(审稿回复)技能直接消费——也就是说,你今天挖的论文,明天写稿和写 rebuttal 时自动受益。
paper-miner 三步实战
第 1 步:准备输入。支持本地 PDF、DOCX 文件、arXiv 链接,甚至一句自然语言描述。
第 2 步:触发挖掘。最简单的方式是用官方命令(定义见commands/mine-writing-patterns.md):
/mine-writing-patterns path/to/paper.pdf还可以指定聚焦方向,例如只挖 rebuttal 技巧:
/mine-writing-patterns path/to/paper.pdf rebuttal第 3 步:查看标准报告。挖掘完成后,paper-miner 会输出一份结构化总结:论文元数据、各记忆板块的更新情况、新增可复用模式、以及"Intro / Method / Results / Rebuttal 分别怎么复用"的建议。
💡小贴士:也可以直接用自然语言触发,例如"帮我从这篇 NeurIPS 论文里学习写作技巧",系统会自动分派给 paper-miner。
kaggle-miner:从竞赛冠军方案中挖掘工程技巧
如果你同时做竞赛或落地项目,kaggle-miner 就是"冠军经验提取器"。
kaggle-miner 的工作流程
- 你给出一个 Kaggle 竞赛 URL;
- Agent 抓取竞赛讨论区,识别 "1st Place"、"Gold" 等冠军帖子;
- 对每个前排方案提取:排名与作者、3-6 个核心技术点、具体参数与实验细节;
- 按 6 段标准模板(竞赛简介、方案概述、前排方案详细技术分析、代码模板、最佳实践、元数据)生成一个独立的竞赛知识文件。
每个竞赛对应一个按领域归档的文件,例如:
~/.claude/skills/kaggle-learner/references/knowledge/nlp/aimo-2-2025.md ~/.claude/skills/kaggle-learner/references/knowledge/time-series/birdclef-plus-2025.md这些文件随后可被skills/kaggle-learner/技能直接调用——当你问"NLP 竞赛有什么成熟技巧"时,助手会基于已沉淀的知识库作答,而不是每次临时上网搜索。
一句话触发示例
"从这个 Kaggle 竞赛中学习:https://www.kaggle.com/competitions/xxx"
完成后 Agent 会报告:竞赛名称、归档分类、提取到的关键技巧、更新的知识文件路径。
挖掘的知识去了哪里?
两个 Agent 的知识去向一目了然:
| Agent | 知识沉淀位置 | 谁会消费它 |
|---|---|---|
| paper-miner | paper-miner-writing-memory.md全局写作记忆 | ml-paper-writing、review-response |
| kaggle-miner | kaggle-learner各领域知识库文件 | kaggle-learner 技能 |
这正是 Claude Scholar 的设计哲学:决策权留在人手里,重复的积累交给 Agent。你只需判断"这篇论文值得挖",剩下的提取、去重、合并都由 Agent 完成,且每条知识都保留来源标注,方便回溯。
如何开始使用这两个 Agent?
如果你还没安装 Claude Scholar,克隆仓库后运行安装脚本即可(Windows 请用 Git Bash 或 WSL):
git clone https://gitcode.com/gh_mirrors/cl/claude-scholar.git /tmp/claude-scholar bash /tmp/claude-scholar/scripts/setup.sh安装器会自动备份已有配置并增量更新。只想尝鲜的话,也可以把agents/paper-miner.md等文件单独复制到~/.claude/agents/下选择性安装。
总结
- ✍️paper-miner:给一篇强论文,换回一套带来源标注的可复用写作模式,沉淀进全局记忆;
- 🏆kaggle-miner:给一个竞赛 URL,换回冠军方案的结构化技术档案,按领域自动归档;
- 🧠核心收益:知识库随使用持续进化,写作与竞赛技能自动复用这些积累。
下一篇建议:试试/mine-writing-patterns命令,从你最近读的最强的一篇论文开始挖起。
【免费下载链接】claude-scholarSemi-automated research assistant for academic research and software development. Supports Claude Code, Codex CLI, Kimi Code CLI, and OpenCode across ideation, coding, experiments, writing, and publication.项目地址: https://gitcode.com/gh_mirrors/cl/claude-scholar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
