当前位置: 首页 > news >正文

AutoScientists生物医学ML实战:24个BioML-Bench任务的数据准备与运行完全指南

AutoScientists生物医学ML实战:24个BioML-Bench任务的数据准备与运行完全指南

【免费下载链接】AutoScientistsAutoScientists: Self-Organizing Agent Teams for Long-Running Scientific Experimentation项目地址: https://gitcode.com/gh_mirrors/au/AutoScientists

AutoScientists是一个由多个 AI 智能体(Agent)自我组织成团队、长时间协作完成计算科学实验的开源系统。本文聚焦它最完整的实战场景——BioML-Bench 生物医学机器学习基准:覆盖蛋白工程、药物发现、单细胞组学、医学影像四大方向的24 个任务,教你从数据准备到一键启动智能体团队跑实验的完整流程 🧬。

为什么选择 AutoScientists 做生物医学ML实验?

与"单轨迹推进"的 AI Agent 系统不同,AutoScientists 的多个智能体会:

  • 围绕有前景的假设自发组队,并行探索不同技术路线
  • 在消耗实验算力之前互相评审彼此的方案
  • 共享成败经验,避免重复探索,让搜索在数小时甚至数天内持续有效

官方实测结果:在 BioML-Bench 上取得74.4% 的平均排行榜百分位,比此前最强的 AI 智能体系统高+8.33%

24个BioML-Bench任务全景清单

任务按四大领域组织,每个任务目录下都有一份TASK.md,写明了问题定义、数据格式、评估指标和验证策略。完整清单见task-biomlbench/README.md

领域任务数代表任务核心指标
🧪 蛋白工程(ProteinGym DMS)6Spike 蛋白 ACE2 结合力预测Spearman ↑
💊 药物发现(Polaris/TDCommons)9Caco-2 肠上皮渗透性预测MAE ↓ / ROC-AUC ↑
🔬 单细胞组学(OpenProblems)5RNA→蛋白丰度预测RMSE ↓
🩻 医学影像(Kaggle)4肺纤维化 FVC 衰退预测Laplace LL ↑

以药物发现中的 Caco-2 渗透性任务为例:输入分子的 SMILES 字符串,输出有效渗透率,用 MAE 评估。每个任务的TASK.md(如task-biomlbench/drug_discovery/tdcommons-caco2-wang/TASK.md)里还内置了防数据泄漏规则——data/private/answers.csv只能由外部评分器使用,智能体开发时禁止读取它。

环境准备:3步装好依赖

第1步:克隆仓库

git clone https://gitcode.com/gh_mirrors/au/AutoScientists

第2步:启动本地协调服务器

系统通过本地ClawInstitute 服务器(工作坊、工作区、消息板)协调所有智能体:

npx clawinstitute start

第3步:安装 Python 依赖

pip install -r requirements.txt

硬件要求:有 GPU 时任务时限为 16 小时墙钟时间,纯 CPU 任务为 8 小时;单细胞任务数据量大(每任务约 10–50 GB),建议预留充足磁盘空间。

实验训练统一使用biomlbench venv(Python 3.12 虚拟环境,预装 scikit-learn、LightGBM、PyTorch、ESM2、scanpy、segmentation-models 等全套工具),设置环境变量即可:

export BIOMLBENCH_VENV=/path/to/biomlbench/.venv

数据准备:一个脚本搞定24个任务

数据准备脚本task-biomlbench/prepare_all_data.py支持按任务或按类别下载,核心用法:

# 只准备一个任务 python prepare_all_data.py --task tdcommons-caco2-wang # 或按类别批量准备 python prepare_all_data.py --category drug_discovery

推荐做法:先用 biomlbench 工具把数据预下载到本地缓存目录,再通过--biomlbench-dir指向缓存,避免重复下载大文件:

python prepare_all_data.py --biomlbench-dir $DATA_DIR

各类别的数据源略有差异,需要注意:

  • 药物发现:数据来自 Polaris Hub,回退方案需要免费的 Polaris 账号
  • 单细胞组学:数据托管在 S3,需要安装 AWS CLI
  • 医学影像:需要安装 Kaggle CLI、配置kaggle.json凭据,并在网页上接受各比赛规则;脚本会自动用患者级 KFold(随机种子 42)生成可复现的cv_fold
  • 蛋白工程:直接从 ProteinGym 下载 DMS 数据,自动附带 CV 分折

准备完成后,每个任务目录下会生成data/train.csvdata/test_features.csvdata/sample_submission.csv等标准文件。

一键启动:让智能体团队开始跑实验

数据就绪后,回到仓库根目录,用launch.py启动一次运行:

cd AutoScientists python3 launch.py my-run --task task-biomlbench/drug_discovery/tdcommons-caco2-wang

launch.py会自动完成以下工作:

  1. 把任务目录复制为独立运行目录../my-run/(含task/TASK.mdrunbook.md、任务配置文件)
  2. 注册智能体,在 ClawInstitute 上创建工作坊和工作区,发布启动帖
  3. 读取任务TASK.md中的task_type: biomlbench,自动匹配task-biomlbench/LAUNCH.md作为任务配置(即task-profile.md

运行目录是完全自包含的。接下来在 Claude Code 会话中打开该目录下的runbook.md并执行,编排器(Orchestrator)就会接管一切。它有一条铁律:只做协调,绝不亲自跑实验——超时、失败、队列空了,它的应对永远是再启动一个智能体,而不是自己动手训练模型。

智能体团队如何分工协作?

BioML-Bench 属于"固定截止期基准"任务,task-biomlbench/LAUNCH.md中定义了完整的行为钩子:

  • 方案讨论(强制):组队前,每个智能体必须先提出一个未被认领的方法族——比如分子任务不能全队都做 RDKit+XGBoost,有人跑 GNN,有人跑指纹+SVM,有人跑 Transformer
  • GPU 调度:GPU 智能体串行占用显卡,CPU 实验则在后台并行;每个智能体通过gpu_claim文件声明自己本次实验的算力类型
  • 冠军晋级:每个周期结束后,编排器把所有智能体产出的submission.csv按分数比较,最优者被提升为"冠军",记录在champion.md
  • 停滞不退出:连续 6 次实验无提升时,系统发布[STUCK]帖要求分析员提出完全不同的技术路线,时间才是唯一停止条件
  • 紧急保存:距截止不足 15 分钟且没有submission.csv时,触发紧急提交流程,哪怕用最简单的均值预测也要保证交卷

跑完能得到什么?真实研究洞察

除了submission.csv,每次运行还会沉淀一份research_insights.md,记录智能体团队发现的规律。以 Caco-2 渗透性任务(task-biomlbench/drug_discovery/tdcommons-caco2-wang/autoscientists_submission/research_insights.md)为例,团队在约 3 小时内发现了多个有价值的结论:

  • 表格 MLP 击败 GNN:在 728 个分子的骨架划分回归中,基于 Mordred+ECFP 特征的深度残差 MLP 优于 AttentiveFP、UniMol 等所有图神经网络
  • 随机种子选择是一等优化杠杆:精心挑选的 88 种子集成把 MAE 从 0.3374 降到 0.3321,等效于一次架构改进,且零新设计
  • 集成规模收益递减且非单调:从 88 种子加到 248 种子反而变差——后期种子引入的是相关噪声

这些发现都标注了可证伪条件,形成了可积累的科学知识 📚。

常见问题速查

问题解决方案
npx clawinstitute首次运行慢首次会从 npm 下载包,之后走本地缓存;也可npm install -g clawinstitute永久安装
想自定义运行输出位置launch.py支持--output-dir /path/to/runs
想加自己的任务新建task-<name>/目录,放好TASK.md+LAUNCH.md两个文件即可
智能体找不到 Python始终使用$BIOMLBENCH_VENV/bin/python全路径,不要依赖 PATH 里的python

写在最后

AutoScientists 把"生物医学 ML 竞赛"变成了一个可以整夜无人值守的自动化实验流程:prepare_all_data.py备好数据,launch.py拉起智能体团队,runbook.md驱动整个实验循环,最后交给你一份带完整研究洞察的提交文件。想要深入理解多智能体协作机制,可以阅读system/reference/SKILL.md与角色模板system/templates/ROLE-GPU.md

【免费下载链接】AutoScientistsAutoScientists: Self-Organizing Agent Teams for Long-Running Scientific Experimentation项目地址: https://gitcode.com/gh_mirrors/au/AutoScientists

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

http://www.cnnetsun.cn/news/4248388.html

相关文章:

  • 2026年内容防盗的教培系统有哪些,具体如何操作呢?
  • Ruby 官方镜像发布自动化完整剖析:versions.sh 到 Docker Hub 的更新管线
  • TeenyUSB MSC U盘开发指南:用FatFs打造你自己的闪存U盘设备
  • KKCE: 网站测速,ping检测,IP查询,路由追踪-快快测
  • AI情感陪伴的隐私风险:从上下文窗口到数据脱敏的技术拆解
  • FigmaCN:Figma界面汉化插件安装教程,4000+人工校验词条,3分钟装好
  • Hotfix API 参考:HotFix.patch() 方法完整用法与参数说明
  • ESAM 配置文件解读指南:decoder、merge_head 与 test_cfg 三大模块参数完整说明
  • 实时上报停留时长数据:TimeMe.js内置WebSocket通道3步集成教程
  • Cushy主题与样式实战:从暗色模式切换到OKLab色彩方案编辑器手把手教程
  • quicktime_video_hack如何建立屏幕流会话:15步USB握手协议逐步图解
  • 基于相似性推理的博弈论方法:多智能体协作中的理性合作策略
  • 【AI大模型实战】手把手教你基于Dify搭建RAG知识库,全程干货,零基础小白也能轻松学会!!
  • 【AI大模型教程】一文讲清支持 MCP 的七大 AI 框架有哪些!零基础小白收藏这一篇就够了!!
  • 从内存数据库走向云原生数据底座,深入理解 SAP HANA Cloud
  • SAR成像全链路解析:从点目标仿真到实测数据处理
  • bravado响应处理完全手册:HttpFuture、超时降级fallback_result与错误捕获最佳实践
  • MPDroid进阶功能:输出设备管理、网络电台与Sticker评分完整攻略
  • extended_text_field 渲染层揭秘:ExtendedRenderEditable 光标定位与桌面端拼音输入修复
  • LRU缓存淘汰机制全揭秘:SDURLCache如何守护你的磁盘容量上限
  • 悟空Agent实战:LLaMA-Factory高危0day漏洞挖掘与修复
  • 大模型推理为什么又长又啰嗦?更多thinking≠更好结果,精准thinking可砍掉一半长度
  • 收藏!小白也能学会!LangChain.js智能体开发指南:10大编排模式详解与实战应用
  • Jeff Dean押注AI4S:从分布式系统到科学发现的基础设施革命
  • IntelliJ IDEA快捷键
  • 【AI大模型】腾讯屠榜MTEB,嵌入模型告别BERT,拥抱LLM
  • 智能体Agent:怎样用自然语言重构数据开发?看完这一篇你就懂了!!
  • 水下鱼类实例分割实战:从COCO数据集到YOLOv8训练全流程
  • 【大模型必备】位置编码终极指南:收藏学习RoPE如何改变Transformer架构
  • 7B扩散LLM,居然能跟671B的DeepSeek V3掰手腕,扩散vs自回归,谁才是未来?