从华驼到本草:揭秘医学大模型的命名故事与技术演进之路
从华驼到本草:揭秘医学大模型的命名故事与技术演进之路
【免费下载链接】Huatuo-Llama-Med-ChineseRepo for BenTsao [original name: HuaTuo (华驼)], Instruction-tuning Large Language Models with Chinese Medical Knowledge. 本草(原名:华驼)模型仓库,基于中文医学知识的大语言模型指令微调项目地址: https://gitcode.com/gh_mirrors/hu/Huatuo-Llama-Med-Chinese
本草(原名:华驼)是哈尔滨工业大学社会计算与信息检索研究中心开发的中文医学大语言模型,通过指令微调技术将通用大语言模型与专业医学知识深度融合,为中文医疗问答场景提供专业支持。该项目开源了基于LLaMA、Alpaca-Chinese、Bloom和活字模型的医学指令微调版本,旨在推动医疗AI的民主化应用。
命名背后的故事:从"华驼"到"本草"的品牌升级
华驼:羊驼家族的医学传承
项目最初命名为"华驼"有双重含义:一方面致敬东汉著名医学家华佗,象征着对传统医学智慧的传承;另一方面巧妙呼应了基础模型LLaMA(美洲驼)和Alpaca(羊驼)的命名体系,形成有趣的"驼类模型家族"。
本草:更具文化深度的品牌重塑
2023年5月,项目正式更名为"本草",取自中国传统医学经典《本草纲目》,既保留了医学属性,又增强了文化辨识度。这一更名也体现了SCIR实验室对大语言模型命名体系的统一规划,使模型名称更具专业性和传播力。
技术架构:医学知识与大模型的融合之道
本草模型的核心创新在于其独特的知识微调技术,通过三阶段处理让模型学会显式利用医学知识:
图:本草模型的三阶段知识微调流程,包括参数填充、知识函数调用和知识增强回答生成
数据集构建:从知识到问答的转化
项目团队基于医学知识库cMeKG和2023年肝癌中文医学文献,构建了八千余条高质量医学问答数据。知识库涵盖疾病、药物、检查指标等多维度信息,示例如下:
{"中心词": "偏头痛", "相关疾病": ["妊娠合并偏头痛", "恶寒发热"], "相关症状": ["皮肤变硬", "头部及眼后部疼痛并能听到连续不断的隆隆声", "晨起头痛加重"], "所属科室": ["中西医结合科", "内科"], "发病部位": ["头部"]}多模型支持:灵活选择适配场景
本草项目支持多种基础模型的微调,包括:
- 活字1.0:哈尔滨工业大学基于Bloom-7B开发的中文通用问答模型
- Bloom-7B:多语言大模型
- Alpaca-Chinese-7B:优化中文表现的Alpaca模型
- LLaMA-7B:Meta开源的基础模型
根据项目经验,基于活字模型的微调版本在医学问答任务中表现最佳。
快速上手:5分钟部署你的医学AI助手
环境准备
首先克隆项目仓库并安装依赖:
git clone https://gitcode.com/gh_mirrors/hu/Huatuo-Llama-Med-Chinese cd Huatuo-Llama-Med-Chinese pip install -r requirements.txt模型下载
项目提供多种LoRA微调权重,可通过百度网盘或Hugging Face获取,以活字模型为例:
- 基于医学知识库的LoRA权重:百度网盘
启动推理
使用提供的脚本快速启动医学问答推理:
# 基于医学知识库 bash ./scripts/infer.sh # 基于医学文献(单轮对话) bash ./scripts/infer-literature-single.sh # 基于医学文献(多轮对话) bash ./scripts/infer-literature-multi.sh实际应用:医学问答能力展示
本草模型在多种医学场景下展现出专业的问答能力,以下是一个实际案例:
图:本草模型针对肠癌术后预后问题的专业回答,展示了模型整合医学知识的能力
在测试中,相比原始LLaMA和Alpaca模型,本草模型在医学问题上的回答准确率显著提升:
| 测试输入 | Llama输出 | 本草输出 |
|---|---|---|
| 小张最近感觉身体不适,出现心悸、气促等症状。体检发现心脏扩大、搏动减弱。 | 问题:小张最近感觉身体不适,出现心悸、气促等症状。体检发现心脏扩大、搏动减弱。 | 小张可能患有心肌炎,建议尽快到医院进行检查和治疗。治疗方案包括药物治疗和手术治疗。 |
| 麻风病和儿童哮喘的病因是否一致? | 儿童哮喘和麻风病的病因是一致,但是儿童哮喘和麻风病的病因不一致 | 不一致,麻风病的病因是麻风杆菌感染,而儿童哮喘的病因是喂养不良、吸烟等因素。 |
未来展望:持续进化的医学AI
本草项目仍在不断迭代发展,未来计划:
- 扩展医学文献覆盖范围,针对"肝胆胰"相关16种疾病训练专用模型
- 提升训练数据集质量,优化知识整合策略
- 增强模型的可解释性,提供回答依据的医学知识来源
项目相关资源仅供学术研究之用,严禁用于商业用途。模型生成内容不能作为实际医学诊断的依据。
如果你对医学AI感兴趣,欢迎通过项目仓库参与贡献,一起推动医疗人工智能的发展!
【免费下载链接】Huatuo-Llama-Med-ChineseRepo for BenTsao [original name: HuaTuo (华驼)], Instruction-tuning Large Language Models with Chinese Medical Knowledge. 本草(原名:华驼)模型仓库,基于中文医学知识的大语言模型指令微调项目地址: https://gitcode.com/gh_mirrors/hu/Huatuo-Llama-Med-Chinese
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
