当前位置: 首页 > news >正文

从华驼到本草:揭秘医学大模型的命名故事与技术演进之路

从华驼到本草:揭秘医学大模型的命名故事与技术演进之路

【免费下载链接】Huatuo-Llama-Med-ChineseRepo for BenTsao [original name: HuaTuo (华驼)], Instruction-tuning Large Language Models with Chinese Medical Knowledge. 本草(原名:华驼)模型仓库,基于中文医学知识的大语言模型指令微调项目地址: https://gitcode.com/gh_mirrors/hu/Huatuo-Llama-Med-Chinese

本草(原名:华驼)是哈尔滨工业大学社会计算与信息检索研究中心开发的中文医学大语言模型,通过指令微调技术将通用大语言模型与专业医学知识深度融合,为中文医疗问答场景提供专业支持。该项目开源了基于LLaMA、Alpaca-Chinese、Bloom和活字模型的医学指令微调版本,旨在推动医疗AI的民主化应用。

命名背后的故事:从"华驼"到"本草"的品牌升级

华驼:羊驼家族的医学传承

项目最初命名为"华驼"有双重含义:一方面致敬东汉著名医学家华佗,象征着对传统医学智慧的传承;另一方面巧妙呼应了基础模型LLaMA(美洲驼)和Alpaca(羊驼)的命名体系,形成有趣的"驼类模型家族"。

本草:更具文化深度的品牌重塑

2023年5月,项目正式更名为"本草",取自中国传统医学经典《本草纲目》,既保留了医学属性,又增强了文化辨识度。这一更名也体现了SCIR实验室对大语言模型命名体系的统一规划,使模型名称更具专业性和传播力。

技术架构:医学知识与大模型的融合之道

本草模型的核心创新在于其独特的知识微调技术,通过三阶段处理让模型学会显式利用医学知识:

图:本草模型的三阶段知识微调流程,包括参数填充、知识函数调用和知识增强回答生成

数据集构建:从知识到问答的转化

项目团队基于医学知识库cMeKG和2023年肝癌中文医学文献,构建了八千余条高质量医学问答数据。知识库涵盖疾病、药物、检查指标等多维度信息,示例如下:

{"中心词": "偏头痛", "相关疾病": ["妊娠合并偏头痛", "恶寒发热"], "相关症状": ["皮肤变硬", "头部及眼后部疼痛并能听到连续不断的隆隆声", "晨起头痛加重"], "所属科室": ["中西医结合科", "内科"], "发病部位": ["头部"]}

多模型支持:灵活选择适配场景

本草项目支持多种基础模型的微调,包括:

  • 活字1.0:哈尔滨工业大学基于Bloom-7B开发的中文通用问答模型
  • Bloom-7B:多语言大模型
  • Alpaca-Chinese-7B:优化中文表现的Alpaca模型
  • LLaMA-7B:Meta开源的基础模型

根据项目经验,基于活字模型的微调版本在医学问答任务中表现最佳。

快速上手:5分钟部署你的医学AI助手

环境准备

首先克隆项目仓库并安装依赖:

git clone https://gitcode.com/gh_mirrors/hu/Huatuo-Llama-Med-Chinese cd Huatuo-Llama-Med-Chinese pip install -r requirements.txt

模型下载

项目提供多种LoRA微调权重,可通过百度网盘或Hugging Face获取,以活字模型为例:

  • 基于医学知识库的LoRA权重:百度网盘

启动推理

使用提供的脚本快速启动医学问答推理:

# 基于医学知识库 bash ./scripts/infer.sh # 基于医学文献(单轮对话) bash ./scripts/infer-literature-single.sh # 基于医学文献(多轮对话) bash ./scripts/infer-literature-multi.sh

实际应用:医学问答能力展示

本草模型在多种医学场景下展现出专业的问答能力,以下是一个实际案例:

图:本草模型针对肠癌术后预后问题的专业回答,展示了模型整合医学知识的能力

在测试中,相比原始LLaMA和Alpaca模型,本草模型在医学问题上的回答准确率显著提升:

测试输入Llama输出本草输出
小张最近感觉身体不适,出现心悸、气促等症状。体检发现心脏扩大、搏动减弱。问题:小张最近感觉身体不适,出现心悸、气促等症状。体检发现心脏扩大、搏动减弱。小张可能患有心肌炎,建议尽快到医院进行检查和治疗。治疗方案包括药物治疗和手术治疗。
麻风病和儿童哮喘的病因是否一致?儿童哮喘和麻风病的病因是一致,但是儿童哮喘和麻风病的病因不一致不一致,麻风病的病因是麻风杆菌感染,而儿童哮喘的病因是喂养不良、吸烟等因素。

未来展望:持续进化的医学AI

本草项目仍在不断迭代发展,未来计划:

  1. 扩展医学文献覆盖范围,针对"肝胆胰"相关16种疾病训练专用模型
  2. 提升训练数据集质量,优化知识整合策略
  3. 增强模型的可解释性,提供回答依据的医学知识来源

项目相关资源仅供学术研究之用,严禁用于商业用途。模型生成内容不能作为实际医学诊断的依据。

如果你对医学AI感兴趣,欢迎通过项目仓库参与贡献,一起推动医疗人工智能的发展!

【免费下载链接】Huatuo-Llama-Med-ChineseRepo for BenTsao [original name: HuaTuo (华驼)], Instruction-tuning Large Language Models with Chinese Medical Knowledge. 本草(原名:华驼)模型仓库,基于中文医学知识的大语言模型指令微调项目地址: https://gitcode.com/gh_mirrors/hu/Huatuo-Llama-Med-Chinese

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

http://www.cnnetsun.cn/news/1569525.html

相关文章:

  • 如何通过本草模型实现医学AI智能诊断:中文医疗大语言模型的完整指南
  • 终极指南:如何为智能硬件构建高效语音交互系统
  • 终极指南:如何用Muzic的MusicBERT实现符号音乐深度理解(从入门到实践)
  • Loop:重新定义macOS窗口管理的优雅革命,让效率触手可及
  • 终极Rocket性能优化指南:10个提升Web应用速度的实用技巧
  • 使用usearch进行聚类分析:从向量数据中发现隐藏模式
  • EVA-01部署案例:科研团队将EVA-01用于卫星遥感图农田病虫害早期识别验证
  • SSD硬性负样本挖掘:解决正负样本不平衡的关键技术
  • 算法/力扣--字符串经典题目
  • KubeSphere Core 离线部署实战:从镜像搬运到私有仓库配置
  • 10个必学的.NET Interactive魔法命令:提升你的多语言编程效率
  • OpenTelemetry日志导出全攻略:Kafka、Elasticsearch和Loki的对比与选择
  • 极简部署方案:星图GPU平台OpenClaw+GLM-4.7-Flash体验
  • 认知几何学:思维对意义空间的弯曲效应V0.2【世毫九实验室原创理论】
  • TSL2561光传感器Arduino库原理与低功耗工程实践
  • WebRTC信令交换实战:从Socket.io到RTCPeerConnection的完整流程解析
  • Realistic Vision V5.1在产品设计中的应用:目标用户画像写实化呈现
  • 软考架构师备考:别死记硬背了,用这3个真实项目场景串联核心知识点
  • AMC1100隔离放大器实战:如何用DUB封装搞定三相电流电压测量?
  • **标题:自进化系统新范式:用Python实现动态代码优化与自我修复能力**
  • Windows屏保设置失效?解锁注册表权限的终极指南
  • 4YA-3玉米联合收割机全套(共有800多张CAXA图纸)(三行中原)
  • mips uboot 阶段nand flash代码注册流程
  • 前端部署:别让你的应用在上线后掉链子
  • 实测避坑:RetinaFace/LFFD等轻量算法在密集人脸场景的漏检率对比(含106关键点方案)
  • ESP32物联网开发环境配置挑战:基于Arduino框架的跨平台解决方案
  • LeetCodehot100-25 K 个一组翻转链表
  • 静态图≠安全!PyTorch 3.0中Graph IR层的3处内存越界隐患,及LLVM后端级修补补丁(已提交CVE-2024-XXXXX)
  • Windows下OpenClaw安装避坑:ollama-QwQ-32B联调实测
  • UniApp自定义导航栏避坑大全:从胶囊适配到主题切换,我踩过的坑你别再踩