当前位置: 首页 > news >正文

【LLM】Qwen3-0.6B服务化部署、请求与性能测试

Qwen3-0.6B

  • 功能:文本生成
  • 部署方式:使用1卡 nvidia A100/asend 910b 部署

模型下载

pipinstallmodelscopemkdirQwen3-0.6B modelscope download--modelQwen/Qwen3-0.6B--local_dirQwen3-0.6B

镜像

nvidia镜像

vllm/vllm-openai:latest

asend镜像

quay.io/ascend/vllm-ascend:v0.18.0

模型部署

vllm serve--modelQwen3-0.6B\--host0.0.0.0\--port8000\--tensor-parallel-size1\--max-model-len32768\--reasoning-parser qwen3\--trust-remote-code\--gpu-memory-utilization0.9

参数说明:

参数说明
--modelQwen3-0.6B模型权重路径(mkdir 生成的文件夹目录)
--host0.0.0.0服务监听地址
--port8000服务监听端口
--tensor-parallel-size1张量并行数,1卡部署
--max-model-len32768最大上下文长度(32K token)
--reasoning-parserqwen3推理内容解析器,用于解析 Qwen3 的思维链(thinking)输出
--trust-remote-code允许执行模型仓库中自带的远程代码
--gpu-memory-utilization0.9GPU/NPU 显存利用率上限(90%)

模型请求

curl命令请求

curlhttp://localhost:8000/v1/chat/completions\-H"Content-Type: application/json"\-d'{ "model": "Qwen3-0.6B", "messages": [ {"role": "user", "content": "你好,请你帮我生成一个关于春天的五言绝句!"} ], "max_tokens": 1024, "temperature": 1.0, "top_p": 0.95, "presence_penalty": 1.5, "extra_body": { "top_k": 20 } }'

python请求方式

fromopenaiimportOpenAI client=OpenAI(api_key="EMPTY",base_url="http://localhost:8000/v1",timeout=3600)messages=[{"role":"user","content":"你好,请你帮我生成一个关于春天的五言绝句!"},]chat_response=client.chat.completions.create(model="Qwen3-0.6B",messages=messages,max_tokens=1024,temperature=1.0,top_p=0.95,presence_penalty=1.5,extra_body={"top_k":20,},)print("Chat response:",chat_response)

请求参数说明:

参数说明
modelQwen3-0.6B模型名称(部署路径)
messages对话消息列表
max_tokens1024最大生成 token 数
temperature1.0采样温度,越高越随机
top_p0.95核采样概率阈值,从概率累积达95%的token中采样
presence_penalty1.5存在惩罚,抑制已出现token的重复
top_k20Top-K 采样,仅从概率最高的20个token中采样

性能测试

vllm bench serve --base-url http://localhost:8000\--backendvllm\--model"Qwen3-0.6B"\--tokenizer"Qwen3-0.6B"\--dataset-name random\--input-len512\--output-len512\--num-prompts10\--num-warmups3\--max-concurrency1\--save-result\--result-dir /path/to/your_save_dir\--result-filename qwen3-0.6b_text_input512_output512_request1_num10.json

参数说明:

参数说明
--base-urlhttp://localhost:8000被测服务地址
--backendvllm后端类型,vllm 原生接口
--modelQwen3-0.6B模型名称(与部署路径一致)
--tokenizerQwen3-0.6Btokenizer 路径
--dataset-namerandom数据集类型,随机生成输入
--input-len512每条输入 token 长度
--output-len512每条输出 token 长度
--num-prompts10测试请求总数
--num-warmups3预热请求数(不计入统计)
--max-concurrency1最大并发数
--save-result保存测试结果到文件
--result-dir/path/to/your_save_dir结果保存目录
--result-filenameqwen3-0.6b_text_...json结果文件名
http://www.cnnetsun.cn/news/4260669.html

相关文章:

  • Pydantic 数据验证讲解
  • YOLO目标检测实战:从331张行人车辆数据集入门到部署
  • 充电桩产线 ATE 自动测试系统架构设计:上下料/测试/分拣怎么拼
  • RustFS 加入 NVIDIA Inception:AI 原生存储路线走到哪了
  • 本地LLM硬件需求怎么算?显存内存估算公式与配置指南
  • 2026年数据分类分级产品选型指南:七大厂商解决方案技术评测与行业优选解析
  • 从零构建AI文本检测系统:Wikipedia AI or Not Quiz实战
  • 概率张量分解与函数配准的统一框架:光滑重参数化实战
  • 荒岛求生1.1.6他来啦
  • 李宏毅机器学习课程学习指南:从基础到实战的完整路径
  • AI生成美术素材引争议:游戏团队必须建立流程责任与审查机制
  • Spring代理模式深度解析:从AOP原理到事务模拟实战
  • 从零构建LLM:打通训练与推理全流程的工程实践
  • effective modern C++- item 1: 理解模版类型推导
  • 零基础也能吃透!Python自动化办公全实操教程,告别加班效率翻倍
  • 学习Python图像处理库Pillow
  • 【29册即拍即发】折纸侦探团全系列PDF合集(1-29卷)|高清步骤图+动物/昆虫/人物全覆盖|折纸入门与进阶必备收藏版
  • 14.什么时候用pgvector什么时候单独部署Milvus
  • PCB缺陷检测VOC数据集实战避坑指南
  • 千问 LeetCode 11. 盛最多水的容器 Java实现
  • AI望远镜技术落地:从边缘推理到智能观测自建方案
  • 学术AI技术进阶:单一模型局限性与多模型协同架构在科研全流程的落地价值
  • 打架行为检测数据集:VOC+YOLO双格式2类别实战指南
  • 深入理解C++ std::enable_if_t的用法<一>做为函数返回值
  • 基于CNN的睡眠质量分析系统:从时间序列处理到健康应用实践
  • 同样是写文档,为什么别人图文清爽?
  • OpenRouter深度解析:一个API Key统一调用多模型的工程实践
  • 本地大模型部署显存估算:用计算器搞定GPU选型与KV Cache优化
  • 降ai率指令怎么写?AI降重后怎样做AIGC检测和论文查重?
  • GPT-Image 2 科研绘图的8个专业Prompt,轻松做出顶刊级配图!