循序渐进 Skywork:模型架构与实现要点梳理
目录
📊 各版本显存需求速查
awq量比版本:
vllm推理:
运行Skywork-R1V2-38B这个 380 亿参数的大模型,具体需要多少显存,取决于你使用哪种精度的版本。如果使用 4-bit 量化版本,单卡24GB 显存(如 RTX 3090/4090)就能流畅运行;但如果要跑未量化的 16-bit 版本,则需要约80GB 显存(如 A100)。
以下是不同版本对显存的具体要求:
📊 各版本显存需求速查
| 模型版本 | 显存占用 | 推荐显卡 (单卡) |
|---|---|---|
| 4-bit 量化版 (AWQ/GPTQ) | 约 24 GB | RTX 3090/4090 (24GB), RTX 5090 (32GB) |
| 8-bit 量化版 | 约 45 GB | A100 (40GB/80GB), A6000 (48GB) |
| 16-bit 原版 (BF16/FP16) | 约 80 GB | A100 80GB, 或 2 x RTX 4090 |
awq量比版本:
Skywork/Skywork-R1V2-38B-AWQ · Hugging Face
vllm推理:
import os from vllm import LLM, SamplingParams from vllm.entrypoints.chat_utils import load_chat_template model_name = "Skywork/Skywork-R1V2-38B-AWQ" # or local path llm = LLM(model_name, dtype='float16', quantization="awq", gpu_memory_utilization=0.9, max_model_len=4096, trust_remote_code=True, )Skywork-R1V3-38B-AWQ 比 Skywork-R1V2-38B-AWQ 好在哪
根据最新的技术报告,Skywork-R1V3 相比 R1V2 是一次重大的代际升级。它的核心优势并不在于增大模型规模(同样保持 38B 参数),而是通过全新的后训练方法,显著提升了模型的推理能力。
