当前位置: 首页 > news >正文

模型部署需要考虑的性能指标和模型部署的步骤

文章目录

  • 模型性能相关
    • 性能指标
    • roofline model
    • 注意点
  • 模型部署相关
    • 量化
    • 量化里重要的细节
      • 量化映射
      • 粒度
      • 校准
      • PTQ
      • QAT

模型性能相关

性能指标

可以分为Memory bandwidth和compute bandwidth

模型里面优化目标是让计算峰值靠近compute bandwidth,让吞吐量靠近Memory bandwidth

此外模型还有:
计算量
参数量
访存量

roofline model

这里提出了一种性能优化的模型。
该模型提出了一个评价模型性能的指标,计算密度

可以用带宽和峰值参数算出计算密度,找到能够性能优化的方面:

注意点

  1. 硬件指标不能完全衡量模型性能
  2. rrt对模型的优化有限

    3.对cuda core和tensor core的使用

    4.不能忽略前处理和后处理的overhead(额外开销)
    5.使用性能分析工具查看benchmark和profiling,找到优化的方向

模型部署相关

量化

通过减少模型的计算精度从而减少模型整体计算量的一种方法。一般针对激活值和权重进行量化,所以一般会说对cnv和linear这些计算密集算子进行量化。


由于模型越来越复杂,希望减少模型的计算量和压缩模型,同时希望在量化后的模型精度损失尽量少。

量化里重要的细节

量化映射


但是对于不同的数据分布,同一种tatio和distance对原数据的损失不同,所以要根据原数据的分布合理的设计ratio和distance

两种量化方法,对称量化和非对称量化:

粒度

校准

PTQ

QAT

http://www.cnnetsun.cn/news/1401320.html

相关文章:

  • 代码编辑器插件 React-Codemirror2
  • AI 编程助手竞品周报
  • 基于YOLO26算法+DeepSeek_qwen大模型的智慧铁路要素缺陷巡检分析系统
  • 垃圾网站穷疯了,什么都要钱
  • 开箱即用!通义千问3-Embedding-4B镜像,小白也能快速搭建知识库
  • Java 流程控制与循环结构笔记
  • Dify生产环境Token成本黑洞排查实录(附官方未公开的token_usage_hook调试接口与离线审计工具)
  • 65R370-ASEMI超结MOS管TO-252封装
  • Python面向对象
  • 漏洞扫描是怎么进行的?什么是漏洞扫描?
  • Python爬虫获取训练数据:为定制化伏羲模型收集历史气象资料
  • Python全自动桌面整理工具,一键分类文件,小白也能用
  • Linux - 应用层自定义协议与序列/反序列化
  • 企业安全防护实战:如何用Firewall+WAF+IDS+IPS搭建多层防御体系?
  • 类目竞争加剧如何找到细分需求切入点
  • Shopee 选品怎么看市场供需比,确定高需求低竞争款?
  • BrowseComp-ZH:中文网络生态下大模型检索能力的极限挑战
  • Snipe-IT:IT资产全生命周期管理的开源创新实践指南
  • 国密SM3哈希吞吐量从42MB/s到216MB/s——一位密码芯片架构师不愿公开的SIMD向量化手记
  • bge-large-zh-v1.5入门到应用:一套完整的语义向量服务搭建指南
  • 进程:pcb
  • 党政机关如何正确使用 OpenClaw LOGO|含下载
  • 美胸-年美-造相Z-Turbo入门秘籍:写好描述词,让AI听懂你的想法
  • 2025年OpenRouter免费模型大盘点:53个零成本AI工具全解析(含Grok-4 Fast/Nemotron Nano 9B V2)
  • Java方法重载
  • DeepSeek-OCR-2部署案例:K8s集群中水平扩展OCR微服务实践
  • 深度学习从入门到实践:零基础也能掌握 AI 核心技术
  • 大数据学习指南:Linux + Hadoop + Spark + Flink 全生态实战手册
  • yz-bijini-cosplay实际生成:LoRA自动标注+种子值嵌入确保结果可复现
  • 如何使用 Gherkin 解析器:Behat 测试的终极指南