当前位置: 首页 > news >正文

从Kimi K3到端侧普惠:探路者双主业共振,抢滩AI压缩千亿红利

2026年7月,月之暗面正式发布Kimi K3,以2.8万亿总参数、896专家MoE稀疏架构、百万级上下文窗口,一举成为当前全球规模最大的开源大模型,在代码竞技场匿名对战中登顶第一,综合智能对标海外顶级闭源模型。过去一年,DeepSeek、文心一言、GPT系列均持续刷新参数上限,行业形成清晰共识——大模型能力提升高度依赖参数规模扩张,未来模型参数只会越来越大。

但参数无限膨胀,正在催生三大无解行业痛点:

1.存储成本指数级飙升:2.8万亿参数模型完整权重需要数百块高端H300/B300 GPU承载,单集群部署硬件投入超十亿元,中小企业完全无法自建。

2.内存墙瓶颈彻底凸显:海量模型权重、KV Cache中间数据持续搬运,算力芯片利用率被带宽与存储拖垮,单纯堆GPU边际收益持续走低。

3.端侧落地近乎不可能:万亿级参数模型无法下沉至车载、AR、机器人、可穿戴设备,云端API调用价格高企(K3输出达100元/百万token),AI普惠化受阻。

业内主流解决方案分为两条路线:一是英伟达等硬件厂商持续升级HBM带宽与存储容量;二是以上海通途半导体为代表的技术路线——主动全链路压缩,从源头降低数据体量。谷歌推出TurboQuant缓存压缩方案,侧面印证“压缩解放算力”是行业长期刚需,而非短期优化工具。

通途全栈AI压缩:唯一覆盖“输入-中间态-模型参数”三层的系统性解决方案

探路者集团(300005.SZ)旗下上海通途半导体,是国内极少数、全球稀缺的全链路AI压缩自研厂商,构建了区别于单点量化工具的三层全栈压缩体系,完美匹配万亿级大模型的降本需求:

1.前端输入数据压缩:视频、图像多模态输入可压缩至原体量1/5,大幅降低模型前置传输带宽压力,适配K3原生多模态视觉推理场景。

2.中间态KV Cache压缩:在谷歌TurboQuant算法基础上再压缩50%;在模型参数层面,可对千亿乃至万亿级参数的大模型实现30%的参数压缩,且全程无需重训、即插即用。

这套技术体系直击当前AI产业最核心的痛点。无论是谷歌推出TurboQuant缓存压缩方案,还是英伟达持续升级HBM带宽方案,本质上都是在尝试突破这一瓶颈。

探路者集团副总裁、上海通途半导体CEO王洪剑此前在2026中关村论坛年会上表示,通途的全栈数据压缩技术与谷歌TurboQuant在核心痛点、技术路径与产业方向上高度契合,共同印证了“用压缩解放算力”是行业的确定性方向。

探路者集团战略拼图:建立体系化芯片产业矩阵

探路者集团自2021年确立“户外+芯片”双主业战略以来,系统性构建起芯片产业版图,先后收购了北京芯能、G2 Touch、江苏鼎茂、深圳贝特莱和上海通途半导体,构建起覆盖“感知—交互—显示—压缩”全链条的芯片产品矩阵。

从产业逻辑看,上海通途半导体在这一矩阵中扮演的角色尤为关键。通途的核心图像算法IP已授权超过20家国内中大型芯片设计公司,IP授权作为轻资产模式,毛利率超60%;其基于自研技术开发的手机显示屏桥接芯片出货量也名列行业前茅。与HW合作研发OLED驱动IC,年底回片。明年形成规模营收。更值得关注的是,通途的压缩类IP已批量导入DPX、ZJ半导体等头部芯片厂商供应链。

这意味着,上海通途半导体不仅是一个独立的利润增长极,更是整个芯片矩阵的“技术黏合剂”——其压缩能力可与贝特莱的触控芯片、北京芯能的显示驱动芯片形成深度协同,在AR眼镜、智能车载、人形机器人等高景气终端场景中,构建起从“感知—处理—压缩—显示”的完整技术闭环,形成跨产品线的技术协同能力。

更重要的是,上海通途半导体的压缩技术为探路者自有智能硬件产品提供了核心底层支撑。公司自研的第二代Crest C3下肢智能运动外骨骼,搭载自有低功耗触控、运动感知芯片,实现了“芯片—装备”的技术闭环。618期间,该产品在天猫平台单日销量突破100台,整机重量仅1.8公斤,推重比达10:1。从底层芯片到终端产品的全链路自主可控正在加速成型。

探路者集团正凭借“户外提供稳定现金流+芯片贡献增长弹性+压缩技术打通全产业链”的三轮驱动模式,在端侧AI赛道中占据了稀缺生态位,走出一条差异化的增长路径。

http://www.cnnetsun.cn/news/3537581.html

相关文章:

  • Vue Progressive Image 核心功能详解:懒加载、占位图与错误处理的终极指南 [特殊字符]
  • C++命令模式实战:解耦请求与实现,支持撤销重做
  • Tachidesk-Server:桌面漫画阅读服务器的终极指南
  • Linux下Docker Compose里运行Jenkins数据故障诊断Shell脚本
  • Python大麦抢票自动化工具终极指南:5步轻松抢到心仪门票
  • WebDevsCom高级用法:如何创建个性化资源收藏和分类系统
  • aws-security-viz核心功能解析:从Graphviz到Web视图的完整方案
  • 多模态AI媒体创作:为智能代理赋能的专业媒体生成框架
  • Streamlit快速搭建Python数据看板实战指南
  • VDO.Ninja终极指南:如何免费搭建专业级远程视频制作系统
  • 基于Qt C++的系统资源监控工具开发实战:从原理到实现
  • Proteus仿真STM32按键检测:从环境搭建到代码调试完整指南
  • AI项目失败主因:90%死于问题定义不清
  • 空调遥控器电路设计中的模拟电子技术解析
  • 3步打造私有化AI编程环境:code-server深度集成实战指南
  • 用Sinh-Arcsinh分布建模Fantacalcio球员得分预测
  • Triangles社区贡献指南:如何参与开源项目开发 [特殊字符]
  • Python-基础-元组
  • DIAMOND技术报告解读:深入理解语音修复模型的创新与突破
  • vue-progressive-image自定义组件开发:扩展插件功能的高级技巧
  • 定制化不是越贵越好!用这4个反直觉指标重构评估体系:已帮37家企业节省平均41.6%定制预算
  • 2026 最新版 Codex 下载、安装及环境配置教程(超详细)
  • 深度解析rust-musl-cross工作原理:musl-libc与Rust工具链协同机制
  • 为什么你的定制AI总不达标?揭秘9大隐藏能力断层——基于172个真实交付项目的归因分析
  • 华北赛区走马观碑队伍成绩申诉书
  • 快速掌握GDScript编程:浏览器实战入门指南
  • 2026年耐高温PPS膜(聚苯硫醚薄膜)与PAEK膜(聚芳醚酮薄膜)厂家专业特性与应用优势全面解析(上海和盛新材料)
  • 终极指南:Visual C++运行时一键安装解决方案,彻底告别DLL缺失错误!
  • TMS320F280013x CAN驱动开发:从寄存器配置到实战代码
  • FLUX.1-dev FP8量化版:如何在8GB显卡上运行AI绘画模型