当前位置: 首页 > news >正文

115、NPU的Tenstorrent:数据流架构的AI芯片

NPU的Tenstorrent:数据流架构的AI芯片

去年冬天调试一块基于Tenstorrent Grayskull的板子,遇到了一个让我抓狂的问题:模型推理结果每隔几次就会跳出一个NaN,但同样的模型在GPU上跑得好好的。查了三天,最后发现是数据流图中一个节点没有正确配置“张量广播”模式——Tenstorrent的编译器默认不会像GPU那样自动做广播,你得显式告诉它“这里要复制一份数据到所有计算单元”。这个坑让我意识到,Tenstorrent的架构思维和传统SIMT/SIMD完全不同,它更像是在设计一个“数据管道工厂”,而不是“计算指令序列”。

数据流架构的基因:从“取指执行”到“数据驱动”

传统CPU/GPU的核心是“指令驱动”——程序计数器告诉硬件下一步该做什么。Tenstorrent走的是另一条路:数据流架构。每个计算单元(他们叫“Tensix Core”)内部有一个小型的“数据流控制器”,它不关心全局指令顺序,只关心“输入数据到了没有”。数据到了,计算自动触发;结果出来了,自动沿着预设的路径流向下一个单元。

这种设计在AI推理场景下有个天然优势:消除了指令取指和发射的开销。想象一下,一个卷积层需要做100次乘加,在GPU上你得发射100条指令(或者用SIMD一条指令处理多个数据),但Tenstorrent只需要在数据流图中定义好“输入张量→乘加器→累加器→输出张量”的路径,数据自己流过去,硬件自动完成所有操作。实测下来,对于大尺寸卷积(比如224x224x64),数据流架构的能效比同制程GPU高3-5倍。

Tensix Cor

http://www.cnnetsun.cn/news/3611015.html

相关文章:

  • 凭什么跑个大模型,就非得要几千块的显卡、几十GB的显存?
  • PG 日报|优化缓冲区批量扫描,降低多套接字并发竞争
  • LLM推理成本优化:Thesean Ship端点固定定价模型解析与实践
  • TI BOOSTXL-SHARP128扩展板实战:嵌入式显示与存储一体化方案
  • 深入解析LLM请求响应循环:从令牌化到流式输出的完整技术流程
  • DA3-GIANT单目深度估计技术解析与应用
  • AI模型路由技术:智能选择最优大模型的应用实践
  • BAML框架实战:LLM调用层标准化迁移与智能体系统优化
  • 工商管理专业学生可以考哪些证书?
  • BQ40Z50-R4 BMS实战:硬件保护、永久失效诊断与SMBus通信配置
  • 人早晚都会死,那么活着的意义何在?
  • 程序员如何转型大模型开发:路径规划与实战指南
  • 大模型异步任务架构:Java 后端别把长推理塞进同步接口
  • 【单片机毕业设计推荐】基于 STM32 的智能柜体环境监测与自动控制系统设计,基于 STM32 的多功能智能储物柜感知与蓝牙控制系统设计(012003)
  • Spring AI 改造老项目:从依赖地狱到流式超时的 4 个实战解法
  • 智能代理系统Hermes Agent:从工作流自动化到AI模型编排实战
  • 六层PCB为何成为中控设备主流标准架构
  • 2025-2026计算机类期刊推荐:从顶刊到“保底”,选对期刊少走弯路
  • 单目视频三维动态重建:NeRF与时序建模的突破
  • 从驾驶舱到智能助手:CEO一天的决策场景正在被重写
  • BI选型的7个评估维度:用权重打分法规避3类红线风险
  • AI短视频创作技术解析与商业化实践
  • 腾讯面试官经常问的问题:Redis 为什么能快到飞起?搞懂这 5 种核心数据结构,你就掌握了 Redis 高性能的秘密!
  • AI论文写作工具全流程测评与自考论文优化方案
  • MSPM0 I2C模块深度解析:从协议基础到高级应用实战
  • 深入解析MSPM0定时器:从通用TIMG到高级TIMA的架构与应用
  • 深入解析MSPM0 UNICOMM-UART:从基础原理到高级应用实战
  • 零代码构建企业知识库问答系统的30分钟实践指南
  • 2024年Cypress前端自动化测试实战:从架构优势到CI/CD集成
  • TVP5154A视频解码芯片硬件设计:电气规格、时序与热设计实战解析