当前位置: 首页 > news >正文

超760万元奖金悬赏,谁能重构 DeepSeek 与 Kimi 的性能底层?


责编 | 梦依丹

出品丨AI 科技大本营(ID:rgznai100)

极致的推理延迟、极高的吞吐量、极大的模型规模……在大模型工程化的战场上,这曾是一个被公认为‘不可能’的三角。

回望 2025 年,DeepSeek-V3 技术报告为大家揭示了超大规模模型推理的新一代范式。通过 MLA 架构将 KV Cache 压缩 93%,配合 MTP(多 Token 预测) 技术大幅提升访存效率,全球开发者见证了万亿参数模型在大规模并发下实现“高吞吐、低延迟”的工程突破。

然而,站在 2026 年的当下,依靠 FP8 精度和基础架构已难以满足爆发式的即时响应需求。在大规模真实并发的洪流前,每一毫秒的延迟缩减,都直接挂钩着数以亿计的算力成本与集群效能。

正是在这种“性能即生命”的行业背景下,🚀2026 线上黑客松:AMD E2E Model Speedrun 全球挑战赛正式拉开帷幕!

AMD 联手 GPU MODE,豪掷 110 万美元发起这场全球竞速。

寻找那些能徒手拆解底层逻辑、将 AMD 旗舰算力的每一滴潜能都榨取出来的顶级开发者。

预选赛——入围即拿 1 万美金

本次大赛采用“预选赛 + 端到端决赛大考”的双阶段赛制,每个阶段都设立了令人心动的重磅奖励。

该阶段前 10 名优胜者将获得 1 万美金,并拿到决赛入场券

三大核心内核任务(总分 3750 Pts)

参赛者需对以下三个 GPU 内核进行极限性能调优,各单项最高分值为:

  • MXFP4 MoE:1500 分

  • MLA Decode:1250 分

  • MXFP4 GEMM:1000 分

硬核竞技规则

  • 唯快不破:基于测试用例的绝对运行时间进行排名,计算所有基准用例的几何平均值;

  • 准入门槛:作品性能必须超越官方基线(Baseline)且排在前 20 名方可计分,未入前 20 者得分为零;

  • 积分公式:单项得分 = 最大分值 × [1 - (排名分值/20)],排名按顺序对应分值 0, 1, 2...19;

  • 先到先得:总分为三项内核得分之和。若遇平局,以提交时间最早的内核为准;

  • 权威复现:总分最高的前十名需经主办方独立复现结果后,正式确定决赛席位。

问题详情及参考实现将在 GPU MODE 网站或微信比赛群公布。

预选赛作品可通过 Popcorn CLI 提交,安装及提交说明见此链接:

👉 https://github.com/gpu-mode/popcorn-cli

决赛大考: 晋级选手将瓜分 100 万美元现金大奖!

预选赛排名前 10 的顶尖团队将获得 AMD 旗舰级算力集群的操控权,开启为期一月的端到端模型性能极限压榨。

决赛大考共分为两条赛道,分别是 DeepSeek-R1-0528 (FP4+MTP) 与 Kimi K2.5 1T (FP4)。参赛选手可以同时开启双线作战,多维度压榨旗舰算力潜能,赢取总计 100 万美元的决赛大奖。

决赛核心评测逻辑:

  • 多维评估:在 Input 8K / Output 1K 的标准测试负载下,综合考量每 GPU 总 Token 吞吐量、交互性(Interactivity)以及端到端延迟(E2E Latency);

  • 算力分配:支持最大 TP/EP = 8 的 8 卡节点配置,开发者可根据显存与通信效率自由调优配置;

  • 结果为王:每个并发等级将根据吞吐量(权重 60%)与交互性(权重 40%)进行排名赋分,三大并发等级得分之和即为决赛总分。

这些数字并非仅仅为了筛选一份跑分榜单,而是要通过这场极限竞速,去回应大模型规模化落地中最硬核的工程命题。

⏳ 决战时刻表:倒计时已经开启!

目前距离预选赛截止已进入关键倒计时,留给各位算子调优、性能压榨的时间已经不多了!这不仅是一场算力的博弈,更是一场与时间的赛跑。

请务必锁定以下关键节点(北京时间):

🚨3 月 7 日 08:00 — 4 月 7 日 14:59 | 预选赛开战

🚀 提醒:距离报名通道关闭即将仅剩 12 天,这是通往 110 万美元奖金池的唯一入场券。

🔥 4 月 8 日 00:00 — 5 月 16 日 14:59 | 总决赛冲刺

✊向百万美元最高奖金发起最后冲刺。

🏆 5 月 19 日 | 全球颁奖典礼

见证算力之王的诞生,代码正式封榜合入开源主分支!

AMD 全球推理竞速挑战赛,只等你来战!

http://www.cnnetsun.cn/news/1555633.html

相关文章:

  • 第3.3章:StarRocks数据导入——Stream Load实战:从CSV到实时分析的完整链路
  • 告别手写C库!用Buddy-MLIR一键编译PyTorch模型到Gemmini加速器(实战避坑)
  • 如何快速搭建免费开源的机器翻译API:LibreTranslate完整指南
  • 终极指南:使用SMUDebugTool解锁AMD Ryzen处理器的隐藏性能潜力
  • s2-pro效果展示:高语速新闻播报(220字/分钟)清晰度实测
  • 腾讯优图4B模型实战:一键部署,轻松实现图片内容分析
  • 别再只会让小车跑直线了!用Arduino UNO + TB6612 + 四路循迹传感器,实现复杂路况的精准控制
  • BERT实践指南:从理论到应用的自然语言处理技术
  • Pixel Dream Workshop 创意爆发:十组高级提示词(Prompt)与生成作品赏析
  • 7个革新性的REFramework应用技巧:游戏开发者的效率提升指南
  • PCB文件查看工具探索:OpenBoardView如何突破电路分析效率瓶颈
  • Clawdbot汉化版实战落地:跨境电商团队WhatsApp多语种客服系统
  • 南北阁Nanbeige 4.1-3B入门必看:软件测试用例的智能生成与评审
  • Arduino离线安装esp32/esp8266:一键式解决方案与版本避坑指南
  • opencode单元测试生成:Python/JS/C++覆盖率对比
  • RVC训练资源节约:LoRA微调替代全量训练实测对比
  • Typecho动态博客部署避坑指南:解决Vercel CLI常见报错与数据库备份问题
  • 绕过ARM云手机高成本:用ReDroid + libndk在x86服务器上跑Android应用的另类思路
  • Spring_couplet_generation 学术研究价值:作为NLP文本生成任务的基准
  • 如何彻底告别Ralph for Claude Code:5步完成系统环境重置终极指南
  • 别再手动传包了!用GitHub Actions自动化部署你的Spring Boot + Vue项目到云服务器
  • 4个步骤解决AtlasOS系统Xbox控制器驱动问题
  • 别再硬编码了!用UE5 DataTable管理你的游戏配置(附结构体设计避坑指南)
  • 如何构建现代化微前端架构:Umi-plugin-qiankun实战指南
  • RWKV7-1.5B-G1A多轮对话能力实战:构建领域知识问答机器人
  • 不用标注数据!手把手教你用SAM 3和SegEarth-OV3搞定遥感图像分割(附避坑指南)
  • 3个实用技巧:如何用LeagueAkari提升你的英雄联盟游戏体验
  • 终极指南:如何解决UABEA项目中MonoBehaviour资产修改的核心挑战
  • 游戏字体的文化解码:开源工具解锁创意设计新维度
  • Python3.8镜像+Miniconda:科研复现与快速开发的利器