当前位置: 首页 > news >正文

2026 LLM大模型权威排行榜评测网站指南(持续更新)

面对不同的大模型排行榜,真正困难的不是找到一个名次,而是判断这个名次反映的是用户偏好、标准化测试、软件工程能力,还是价格与速度.

如果只想快速了解当前大模型的综合表现,优先查看ArenaArtificial Analysis:前者更接近真实用户的使用偏好,后者适合同时比较能力、价格和推理速度。专项能力则应结合 LiveBench、SWE-bench 等对应基准判断。

网站编号表示推荐阅读顺序,不代表对平台权威性的绝对排名;动态榜单的结果和维护状态仍可能继续变化。

网站汇总

评测网站开发/维护团队主要方向更新状态
ArenaArena Team;起源于 UC Berkeley SkyLab / LMSYS真实用户偏好、文本、多模态、代码、Agent持续更新
Artificial AnalysisArtificial Analysis综合能力、价格、速度、Agent、API持续更新
LiveBenchAbacus.AI、NYU、NVIDIA、UMD、USC 等研究人员动态题库、抗污染、客观评分代码仓库持续更新;官网显示“Showing LiveBench-2026-06-25 — the latest release”
SWE-benchSWE-bench Team;起源于 Princeton、PLI、UChicago软件工程、Coding Agent持续更新
LM Market CapAnalyxa LLC多来源综合排名、价格、速度、上下文与趋势持续更新;官方称模型元数据每小时刷新
Hugging Face Open LLM LeaderboardHugging Face 与开源社区开放权重模型标准基准官方已停止并归档
OpenCompass(司南)上海人工智能实验室相关团队及开源社区中文、通用能力、多模态、专项评测本文归档为历史参考;主榜单最近更新时间为 2026-05-13

首选推荐:快速了解当前大模型表现

1. ⭐ Arena:看真实用户偏好与实际对战表现

网站简介

Arena 是基于真实用户匿名对战与偏好投票进行模型比较的平台。平台最初以 Chatbot Arena 形式出现,后更名为 LMArena,并于 2026 年 1 月正式更名为 Arena。其公开榜单覆盖文本、视觉、代码、图像、视频、搜索和 Agent 等多种模型与任务。

开发团队简介

Arena 最初由加州大学伯克利分校(UC Berkeley)SkyLab 的研究人员创建,项目早期属于 UC Berkeley / LMSYS 研究体系。此后项目公司化运营,由 Arena Team 持续开发和维护。

主要评测方式

  • 匿名模型对战
  • 真实用户投票
  • 基于成对比较数据计算模型排名
  • 文本、视觉、Web 开发、图像、视频、搜索、Agent 等分类榜单

官方链接及更新时间

  • 官网:https://arena.ai/
    更新时间:动态更新,截至 2026-08-19,Arena 官方最近公开的榜单产品更新日期为2026-08-14
  • 排行榜:https://arena.ai/leaderboard
    更新时间:动态更新,截至 2026-08-19,Arena 官方最近公开的榜单产品更新日期为2026-08-14

2. ⭐ Artificial Analysis:综合比较模型能力、价格与速度

网站简介

Artificial Analysis 是独立 AI 基准测试与分析平台,公开比较大语言模型和 AI API 服务商的能力、价格、输出速度、延迟、上下文窗口以及其他性能指标。其模型榜单包含 Artificial Analysis Intelligence Index,并提供代码、Agent、长上下文、多模态、指令遵循等专项评测。

开发团队简介

Artificial Analysis 由同名独立 AI 基准测试公司开发和维护。平台业务覆盖语言模型评测、推理性能、AI 硬件、语音、图像与视频生成、Agent 等方向。

主要评测方式

  • Artificial Analysis Intelligence Index
  • 独立运行的模型能力基准测试
  • Coding、Agentic、Long Context、Multimodal 等专项评测
  • API 输出速度、首 Token 延迟、端到端响应时间测试
  • 模型与 API 价格比较

官方链接及更新时间

  • 官网:https://artificialanalysis.ai/
    更新时间:持续更新;截至 2026-08-19,首页 Changelog 最近一条公开更新为2026-08-18
  • 大模型排行榜:https://artificialanalysis.ai/leaderboards/models
    更新时间:动态更新;截至 2026-08-19,平台最近一批公开语言模型评测更新日期为2026-08-18

其他评测与基准测试网站

3. LiveBench:强调抗污染的动态评测

网站简介

LiveBench 是面向大语言模型的基准测试和排行榜,目标之一是降低测试集污染对评测结果的影响。其题目来源包括数学竞赛、论文、新闻和数据集等,并使用具有客观标准答案的任务进行自动评分。

开发团队简介

LiveBench 由来自 Abacus.AI、纽约大学(NYU)、NVIDIA、马里兰大学(UMD)和南加州大学(USC)等机构的研究人员共同开发,项目由 Abacus.AI 赞助。其论文入选 ICLR 2025 Spotlight。

主要评测方式

  • 使用较新的信息来源构造题目,以限制测试集污染
  • 使用可验证的客观标准答案进行自动评分
  • Reasoning、Coding、Mathematics、Data Analysis、Language、Instruction Following 等分类评测
  • 官方仓库持续维护模型配置与评测代码

官方链接及更新时间

  • 官网与排行榜:https://livebench.ai/
    更新时间:动态页面展示 Showing LiveBench-2026-06-25 — the latest release.
  • GitHub:https://github.com/LiveBench/LiveBench
    更新时间:最近提交2026-08-18

4. SWE-bench:软件工程与 Coding Agent 评测

网站简介

SWE-bench 是面向大语言模型和软件工程 Agent 的代码能力评测基准。其任务来自真实 GitHub Issue 和对应代码仓库,要求模型理解现有代码库、修改代码并通过项目测试。

SWE-bench 官方榜单包括 SWE-bench、SWE-bench Verified、SWE-bench Multilingual、SWE-bench Multimodal、SWE-bench Lite 等版本,并在 2026 年继续维护相关榜单和软件工程评测项目。

开发团队简介

SWE-bench 最初由来自 Princeton University、Princeton Language and Intelligence(PLI)和 University of Chicago 的研究人员提出。原始论文作者包括 Carlos E. Jimenez、John Yang、Alexander Wettig、Shunyu Yao、Kexin Pei、Ofir Press 和 Karthik Narasimhan。项目由 SWE-bench Team 持续维护。

主要评测方式

  • 真实 GitHub Issue
  • 真实开源代码仓库
  • 自动运行测试验证补丁正确性
  • 以成功解决任务的比例作为核心指标之一
  • Verified、Multilingual、Multimodal 等不同任务集合

官方链接及更新时间

  • 官网与排行榜:https://www.swebench.com/
    更新时间:动态更新,官网 News 最近一项标为2026 年 5 月(ProgramBench),官方代码仓库截至核对日仍在更新。
  • GitHub:https://github.com/SWE-bench/SWE-bench
    更新时间:最近提交2026-08-18

5. LM Market Cap:综合查看模型排名、价格与使用成本

网站简介

LM Market Cap 是一个 AI 模型排名与比较平台。它汇总多个公开评测来源,为模型计算统一的 LMC Score,并集中展示价格、输出速度、上下文窗口、能力特性和排名变化等信息。除了大语言模型,网站还收录图像与视频生成模型。

LM Market Cap 更适合用来快速筛选和横向比较模型,而不是作为某项原始基准测试的官方结果来源。需要核验具体能力时,仍应回到 Arena、LiveBench、SWE-bench 等原始评测平台。

开发团队简介

LM Market Cap 官网将其标注为 Analyxa LLC 旗下产品。官网公开资料主要介绍平台功能和排名方法,未提供更详细的开发团队成员信息。

主要评测方式

  • 汇总 Arena Elo、LiveBench、SWE-bench Verified、模型官方报告等多个来源的数据
  • 对不同基准分数进行基线扣除和归一化,统一换算到 0~100 分
  • LMC Score 由基准测试分数(90%)、能力特性(5%)和上下文窗口(5%)组成
  • 在基准测试部分,将 Arena Elo 作为 30% 的权重,其余任务基准合计占 70%
  • 单独展示模型价格、速度、上下文窗口、可用方式和历史排名变化
  • 支持按照质量、成本和使用需求调整权重,生成自定义排名

官方链接及更新时间

  • 官网与排行榜:https://lmmarketcap.com/
    更新时间:动态更新;截至 2026-08-19,官网显示榜单处于 Live 状态,官方说明模型元数据每小时刷新。
  • 排名方法:https://lmmarketcap.com/docs/methodology
    更新时间:方法页持续维护;截至 2026-08-19,页面模型评估方法变更记录的最新版本为v3(2026 年 4 月)

历史参考

6. Hugging Face Open LLM Leaderboard(已停止维护)

网站简介

Open LLM Leaderboard 是 Hugging Face 曾长期维护的开放大语言模型排行榜,主要用于比较公开权重模型在多个标准基准上的表现。该榜单曾广泛用于 Llama、Mistral、Qwen 等开放模型的横向比较。

Hugging Face 在2025-03-13正式宣布 Open LLM Leaderboard 退役。官方归档材料继续保留旧版榜单、评测方法和历史结果。

开发团队简介

该榜单由 Hugging Face 团队及开源社区建设和维护,依托 Hugging Face Hub、Datasets 和评测工具运行开放模型基准测试。

主要评测方式

历史版本使用过 IFEval、BBH、MATH、GPQA、MMLU-Pro 等标准基准评测开放模型。

官方链接及更新时间

  • 归档文档:https://huggingface.co/docs/leaderboards/en/open_llm_leaderboard/archive
    更新时间:归档页面本身未公开单一最后更新时间;其中 Open LLM Leaderboard v1 官方记录为2024 年 6 月归档
  • 官方退役公告:https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard/discussions/1135
    更新时间:2025-03-13(官方宣布 leaderboard officially retiring)。

7. OpenCompass(司南,本文作为历史参考)

网站简介

OpenCompass 是面向大语言模型和多模态大模型的开源评测平台,提供模型评测框架、数据集、评测配置和公开榜单。其评测体系支持客观评测和主观评测,并覆盖知识、语言、理解、推理、代码、安全及垂直领域等能力。

本文将 OpenCompass 的综合大模型排行榜列入“归档/历史参考”。截至 2026-08-19,主榜单页面显示的最近一次更新时间为2026-05-13;CompassArena 页面显示的榜单更新日期为2026-06-11。OpenCompass 代码仓库仍在维护,但官网主页显示的模型已经较为陈旧,因此显示归档。

开发团队简介

OpenCompass 由上海人工智能实验室相关团队开发并维护,同时接受开源社区贡献。其开源代码、文档和多个专项评测平台仍可访问。

主要评测方式

  • 标准数据集客观评测
  • LLM-as-a-Judge 评测
  • 主观模型比较
  • CompassAcademic 学术榜单
  • CompassArena 匿名模型对战与用户投票
  • 多模态、医疗、金融等专项评测

官方链接及更新时间

  • OpenCompass 官网:https://opencompass.org.cn/
    更新时间:官网首页未公开单一最后更新时间;本文参考的综合主榜单最近一次页面更新时间为2026-05-13
  • 大语言模型主榜单:https://rank.opencompass.org.cn/leaderboard-llm-v2
    更新时间:2026-05-13(主榜单页面显示的最近更新时间)。
http://www.cnnetsun.cn/news/4160727.html

相关文章:

  • 【AI接入大模型SDK】云端接入和本地部署模型的区别
  • K-Means、KNN、SVM三大算法原理与实战:从黑盒到白盒的建模指南
  • Win10网速优化全攻略:从诊断到硬件排查的完整解决方案
  • 24V3A欧规电源适配器选型指南:GS认证、纹波与工程实践
  • Linux学习19-moosefs部署与SBD共享磁盘
  • 美赛实战解题逻辑链:从题目翻译到代码实现的五维建模方法论
  • 免训练AI模型Nori:表格数据缺失值填充与预测实战指南
  • 数学建模国赛零基础冲省二:策略、流程与三天实战指南
  • 3 分钟跑通 NBA 官方数据:nba_api 从查到用全解
  • 如何用 PyVISA 让 Python 自动操控 GPIB / USB / TCP/IP 测量仪器
  • untrunc:不重新编码修复损坏 MP4/MOV 视频文件
  • LlamaIndex 系列【4】入门案例(阿里云百炼适配)
  • Java求职Day51:Spring Boot整合与JVM调优实战
  • Arcface-PyTorch 完整实操:5 步搞定人脸识别模型训练与 LFW 评估
  • OpenAI暂停Astra训练警示:AI前沿训练中的网络风险与安全实践
  • 贪心算法与组合编码实战:从双数极值配对到卡牌状态压缩
  • 容度升维方法论(CDEM)深化——与六种经典方法论的对比、哲学根基与未来演化
  • 基于SpringBoot的毕业设计选题系统:从需求到部署的全栈实战
  • CLion中Makefile项目自动化构建:编译前清理与编译后复制配置指南
  • 车载安卓Framework开发核心技术与面试指南
  • HsMod炉石插件快速上手指南:三步安装,讲透加速、皮肤与Web面板
  • 5分钟同步上云:Nextcloud桌面客户端新手配置指南
  • 2026年7月辽源市新房价格深度分析报告
  • 稳态耦合智能体:从内在驱动到亲社会行为的AI架构革新
  • AI编程助手ABTest:行为驱动测试框架构建与评估实践
  • 从零到一 | CV转多模态大模型 | week22 | 实战项目-DocuMind-VL:基于 OCR 与 Qwen-VL 的文档多模态问答系统(二)
  • AI Native 时代, IC 人的自我修养
  • 2026年Java面试核心考点与云原生趋势解析
  • 从零安装 lm-sensors 硬件监控的完整实战
  • future/promise并发模型:从内存布局到跨语言实践