2026 LLM大模型权威排行榜评测网站指南(持续更新)
面对不同的大模型排行榜,真正困难的不是找到一个名次,而是判断这个名次反映的是用户偏好、标准化测试、软件工程能力,还是价格与速度.
如果只想快速了解当前大模型的综合表现,优先查看Arena和Artificial Analysis:前者更接近真实用户的使用偏好,后者适合同时比较能力、价格和推理速度。专项能力则应结合 LiveBench、SWE-bench 等对应基准判断。
网站编号表示推荐阅读顺序,不代表对平台权威性的绝对排名;动态榜单的结果和维护状态仍可能继续变化。
网站汇总
| 评测网站 | 开发/维护团队 | 主要方向 | 更新状态 |
|---|---|---|---|
| Arena | Arena Team;起源于 UC Berkeley SkyLab / LMSYS | 真实用户偏好、文本、多模态、代码、Agent | 持续更新 |
| Artificial Analysis | Artificial Analysis | 综合能力、价格、速度、Agent、API | 持续更新 |
| LiveBench | Abacus.AI、NYU、NVIDIA、UMD、USC 等研究人员 | 动态题库、抗污染、客观评分 | 代码仓库持续更新;官网显示“Showing LiveBench-2026-06-25 — the latest release” |
| SWE-bench | SWE-bench Team;起源于 Princeton、PLI、UChicago | 软件工程、Coding Agent | 持续更新 |
| LM Market Cap | Analyxa LLC | 多来源综合排名、价格、速度、上下文与趋势 | 持续更新;官方称模型元数据每小时刷新 |
| Hugging Face Open LLM Leaderboard | Hugging Face 与开源社区 | 开放权重模型标准基准 | 官方已停止并归档 |
| OpenCompass(司南) | 上海人工智能实验室相关团队及开源社区 | 中文、通用能力、多模态、专项评测 | 本文归档为历史参考;主榜单最近更新时间为 2026-05-13 |
首选推荐:快速了解当前大模型表现
1. ⭐ Arena:看真实用户偏好与实际对战表现
网站简介
Arena 是基于真实用户匿名对战与偏好投票进行模型比较的平台。平台最初以 Chatbot Arena 形式出现,后更名为 LMArena,并于 2026 年 1 月正式更名为 Arena。其公开榜单覆盖文本、视觉、代码、图像、视频、搜索和 Agent 等多种模型与任务。
开发团队简介
Arena 最初由加州大学伯克利分校(UC Berkeley)SkyLab 的研究人员创建,项目早期属于 UC Berkeley / LMSYS 研究体系。此后项目公司化运营,由 Arena Team 持续开发和维护。
主要评测方式
- 匿名模型对战
- 真实用户投票
- 基于成对比较数据计算模型排名
- 文本、视觉、Web 开发、图像、视频、搜索、Agent 等分类榜单
官方链接及更新时间
- 官网:https://arena.ai/
更新时间:动态更新,截至 2026-08-19,Arena 官方最近公开的榜单产品更新日期为2026-08-14。 - 排行榜:https://arena.ai/leaderboard
更新时间:动态更新,截至 2026-08-19,Arena 官方最近公开的榜单产品更新日期为2026-08-14。
2. ⭐ Artificial Analysis:综合比较模型能力、价格与速度
网站简介
Artificial Analysis 是独立 AI 基准测试与分析平台,公开比较大语言模型和 AI API 服务商的能力、价格、输出速度、延迟、上下文窗口以及其他性能指标。其模型榜单包含 Artificial Analysis Intelligence Index,并提供代码、Agent、长上下文、多模态、指令遵循等专项评测。
开发团队简介
Artificial Analysis 由同名独立 AI 基准测试公司开发和维护。平台业务覆盖语言模型评测、推理性能、AI 硬件、语音、图像与视频生成、Agent 等方向。
主要评测方式
- Artificial Analysis Intelligence Index
- 独立运行的模型能力基准测试
- Coding、Agentic、Long Context、Multimodal 等专项评测
- API 输出速度、首 Token 延迟、端到端响应时间测试
- 模型与 API 价格比较
官方链接及更新时间
- 官网:https://artificialanalysis.ai/
更新时间:持续更新;截至 2026-08-19,首页 Changelog 最近一条公开更新为2026-08-18。 - 大模型排行榜:https://artificialanalysis.ai/leaderboards/models
更新时间:动态更新;截至 2026-08-19,平台最近一批公开语言模型评测更新日期为2026-08-18。
其他评测与基准测试网站
3. LiveBench:强调抗污染的动态评测
网站简介
LiveBench 是面向大语言模型的基准测试和排行榜,目标之一是降低测试集污染对评测结果的影响。其题目来源包括数学竞赛、论文、新闻和数据集等,并使用具有客观标准答案的任务进行自动评分。
开发团队简介
LiveBench 由来自 Abacus.AI、纽约大学(NYU)、NVIDIA、马里兰大学(UMD)和南加州大学(USC)等机构的研究人员共同开发,项目由 Abacus.AI 赞助。其论文入选 ICLR 2025 Spotlight。
主要评测方式
- 使用较新的信息来源构造题目,以限制测试集污染
- 使用可验证的客观标准答案进行自动评分
- Reasoning、Coding、Mathematics、Data Analysis、Language、Instruction Following 等分类评测
- 官方仓库持续维护模型配置与评测代码
官方链接及更新时间
- 官网与排行榜:https://livebench.ai/
更新时间:动态页面展示 Showing LiveBench-2026-06-25 — the latest release. - GitHub:https://github.com/LiveBench/LiveBench
更新时间:最近提交2026-08-18。
4. SWE-bench:软件工程与 Coding Agent 评测
网站简介
SWE-bench 是面向大语言模型和软件工程 Agent 的代码能力评测基准。其任务来自真实 GitHub Issue 和对应代码仓库,要求模型理解现有代码库、修改代码并通过项目测试。
SWE-bench 官方榜单包括 SWE-bench、SWE-bench Verified、SWE-bench Multilingual、SWE-bench Multimodal、SWE-bench Lite 等版本,并在 2026 年继续维护相关榜单和软件工程评测项目。
开发团队简介
SWE-bench 最初由来自 Princeton University、Princeton Language and Intelligence(PLI)和 University of Chicago 的研究人员提出。原始论文作者包括 Carlos E. Jimenez、John Yang、Alexander Wettig、Shunyu Yao、Kexin Pei、Ofir Press 和 Karthik Narasimhan。项目由 SWE-bench Team 持续维护。
主要评测方式
- 真实 GitHub Issue
- 真实开源代码仓库
- 自动运行测试验证补丁正确性
- 以成功解决任务的比例作为核心指标之一
- Verified、Multilingual、Multimodal 等不同任务集合
官方链接及更新时间
- 官网与排行榜:https://www.swebench.com/
更新时间:动态更新,官网 News 最近一项标为2026 年 5 月(ProgramBench),官方代码仓库截至核对日仍在更新。 - GitHub:https://github.com/SWE-bench/SWE-bench
更新时间:最近提交2026-08-18。
5. LM Market Cap:综合查看模型排名、价格与使用成本
网站简介
LM Market Cap 是一个 AI 模型排名与比较平台。它汇总多个公开评测来源,为模型计算统一的 LMC Score,并集中展示价格、输出速度、上下文窗口、能力特性和排名变化等信息。除了大语言模型,网站还收录图像与视频生成模型。
LM Market Cap 更适合用来快速筛选和横向比较模型,而不是作为某项原始基准测试的官方结果来源。需要核验具体能力时,仍应回到 Arena、LiveBench、SWE-bench 等原始评测平台。
开发团队简介
LM Market Cap 官网将其标注为 Analyxa LLC 旗下产品。官网公开资料主要介绍平台功能和排名方法,未提供更详细的开发团队成员信息。
主要评测方式
- 汇总 Arena Elo、LiveBench、SWE-bench Verified、模型官方报告等多个来源的数据
- 对不同基准分数进行基线扣除和归一化,统一换算到 0~100 分
- LMC Score 由基准测试分数(90%)、能力特性(5%)和上下文窗口(5%)组成
- 在基准测试部分,将 Arena Elo 作为 30% 的权重,其余任务基准合计占 70%
- 单独展示模型价格、速度、上下文窗口、可用方式和历史排名变化
- 支持按照质量、成本和使用需求调整权重,生成自定义排名
官方链接及更新时间
- 官网与排行榜:https://lmmarketcap.com/
更新时间:动态更新;截至 2026-08-19,官网显示榜单处于 Live 状态,官方说明模型元数据每小时刷新。 - 排名方法:https://lmmarketcap.com/docs/methodology
更新时间:方法页持续维护;截至 2026-08-19,页面模型评估方法变更记录的最新版本为v3(2026 年 4 月)。
历史参考
6. Hugging Face Open LLM Leaderboard(已停止维护)
网站简介
Open LLM Leaderboard 是 Hugging Face 曾长期维护的开放大语言模型排行榜,主要用于比较公开权重模型在多个标准基准上的表现。该榜单曾广泛用于 Llama、Mistral、Qwen 等开放模型的横向比较。
Hugging Face 在2025-03-13正式宣布 Open LLM Leaderboard 退役。官方归档材料继续保留旧版榜单、评测方法和历史结果。
开发团队简介
该榜单由 Hugging Face 团队及开源社区建设和维护,依托 Hugging Face Hub、Datasets 和评测工具运行开放模型基准测试。
主要评测方式
历史版本使用过 IFEval、BBH、MATH、GPQA、MMLU-Pro 等标准基准评测开放模型。
官方链接及更新时间
- 归档文档:https://huggingface.co/docs/leaderboards/en/open_llm_leaderboard/archive
更新时间:归档页面本身未公开单一最后更新时间;其中 Open LLM Leaderboard v1 官方记录为2024 年 6 月归档。 - 官方退役公告:https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard/discussions/1135
更新时间:2025-03-13(官方宣布 leaderboard officially retiring)。
7. OpenCompass(司南,本文作为历史参考)
网站简介
OpenCompass 是面向大语言模型和多模态大模型的开源评测平台,提供模型评测框架、数据集、评测配置和公开榜单。其评测体系支持客观评测和主观评测,并覆盖知识、语言、理解、推理、代码、安全及垂直领域等能力。
本文将 OpenCompass 的综合大模型排行榜列入“归档/历史参考”。截至 2026-08-19,主榜单页面显示的最近一次更新时间为2026-05-13;CompassArena 页面显示的榜单更新日期为2026-06-11。OpenCompass 代码仓库仍在维护,但官网主页显示的模型已经较为陈旧,因此显示归档。
开发团队简介
OpenCompass 由上海人工智能实验室相关团队开发并维护,同时接受开源社区贡献。其开源代码、文档和多个专项评测平台仍可访问。
主要评测方式
- 标准数据集客观评测
- LLM-as-a-Judge 评测
- 主观模型比较
- CompassAcademic 学术榜单
- CompassArena 匿名模型对战与用户投票
- 多模态、医疗、金融等专项评测
官方链接及更新时间
- OpenCompass 官网:https://opencompass.org.cn/
更新时间:官网首页未公开单一最后更新时间;本文参考的综合主榜单最近一次页面更新时间为2026-05-13。 - 大语言模型主榜单:https://rank.opencompass.org.cn/leaderboard-llm-v2
更新时间:2026-05-13(主榜单页面显示的最近更新时间)。
