英文来源已译为中文,每条均可点回原文核对。选取标准是「对从业者有决策价值」,不是流量。
不同榜单的评测口径并不一致,这里明确列出主榜来源与并列校验结果,避免单一来源造成误判。
主榜取自 BenchLM Open-Source LLM Leaderboard(唯一以『可下载权重』为硬门槛的榜单,且本次校验日期最新,因此选其作为主榜)。下表列出同一时点其他榜单的前三,供交叉参考。
| 榜单 | 该榜前三 | 口径说明 |
|---|---|---|
| LLM Stats Open LLM Leaderboard | Kimi K3 · GLM-5.3 · DeepSeek-V4-Pro-0813 | 以编码 Arena 分为主口径,排序偏向低延迟高性价比模型。 |
| BenchLM Open-Source Leaderboard | Qwen3.8 Max · GLM-5.3 · GLM-5.2 | 主榜。综合 BenchAlign v5 得分,2026-09-15 校验。 |
| 2026 国产开源模型盘点(Artificial Analysis v4.1 开源切片) | GLM-5.2 (max) · MiniMax-M3 · DeepSeek V4 Pro | 7 月口径,时效性较弱但可作为趋势校验。 |
全部为可下载权重模型,闭源 API 模型不参与排名。
| 量化档位 | 权重体积 | 建议总显存 | 长上下文预算 | 推荐配置 | 落地成本(数据中心方案) |
|---|---|---|---|---|---|
| BF16 原生 官方提供 | 4.69 TB | 5.40 TB | 6.75 TB | 数据中心:43 卡 NVIDIA H200 141GB(6063GB,需多机组网) 工作站/消费级:72 卡 NVIDIA RTX 6000D Blackwell 84GB(6048GB,需多机组网) 整机/一体机:24 台 Apple Mac Studio(M5 Ultra)256GB(6144GB,需多台组集群) | ¥910 万 – ¥1,491 万,满载电费约 ¥15.8 万/年 |
| FP8 官方 官方提供 | 2.34 TB | 2.70 TB | 3.38 TB | 数据中心:22 卡 NVIDIA H200 141GB(3102GB,需多机组网) 工作站/消费级:36 卡 NVIDIA RTX 6000D Blackwell 84GB(3024GB,需多机组网) 整机/一体机:12 台 Apple Mac Studio(M5 Ultra)256GB(3072GB,需多台组集群) | ¥465 万 – ¥762 万,满载电费约 ¥8.1 万/年 |
| INT4 / Q4_K_M 社区量化 | 1.17 TB | 1.35 TB | 1.69 TB | 数据中心:11 卡 NVIDIA H200 141GB(1551GB,需多机组网) 工作站/消费级:18 卡 NVIDIA RTX 6000D Blackwell 84GB(1512GB,需多机组网) 整机/一体机:6 台 Apple Mac Studio(M5 Ultra)256GB(1536GB,需多台组集群) | ¥238 万 – ¥387 万,满载电费约 ¥4.0 万/年 |
vllm serve Qwen/Qwen3.8-2.4T-A95B --tensor-parallel-size 16 --max-model-len 262144 --reasoning-parser qwen3
sglang serve --model-path Qwen/Qwen3.8-2.4T-A95B --tp-size 16 --context-length 262144 --reasoning-parser qwen3
| 量化档位 | 权重体积 | 建议总显存 | 长上下文预算 | 推荐配置 | 落地成本(数据中心方案) |
|---|---|---|---|---|---|
| BF16 原生 官方提供 | 1.45 TB | 1.68 TB | 2.10 TB | 数据中心:14 卡 NVIDIA H200 141GB(1974GB,需多机组网) 工作站/消费级:23 卡 NVIDIA RTX 6000D Blackwell 84GB(1932GB,需多机组网) 整机/一体机:8 台 Apple Mac Studio(M5 Ultra)256GB(2048GB,需多台组集群) | ¥297 万 – ¥486 万,满载电费约 ¥5.2 万/年 |
| FP8 官方 官方提供 | 744 GB | 862 GB | 1.05 TB | 数据中心:7 卡 NVIDIA H200 141GB(987GB) 工作站/消费级:12 卡 NVIDIA RTX 6000D Blackwell 84GB(1008GB,需多机组网) 整机/一体机:4 台 Apple Mac Studio(M5 Ultra)256GB(1024GB,需多台组集群) | ¥148 万 – ¥243 万,满载电费约 ¥2.6 万/年 |
| INT4 / Q4_K_M 社区量化 | 372 GB | 434 GB | 542 GB | 数据中心:4 卡 NVIDIA H200 141GB(564GB) 工作站/消费级:6 卡 NVIDIA RTX 6000D Blackwell 84GB(504GB) 整机/一体机:2 台 Apple Mac Studio(M5 Ultra)256GB(512GB,需多台组集群) | ¥90.0 万 – ¥144 万,满载电费约 ¥1.5 万/年 |
vllm serve zai-org/GLM-5.3 --tensor-parallel-size 8 --max-model-len 1048576 --tool-call-parser glm5
sglang serve --model-path zai-org/GLM-5.3 --tp-size 8 --context-length 1048576
国产算力:vLLM-Ascend / xLLM / SGLang 均见仓库 example/ascend.md
| 量化档位 | 权重体积 | 建议总显存 | 长上下文预算 | 推荐配置 | 落地成本(数据中心方案) |
|---|---|---|---|---|---|
| BF16 原生 官方提供 | 1.45 TB | 1.68 TB | 2.10 TB | 数据中心:14 卡 NVIDIA H200 141GB(1974GB,需多机组网) 工作站/消费级:23 卡 NVIDIA RTX 6000D Blackwell 84GB(1932GB,需多机组网) 整机/一体机:8 台 Apple Mac Studio(M5 Ultra)256GB(2048GB,需多台组集群) | ¥297 万 – ¥486 万,满载电费约 ¥5.2 万/年 |
| FP8 官方 官方提供 | 744 GB | 862 GB | 1.05 TB | 数据中心:7 卡 NVIDIA H200 141GB(987GB) 工作站/消费级:12 卡 NVIDIA RTX 6000D Blackwell 84GB(1008GB,需多机组网) 整机/一体机:4 台 Apple Mac Studio(M5 Ultra)256GB(1024GB,需多台组集群) | ¥148 万 – ¥243 万,满载电费约 ¥2.6 万/年 |
| INT4 / Q4_K_M 社区量化 | 372 GB | 434 GB | 542 GB | 数据中心:4 卡 NVIDIA H200 141GB(564GB) 工作站/消费级:6 卡 NVIDIA RTX 6000D Blackwell 84GB(504GB) 整机/一体机:2 台 Apple Mac Studio(M5 Ultra)256GB(512GB,需多台组集群) | ¥90.0 万 – ¥144 万,满载电费约 ¥1.5 万/年 |
vllm serve zai-org/GLM-5.2 --tensor-parallel-size 8 --max-model-len 1048576
sglang serve --model-path zai-org/GLM-5.2 --tp-size 8 --context-length 1048576
KTransformers 单机 MoE 卸载见仓库 tutorial
未进主榜前三,但在其他榜单靠前或更适合自建部署。
前三名的满血模型都是数据中心级,真正能落地的往往是下面这些组合。
成本按「卡数 ÷ 单机可插卡数 × 主机价 + 卡数 × 单卡价」估算,取中国区渠道价格区间(AI 需求导致显卡长期溢价,同一张卡二手与全新能差一倍以上)。
| 档位 | 硬件组合 | 在售状态 | 目标模型 | 合计显存 | 落地成本 | 适合谁 / 预期表现 |
|---|---|---|---|---|---|---|
| 个人入门(一张卡) | 1 卡 NVIDIA RTX 5090D v2 24GB | 在售现货 | Qwen3.8-27B INT4 / Q4_K_M | 24 GB | ¥3.6 万 – ¥4.6 万,满载电费约 ¥3,022/年 | 单人本地 Coding Agent / 个人知识库 RAG,一张国行新卡搞定 注意这是 24GB 特供版而非 32GB;单用户约 15–30 tok/s,262K 上下文基本吃满显存,没有并发余量 |
| 桌面一体机(免装机) | 1 台 NVIDIA DGX Spark GB10 128GB | 在售现货 | Qwen3.8-27B BF16 原生 | 128 GB | ¥2.9 万 – ¥3.8 万,满载电费约 ¥1,261/年 | 不想自己配主机、办公室里插电就能用,想要 CUDA 生态 128GB 统一内存可留足 KV cache;代价是带宽仅约 273GB/s,解码速度明显慢于同容量 Mac |
| 安静办公室(大内存) | 1 台 Apple Mac Studio(M5 Max)128GB | 已开预售 | Qwen3.8-27B BF16 原生 | 128 GB | ¥3.9 万 – ¥4.2 万,满载电费约 ¥1,051/年 | 要 128GB 且预算有限,能接受带宽只有 Ultra 的一半 约 ¥4.17 万就能拿到 128GB,是当下单位内存成本最低的正规渠道方案; september 22 日才发货 |
| 旗舰单人士可以尝试的最强单机 | 1 台 Apple Mac Studio(M5 Ultra)256GB | 已开预售 | GLM-5.3-Flash INT4 / Q4_K_M | 256 GB | ¥8.7 万 – ¥9.0 万,满载电费约 ¥1,577/年 | 想在不建机房的前提下跑 320B 级 MoE,预算不到 ¥10 万 1.2TB/s 带宽 + 256GB 内存,INT4 的 GLM-5.3-Flash 完全装得下;吞吐约为同容量 GPU 的 1/4–1/6,适合小团队低并发 |
| 小工作组私有化(工作站卡) | 3 卡 NVIDIA RTX 6000D Blackwell 84GB | 在售现货 | GLM-5.3-Flash INT4 / Q4_K_M | 252 GB | ¥17.9 万 – ¥20.3 万,满载电费约 ¥9,461/年 | 要旗舰能力、预算几十万,且必须走 NVIDIA 生态 特供版 ¥4.8–5.6 万/卡,性价比高于已涨到 13.8 万的满血 PRO 6000;无 NVLink,多卡按实例切分而非硬上 TP |
| 二手数据中心路线 | 6 卡 NVIDIA A100 80GB | 仅二手市场 | GLM-5.3 INT4 / Q4_K_M | 480 GB | ¥48.0 万 – ¥66.0 万,满载电费约 ¥1.3 万/年 | 想跑满血旗舰但预算有限,能接受二手设备与更长的上下文延迟 A100 二手市场最成熟、退出价明确;代价是无 FP8 原生,长上下文吞吐明显吃力 |
| 企业满血私有化 | 7 卡 NVIDIA H200 141GB | 仅二手市场 | GLM-5.3 FP8 官方 | 987 GB | ¥148 万 – ¥243 万,满载电费约 ¥2.6 万/年 | 生产环境满血旗舰、长上下文、高并发,且有机房条件 8 卡 HGX 整机功耗 6–10kW,必须机房供电 + 制冷;二手 H100 方案可省约 40% 但要接受无 FP8 |
| 先租后买 | 非采购方案 | — | — | — | ¥15 – 60 元 / 卡·时 | PoC 验证、流量不确定、阶段性压测 在显卡价格剧烈波动的当下,先用租赁把业务跑通再决定采购时点,是最稳的做法 |
硬件行情变化快,推荐买不到的设备没有意义。下表每一项都标注了在售状态与当前参考价,点击渠道标签即可到对应商城核对当日实时价格(行情基准 2026-09-17)。
| 设备 | 形态 | 显存/内存 | 在售状态 | 当前参考价 | 可查询渠道 |
|---|---|---|---|---|---|
| NVIDIA RTX 6000D Blackwell 84GB 中国特供合规版,现货相对充足,是当前每 GB 单价最低的大显存新卡 出口管制降规版:19968 CUDA / 448-bit / 84GB,无 NVLink,算力约为满血版的 77%;Linux 下存在已知 Xid-8 锁死问题,务必先做长时间压力测试 | 插卡(需另配主机) | 84 GB | 在售现货 | ¥4.8 万 – ¥5.6 万 | 渠道现货 · 约 ¥4.8 万 – 5.6 万 京东搜索 · ¥5.0 万 – 5.6 万 |
| NVIDIA RTX 5090D v2 24GB 国行主力型号,京东自营有货但有明显的品牌/版本价差 出口管制版:显存从 32GB 砍到 24GB,算力同样受限;买前务必确认是 32GB 还是 24GB 版本 | 插卡(需另配主机) | 24 GB | 在售现货 | ¥2.1 万 – ¥3.1 万 | 京东自营 · ¥2.1 万 – 3.1 万 |
| NVIDIA DGX Spark GB10 128GB 京东多个店铺有货,注意区分自营与第三方,以及是否含 4TB 版本 128GB 统一内存 + 完整 CUDA 生态 + 台式体积;代价是带宽仅约 273GB/s,是 Mac Studio 的 1/4,解码速度明显偏慢 | 整机(含机身) | 128 GB | 在售现货 | ¥2.9 万 – ¥3.8 万 | 京东 · ¥2.89 万 – 3.85 万 |
| AMD Ryzen AI Max+ 395 128GB 主机 零刻、极摩客等品牌的迷你主机,京东在售;受内存涨价影响已接近 ¥2 万 128GB 统一内存的最低门槛方案;ROCm 生态与新模型适配通常慢半拍,适合预算优先的实验性部署 | 整机(含机身) | 128 GB | 在售现货 | ¥1.8 万 – ¥2.2 万 | 京东 · 约 ¥1.8 万 – 2.2 万 |
| Ascend 910C 128GB 国产算力主线,境内可正规采购,但需通过厂商或授权集成商报价 走 vLLM-Ascend / MindIE;推理能效比突出,生态覆盖度落后 CUDA | 插卡(需另配主机) | 128 GB | 在售现货 | ¥12.0 万 – ¥20.0 万 | 厂商 / 集成商 · ¥12 万 – 20 万 / 卡(需询价) |
| NVIDIA RTX PRO 6000 Blackwell 96GB 京东自营可下单但价格已翻倍(上月至今年年中约 ¥7.7–9.3 万),第三方 ¥7.7–10.1 万多为无现货挂单 96GB GDDR7 ECC,单卡显存最大的非 HGX 方案;Blackwell 工作站版已取消 NVLink 桥接,多卡只能走 PCIe | 插卡(需另配主机) | 96 GB | 在售 · 严重缺货 | ¥13.8 万 – ¥15.4 万 | 京东自营 · ¥13.8 万 – 15.4 万 渠道询价 · ¥7.7 万 – 10.1 万(需核实货源与保修) |
| NVIDIA RTX 5090 32GB 全线缺货 + 封仓涨价,京东自营报价 ¥3.4 万 – 5.5 万,且多数实际成交为 5090D 特供版 支持 FP4/FP8,但单卡 32GB 对 MoE 仍偏小;当前价位下性价比已经远不如去年同期 | 插卡(需另配主机) | 32 GB | 在售 · 严重缺货 | ¥3.4 万 – ¥5.5 万 | 京东自营 · ¥3.4 万 – 5.5 万(需看实时库存) |
| NVIDIA RTX 5080 16GB 京东报价 ¥1.2 万 – 1.6 万,一周内拿货价多次变动 16GB 显存只能跑 27B 及以下的量化模型 teams;作为纯推理卡性价比低于二手 3090/4090 | 插卡(需另配主机) | 16 GB | 在售 · 严重缺货 | ¥1.2 万 – ¥1.6 万 | 京东自营 · ¥1.2 万 – 1.6 万 |
| Apple Mac Studio(M5 Ultra)256GB Apple 官网在售:8 月 27 日开预售,9 月 22 日发货,限购 2 台;512GB 版 10 月下旬上市、价格未公布 满血 36 核 CPU + 80 核 GPU 才有 256GB 选项;1.2TB/s 带宽为 M5 Max 的近 2 倍,是当前能正规开票的最大单机显存方案 | 整机(含机身) | 256 GB | 已开预售 | ¥8.7 万 – ¥9.0 万 | Apple 官网 · ¥86,749(1TB)/ ¥90,499(2TB) |
| Apple Mac Studio(M5 Ultra)96GB Apple 官网在售:9 月 22 日发货(残血 30 核 CPU 版 ¥46,999 / 满血 36 核版 ¥56,749) 同价位里唯一能正规报销的大显存单机;MLX / llama.cpp 推理,不可扩展 | 整机(含机身) | 96 GB | 已开预售 | ¥4.7 万 – ¥5.7 万 | Apple 官网 · ¥46,999 – 56,749 |
| Apple Mac Studio(M5 Max)128GB Apple 官网在售:需选满血 40 核 GPU 版才有 128GB 选项,9 月 22 日发货 比 M5 Ultra 96GB 更便宜且内存更大,代价是带宽只有 614GB/s(Ultra 的一半);适合容量优先、吞吐不敏感的部署 | 整机(含机身) | 128 GB | 已开预售 | ¥3.9 万 – ¥4.2 万 | Apple 官网 · ¥39,499(512GB)/ ¥41,749(1TB) |
| NVIDIA RTX 4090 24GB 2024 年 9 月已正式停产,只剩库存新卡与二手;二手约 ¥1.1 万 – 1.3 万但假卡/翻新卡泛滥 不再建议作为 2026 年的新采购对象:停产 + 无保修保障 + 二手翻新横行;已有卡继续用没问题 | 插卡(需另配主机) | 24 GB | 已停产 · 仅库存/二手 | ¥1.6 万 – ¥2.5 万 | 京东(库存新卡) · ¥1.6 万 – 2.5 万 |
| NVIDIA H200 141GB 受出口管制影响,境内无正规新货,只能通过系统集成商拿二手/渠道货 HBM3e 超大显存 + 4.8TB/s 带宽,长上下文与 MoE 的首选;采购前需确认保修与售后来源 | 插卡(需另配主机) | 141 GB | 仅二手市场 | ¥19.5 万 – ¥33.0 万 | 系统集成商 · ¥19.5 万 – 33 万 / 卡 |
| NVIDIA H100 80GB 同属管制清单,境内为二手/渠道货,二手市场最成熟、有明确退出价 NVSwitch + FP8 Transformer Engine;8 卡整机 ¥100 万 – 130 万 | 插卡(需另配主机) | 80 GB | 仅二手市场 | ¥12.0 万 – ¥16.0 万 | 系统集成商 / 二手服务器商 · ¥12 万 – 16 万 / 卡 |
| NVIDIA A100 80GB 只有二手市场,供应量大、价格最透明 二手最便宜的入门数据中心卡;无 FP8 原生,长上下文吞吐吃力 | 插卡(需另配主机) | 80 GB | 仅二手市场 | ¥6.0 万 – ¥9.0 万 | 二手服务器商 · ¥6 万 – 9 万 / 卡 |
| NVIDIA B200 180GB 境内无正规渠道,二手市场尚未形成 Blackwell 旗舰,支持 FP4/FP8;境内采购难度极高,本报告保留仅作性能上限参考 | 插卡(需另配主机) | 180 GB | 仅二手市场 | ¥40.0 万 – ¥50.0 万 | 渠道询价 · ¥40 万 – 50 万 / 卡 |
同样的模型,不同互联拓扑下的实际表现可以差一倍以上。
4 张消费卡插一块支持 4× PCIe 的主板或扩展机箱,vLLM tp-size ≤ 4;也可以干脆不用 TP,跑多实例 + 负载均衡规避互联瓶颈。
RTX PRO 6000 / RTX 6000D 是当前『单卡显存最大 + 无需机房』的组合,600W 三风扇,塔式机箱可塞 2–4 张。
8 卡经 NVSwitch 全互联,才真正具备 TP=8 的条件。这是跑 GLM-5.x FP8 满血的起点。
2 机以上必须上 RDMA:InfiniBand NDR 400G 或 RoCE 无损以太网。Qwen3.8 Max INT4、GLM-5.x BF16 都在这个区间。
KTransformers / llama.cpp 把非热点的 MoE 专家权重放在系统内存里,只把注意力层和当前激活专家留在 GPU 上。744B 模型可以在一张 24GB 显卡 + 512GB DDR5 的单机上跑起来。
vLLM-Ascend、MindIE、xLLM 已支持 GLM-5 全系(官方仓库有 example/ascend.md)。单卡 128GB 显存,推理能效比突出。
专业算力云 H100 约 $2–4/卡·时,AWS P5 约 $6.88、Azure 约 $12.29;A100 $1.29–3.43。先用真实业务数据压一轮,再决定自建与否。
现在是 Mac Studio M5 系列:M5 Max 最高 128GB(¥39,499 起),M5 Ultra 96GB ¥46,999 起、256GB ¥86,749(512GB 版 10 月下旬上市)。统一内存让权重不必在显存与内存之间搬运,MLX / llama.cpp 开箱即用,静音免改造。多台还可用雷雳 5 + RDMA 组集群,官方称 4 台集群推理速度约为单台的 3 倍。
DGX Spark GB10(128GB 统一内存 + 完整 CUDA)京东 ¥2.89 万 – 3.85 万;AMD Ryzen AI Max+ 395 主机(128GB)约 ¥1.8 万 – 2.2 万。插电联网即用,不用管 PCIe 槽位、电源和风道。
行情基准:2026-09-17 · 币种 CNY · 电费按 0.6 元/度 满载估算