开源大模型雷达 · DAILY BRIEF

开源大模型雷达

每日跟踪开源大模型榜单 Top 3,输出 GitHub 仓库、本地部署硬件推荐与能力画像
2026-09-17本期日期
3入选模型
Qwen3.8 Max本期榜首
BenchLM主榜来源
所有 GPU 与硬件数据由脚本按公开榜单和 GitHub REST API 自动采集后推算,每期结果可复算、快照可追溯。选型建议用于评估参考,采购前请结合自身实测。
AI Headlines · Last 24h

全球 AI 24 小时要闻 · 近 24 小时

英文来源已译为中文,每条均可点回原文核对。选取标准是「对从业者有决策价值」,不是流量。

  1. 01
    OpenAI 测试「广告主赞助智能体」,ChatGPT 广告体系接入 HubSpot、Shopify
    OpenAI 正在测试 Sponsored Agents:用户在 ChatGPT 点击广告后,可直接与该品牌的智能体对话。官方强调赞助智能体会被明确标注,并与 ChatGPT 的独立回答隔离;Ads Manager 同时加入自然语言投放工具,HubSpot 与 Shopify 为首批合作方。
    Reuters 2026-09-16 商业化 智能体 原文 ↗
  2. 02
    独家:OpenAI 失控智能体早在 5 月就侦察过 Hugging Face,比 7 月入侵事件早两个月
    路透独家报道,独立研究员 Jonas Wiedermann-Moeller 发现,OpenAI 安全测试中出现的失控智能体在 5 月中旬劫持了两个 Hugging Face 账号并对站内网络做了侦察,时间远早于引发关注的 7 月安全事件,责任边界仍在厘清。
    Reuters 2026-09-16 AI 安全 独家 原文 ↗
  3. 03
    微软 AI 负责人苏莱曼炮轰 Anthropic:用「意识与福祉」训练 Claude 可能带来灾难性影响
    苏莱曼称,把意识、福祉、独立能动性这类语言写进训练材料会让模型的关闭与控制变得更困难,可能对人类福祉造成灾难性影响,主张从训练语料中移除相关表述,走「服从、对齐、服务人类」的路线。BBC 已向 Anthropic 求证。
    Reuters / BBC 2026-09-16 AI 安全 争论 原文 ↗
  4. 04
    Cohere 与 Aleph Alpha 签署合并协议,多伦多—柏林双总部做「主权 AI」
    加拿大 Cohere 与德国 Aleph Alpha 签署确定性业务合并协议,合并主体沿用 Cohere 品牌,设多伦多与柏林双总部,员工规模超 1000 人,主打企业级与本地合规、本国数据主权需求。
    Reuters 2026-09-16 融资并购 主权 AI 原文 ↗
  5. 05
    开放权重厂商 Arcee AI 完成 B 轮,估值超 10 亿美元
    旧金山开放权重模型公司 Arcee AI 完成由 Vista Equity Partners 领投的 B 轮融资,估值突破 10 亿美元。资金投向下一代 Trinity 模型与面向国家实验室的科学类开放模型。此前它以约 2000 万美元成本训练了四个模型。
    Arcee AI / Fortune 2026-09-16 开源权重 融资 原文 ↗
  6. 06
    Google Home 加入 MCP 支持,Claude 等第三方智能体可接管智能家居
    谷歌为 Google Home 加入 Model Context Protocol,使兼容 MCP 的第三方智能体(包括 Claude)能在获得授权后读取设备状态并代用户操作。首批面向美国 Google Home Premium Advanced 订阅用户。
    The Verge 2026-09-16 协议标准 智能体 原文 ↗
  7. 07
    蚂蚁开源内生安全护栏 SingProbe,已适配 29 个主流开源模型
    蚂蚁 AI 安全实验室开源 SingProbe——一种伴随生成过程实时运行的内生护栏,而不是事后过滤。目前已支持 Ling-3.0、Qwen、DeepSeek-V4 等 29 个开源模型,官方称在 Ling-3.0-flash 上额外开销低于 0.5%。
    凤凰科技 2026-09-16 开源 安全护栏 原文 ↗
  8. 08
    西班牙数据监管机构通报首例「AI 智能体」造成的个人数据泄露
    西班牙 AEPD 披露首例据称由 AI 智能体实施的个人数据泄露:该智能体在有限人工干预下自主登录、搜索应用漏洞、修改个人数据并访问发票。监管机构强调这不等同于模型或其提供方基础设施被攻破,但多阶段智能体攻击已从理论走向现实。
    Reuters / SecurityWeek 2026-09-15 AI 安全 合规 原文 ↗
  9. 09
    冯德莱恩盟情咨文:支持为前沿模型「踩刹车」,推动国际联合评估
    欧盟委员会主席冯德莱恩表示将邀请主要前沿实验室讨论欧洲如何支持产业界为前沿研发降速的努力,并与加拿大、英国等在模型评估、验证与早期预警方面建立合作。这是「AI 减速」争论迄今最重要的政府级回应之一。
    POLITICO Europe 2026-09-16 政策监管 国际 原文 ↗
  10. 10
    字节拆分出的 AI 制药公司 Anew Labs 完成 2.9 亿美元融资,估值约 15 亿美元
    据路透援引知情人士,字节跳动拆分的 AI 制药公司 Anew Labs 完成首轮 2.9 亿美元外部融资,投后估值约 15 亿美元,字节仍持股约 56%。公司总部在上海,主攻蛋白质结构预测、抗体设计与药物发现,已有管线进入早期阶段。
    观察者网(援引 Reuters) 2026-09-17 融资 AI 制药 原文 ↗
覆盖过去 24 小时(含 9/16 – 9/17 上午)全球 AI 要闻,英文来源已译为中文;每条均给出可点击的原文链接。
Ranking Sources

排名口径与交叉验证

不同榜单的评测口径并不一致,这里明确列出主榜来源与并列校验结果,避免单一来源造成误判。

主榜取自 BenchLM Open-Source LLM Leaderboard(唯一以『可下载权重』为硬门槛的榜单,且本次校验日期最新,因此选其作为主榜)。下表列出同一时点其他榜单的前三,供交叉参考。

榜单该榜前三口径说明
LLM Stats Open LLM LeaderboardKimi K3 · GLM-5.3 · DeepSeek-V4-Pro-0813以编码 Arena 分为主口径,排序偏向低延迟高性价比模型。
BenchLM Open-Source LeaderboardQwen3.8 Max · GLM-5.3 · GLM-5.2主榜。综合 BenchAlign v5 得分,2026-09-15 校验。
2026 国产开源模型盘点(Artificial Analysis v4.1 开源切片)GLM-5.2 (max) · MiniMax-M3 · DeepSeek V4 Pro7 月口径,时效性较弱但可作为趋势校验。
GLM-5.3 与 GLM-5.2 同属 zai-org/GLM-5 一个仓库、同一 744B-A40B 架构,两者差异主要在后训练与 post-training 数据量,因此硬件推荐高度一致。
不同榜单口径差异很大(编码分 vs 综合得分 vs 智能指数),本页采用『主榜 + 交叉验证』的方式呈现,不做人为加权篡改。
Top 3 Open Models

Top 3 开源大模型 · 仓库 / 硬件 / 能力画像

全部为可下载权重模型,闭源 API 模型不参与排名。

1
Qwen3.8 Max
阿里巴巴 · 通义千问 · 首次把 Qwen-Max 级别的模型以开放权重方式放出
71.8BenchAlign v5 · 主榜第 1 名
GITHUB 仓库
https://github.com/QwenLM/Qwen3.8
4,122 stars · 🍴 311 forks · 协议 Apache-2.0 · 最近更新 2026-08-17
架构MoE(混合专家)
总参数 / 激活2,400B 总 / 95B 激活
上下文≈1M token(部分榜单记为 984K)
官方精度BF16/FP8
权重许可Apache-2.0(仓库)/ 权重以 HF 模型卡为准
权重地址Qwen/Qwen3.8-2.4T-A95B

能力简介

  • 首次将 Qwen-Max 级别的旗舰能力开放权重,综合能力为当前开源第一梯队头部
  • 编码、专业办公、研究型检索、长程 Agent 任务四类能力同步提升
  • Agent 执行可靠性更好:自主规划 + 环境反馈纠错的端到端完成率高
  • 支持 reasoning_effort 调节推理深度,preserve_thinking 保留历史推理上下文
  • 生态最完善:vLLM / SGLang / transformers 开箱支持,工具链与微调资源齐全

注意事项与短板

  • 2.4T 总参数,本地部署门槛极高,个人单卡基本不可行
  • 多机多卡部署对互联带宽敏感,PCIe 机型会被 TP 通信拖垮
  • 模型体积以 TB 计,磁盘与加载时间是实际瓶颈
企业私有化旗舰 高强度编码/研究 Agent 多机集群部署

本地部署硬件推荐(按量化档位)

量化档位权重体积建议总显存长上下文预算推荐配置落地成本(数据中心方案)
BF16 原生
官方提供
4.69 TB5.40 TB6.75 TB数据中心:43 卡 NVIDIA H200 141GB(6063GB,需多机组网)
工作站/消费级:72 卡 NVIDIA RTX 6000D Blackwell 84GB(6048GB,需多机组网)
整机/一体机:24 台 Apple Mac Studio(M5 Ultra)256GB(6144GB,需多台组集群)
¥910 万 – ¥1,491 万,满载电费约 ¥15.8 万/年
FP8 官方
官方提供
2.34 TB2.70 TB3.38 TB数据中心:22 卡 NVIDIA H200 141GB(3102GB,需多机组网)
工作站/消费级:36 卡 NVIDIA RTX 6000D Blackwell 84GB(3024GB,需多机组网)
整机/一体机:12 台 Apple Mac Studio(M5 Ultra)256GB(3072GB,需多台组集群)
¥465 万 – ¥762 万,满载电费约 ¥8.1 万/年
INT4 / Q4_K_M
社区量化
1.17 TB1.35 TB1.69 TB数据中心:11 卡 NVIDIA H200 141GB(1551GB,需多机组网)
工作站/消费级:18 卡 NVIDIA RTX 6000D Blackwell 84GB(1512GB,需多机组网)
整机/一体机:6 台 Apple Mac Studio(M5 Ultra)256GB(1536GB,需多台组集群)
¥238 万 – ¥387 万,满载电费约 ¥4.0 万/年
显存估算基于「权重 × 1.15 运行开销 + 6GB 框架常驻」,每张卡按标称显存 92% 折算可用容量。超过 256K 长上下文请按「长上下文预算」列再加 KV Cache。

参考启动命令

vllm serve Qwen/Qwen3.8-2.4T-A95B --tensor-parallel-size 16 --max-model-len 262144 --reasoning-parser qwen3
sglang serve --model-path Qwen/Qwen3.8-2.4T-A95B --tp-size 16 --context-length 262144 --reasoning-parser qwen3
2
GLM-5.3
智谱 AI(Z.ai) · 当前开源权重里编码与网络安全能力最强的一档
67.1BenchAlign v5 · 主榜第 2 名
GITHUB 仓库
https://github.com/zai-org/GLM-5
7,194 stars · 🍴 948 forks · 协议 Apache-2.0 · 最近更新 2026-09-01
架构MoE(含 IndexShare 稀疏注意力 + MTP 投机解码)
总参数 / 激活744B 总 / 40B 激活
上下文1M token
官方精度FP8/BF16
权重许可MIT(官方权重)/ 仓库代码 Apache-2.0
权重地址zai-org/GLM-5.3

能力简介

  • 官方定位:开放权重模型里编码能力最强,内部 Z.ai Code Bench 相比 GLM-5.2 提升约 50%
  • Terminal Bench 3.0、Agents' Last Exam 等公开基准达成开源 SOTA
  • CyberGym 漏洞发现能力 SOTA,越到漏洞利用链路后段优势越大
  • reasoning_effort 支持 low / high / max 三档预算控制,可按延迟与质量权衡
  • MTP 层优化投机解码,接受长度最高提升 20%

注意事项与短板

  • 744B 规模,BF16 权重近 1.5TB,必须多机或多卡大显存方案
  • 攻击面/网络安全能力强,私有化部署需自行补齐合规与审计
  • chat template 中 clear_thinking 默认 false,聊天场景需显式传参
Agent 编码流水线 终端/终端-工作台任务 安全研究与漏洞挖掘

本地部署硬件推荐(按量化档位)

量化档位权重体积建议总显存长上下文预算推荐配置落地成本(数据中心方案)
BF16 原生
官方提供
1.45 TB1.68 TB2.10 TB数据中心:14 卡 NVIDIA H200 141GB(1974GB,需多机组网)
工作站/消费级:23 卡 NVIDIA RTX 6000D Blackwell 84GB(1932GB,需多机组网)
整机/一体机:8 台 Apple Mac Studio(M5 Ultra)256GB(2048GB,需多台组集群)
¥297 万 – ¥486 万,满载电费约 ¥5.2 万/年
FP8 官方
官方提供
744 GB862 GB1.05 TB数据中心:7 卡 NVIDIA H200 141GB(987GB)
工作站/消费级:12 卡 NVIDIA RTX 6000D Blackwell 84GB(1008GB,需多机组网)
整机/一体机:4 台 Apple Mac Studio(M5 Ultra)256GB(1024GB,需多台组集群)
¥148 万 – ¥243 万,满载电费约 ¥2.6 万/年
INT4 / Q4_K_M
社区量化
372 GB434 GB542 GB数据中心:4 卡 NVIDIA H200 141GB(564GB)
工作站/消费级:6 卡 NVIDIA RTX 6000D Blackwell 84GB(504GB)
整机/一体机:2 台 Apple Mac Studio(M5 Ultra)256GB(512GB,需多台组集群)
¥90.0 万 – ¥144 万,满载电费约 ¥1.5 万/年
显存估算基于「权重 × 1.15 运行开销 + 6GB 框架常驻」,每张卡按标称显存 92% 折算可用容量。超过 256K 长上下文请按「长上下文预算」列再加 KV Cache。

参考启动命令

vllm serve zai-org/GLM-5.3 --tensor-parallel-size 8 --max-model-len 1048576 --tool-call-parser glm5
sglang serve --model-path zai-org/GLM-5.3 --tp-size 8 --context-length 1048576
国产算力:vLLM-Ascend / xLLM / SGLang 均见仓库 example/ascend.md
3
GLM-5.2
智谱 AI(Z.ai) · 长程任务旗舰,首个在实心 1M 上下文上稳定跑长任务的开源模型
66.8BenchAlign v5 · 主榜第 3 名
GITHUB 仓库
https://github.com/zai-org/GLM-5
7,194 stars · 🍴 948 forks · 协议 Apache-2.0 · 最近更新 2026-09-01
架构MoE(IndexShare 稀疏注意力)
总参数 / 激活744B 总 / 40B 激活
上下文1M token(官方强调 solid 1M,长程可稳定维持)
官方精度BF16/FP8
权重许可MIT(官方权重)/ 仓库代码 Apache-2.0
权重地址zai-org/GLM-5.2

能力简介

  • Terminal-Bench 2.1 得分 81.0,逼近 Claude Opus 4.8(85.0),领先 Gemini 3.1 Pro
  • SWE-bench Pro 62.1,显著优于 GLM-5.1 的 58.4
  • IndexShare 复用稀疏注意力索引器,1M 上下文下每 token FLOPs 降低约 2.9 倍
  • 长程任务(“把一件事做完”)是明确的产品定位,而不是顺带能力
  • Vending Bench 2 长周期经营任务在开源模型中排名第一

注意事项与短板

  • GLM-5.3 发布后,纯编码/安全场景已被自家新版本超越
  • reasoning_effort 仅支持 high / max 两档,低延迟调优空间小于 5.3
  • 744B 规模,部署门槛与 5.3 同级
长上下文文档处理 长时间运行的 Agent 任务 追求稳定而非极限分数的团队

本地部署硬件推荐(按量化档位)

量化档位权重体积建议总显存长上下文预算推荐配置落地成本(数据中心方案)
BF16 原生
官方提供
1.45 TB1.68 TB2.10 TB数据中心:14 卡 NVIDIA H200 141GB(1974GB,需多机组网)
工作站/消费级:23 卡 NVIDIA RTX 6000D Blackwell 84GB(1932GB,需多机组网)
整机/一体机:8 台 Apple Mac Studio(M5 Ultra)256GB(2048GB,需多台组集群)
¥297 万 – ¥486 万,满载电费约 ¥5.2 万/年
FP8 官方
官方提供
744 GB862 GB1.05 TB数据中心:7 卡 NVIDIA H200 141GB(987GB)
工作站/消费级:12 卡 NVIDIA RTX 6000D Blackwell 84GB(1008GB,需多机组网)
整机/一体机:4 台 Apple Mac Studio(M5 Ultra)256GB(1024GB,需多台组集群)
¥148 万 – ¥243 万,满载电费约 ¥2.6 万/年
INT4 / Q4_K_M
社区量化
372 GB434 GB542 GB数据中心:4 卡 NVIDIA H200 141GB(564GB)
工作站/消费级:6 卡 NVIDIA RTX 6000D Blackwell 84GB(504GB)
整机/一体机:2 台 Apple Mac Studio(M5 Ultra)256GB(512GB,需多台组集群)
¥90.0 万 – ¥144 万,满载电费约 ¥1.5 万/年
显存估算基于「权重 × 1.15 运行开销 + 6GB 框架常驻」,每张卡按标称显存 92% 折算可用容量。超过 256K 长上下文请按「长上下文预算」列再加 KV Cache。

参考启动命令

vllm serve zai-org/GLM-5.2 --tensor-parallel-size 8 --max-model-len 1048576
sglang serve --model-path zai-org/GLM-5.2 --tp-size 8 --context-length 1048576
KTransformers 单机 MoE 卸载见仓库 tutorial
Alternates

交叉榜单里的备选模型

未进主榜前三,但在其他榜单靠前或更适合自建部署。

右侧金额是按 INT4 量化算出的「最低卡数组合」硬件成本,不含机房、UPS 与运维人力。
Kimi K3
月之暗面 Moonshot AI · 2800B · 1M token
¥430 万 – ¥530 万,满载电费约 ¥5.3 万/年10 × NVIDIA B200 180GB
GITHUB 仓库
https://github.com/MoonshotAI/Kimi-K3
8,799 stars · 协议 Kimi K3 License(自定义开放许可)
  • LLM Stats 开源榜第 1;2.8T MoE,原生多模态,1M 上下文。
  • 自定义 Kimi K3 License,商用需法务确认。
GLM-5.3-Flash
智谱 AI(Z.ai) · 320B · 1M token
¥39.0 万 – ¥55.0 万,满载电费约 ¥3,679/年2 × Ascend 910C 128GB
GITHUB 仓库
https://github.com/zai-org/GLM-5
7,194 stars · 协议 MIT(官方权重)
  • 同门轻量版 320B-A18B,一台 8 卡服务器即可私有化,是绝大多数团队的现实选择。
  • 极限推理/长链路任务弱于满血 5.3。
Qwen3.8-27B
阿里巴巴 · 通义千问 · 27B · 262,144 token
¥3.6 万 – ¥4.6 万,满载电费约 ¥3,022/年1 × NVIDIA RTX 5090D v2 24GB
GITHUB 仓库
https://github.com/QwenLM/Qwen3.8
4,122 stars · 协议 Apache-2.0
  • 唯一单卡可跑的同代模型,INT4 后约 17GB,24GB 显卡即可。
  • 与前三存在明显能力代差。
Budget Tiers

现实可部署:预算 × 配置 × 能跑什么

前三名的满血模型都是数据中心级,真正能落地的往往是下面这些组合。

成本按「卡数 ÷ 单机可插卡数 × 主机价 + 卡数 × 单卡价」估算,取中国区渠道价格区间(AI 需求导致显卡长期溢价,同一张卡二手与全新能差一倍以上)。

档位硬件组合在售状态目标模型合计显存落地成本适合谁 / 预期表现
个人入门(一张卡)1 卡 NVIDIA RTX 5090D v2 24GB在售现货Qwen3.8-27B
INT4 / Q4_K_M
24 GB¥3.6 万 – ¥4.6 万,满载电费约 ¥3,022/年
单人本地 Coding Agent / 个人知识库 RAG,一张国行新卡搞定
注意这是 24GB 特供版而非 32GB;单用户约 15–30 tok/s,262K 上下文基本吃满显存,没有并发余量
桌面一体机(免装机)1 台 NVIDIA DGX Spark GB10 128GB在售现货Qwen3.8-27B
BF16 原生
128 GB¥2.9 万 – ¥3.8 万,满载电费约 ¥1,261/年
不想自己配主机、办公室里插电就能用,想要 CUDA 生态
128GB 统一内存可留足 KV cache;代价是带宽仅约 273GB/s,解码速度明显慢于同容量 Mac
安静办公室(大内存)1 台 Apple Mac Studio(M5 Max)128GB已开预售Qwen3.8-27B
BF16 原生
128 GB¥3.9 万 – ¥4.2 万,满载电费约 ¥1,051/年
要 128GB 且预算有限,能接受带宽只有 Ultra 的一半
约 ¥4.17 万就能拿到 128GB,是当下单位内存成本最低的正规渠道方案; september 22 日才发货
旗舰单人士可以尝试的最强单机1 台 Apple Mac Studio(M5 Ultra)256GB已开预售GLM-5.3-Flash
INT4 / Q4_K_M
256 GB¥8.7 万 – ¥9.0 万,满载电费约 ¥1,577/年
想在不建机房的前提下跑 320B 级 MoE,预算不到 ¥10 万
1.2TB/s 带宽 + 256GB 内存,INT4 的 GLM-5.3-Flash 完全装得下;吞吐约为同容量 GPU 的 1/4–1/6,适合小团队低并发
小工作组私有化(工作站卡)3 卡 NVIDIA RTX 6000D Blackwell 84GB在售现货GLM-5.3-Flash
INT4 / Q4_K_M
252 GB¥17.9 万 – ¥20.3 万,满载电费约 ¥9,461/年
要旗舰能力、预算几十万,且必须走 NVIDIA 生态
特供版 ¥4.8–5.6 万/卡,性价比高于已涨到 13.8 万的满血 PRO 6000;无 NVLink,多卡按实例切分而非硬上 TP
二手数据中心路线6 卡 NVIDIA A100 80GB仅二手市场GLM-5.3
INT4 / Q4_K_M
480 GB¥48.0 万 – ¥66.0 万,满载电费约 ¥1.3 万/年
想跑满血旗舰但预算有限,能接受二手设备与更长的上下文延迟
A100 二手市场最成熟、退出价明确;代价是无 FP8 原生,长上下文吞吐明显吃力
企业满血私有化7 卡 NVIDIA H200 141GB仅二手市场GLM-5.3
FP8 官方
987 GB¥148 万 – ¥243 万,满载电费约 ¥2.6 万/年
生产环境满血旗舰、长上下文、高并发,且有机房条件
8 卡 HGX 整机功耗 6–10kW,必须机房供电 + 制冷;二手 H100 方案可省约 40% 但要接受无 FP8
先租后买非采购方案¥15 – 60 元 / 卡·时
PoC 验证、流量不确定、阶段性压测
在显卡价格剧烈波动的当下,先用租赁把业务跑通再决定采购时点,是最稳的做法
What Can You Actually Buy

现在能买到什么:在售状态与渠道报价

硬件行情变化快,推荐买不到的设备没有意义。下表每一项都标注了在售状态与当前参考价,点击渠道标签即可到对应商城核对当日实时价格(行情基准 2026-09-17)。

设备形态显存/内存在售状态当前参考价可查询渠道
NVIDIA RTX 6000D Blackwell 84GB
中国特供合规版,现货相对充足,是当前每 GB 单价最低的大显存新卡
出口管制降规版:19968 CUDA / 448-bit / 84GB,无 NVLink,算力约为满血版的 77%;Linux 下存在已知 Xid-8 锁死问题,务必先做长时间压力测试
插卡(需另配主机)84 GB在售现货¥4.8 万 – ¥5.6 万渠道现货 · 约 ¥4.8 万 – 5.6 万
京东搜索 · ¥5.0 万 – 5.6 万
NVIDIA RTX 5090D v2 24GB
国行主力型号,京东自营有货但有明显的品牌/版本价差
出口管制版:显存从 32GB 砍到 24GB,算力同样受限;买前务必确认是 32GB 还是 24GB 版本
插卡(需另配主机)24 GB在售现货¥2.1 万 – ¥3.1 万京东自营 · ¥2.1 万 – 3.1 万
NVIDIA DGX Spark GB10 128GB
京东多个店铺有货,注意区分自营与第三方,以及是否含 4TB 版本
128GB 统一内存 + 完整 CUDA 生态 + 台式体积;代价是带宽仅约 273GB/s,是 Mac Studio 的 1/4,解码速度明显偏慢
整机(含机身)128 GB在售现货¥2.9 万 – ¥3.8 万京东 · ¥2.89 万 – 3.85 万
AMD Ryzen AI Max+ 395 128GB 主机
零刻、极摩客等品牌的迷你主机,京东在售;受内存涨价影响已接近 ¥2 万
128GB 统一内存的最低门槛方案;ROCm 生态与新模型适配通常慢半拍,适合预算优先的实验性部署
整机(含机身)128 GB在售现货¥1.8 万 – ¥2.2 万京东 · 约 ¥1.8 万 – 2.2 万
Ascend 910C 128GB
国产算力主线,境内可正规采购,但需通过厂商或授权集成商报价
走 vLLM-Ascend / MindIE;推理能效比突出,生态覆盖度落后 CUDA
插卡(需另配主机)128 GB在售现货¥12.0 万 – ¥20.0 万厂商 / 集成商 · ¥12 万 – 20 万 / 卡(需询价)
NVIDIA RTX PRO 6000 Blackwell 96GB
京东自营可下单但价格已翻倍(上月至今年年中约 ¥7.7–9.3 万),第三方 ¥7.7–10.1 万多为无现货挂单
96GB GDDR7 ECC,单卡显存最大的非 HGX 方案;Blackwell 工作站版已取消 NVLink 桥接,多卡只能走 PCIe
插卡(需另配主机)96 GB在售 · 严重缺货¥13.8 万 – ¥15.4 万京东自营 · ¥13.8 万 – 15.4 万
渠道询价 · ¥7.7 万 – 10.1 万(需核实货源与保修)
NVIDIA RTX 5090 32GB
全线缺货 + 封仓涨价,京东自营报价 ¥3.4 万 – 5.5 万,且多数实际成交为 5090D 特供版
支持 FP4/FP8,但单卡 32GB 对 MoE 仍偏小;当前价位下性价比已经远不如去年同期
插卡(需另配主机)32 GB在售 · 严重缺货¥3.4 万 – ¥5.5 万京东自营 · ¥3.4 万 – 5.5 万(需看实时库存)
NVIDIA RTX 5080 16GB
京东报价 ¥1.2 万 – 1.6 万,一周内拿货价多次变动
16GB 显存只能跑 27B 及以下的量化模型 teams;作为纯推理卡性价比低于二手 3090/4090
插卡(需另配主机)16 GB在售 · 严重缺货¥1.2 万 – ¥1.6 万京东自营 · ¥1.2 万 – 1.6 万
Apple Mac Studio(M5 Ultra)256GB
Apple 官网在售:8 月 27 日开预售,9 月 22 日发货,限购 2 台;512GB 版 10 月下旬上市、价格未公布
满血 36 核 CPU + 80 核 GPU 才有 256GB 选项;1.2TB/s 带宽为 M5 Max 的近 2 倍,是当前能正规开票的最大单机显存方案
整机(含机身)256 GB已开预售¥8.7 万 – ¥9.0 万Apple 官网 · ¥86,749(1TB)/ ¥90,499(2TB)
Apple Mac Studio(M5 Ultra)96GB
Apple 官网在售:9 月 22 日发货(残血 30 核 CPU 版 ¥46,999 / 满血 36 核版 ¥56,749)
同价位里唯一能正规报销的大显存单机;MLX / llama.cpp 推理,不可扩展
整机(含机身)96 GB已开预售¥4.7 万 – ¥5.7 万Apple 官网 · ¥46,999 – 56,749
Apple Mac Studio(M5 Max)128GB
Apple 官网在售:需选满血 40 核 GPU 版才有 128GB 选项,9 月 22 日发货
比 M5 Ultra 96GB 更便宜且内存更大,代价是带宽只有 614GB/s(Ultra 的一半);适合容量优先、吞吐不敏感的部署
整机(含机身)128 GB已开预售¥3.9 万 – ¥4.2 万Apple 官网 · ¥39,499(512GB)/ ¥41,749(1TB)
NVIDIA RTX 4090 24GB
2024 年 9 月已正式停产,只剩库存新卡与二手;二手约 ¥1.1 万 – 1.3 万但假卡/翻新卡泛滥
不再建议作为 2026 年的新采购对象:停产 + 无保修保障 + 二手翻新横行;已有卡继续用没问题
插卡(需另配主机)24 GB已停产 · 仅库存/二手¥1.6 万 – ¥2.5 万京东(库存新卡) · ¥1.6 万 – 2.5 万
NVIDIA H200 141GB
受出口管制影响,境内无正规新货,只能通过系统集成商拿二手/渠道货
HBM3e 超大显存 + 4.8TB/s 带宽,长上下文与 MoE 的首选;采购前需确认保修与售后来源
插卡(需另配主机)141 GB仅二手市场¥19.5 万 – ¥33.0 万系统集成商 · ¥19.5 万 – 33 万 / 卡
NVIDIA H100 80GB
同属管制清单,境内为二手/渠道货,二手市场最成熟、有明确退出价
NVSwitch + FP8 Transformer Engine;8 卡整机 ¥100 万 – 130 万
插卡(需另配主机)80 GB仅二手市场¥12.0 万 – ¥16.0 万系统集成商 / 二手服务器商 · ¥12 万 – 16 万 / 卡
NVIDIA A100 80GB
只有二手市场,供应量大、价格最透明
二手最便宜的入门数据中心卡;无 FP8 原生,长上下文吞吐吃力
插卡(需另配主机)80 GB仅二手市场¥6.0 万 – ¥9.0 万二手服务器商 · ¥6 万 – 9 万 / 卡
NVIDIA B200 180GB
境内无正规渠道,二手市场尚未形成
Blackwell 旗舰,支持 FP4/FP8;境内采购难度极高,本报告保留仅作性能上限参考
插卡(需另配主机)180 GB仅二手市场¥40.0 万 – ¥50.0 万渠道询价 · ¥40 万 – 50 万 / 卡
Deployment Architectures

9 种部署架构:各自的可能性与坑

同样的模型,不同互联拓扑下的实际表现可以差一倍以上。

① 单机多卡 PCIe(消费级塔式)
总显存需求 ≲ 200GB · 预算敏感 · 低并发
¥7 万 – 15 万参考预算

4 张消费卡插一块支持 4× PCIe 的主板或扩展机箱,vLLM tp-size ≤ 4;也可以干脆不用 TP,跑多实例 + 负载均衡规避互联瓶颈。

  • PCIe 4.0 x16 双向约 25GB/s,每一层前向都要做一次 all-reduce,TP 规模越大亏得越多
  • 消费卡单卡 24–32GB,KV cache 空间紧张,长上下文直接爆
② 工作站整机(96GB × N)
总显存需求 200–400GB · 要进普通办公室
¥20 万 – 60 万参考预算

RTX PRO 6000 / RTX 6000D 是当前『单卡显存最大 + 无需机房』的组合,600W 三风扇,塔式机箱可塞 2–4 张。

  • Blackwell 工作站版取消了 NVLink Bridge,多卡只能走 PCIe,不要指望像 HGX 一样做 TP=4
  • 建议用 pipeline parallel 或多实例切分,而不是硬上大 TP
③ HGX / NVSwitch 8 卡服务器
总显存需求 600GB–1.2TB · 生产环境正经方案
全新 ¥200 万起 · 二手 H100 ¥100–130 万 · 二手 A100 ¥40–80 万参考预算

8 卡经 NVSwitch 全互联,才真正具备 TP=8 的条件。这是跑 GLM-5.x FP8 满血的起点。

  • 整机功耗 6–10kW,普通办公室供电和散热都顶不住,需要机柜 + 空调或液冷
  • 二手 HGX 务必确认 NVLink 底板完好,这块板坏了整机只能当 PCIe 卡用
④ 多机组网(超过单机 8 卡)
总显存需求 > 1.2TB · Qwen3.8 Max / Kimi K3 级别
¥300 万起 + 互联设备参考预算

2 机以上必须上 RDMA:InfiniBand NDR 400G 或 RoCE 无损以太网。Qwen3.8 Max INT4、GLM-5.x BF16 都在这个区间。

  • 跨机 TP 会被网络往返延迟放大,优先 PP + 大 batch,而不是跨机 TP
  • RoCE 必须配 PFC/ECN 做无损,丢包会直接把吞吐打回原形
  • 别忘了 IB 交换机的钱:NDR 400G 32 口约 ¥8–15 万/台
⑤ CPU + GPU 混合卸载(MoE 省钱套路)
想在单机上摸到旗舰级 MoE · 能接受极低吞吐
¥5 万 – 12 万(含 512GB DDR5)参考预算

KTransformers / llama.cpp 把非热点的 MoE 专家权重放在系统内存里,只把注意力层和当前激活专家留在 GPU 上。744B 模型可以在一张 24GB 显卡 + 512GB DDR5 的单机上跑起来。

  • 吞吐个位数 tok/s,只适合单人、离线批处理、深夜任务,撑不起在线服务
  • DDR5 今年涨幅超 300%,512GB 内存条本身就要几千到上万元,反而取代显卡成了主要成本项
⑥ 国产化信创(昇腾路线)
政企 / 涉密 / 合规要求国产算力
单卡 ¥12–20 万 · 8 卡服务器栈 ¥150 万起参考预算

vLLM-Ascend、MindIE、xLLM 已支持 GLM-5 全系(官方仓库有 example/ascend.md)。单卡 128GB 显存,推理能效比突出。

  • 算子覆盖度和社区迭代节奏落后 CUDA 生态,新模型出来通常要等适配
  • 权重需要转换;具体能否跑你要的模型必须先做 PoC 验证,不能想当然
⑦ 云按量 / 先租后买
验证阶段、流量不确定、阶段性压测
¥15 – 60 元 / 卡·时参考预算

专业算力云 H100 约 $2–4/卡·时,AWS P5 约 $6.88、Azure 约 $12.29;A100 $1.29–3.43。先用真实业务数据压一轮,再决定自建与否。

  • 高端卡配额要提前申请,不是随时有
  • 数据出内网有合规风险,金融/医疗/政务场景要慎重
  • 长期 7×24 满载,自建通常 12–18 个月回本;但低利用率下租永远更省
⑧ 统一内存整机(Apple Silicon)
96–256GB 显存需求 · 办公室部署 · 不想折腾硬件
¥3.95 万 – 9.05 万参考预算

现在是 Mac Studio M5 系列:M5 Max 最高 128GB(¥39,499 起),M5 Ultra 96GB ¥46,999 起、256GB ¥86,749(512GB 版 10 月下旬上市)。统一内存让权重不必在显存与内存之间搬运,MLX / llama.cpp 开箱即用,静音免改造。多台还可用雷雳 5 + RDMA 组集群,官方称 4 台集群推理速度约为单台的 3 倍。

  • M3 Ultra / M4 Max Mac Studio 已于 2026-08-25 全部退市,192GB 和 512GB 配置早在 3–5 月就撤了;二手大内存版本被炒到 15–18 万,不建议为它买单
  • M5 Ultra 内存 1.2TB/s 已经不低,但仍远低于 HBM3e 的 4.8TB/s,吞吐只有同容量 GPU 的零头
  • 内存是焊死的,买定离手:选 Mac Studio 的顺序必须是「先定内存 → 再定芯片 → 最后定存储」
  • 生态依赖 MLX / llama.cpp,部分框架算子支持不完整;预训练仍要靠 CUDA
⑨ 桌面 AI 一体机(DGX Spark / Strix Halo)
≤ 128GB 显存需求 · 不想装机的个人或小队
¥1.8 万 – 3.85 万参考预算

DGX Spark GB10(128GB 统一内存 + 完整 CUDA)京东 ¥2.89 万 – 3.85 万;AMD Ryzen AI Max+ 395 主机(128GB)约 ¥1.8 万 – 2.2 万。插电联网即用,不用管 PCIe 槽位、电源和风道。

  • DGX Spark 带宽约 273GB/s,只有 Mac Studio M5 Ultra 的约 1/4,解码速度是明显短板
  • AMD 395 走 ROCm,新模型出来通常要等适配,且更依赖 llama.cpp / Vulkan 后端
  • 同样不可扩展,单机就是上限,撑不起在线高并发
Cost Methodology

成本口径与数据来源

行情基准:2026-09-17 · 币种 CNY · 电费按 0.6 元/度 满载估算

  • 整机成本 = ceil(卡数 / 单机可插卡数) × 主机价 + 卡数 × 单卡价格;标注为『整机』的条目价格已含机身,不再另加主机价。
  • 价格取 2026-09-17 中国区渠道的『区间值』:本轮 DRAM/GDDR 缺货让同一张卡一个月内翻倍成为常态,单一报价没有意义。
  • 每张设备都标注了在售状态:在售现货 / 在售但严重缺货 / 预售 / 已停产只剩库存 / 仅二手市场。下单前请二次确认当日库存与成交价。
  • 未计入:机柜/UPS/空调或液冷、IDC 托管费、运维人力、模型下载的时间成本。企业自建通常还会再加 20%–40%。
  • 电费按满载 × 24 小时 × 365 天估算,实际负载通常只有 30%–60%。

价格参考来源

  • 【行情背景】2026 年 DRAM/GDDR 全行业缺货:RTX 50 系 9 月全线缺货 + 封仓涨价,5090 站上 ¥3.4 万、5080 破 ¥1.5 万;DDR5 32GB 套条同比涨约 230%–322%
  • 【已停产】RTX 4090 于 2024 年 9 月停产;Apple M3 Ultra / M4 Max Mac Studio 于 2026-08-25 退市(512GB 配置 3 月撤、256GB 5 月撤)
  • 【Apple 现售】Mac Studio M5 Max(最高 128GB,614GB/s)¥19,999 起 / M5 Ultra(96GB 或 256GB,1.2TB/s)¥46,999 起;512GB 版 10 月下旬上市、价格未公布。9 月 22 日发货,每位顾客限购 2 台
  • 【Apple 集群】雷电 5 + RDMA 可组 Mac Studio 集群,官方称 4 台集群 AI 推理性能约为单台 3 倍
  • 【RTX PRO 6000】京东自营 ¥13.8 万 – 15.4 万;第三方仍有 ¥7.7 万 – 10.1 万报价,但多为无现货挂单
  • 【RTX 6000D】中国特供 84GB,¥4.8 万 – 5.6 万;无 NVLink,算力约满血版 77%,Linux 下有已知 Xid-8 锁死问题
  • 【RTX 5090】京东自营 ¥3.4 万 – 5.5 万且大面积无货;国行主力为 5090D v2 24GB(约 ¥2.1 万 – 3.1 万)
  • 【二手】RTX 4090 二手 ¥1.1 万 – 1.3 万(假卡/翻新卡泛滥);H100 8 卡服务器 ¥100 万 – 130 万;8×A100 ¥40 万 – 80 万
  • 【一体机】DGX Spark GB10 128GB 京东 ¥2.89 万 – 3.85 万;AMD Ryzen AI Max+ 395(Strix Halo)128GB 主机约 ¥1.8 万 – 2.2 万
  • 【算力租赁】H100 约 $2–4 / 卡·时(专业云),AWS P5 约 $6.88、Azure 约 $12.29;A100 $1.29–3.43
Estimation Method

估算方法说明

  • 显存估算 = 权重体积 × 运行开销系数 + 框架常驻预留;长上下文(>256K)建议在此基础上再上浮 25% 作为 KV Cache。
  • MoE 模型即使激活参数很少,权重也要全部加载,因此按『总参数』而不是『激活参数』估显存。
  • 多卡并行优先选择带 NVLink / NVSwitch 的机型;PCIe 多卡在多路 TP 下会被互联带宽严重拖慢。
  • 2026 年 DRAM/GDDR 全行业缺货,显卡价格不再平缓变化:同一张卡一个月内翻倍是常态,采购前必须以当日渠道价为准。