Solution · 投入与演进

先把三机做成可靠产品,再复制第二套

当前最合理的目标不是追求更长上下文,而是把已验证的 8K 能力变成安全、可监控、可恢复的内部服务。

方案结构

一套最小可用的本地大模型平台

模型留在内网,业务系统只通过统一入口调用;入口负责安全、限流和长文本控制。

业务入口员工 / 编码助手 / 内部系统不直接访问模型端口
治理层安全网关TLS、用户认证、限流、排队、8K 上限、审计
算力层3 × DGX Spark一个 DeepSeek V4 NVFP4 实例
运维层监控、告警、模型校验、整组恢复任何节点故障时协调重启

方案比较

端侧部署不是全面替代云,而是补上“本地可控”能力

选择优势限制适合场景
单台 DGX Spark部署简单、成本和运维较低本项目 284B 模型权重装不下中小模型、个人研发、原型验证
三台 DGX Spark当前方案284B 模型本地运行,数据留在内网单实例、吞吐有限、长文本慢内部研发、代码助手、复杂分析
六台,两套三机可做高可用,整体吞吐接近翻倍设备与运维投入增加生产核心业务、多团队共享
云端 API / 数据中心 GPU弹性更强、并发和高可用更成熟持续费用、数据边界和供应商依赖公网产品、高并发、流量波动大

“接近翻倍”指两个独立副本在请求可均衡分配时的总体吞吐方向,不是本项目实测承诺,也不代表单个请求快一倍。

当前实际部署

不是概念图,而是已经落地的三机 Ring

控制面与模型数据面分离,三台共同承载一个 API 服务。

Rank 0 · API 入口spark-6PP 第 0 段 · 14 层
Rank 1spark-7PP 第 1 段 · 14 层
Rank 2spark-8PP 第 2 段 · 15 层
管理面OpenAI-compatible API、进程协调、SSH数据面ConnectX-7 200GbE RoCE Ring、六个不重叠子网故障域任一 Rank 退出,三机协调重启

生产 Gate

当前通过项与阻断项

PASS

网络与 RDMA

六子网 Ring、12/12 rail、三条链路 183.50–185.22 Gb/s。

PASS

容器 NCCL 与模型

NET/IB collective、真实生成、SSE、Reasoning、Tool-call 和 Codex CLI。

PASS

8K 能力与容量

Scale8 120/120、Arrival 160/160、Cold-long 10/10、NIAH 6/6。

待完成

三机 OTA 对齐

spark-6/7 与 spark-8 的 OS、Kernel、Driver 批次仍有漂移。

待完成

模型全量签名

46 个分片数量完整,但生产 SHA-256 manifest 仍待签署。

缺口

高可用副本

当前只有一个 PP3 实例,没有无缝接管能力。

分阶段投入

建议分三步走

阶段 1 · 当前

内部受控试点

限定用户和业务,输入不超过 8K,稳态不超过 0.10 req/s;收集真实问题类型、平均输入长度和排队数据。

目标:证明业务价值
阶段 2 · 上线前

生产化补强

统一系统版本,完成模型哈希签署;上线安全网关、监控告警、容量保护和恢复演练。

目标:把“能跑”变成“可运营”
阶段 3 · 有需求时

第二套三机副本

当真实流量、停机风险或多团队需求超过单实例能力时,再复制完整集群并增加负载均衡。

目标:高可用与横向扩容

风险清单

需要管理层知道的五件事

单点故障

当前三台共同组成一个实例,任何一台故障都会中断服务。核心生产业务需要第二套副本。

应对:整组恢复 + 后续双副本

长文本越界

12K 重复请求已经触发内存压力,不能依据模型标称 1M 上下文进行业务承诺。

应对:网关强制 8K + 自动压缩

三机软件版本漂移

系统、内核和驱动批次不完全一致,升级后必须重新验证网络和性能。

应对:维护窗口统一版本

容量被成功率掩盖

高流量下请求仍能成功,但排队时间已经不可接受。

应对:用首字和队列延迟做告警
可控

模型输出风险

本地部署不消除幻觉、偏见、错误答案或敏感输出风险。

应对:业务评测、权限与人工复核

投入判断

是否扩容,看四个真实指标

不要只看 GPU 利用率,也不要只看请求是否成功。

01

业务价值

每周活跃用户、节省工时、任务完成率是否持续增长。

02

排队体验

首字 p95 是否经常超过业务容忍值,0.10 req/s 是否成为常态瓶颈。

03

停机损失

一次三机重启是否会影响关键业务;若答案是“会”,就需要第二套副本。

04

数据边界

本地处理带来的合规和数据控制收益,是否高于云端弹性的便利。

最终建议

批准试点,暂不以“高并发生产平台”立项

以三机现有方案承载受控内部场景,明确 8K 输入与低并发边界;用 4–8 周真实使用数据决定是否增加第二套三机副本。不要为了追求标称上下文继续提高内存比例或放宽 12K 上限。

建议批准范围内部试点 / 敏感数据本地推理 / 小团队助手暂不批准范围公网高并发 / 核心业务单实例 / 12K+ 生产承诺

官方资料

外部依据

设备规格

DGX Spark 采用 GB10、128 GB 统一内存、最高 1 PFLOP FP4 和 ConnectX-7 200 Gbps。

NVIDIA 产品页 ↗
软件支持

NVIDIA SGLang 26.07 明确包含多节点、DGX Spark 和 Blackwell NVFP4 支持。

SGLang 26.07 说明 ↗
模型说明

NVFP4 模型卡给出 284B / 13B 激活、Blackwell 支持和理论 1M 上下文。

NVIDIA 模型卡 ↗