Evidence · 可追溯数据

每一个性能结论,都能回到原始证据

性能以本项目 JSON、资源快照和人工验收报告为准;官方资料用于确认设备与模型规格;B站/CSDN用于了解行业关注点和常见误区。

现场证据地图

本项目到底测了多少

最终重启后的代表性混合负载共至少 296 个正式请求,不包含前期调参和单次 canary。

120 / 120并发性能矩阵

256→128 与 1K→256,C4/C8 全部成功。

160 / 160到达率测试

0.05 / 0.10 / 0.20 / 0.30 req/s 四档。

10 / 104K/8K 冷长输入

每次请求前刷新请求缓存。

6 / 6NIAH 检索正确性

4K/8K,针位于 10% / 50% / 90%。

约 83 分钟混合负载观察

无容器退出、OOM、热降频、Xid、AER 或 RoCE 硬错误。

12K / 16K FAIL边界测试

能完成一次不等于能安全重复;资源门槛优先于 HTTP 成功。

原始资料

从结论回到报告和 JSON

以下证据保留在内部资料包中。公网发布版仅展示索引和结论,不上传节点、日志及运维原始文件。

测试方法

为什么这些数据比“随手问一句”更可信

01

输入长度可复现

合成内容通过模型 Tokenizer 校准到目标 Token,而不是用字符数猜测。

02

缓存影响可控

长输入与 NIAH 在每个正式请求前刷新请求/Radix Cache,避免“第二次更快”污染结论。

03

同时测体验和吞吐

记录 TTFT、TPOT、E2E、请求/秒和输出 Token/秒,不用单一数字代替全部体验。

04

资源失败优先

即使 HTTP 200,只要出现持续 PSI、Swap-out、OOM、重启或硬件错误,就判定调参失败。

05

内容不落盘

结果保存 Token 数、时延、状态、字符数与内容哈希,不保存 API Key、原始提示词和生成正文。

06

小样本不冒充 SLA

20/40 次样本的 p95 用于方向判断;正式 p99 或 SLA 需要至少 100 次并结合真实业务回放。

社区数字辨析

为什么网上 65t、82t、284t 和本项目 35.1 不能直接比

差异不是一句“谁优化得更好”就能解释,而是测试对象和计时口径不同。

维度本项目实测社区双机示例所述影响
设备/并行3 台,PP=3,14/14/15 层2 台,常见 TP=2通信频率和流水线行为不同
模型/精度NVIDIA NVFP4,46 分片常见 0731 FP8 或其他 NVFP4 路径权重、KV 和内核不同
推理引擎SGLang 26.07,SM121 CUTLASS常见 vLLM + 专用镜像调度器、Kernel 与缓存不同
加速功能未启用 MTP 投机解码部分示例启用 MTP5Decode tok/s 可能大幅变化
性能口径35.105 tok/s:C8 完整请求总输出65/82 常指单流 Decode;284.8 是另一环境八并发 Decode 合计计时窗口不同,不能横比
生产边界重复实测后输入 cap=8K部分展示配置 1M 或单次极限通过“能接受”不等于“低延迟、可重复”
×
不要把视频标题或配置页里的“无限 Token / 1M Context”写进本项目能力承诺。

本项目证据显示:12K 重复负载已经触发内存压力,16K 也越过系统安全门槛。部署能力以当前硬件、镜像、配置和重复测试共同决定。

B站 / CSDN 延伸学习

社区资料适合学什么

以下内容用于拓展视野。作者环境和口径各异,引用不代表本项目为其数据背书。

B站

双机 DeepSeek V4 展示

适合直观看设备形态、双机互联和本地模型使用场景;同时也是理解“标题中的无限 Token 不等于生产 SLA”的好案例。

查看视频 ↗
B站

DGX Spark 部署常见问题

适合新手了解下载、镜像、网络和启动阶段常遇到的障碍,再对照本项目九道 Gate。

查看视频 ↗
B站

128G 统一内存与 Coding 体验

适合理解设备定位:它首先是能在桌面装下大模型的个人 AI 超算,而不是数据中心 GPU 的等价替代。

查看视频 ↗
CSDN

部署验收要看哪五类数据

文章强调“配置元数据不等于真实可服务、权重加载不等于编码兼容”,与本项目的 API、功能和资源 Gate 思路一致。

阅读文章 ↗
CSDN

长上下文为什么拖垮体感

文章用另一套双机数据解释 Decode 速度可能仍高,但 TTFT 和端到端吞吐会随 Prefill 急剧恶化;原理可借鉴,数字不可套用。

阅读文章 ↗
CSDN

双机部署实践路线

可用于了解另一种 vLLM 双机方案的物理连接与部署流程,再与本项目 SGLang PP3 路径比较。

阅读文章 ↗

官方资料

规格和兼容性以官方为准

NVIDIA DGX Spark

128 GB 统一内存、最高 1 PFLOP FP4、ConnectX-7 200 Gbps 和产品定位。

产品页 ↗
NVIDIA SGLang 26.07

多节点、DGX Spark、Blackwell NVFP4 支持和容器版本说明。

发行说明 ↗
NVIDIA 模型卡

284B / 13B 激活、NVFP4 量化范围、准确率评测和理论上下文。

模型卡 ↗