256→128 与 1K→256,C4/C8 全部成功。
Evidence · 可追溯数据
每一个性能结论,都能回到原始证据
性能以本项目 JSON、资源快照和人工验收报告为准;官方资料用于确认设备与模型规格;B站/CSDN用于了解行业关注点和常见误区。
现场证据地图
本项目到底测了多少
最终重启后的代表性混合负载共至少 296 个正式请求,不包含前期调参和单次 canary。
0.05 / 0.10 / 0.20 / 0.30 req/s 四档。
每次请求前刷新请求缓存。
4K/8K,针位于 10% / 50% / 90%。
无容器退出、OOM、热降频、Xid、AER 或 RoCE 硬错误。
能完成一次不等于能安全重复;资源门槛优先于 HTTP 成功。
原始资料
从结论回到报告和 JSON
以下证据保留在内部资料包中。公网发布版仅展示索引和结论,不上传节点、日志及运维原始文件。
性能与 Agent 验收报告
最终配置、并发、长上下文、NIAH、Arrival、Agent 协议与生产缺口。
内部归档 · 未随站点发布Final Scale8
120 个正式请求;C4/C8 的 TTFT、TPOT、E2E 与 output tok/s。
内部归档 · 未随站点发布Final Arrival
四档泊松到达率、客户端排队、服务端队列和资源门槛。
内部归档 · 未随站点发布4K / 8K Cold-long
重复长输入的首字、逐字和完整耗时;12K 阶段因 PSI 主动停止。
内部归档 · 未随站点发布NIAH 4K / 8K
针位于文本前、中、后,6 次全部检索正确。
内部归档 · 未随站点发布RDMA 与 NCCL
三条 200G 物理链、三节点 collective 正确性和恢复性重传记录。
内部归档 · 未随站点发布测试方法
为什么这些数据比“随手问一句”更可信
输入长度可复现
合成内容通过模型 Tokenizer 校准到目标 Token,而不是用字符数猜测。
缓存影响可控
长输入与 NIAH 在每个正式请求前刷新请求/Radix Cache,避免“第二次更快”污染结论。
同时测体验和吞吐
记录 TTFT、TPOT、E2E、请求/秒和输出 Token/秒,不用单一数字代替全部体验。
资源失败优先
即使 HTTP 200,只要出现持续 PSI、Swap-out、OOM、重启或硬件错误,就判定调参失败。
内容不落盘
结果保存 Token 数、时延、状态、字符数与内容哈希,不保存 API Key、原始提示词和生成正文。
小样本不冒充 SLA
20/40 次样本的 p95 用于方向判断;正式 p99 或 SLA 需要至少 100 次并结合真实业务回放。
社区数字辨析
为什么网上 65t、82t、284t 和本项目 35.1 不能直接比
差异不是一句“谁优化得更好”就能解释,而是测试对象和计时口径不同。
| 维度 | 本项目实测 | 社区双机示例所述 | 影响 |
|---|---|---|---|
| 设备/并行 | 3 台,PP=3,14/14/15 层 | 2 台,常见 TP=2 | 通信频率和流水线行为不同 |
| 模型/精度 | NVIDIA NVFP4,46 分片 | 常见 0731 FP8 或其他 NVFP4 路径 | 权重、KV 和内核不同 |
| 推理引擎 | SGLang 26.07,SM121 CUTLASS | 常见 vLLM + 专用镜像 | 调度器、Kernel 与缓存不同 |
| 加速功能 | 未启用 MTP 投机解码 | 部分示例启用 MTP5 | Decode tok/s 可能大幅变化 |
| 性能口径 | 35.105 tok/s:C8 完整请求总输出 | 65/82 常指单流 Decode;284.8 是另一环境八并发 Decode 合计 | 计时窗口不同,不能横比 |
| 生产边界 | 重复实测后输入 cap=8K | 部分展示配置 1M 或单次极限通过 | “能接受”不等于“低延迟、可重复” |
本项目证据显示:12K 重复负载已经触发内存压力,16K 也越过系统安全门槛。部署能力以当前硬件、镜像、配置和重复测试共同决定。
B站 / CSDN 延伸学习
社区资料适合学什么
以下内容用于拓展视野。作者环境和口径各异,引用不代表本项目为其数据背书。
双机 DeepSeek V4 展示
适合直观看设备形态、双机互联和本地模型使用场景;同时也是理解“标题中的无限 Token 不等于生产 SLA”的好案例。
查看视频 ↗DGX Spark 部署常见问题
适合新手了解下载、镜像、网络和启动阶段常遇到的障碍,再对照本项目九道 Gate。
查看视频 ↗128G 统一内存与 Coding 体验
适合理解设备定位:它首先是能在桌面装下大模型的个人 AI 超算,而不是数据中心 GPU 的等价替代。
查看视频 ↗部署验收要看哪五类数据
文章强调“配置元数据不等于真实可服务、权重加载不等于编码兼容”,与本项目的 API、功能和资源 Gate 思路一致。
阅读文章 ↗长上下文为什么拖垮体感
文章用另一套双机数据解释 Decode 速度可能仍高,但 TTFT 和端到端吞吐会随 Prefill 急剧恶化;原理可借鉴,数字不可套用。
阅读文章 ↗双机部署实践路线
可用于了解另一种 vLLM 双机方案的物理连接与部署流程,再与本项目 SGLang PP3 路径比较。
阅读文章 ↗官方资料