編者按:「DeepSeek Harness」一詞近期在社群熱度上升,但其實涵蓋兩個層面:[模型側] DeepSeek 從 V3 到 V3.2-Exp、再到 V4 的開源模型與訓練/推理程式碼;以及 [Agent 側] 官方 2026-08-13 釋出的開源 agent runtime
deepseek-ai/deepseek-harness(DSH)。本文以「推理性能」與「部署成本」為主軸,整理 DeepSeek 開源堆疊近期的重要進展。[1][2]
DeepSeek-V3 技術報告奠定了後續版本的架構基調:671B 總參數、每個 token 啟用 37B 的 MoE 結構、Multi-head Latent Attention(MLA)與 DeepSeekMoE 架構,並首次在此規模驗證 FP8 混合精度訓練。預訓練資料為 14.8 兆 token;整個 V3 完整訓練僅耗時 278.8 萬 H800 GPU-小時。[6]
這個「極低訓練成本」的數字在當時已是業界標竿,也成為後續 V3.2-Exp 推理定價能壓到極低水準的根基。
V3.2-Exp 從 V3.1-Terminus 出發,引入 DeepSeek Sparse Attention(DSA):一個 FP8、8 head、ReLU 啟動的「lightning indexer」負責為每個 query 挑出 top-k(k=2048)最相關的 key-value 位置,把核心 attention 計算從 O(L²) 降到 O(Lk)。[3][4]
DSA 的目標是長上下文場景。Figure 3 給出的 H800($2/GPU-hour 假設)成本估算:[4]
| 階段 | 128K context | V3.1-Terminus | V3.2-Exp | 倍數差 |
|---|---|---|---|---|
| 階段 | 128K context | V3.1-Terminus | V3.2-Exp | 倍數差 |
| Prefilling | 每百萬 token | ~$0.70 | ~$0.20 | ~3.5× 更便宜 |
| Decoding | 每百萬 token | ~$2.10 | ~$0.27 | ~7–8× 更便宜 |
與此同時,benchmark 幾乎不退步:MMLU-Pro 85.0 → 85.0、GPQA 80.7 → 79.9、AIME 2025 88.4 → 89.3、Codeforces 2046 → 2121。[4]
2025-12-02 公開的 arXiv 2512.02556 進一步介紹了 DeepSeek-V3.2,主打三項突破:DSA 持續優化、可擴展強化學習框架、與大規模 agentic 任務合成管線。論文中聲明高算力變體 V3.2-Speciale 在多項基準上與 GPT-5、Gemini-3.0-Pro 持平甚至超越,並在 2025 IMO 與 IOI 雙雙達到金牌水準。[5](此結論以論文作者自述為依據,尚待獨立基準複現。)
模型本身的演算法只決定上限;真正拉到 throughput 的是 kernel 與系統庫。DeepSeek 同時開源了兩條主線:
FlashMLA 提供 H800 / B200 上最佳化的 MLA decode / prefill 實作。在 H800 SXM5 + CUDA 12.8 下,dense MLA decode 達 660 TFLOPS / 3000 GB/s;sparse(FP8 KV)decode 410 TFLOPS;sparse prefill 640 TFLOPS。換到 B200,sparse prefill 進一步推到 1450 TFLOPS。[7] 對 V3.2-Exp 的長上下文場景,這是 throughput 改善的硬底氣。
DeepGEMM 2025-04 版本在 H800 達到 1550 TFLOPS(FP8),2026-04 加入 Mega MoE、FP8×FP4 GEMM、FP4 Indexer、PDL 等功能。vLLM 的 V3.2-Exp 食譜正是透過 DeepGEMM 同時加速 MoE expert 計算與 DSA lightning indexer 的 MQA logits。[8][9]
官方 vLLM 食譜直接給出可運行指令:vllm serve deepseek-ai/DeepSeek-V3.2-Exp -dp 8 --enable-expert-parallel,硬體需求是 8×H200、8×H20 或 8×B200;H20 上官方建議設 VLLM_USE_DEEP_GEMM=0 反而效能更好。SGLang 也有對應映像(lmsysorg/sglang:dsv32),覆蓋 H200、MI350 與華為 NPU。[3][9]