DeepSeek 正式推出最新的实验性模型 DeepSeek-V3.2-Exp。基于 V3.1-Terminus, 引入革命性的 DeepSeek Sparse Attention(DSA)技术,旨在大幅提升长文本处理效率。 官方 App、网页端、小程序均已同步更新;API 服务价格下调超过 50%。
技术革新 · 成本骤降 · 无缝升级与对比测试
首创 DeepSeek 稀疏注意力(DSA)机制,在几乎不影响模型性能的前提下,显著提升长文本的训练和推理速度。
得益于效率提升,API 调用成本直降超过 50%,开发者能够以更低成本构建更强大的应用。
官方 App、网页端、小程序已全面升级为 V3.2-Exp,所有标准 API 接口默认使用新模型。
为方便用户对比,限时保留旧版 V3.1-Terminus 的 API 访问通道,并同样享受新版价格。
首次实现细粒度稀疏注意力机制,在几乎不影响输出效果的前提下,大幅提升长文本训练和推理效率。
在注意力计算中选择性激活关键 token,避免全量计算带来的资源浪费。
训练设置与 V3.1-Terminus 严格对齐,各领域公开评测集表现基本持平。
长文本训练和推理效率大幅提升,是本次成本下降超过 50% 的核心原因。
开源算子包含 TileLang 与 CUDA 两种版本,研究场景建议使用 TileLang 版便于调试。
模型服务成本的降低,最直接的受益者就是开发者。即刻生效新标准,整体降幅超过 50%。
所有标准 API 接口即刻生效新价格,无需额外申请。
官方 App、网页端、小程序与标准 API 均默认使用 V3.2-Exp 模型。
限时保留期内,V3.1-Terminus 的调用价格与 V3.2-Exp 相同。
模型已在 HuggingFace 与魔搭开源,论文同步公开,欢迎社区复现与对比。
本次开源算子包含 TileLang 与 CUDA 两种版本,研究场景建议使用 TileLang 版。
TileLang · CUDADeepSeek 正式推出其最新的实验性模型 DeepSeek-V3.2-Exp。这是一个实验性(Experimental)的版本, 在 V3.1-Terminus 的基础上,引入了革命性的 DeepSeek Sparse Attention(DSA)技术, 旨在大幅提升长文本处理的效率。目前,官方 App、网页端、小程序均已同步更新为 DeepSeek-V3.2-Exp。 与此同时,官方宣布 API 服务价格下调超过 50%。
DeepSeek Sparse Attention(DSA)首次实现了细粒度稀疏注意力机制,在几乎不影响模型输出效果的前提下, 实现了长文本训练和推理效率的大幅提升。为了严谨地评估引入稀疏注意力带来的影响, 我们特意把 DeepSeek-V3.2-Exp 的训练设置与 V3.1-Terminus 进行了严格的对齐。 在各领域的公开评测集上,DeepSeek-V3.2-Exp 的表现与 V3.1-Terminus 基本持平。
DeepSeek-V3.2-Exp 模型现已在 Huggingface 与魔搭开源:
官方注:在新模型的研究过程中,需要设计和实现很多新的 GPU 算子。使用高级语言 TileLang 进行快速原型开发, 以支持更深入的探索。在最后阶段,以 TileLang 作为精度基线,逐步使用底层语言实现更高效的版本。 因此,本次开源的主要算子包含 TileLang 与 CUDA 两种版本。我们建议社区在进行研究性实验时, 使用基于 TileLang 的版本以方便调试和快速迭代。
模型服务成本的降低,最直接的受益者就是开发者。DeepSeek 宣布,API 定价即刻生效新标准,整体降幅超过 50%。 这意味着开发者能够以更低的成本,构建更强大的应用。目前,所有官方平台(App、网页端、小程序) 和标准 API 接口均已默认使用 V3.2-Exp 模型。
作为实验性版本,V3.2-Exp 虽然在评测中表现优异,但仍需在真实应用场景中接受更广泛的检验。 为此,DeepSeek 诚挚邀请所有用户参与测试,并提供宝贵的反馈。为了方便您进行新旧版本对比, 官方限时保留了 V3.1 模型的 API 访问通道(至 2025 年 10 月 15 日),且调用价格与新版 V3.2-Exp 相同。
用户只需修改 base_url="https://api.deepseek.com/v3.1_terminus_expires_on_20251015"
即可访问 V3.1-Terminus,调用价格与 V3.2-Exp 相同。
官方 App、网页端与小程序均已同步升级;开发者可即刻使用新价格调用 API。