batch size - 搜索 News

10 天

AI大模型DeepSeek日前在知乎贴文《DeepSeek-V3 / R1 推理系统概览》，DeepSeek称，在最近的 24 小时里（北京时间 2025/02/27 12:00 至 2025/02/28 12:00），DeepSeek V3 和 ...

12 天

官方详解 DeepSeek-V3 / R1 推理系统：优化目标是更大吞吐、更低延迟

由于 DeepSeek-V3 / R1 的专家数量众多，并且每层 256 个专家中仅激活其中 8 个。模型的高度稀疏性决定了 DeepSeek 必须采用很大的 overall batch size，才能给每个专家提供足够的 expert batch size，从而实现更大的吞吐、更低的延时。需要大规模跨节点专家并行（Expert Parallelism / EP）。

12 天

突然宣布！暂停DeepSeek API服务

就在DeepSeek披露大规模部署成本和收益之后，潞晨科技突然宣布：“尊敬的用户，潞晨云将在一周后停止提供DeepSeek API服务，请尽快用完您的余额。如果没用完，我们全额退款。 ” ...

知乎专栏 on MSN12 天

DeepSeek-V3 / R1 推理系统概览

DeepSeek-V3 / R1 推理系统的优化目标是：更大的吞吐，更低的延迟。为了实现这两个目标，我们的方案是使用大规模跨节点专家并行（Expert Parallelism / EP）。首先 EP 使得 batch size 大大增加，从而提高 GPU 矩阵乘法的效率，提高吞吐。其次 EP 使得专家分散在不同的 GPU 上，每个 GPU ...

一些您可能无法访问的结果已被隐去。

显示无法访问的结果