https://mp.weixin.qq.com/s/6hKi5F_S2zQ4g6SyF0UNow
官方推文,从这个图看

性能其实跟3.1差不多
主要是长上下文推理成本降低,用官方的话说:
DeepSeek Sparse Attention(DSA)首次实现了细粒度稀疏注意力机制,在几乎不影响模型输出效果的前提下,实现了长文本训练和推理效率的大幅提升。
https://mp.weixin.qq.com/s/6hKi5F_S2zQ4g6SyF0UNow
官方推文,从这个图看

性能其实跟3.1差不多
主要是长上下文推理成本降低,用官方的话说:
DeepSeek Sparse Attention(DSA)首次实现了细粒度稀疏注意力机制,在几乎不影响模型输出效果的前提下,实现了长文本训练和推理效率的大幅提升。
看起来是的 毕竟exp版本
按照这个进度 正式版提升也有限 遇到瓶颈了