v3 sft微调的时候很多数据是来源于openai和claude,强化学习阶段没用别人的数据。 而且现在很多时候是需要自己造一些数据,全流程的数据(比如deep research)很多是拿不到的,对强化学习要求很高
你都先入为主了,跟你说啥还有用吗?你既然认为所谓deepseek只是偷鸡人家模型蒸馏的产物,别人说啥都不好使呀。
v3 sft微调的时候很多数据是来源于openai和claude,强化学习阶段没用别人的数据。
而且现在很多时候是需要自己造一些数据,全流程的数据(比如deep research)很多是拿不到的,对强化学习要求很高
不是听说用了华子的显卡,短期会有一些进度问题嘛
dpsk现在不是想降成本吗,搞线性复杂度