DeepFloodbeta

让AI弄了一个学习的时间表,进度会在论坛更新

让AI弄了一个时间表,打算从这周末开始复现
但是考虑到还要上班,自己还要做交易
要想想怎么提高效率
尤其是刚开始的时候
工具和路径都不熟练
可能花的时间更多

后期的进度和碰到的问题
都会在论坛更新
期待XDM监督

如果大家觉得这个论文表或者时间安排有问题
也请提出建议意见


⚙️ 修正后的学习路线图:资源与时间表

阶段 I: 深度学习基础与RL入门 (DL/DQN)

步骤 任务目标 核心论文 (标题/重点) 推荐代码/资源 预估时间 (天)
基础 1 掌握主流网络结构(ResNet)和优化器(Adam)。 [1] Deep Residual Learning... (ResNet) / [15] ADAM PyTorch官方教程动手学深度学习 (Dive into Deep Learning) 4
基础 2 归一化: 理解BN、LN及GN的原理和应用场景(尤其在小批量和LLM中的LN)。 [3] Batch Normalization... (BN) / [4] Group Normalization (GN/LN) 阅读PyTorch中nn.BatchNormnn.LayerNorm的文档。 3
RL 入门 2 彻底理解DQN核心机制。 [10] Human-level control through deep reinforcement learning (DQN) CleanRL: DQN implementation 3
项目实践 代码级复现DQN(CartPole)。 [10] DQN 自己从零实现DQN(经验回放、目标网络)。 7
拓展 了解DQN改进方向。 [14] Exploring Simple Reinforcement Learning Techniques (Rainbow) 阅读SB3中的DQN文档和源码注释。 3
I 阶段总计 约 20 天

修正说明: 将原步骤1细分为两步,将 [4] Group Normalization 纳入 基础 2,强调其与 [3] Batch Normalization 的对比以及对 Layer Normalization 的理解(LayerNorm是GN的一种特例,对理解Transformer至关重要)。

阶段 II: 现代策略梯度与连续控制 (PPO/SAC)

步骤 任务目标 核心论文 (标题/重点) 推荐代码/资源 预估时间 (天)
PG 基础 理解Actor-Critic和策略梯度。 [11] Asynchronous Methods for Deep RL (A3C框架) Spinning Up in Deep RL 教程 (OpenAI) 3
PPO 核心 理解PPO的裁剪目标函数。 [12] Proximal Policy Optimization Algorithms (PPO) CleanRL: PPO implementation 3
项目实践 代码级复现PPO(离散/简单连续环境)。 [12] PPO 使用CleanRL/SB3的PPO代码进行运行和调试理解 7
Off-Policy 理解SAC的Maximum Entropy原理。 [13] Soft Actor-Critic... (SAC) CleanRL/SB3: SAC implementation 3
项目实践 代码级复现SAC(连续控制环境)。 [13] SAC 使用CleanRL/SB3的SAC代码,重点关注Off-Policy更新 7
高级范式 了解RL+搜索范式。 [17] Mastering the game of Go... (AlphaGo, MCTS) 阅读关于MCTS的博客或简短实现。 3
II 阶段总计 约 26 天

阶段 III: LLM核心架构与Scaling Laws

步骤 任务目标 核心论文 (标题/重点) 推荐代码/资源 预估时间 (天)
Transformer 彻底掌握自注意力机制。 [2] Attention Is All You Need Hugging Face: The Transformer Model (Encoder/Decoder) 教程。 7
预训练 理解BERT与GPT的预训练区别。 [5] BERT: Pre-training of Deep Bidirectional Transformers... Hugging Face: BERT/GPT模型结构源码和config文件。 4
Scaling Laws 掌握模型经济学。 [7] Training Compute-Optimal Large Language Models (Chinchilla) 阅读论文中的图表和结论,理解N和D的最佳比例。 4
涌现能力 理解ICL。 [6] Language Models are Few-Shot Learners (GPT-3) 观看相关研讨会或论文解读视频。 3
实战微调 熟悉SFT流程。 [8] Instruction Tuning for Large Language Models Hugging Face: SFTTrainer 使用教程。 5
最新实践 学习Llama 2的细节。 [9] Llama 2: Open Foundation and Fine-Tuned Chat Models 重点阅读论文的Methods和RLHF部分。 4
III 阶段总计 约 27 天

阶段 IV: 前沿交叉与研究范式 (RLHF/PEFT/DT)

步骤 任务目标 核心论文 (标题/重点) 推荐代码/资源 预估时间 (天)
高效微调 掌握QLoRA原理与实践。 [16] QLoRA: Quantization-aware Low-Rank Adapter... Hugging Face PEFT 库,使用 QLoRA 进行 Llama 2 微调实践。 6
LLM-RL融合 理解RLHF流程与PPO应用。 [9] Llama 2 (RLHF部分) trl (Transformer Reinforcement Learning) 库的RLHF教程。 4
RL-序列建模 掌握Decision Transformer范式。 [18] Decision Transformer: RL via Sequence Modeling Decision Transformer Pytorch implementation (GitHub) 4
研究范式 思考研究切入点。 [20] In-Context Learning vs. Fine-Tuning... / [19] A Generalist Agent (Gato) 撰写总结笔记,思考现有算法的局限性。 4
IV 阶段总计 约 18 天
  • 支持,有心了

  • 支持,有心了

  • 学习了

  • 了解一下

  • 支持

  • 我还是摸鱼吧

  • 不错不错,速成

  • 厉害了,支持

  • 学习了

  • 楼主,🐂🍺威武