让AI弄了一个时间表,打算从这周末开始复现
但是考虑到还要上班,自己还要做交易
要想想怎么提高效率
尤其是刚开始的时候
工具和路径都不熟练
可能花的时间更多
后期的进度和碰到的问题
都会在论坛更新
期待XDM监督
如果大家觉得这个论文表或者时间安排有问题
也请提出建议意见
⚙️ 修正后的学习路线图:资源与时间表
阶段 I: 深度学习基础与RL入门 (DL/DQN)
| 步骤 | 任务目标 | 核心论文 (标题/重点) | 推荐代码/资源 | 预估时间 (天) |
|---|---|---|---|---|
| 基础 1 | 掌握主流网络结构(ResNet)和优化器(Adam)。 | [1] Deep Residual Learning... (ResNet) / [15] ADAM | PyTorch官方教程,动手学深度学习 (Dive into Deep Learning) | 4 |
| 基础 2 | 归一化: 理解BN、LN及GN的原理和应用场景(尤其在小批量和LLM中的LN)。 | [3] Batch Normalization... (BN) / [4] Group Normalization (GN/LN) | 阅读PyTorch中nn.BatchNorm和nn.LayerNorm的文档。 |
3 |
| RL 入门 2 | 彻底理解DQN核心机制。 | [10] Human-level control through deep reinforcement learning (DQN) | CleanRL: DQN implementation | 3 |
| 项目实践 | 代码级复现DQN(CartPole)。 | [10] DQN | 自己从零实现DQN(经验回放、目标网络)。 | 7 |
| 拓展 | 了解DQN改进方向。 | [14] Exploring Simple Reinforcement Learning Techniques (Rainbow) | 阅读SB3中的DQN文档和源码注释。 | 3 |
| I 阶段总计 | 约 20 天 |
修正说明: 将原步骤1细分为两步,将 [4] Group Normalization 纳入 基础 2,强调其与 [3] Batch Normalization 的对比以及对 Layer Normalization 的理解(LayerNorm是GN的一种特例,对理解Transformer至关重要)。
阶段 II: 现代策略梯度与连续控制 (PPO/SAC)
| 步骤 | 任务目标 | 核心论文 (标题/重点) | 推荐代码/资源 | 预估时间 (天) |
|---|---|---|---|---|
| PG 基础 | 理解Actor-Critic和策略梯度。 | [11] Asynchronous Methods for Deep RL (A3C框架) | Spinning Up in Deep RL 教程 (OpenAI) | 3 |
| PPO 核心 | 理解PPO的裁剪目标函数。 | [12] Proximal Policy Optimization Algorithms (PPO) | CleanRL: PPO implementation | 3 |
| 项目实践 | 代码级复现PPO(离散/简单连续环境)。 | [12] PPO | 使用CleanRL/SB3的PPO代码进行运行和调试理解。 | 7 |
| Off-Policy | 理解SAC的Maximum Entropy原理。 | [13] Soft Actor-Critic... (SAC) | CleanRL/SB3: SAC implementation | 3 |
| 项目实践 | 代码级复现SAC(连续控制环境)。 | [13] SAC | 使用CleanRL/SB3的SAC代码,重点关注Off-Policy更新。 | 7 |
| 高级范式 | 了解RL+搜索范式。 | [17] Mastering the game of Go... (AlphaGo, MCTS) | 阅读关于MCTS的博客或简短实现。 | 3 |
| II 阶段总计 | 约 26 天 |
阶段 III: LLM核心架构与Scaling Laws
| 步骤 | 任务目标 | 核心论文 (标题/重点) | 推荐代码/资源 | 预估时间 (天) |
|---|---|---|---|---|
| Transformer | 彻底掌握自注意力机制。 | [2] Attention Is All You Need | Hugging Face: The Transformer Model (Encoder/Decoder) 教程。 | 7 |
| 预训练 | 理解BERT与GPT的预训练区别。 | [5] BERT: Pre-training of Deep Bidirectional Transformers... | Hugging Face: BERT/GPT模型结构源码和config文件。 | 4 |
| Scaling Laws | 掌握模型经济学。 | [7] Training Compute-Optimal Large Language Models (Chinchilla) | 阅读论文中的图表和结论,理解N和D的最佳比例。 | 4 |
| 涌现能力 | 理解ICL。 | [6] Language Models are Few-Shot Learners (GPT-3) | 观看相关研讨会或论文解读视频。 | 3 |
| 实战微调 | 熟悉SFT流程。 | [8] Instruction Tuning for Large Language Models | Hugging Face: SFTTrainer 使用教程。 | 5 |
| 最新实践 | 学习Llama 2的细节。 | [9] Llama 2: Open Foundation and Fine-Tuned Chat Models | 重点阅读论文的Methods和RLHF部分。 | 4 |
| III 阶段总计 | 约 27 天 |
阶段 IV: 前沿交叉与研究范式 (RLHF/PEFT/DT)
| 步骤 | 任务目标 | 核心论文 (标题/重点) | 推荐代码/资源 | 预估时间 (天) |
|---|---|---|---|---|
| 高效微调 | 掌握QLoRA原理与实践。 | [16] QLoRA: Quantization-aware Low-Rank Adapter... | Hugging Face PEFT 库,使用 QLoRA 进行 Llama 2 微调实践。 | 6 |
| LLM-RL融合 | 理解RLHF流程与PPO应用。 | [9] Llama 2 (RLHF部分) | trl (Transformer Reinforcement Learning) 库的RLHF教程。 | 4 |
| RL-序列建模 | 掌握Decision Transformer范式。 | [18] Decision Transformer: RL via Sequence Modeling | Decision Transformer Pytorch implementation (GitHub) | 4 |
| 研究范式 | 思考研究切入点。 | [20] In-Context Learning vs. Fine-Tuning... / [19] A Generalist Agent (Gato) | 撰写总结笔记,思考现有算法的局限性。 | 4 |
| IV 阶段总计 | 约 18 天 |
支持,有心了
支持,有心了
学习了
了解一下
支持
我还是摸鱼吧
不错不错,速成
厉害了,支持
学习了
楼主,🐂🍺威武