这篇适合谁读
这篇适合希望补 AI、LLM、系统、视觉或生成模型基础的人阅读。它把课程定位、学习价值和适合产出的笔记方向整理成公开路线,便于按目标选择课程。
斯坦福大学硬核语言模型课程,从零构建完整 LLM——涵盖数据收集清洗、Transformer 构建、模型训练、评估部署、对齐与推理 RL。借鉴 OS 课程”从零构建操作系统”的理念。
基本信息
| 信息 | 内容 |
|---|---|
| 课程编号 | CS 336 |
| 课程名称 | Language Modeling from Scratch |
| 学校 | Stanford University |
| 学期 | Spring 2026 |
| 学分 | 3-5 Units |
| 上课时间 | 周一/周三 3:00-4:20pm |
| 上课地点 | Skilling Auditorium |
| 讲师 | Percy Liang、Tatsunori Hashimoto |
| 助教 | Marcel Rød, Herman Brunborg, Steven Cao |
| 课程网站 | https://cs336.stanford.edu/ |
课程简介
语言模型是现代 NLP 应用的基石,为下游任务提供了通用系统的新范式。本课程通过引导学生完成开发自己语言模型的全过程,让学生全面掌握语言模型。
借鉴操作系统课程从零构建操作系统的理念,涵盖语言模型创建的方方面面:预训练数据收集与清洗、Transformer 模型构建、模型训练和评估部署。
课程作业(5 个大型编程作业)
| 作业 | 内容 | GitHub Stars |
|---|---|---|
| Assignment 1: Basics | 基础——词元化、前向/反向传播、训练循环 | ⭐ 1,950 |
| Assignment 2: Systems | 系统优化——FlashAttention、融合核、分布式训练 | ⭐ 246 |
| Assignment 3: Scaling | 规模化——Scaling Laws、计算最优训练 | ⭐ 69 |
| Assignment 4: Data | 数据——数据清洗、去重、质量过滤 | ⭐ 55 |
| Assignment 5: Alignment | 对齐与推理 RL——DPO、RLHF、推理强化学习 | ⭐ 160 |
先修要求
- Python 编程熟练(极强的编程和软件工程能力)
- 深度学习和系统优化经验(熟悉 PyTorch,了解内存层次等系统概念)
- 大学微积分、线性代数(如 MATH 51, CME 100)
- 基本概率与统计(如 CS 109)
- 机器学习基础(如 CS221, CS229, CS230, CS124, CS224N)
⚠️ 这是一门 5 学分课程,实现工作量极大,请预留充足时间。
GitHub 仓库(https://github.com/stanford-cs336)
共 22 个仓库,主要仓库:
| 仓库 | Stars | 描述 |
|---|---|---|
| lectures | 3,237 | 课程讲义/幻灯片 |
| spring2024-lectures | 430 | 2024 春季讲义 |
| assignment1-basics | 1,950 | 作业 1 基础版 |
| assignment2-systems | 246 | 作业 2 系统优化 |
| assignment3-scaling | 69 | 作业 3 规模化 |
| assignment4-data | 55 | 作业 4 数据 |
| assignment5-alignment | 160 | 作业 5 对齐 |
其他资源
- YouTube 课程录像: 有完整播放列表
- Slack 频道: 课程公告和讨论
与个人发展的关联
- 这是从”会用 LLM”到”理解 LLM”的关键一步
- Assignment 5(对齐与推理 RL)直接对应当前 AI agent 开发中的 reward modeling 和 RLHF 实践
- 课程强调系统优化(Assignment 2),对独立开发者优化推理性能有实际价值
- 完成这门课意味着具备独立训练/微调小模型的能力,是技术壁垒的重要来源
学习路径建议
CS 146S(AI 工具使用) ↓CS 224N(NLP 基础 + Transformer 原理) ↓CS 336(从零构建 LLM)状态
已收录课程基本信息和资源,待后续深入学习。
COMMUNITY DISCUSSION
评论
使用 GitHub 账号登录后参与讨论,评论会同步到 GitHub Discussions。