跳到正文
世傲命的技术观测站 PERSONAL TECHNOLOGY OBSERVATORY
学习 CS 课程图谱 2026-06

CS 课程图谱

CS 221M: Mechanistic Interpretability

理解模型如何处理信息以及为什么产生特定输出的 ML 子领域。涵盖探针(probing)、引导(steering)、因果抽象和稀疏自编码器。包含来自学术界和工业界领先可解释性实验室的客座讲座。

来源:wiki/courses/stanford-cs/基础/CS221M-Mechanistic-Interpretability.md

这篇适合谁读

这篇适合希望补 AI、LLM、系统、视觉或生成模型基础的人阅读。它把课程定位、学习价值和适合产出的笔记方向整理成公开路线,便于按目标选择课程。

全面介绍可解释性——理解模型如何处理信息以及为什么产生特定输出。涵盖探针(probing)、引导(steering)、因果抽象和稀疏自编码器,特别关注因果方法和大语言模型。

基本信息

信息内容
课程编号CS 221M
课程名称Mechanistic Interpretability
学校Stanford University
学期Spring
学分3 Units
讲师Tomer Icard

课程简介

理解模型如何处理信息以及为什么产生特定输出的 ML 子领域。涵盖探针(probing)、引导(steering)、因果抽象和稀疏自编码器。包含来自学术界和工业界领先可解释性实验室的客座讲座。

与个人发展的关联

  • 可解释性是 AI 安全和对齐的核心问题
  • 理解 LLM 内部机制对于开发更安全、可控的 AI 系统至关重要
  • AI 安全领域的前沿课程
  • 与 CS 336 的 Alignment 部分互补

状态

已收录课程基本信息,待后续深入学习。

继续探索

展开学习路线

学习路线

CS 课程图谱

06 / 18
查看完整路线
  1. 01斯坦福 CS 课程学习图谱:面向 AI 与 LLM 的路线
  2. 02CS 107: Computer Organization and Systems
  3. 03CS 146S: The Modern Software Developer
  4. 04CS 149: Parallel Computing
  5. 05CS 221: Artificial Intelligence: Principles and Techniques
  6. 06CS 221M: Mechanistic Interpretability当前
  7. 07CS 224N: Natural Language Processing with Deep Learning
  8. 08CS 224v: Conversational Virtual Assistants with Deep Learning
  9. 09CS 224w: Machine Learning with Graphs
  10. 10CS 229: Machine Learning
  11. 11CS 230: Deep Learning
  12. 12CS 231n: Deep Learning for Computer Vision
  13. 13CS 234: Reinforcement Learning
  14. 14CS 236: Deep Generative Models
  15. 15CS 324: Advances in Foundation Models
  16. 16CS 336: Language Modeling from Scratch
  17. 17CS 348k: Visual Computing Systems
  18. 18CS 349d: AI Inference Infrastructure
  • #Stanford
  • #可解释性
  • #AI安全
  • #LLM内部机制
  • #课程资料
  • #课程

COMMUNITY DISCUSSION

评论

使用 GitHub 账号登录后参与讨论,评论会同步到 GitHub Discussions。