这篇适合谁读
这篇适合正在把 AI 产品、Agent、RAG、评估和部署能力整理成项目作品集的人阅读。它更像一份公开学习索引,帮助你快速判断某个方向为什么值得学、应该看哪些项目、最后能沉淀成什么能力。
对应 JD 能力:RAG、Embedding、检索策略、知识库设计
1. LangChain
- 链接: https://github.com/langchain-ai/langchain
- 一句话: 最流行的 LLM 应用开发框架,RAG 是其最核心的应用模式
- 学习价值: ⭐⭐⭐
- 涉及领域: [RAG, Prompt Engineering, Embedding, Document Loading, Retrieval QA]
- 对应 JD 能力: “请介绍 LangChain 里实现 RAG 的几种方式”、“如何搭建一个多轮对话的 RAG 系统”
- 推荐理由: 行业事实标准,几乎每个 RAG 相关的 JD 都会提到 LangChain
- 学习路径建议: 官方文档 →
tutorials/rag.ipynb→ 源码阅读chains/retrieval_qa→ 动手搭一个带 memory 的 RAG chatbot
2. LlamaIndex
- 链接: https://github.com/run-llama/llama_index
- 一句话: 专注数据索引和检索的框架,对高级 RAG 策略支持极好
- 学习价值: ⭐⭐⭐
- 涉及领域: [RAG, Indexing, Chunking, Router, Query Engine]
- 对应 JD 能力: “LlamaIndex 的索引类型有哪些?各适用什么场景”、“SentenceWindow 和 AutoMerging 检索的原理”
- 推荐理由: RAG 专项深度远超 LangChain,高级 RAG 策略都是 LlamaIndex 首创
- 学习路径建议: 官方文档 “Understanding LlamaIndex” → 看
examples/advanced/→ 跑 “RAG with Router Query Engine”
3. Chroma
- 链接: https://github.com/chroma-core/chroma
- 一句话: 轻量级、开发友好的开源向量数据库,仅 4 个核心 API 方法
- 学习价值: ⭐⭐
- 涉及领域: [Vector DB, Embedding, Metadata Filtering]
- 对应 JD 能力: “向量数据库和传统数据库的区别”、“Embedding 的存储和检索原理”
- 推荐理由: 代码量极小(~10k LOC),是学习向量数据库内部原理的最佳教材
- 学习路径建议: Quickstart → 读源码
chromadb/api/→ 理解 Segment API 和 EmbeddingFunction 接口
4. Qdrant
- 链接: https://github.com/qdrant/qdrant
- 一句话: 用 Rust 写的生产级高性能向量数据库,支持过滤、分组、multivector
- 学习价值: ⭐⭐
- 涉及领域: [Vector DB, Hybrid Search, Filtering, Production Deployment]
- 对应 JD 能力: “向量数据库的选型对比”、“生产环境向量数据库的部署和扩展”
- 推荐理由: Rust 写的高性能标杆,理解它的架构=理解现代向量搜索引擎
- 学习路径建议: Quickstart → REST API 文档 → 理解 collection/payload/index 模型
5. RAGFlow
- 链接: https://github.com/infiniflow/ragflow
- 一句话: 基于深度文档理解的开源 RAG 引擎,中文文档处理能力突出
- 学习价值: ⭐⭐⭐
- 涉及领域: [RAG, Document Parsing, OCR, Layout Analysis, Chinese NLP]
- 对应 JD 能力: “中文 RAG 系统设计的难点和方案”、“企业级 RAG 系统的架构设计”
- 推荐理由: 中文社区最优秀的 RAG 开源项目之一
- 学习路径建议: 部署体验 → 理解 Document Parser 流水线 → 看
deepdoc/目录
6. RAG Survey 论文
- 链接: https://arxiv.org/abs/2312.10997 (Gao et al., 2023)
- 一句话: RAG 领域最全面的综述,系统梳理 Naive RAG → Advanced RAG → Modular RAG 演进
- 学习价值: ⭐⭐⭐
- 涉及领域: [RAG Survey, Evaluation, Benchmark]
- 对应 JD 能力: “RAG 的最新发展趋势”、“RAG 的主要挑战和解决方案”
- 推荐理由: 一字不差读完=面试 RAG 相关问题的 80% 基础
- 学习路径建议: 先读 Abstract+Introduction → 理解 RAG 三阶段分类
7. Self-RAG 论文
- 链接: https://arxiv.org/abs/2310.11511 (Asai et al., 2023)
- 一句话: 让 LLM 自己决定”是否需要检索”以及”检索结果是否可信”
- 学习价值: ⭐⭐⭐
- 涉及领域: [Self-RAG, Reflection, Critique, Active Retrieval]
- 对应 JD 能力: “RAG 中检索频率如何控制”、“如何减少 RAG 中的幻觉”
- 推荐理由: 改变了 RAG 范式——从”每次都检索”变成”按需检索”
- 学习路径建议: 从 Intro+Method 开始 → 理解 Reflection Token 概念
8. Corrective RAG (CRAG)
- 链接: https://arxiv.org/abs/2401.15884 (Yan et al., 2024)
- 一句话: 给检索结果加”质量分”,把 RAG 变成有退路的多路系统
- 学习价值: ⭐⭐
- 涉及领域: [CRAG, Retrieval Evaluation, Web Search, Robustness]
- 对应 JD 能力: “RAG 系统面对低质量检索如何兜底”、“多源检索的融合策略”
- 推荐理由: 把 RAG 从线性流水线变成有分支决策的智能系统
- 学习路径建议: 看 Figure 2 (CRAG 架构图)
学习顺序建议(PM 视角)
第1阶段:理解概念(2-3天) ① RAG Survey 论文 → ② 部署 RAGFlow 体验
第2阶段:深入架构(1周) ③ LlamaIndex 文档 → ④ Self-RAG 论文 → ⑤ 对比 LangChain/LlamaIndex
第3阶段:建立判断力(持续) ⑥ Chroma 源码 → ⑦ CRAG 论文 → ⑧ Haystack Pipeline
COMMUNITY DISCUSSION
评论
使用 GitHub 账号登录后参与讨论,评论会同步到 GitHub Discussions。