这篇适合谁读
这篇适合正在把 AI 产品、Agent、RAG、评估和部署能力整理成项目作品集的人阅读。它更像一份公开学习索引,帮助你快速判断某个方向为什么值得学、应该看哪些项目、最后能沉淀成什么能力。
对应 JD 能力:模型能力边界、成本/质量/速度取舍、模型选型
1. vLLM
- 链接: https://github.com/vllm-project/vllm
- 一句话: 最流行的开源 LLM 推理引擎,PagedAttention + Continuous Batching
- 学习价值: ⭐⭐⭐
- 涉及领域: [Model Serving, LLM Inference, GPU Optimization]
- 对应 JD 能力: “模型推理耗时受哪些因素影响?如何进行服务化部署?”
- 推荐理由: 业界主流 LLM serving 框架,几乎所有 C 端 AI 产品对标 vLLM
- 学习路径建议: PagedAttention 论文摘要 → 实操部署 7B 模型
2. Ollama
- 链接: https://github.com/ollama/ollama
- 一句话: 一键本地运行开源模型的桌面/命令行工具
- 学习价值: ⭐⭐⭐
- 涉及领域: [Model Serving, Local Deployment, Quantization]
- 对应 JD 能力: “开源模型本地跑通需要什么配置?不同参数量的实际影响?”
- 推荐理由: PM 体验开源模型的最快路径
- 学习路径建议: 下载安装 → 跑
ollama run llama3.2:3b和1b对比
3. LM Studio
- 链接: https://lmstudio.ai/
- 一句话: 带 GUI 的本地 LLM 运行工具,内置聊天和 API 服务器
- 学习价值: ⭐⭐
- 涉及领域: [Model Serving, Local Deployment, Product UX]
- 对应 JD 能力: “C 端产品模型加载体验应该怎么设计?”
- 推荐理由: PM 视角最值得体验的工具——本身就是产品案例
- 学习路径建议: 下载安装 → 搜模型运行 → 体验 API server 功能
4. llama.cpp
- 链接: https://github.com/ggerganov/llama.cpp
- 一句话: 纯 C/C++ LLM 推理引擎,定义 GGUF 量化格式标准
- 学习价值: ⭐⭐⭐
- 涉及领域: [Model Serving, Quantization, CPU Inference, Edge Deployment]
- 对应 JD 能力: “模型量化怎么做的?影响有多大?GGUF 和 safetensors 区别?”
- 推荐理由: 理解量化级别(Q2-Q8)就能和工程师同频道讨论 trade-off
- 学习路径建议: 理解 GGUF → 看量化级别含义 → 自己量化对比
5. Chatbot Arena (LMSYS)
- 链接: https://lmarena.ai/
- 一句话: 最大 LLM 盲测竞技场,ELO 排名反映真实人类偏好
- 学习价值: ⭐⭐⭐
- 涉及领域: [Model Evaluation, Benchmarking, Model Selection, Human Preference]
- 对应 JD 能力: “怎么看一个模型好不好?GPT-4o 和开源模型差距多大?”
- 推荐理由: PM 选型的第一手参考
- 学习路径建议: 盲测几轮 → 按类别看排行榜
6. OpenRouter
- 链接: https://openrouter.ai/
- 一句话: 聚合 200+ 模型的 API 市场,统一接口、实时价格和延迟数据
- 学习价值: ⭐⭐⭐
- 涉及领域: [Model Selection, Cost Optimization, API Pricing]
- 对应 JD 能力: “不同模型的 API 价格怎么对比?如何做 cost/latency/quality 路由?”
- 推荐理由: PM 的模型选型工具箱
- 学习路径建议: 浏览模型目录按价格排序 → 对比 GPT-4o-mini vs 开源 8B
7. Artificial Analysis
- 链接: https://artificialanalysis.ai/
- 一句话: 独立第三方模型性能基准平台,可视化对比各提供商
- 学习价值: ⭐⭐⭐
- 涉及领域: [Model Evaluation, Benchmarking, Cost Analysis]
- 对应 JD 能力: “选哪个云厂商性价比最高?同一模型不同厂商速度差多少?”
- 推荐理由: 比 OpenRouter 更深——实测每家厂商推理速度
- 学习路径建议: 看质量 vs 价格散点图 → 对比不同厂商 throughput
8. Speculative Decoding
- 链接: https://arxiv.org/abs/2211.17192
- 一句话: 小模型”打草稿”、大模型”验证”,无损质量 2-3x 提速
- 学习价值: ⭐⭐⭐
- 涉及领域: [Inference Optimization, Latency Reduction, Product UX]
- 对应 JD 能力: “有哪些无损加速推理的方法?对产品体验意味着什么?”
- 推荐理由: 最有落地价值的推理优化技术,Copilot/Cursor 已在用
- 学习路径建议: 理解”草稿-验证”核心思想 → 思考 latency 从 2s 到 800ms 用户行为变化
9. TensorRT-LLM
- 链接: https://github.com/NVIDIA/TensorRT-LLM
- 一句话: NVIDIA 官方 LLM 推理优化框架,FP8/INT4 量化极致性能
- 学习价值: ⭐⭐⭐
- 涉及领域: [Model Serving, GPU Optimization, Quantization]
- 对应 JD 能力: “怎样极致压榨 GPU 性能?FP8/INT4 的加速比?”
- 推荐理由: 代表推理性能天花板
- 学习路径建议: 读架构概述 → 对比 TRT-LLM vs vLLM benchmark
学习顺序建议
第1阶段(1-2天):建立体感 Ollama(跑 1B/3B/7B 感受规模差异)→ LM Studio(好 UX)→ Chatbot Arena(质量手感)
第2阶段(1周):选型能力 OpenRouter(定价地图)→ Artificial Analysis(厂商对比)→ HF Leaderboard(benchmark)
第3阶段(1-2周):技术深度 vLLM(推理引擎原理)→ llama.cpp(量化 Q2-Q8)→ TensorRT-LLM(性能上限)
第4阶段(持续):前沿洞察 Speculative Decoding → Knowledge Distillation(模型矩阵逻辑)
COMMUNITY DISCUSSION
评论
使用 GitHub 账号登录后参与讨论,评论会同步到 GitHub Discussions。