跳到正文
世傲命的技术观测站 PERSONAL TECHNOLOGY OBSERVATORY
学习 AI 产品路线 2026-06

AI 产品路线

模型部署与选型 — 值得学习的项目与资源

---

来源:wiki/courses/ai-product-roadmap/project-network/deployment-projects.md

这篇适合谁读

这篇适合正在把 AI 产品、Agent、RAG、评估和部署能力整理成项目作品集的人阅读。它更像一份公开学习索引,帮助你快速判断某个方向为什么值得学、应该看哪些项目、最后能沉淀成什么能力。

对应 JD 能力:模型能力边界、成本/质量/速度取舍、模型选型


1. vLLM

  • 链接: https://github.com/vllm-project/vllm
  • 一句话: 最流行的开源 LLM 推理引擎,PagedAttention + Continuous Batching
  • 学习价值: ⭐⭐⭐
  • 涉及领域: [Model Serving, LLM Inference, GPU Optimization]
  • 对应 JD 能力: “模型推理耗时受哪些因素影响?如何进行服务化部署?”
  • 推荐理由: 业界主流 LLM serving 框架,几乎所有 C 端 AI 产品对标 vLLM
  • 学习路径建议: PagedAttention 论文摘要 → 实操部署 7B 模型

2. Ollama

  • 链接: https://github.com/ollama/ollama
  • 一句话: 一键本地运行开源模型的桌面/命令行工具
  • 学习价值: ⭐⭐⭐
  • 涉及领域: [Model Serving, Local Deployment, Quantization]
  • 对应 JD 能力: “开源模型本地跑通需要什么配置?不同参数量的实际影响?”
  • 推荐理由: PM 体验开源模型的最快路径
  • 学习路径建议: 下载安装 → 跑 ollama run llama3.2:3b1b 对比

3. LM Studio

  • 链接: https://lmstudio.ai/
  • 一句话: 带 GUI 的本地 LLM 运行工具,内置聊天和 API 服务器
  • 学习价值: ⭐⭐
  • 涉及领域: [Model Serving, Local Deployment, Product UX]
  • 对应 JD 能力: “C 端产品模型加载体验应该怎么设计?”
  • 推荐理由: PM 视角最值得体验的工具——本身就是产品案例
  • 学习路径建议: 下载安装 → 搜模型运行 → 体验 API server 功能

4. llama.cpp

  • 链接: https://github.com/ggerganov/llama.cpp
  • 一句话: 纯 C/C++ LLM 推理引擎,定义 GGUF 量化格式标准
  • 学习价值: ⭐⭐⭐
  • 涉及领域: [Model Serving, Quantization, CPU Inference, Edge Deployment]
  • 对应 JD 能力: “模型量化怎么做的?影响有多大?GGUF 和 safetensors 区别?”
  • 推荐理由: 理解量化级别(Q2-Q8)就能和工程师同频道讨论 trade-off
  • 学习路径建议: 理解 GGUF → 看量化级别含义 → 自己量化对比

5. Chatbot Arena (LMSYS)

  • 链接: https://lmarena.ai/
  • 一句话: 最大 LLM 盲测竞技场,ELO 排名反映真实人类偏好
  • 学习价值: ⭐⭐⭐
  • 涉及领域: [Model Evaluation, Benchmarking, Model Selection, Human Preference]
  • 对应 JD 能力: “怎么看一个模型好不好?GPT-4o 和开源模型差距多大?”
  • 推荐理由: PM 选型的第一手参考
  • 学习路径建议: 盲测几轮 → 按类别看排行榜

6. OpenRouter

  • 链接: https://openrouter.ai/
  • 一句话: 聚合 200+ 模型的 API 市场,统一接口、实时价格和延迟数据
  • 学习价值: ⭐⭐⭐
  • 涉及领域: [Model Selection, Cost Optimization, API Pricing]
  • 对应 JD 能力: “不同模型的 API 价格怎么对比?如何做 cost/latency/quality 路由?”
  • 推荐理由: PM 的模型选型工具箱
  • 学习路径建议: 浏览模型目录按价格排序 → 对比 GPT-4o-mini vs 开源 8B

7. Artificial Analysis

  • 链接: https://artificialanalysis.ai/
  • 一句话: 独立第三方模型性能基准平台,可视化对比各提供商
  • 学习价值: ⭐⭐⭐
  • 涉及领域: [Model Evaluation, Benchmarking, Cost Analysis]
  • 对应 JD 能力: “选哪个云厂商性价比最高?同一模型不同厂商速度差多少?”
  • 推荐理由: 比 OpenRouter 更深——实测每家厂商推理速度
  • 学习路径建议: 看质量 vs 价格散点图 → 对比不同厂商 throughput

8. Speculative Decoding

  • 链接: https://arxiv.org/abs/2211.17192
  • 一句话: 小模型”打草稿”、大模型”验证”,无损质量 2-3x 提速
  • 学习价值: ⭐⭐⭐
  • 涉及领域: [Inference Optimization, Latency Reduction, Product UX]
  • 对应 JD 能力: “有哪些无损加速推理的方法?对产品体验意味着什么?”
  • 推荐理由: 最有落地价值的推理优化技术,Copilot/Cursor 已在用
  • 学习路径建议: 理解”草稿-验证”核心思想 → 思考 latency 从 2s 到 800ms 用户行为变化

9. TensorRT-LLM

  • 链接: https://github.com/NVIDIA/TensorRT-LLM
  • 一句话: NVIDIA 官方 LLM 推理优化框架,FP8/INT4 量化极致性能
  • 学习价值: ⭐⭐⭐
  • 涉及领域: [Model Serving, GPU Optimization, Quantization]
  • 对应 JD 能力: “怎样极致压榨 GPU 性能?FP8/INT4 的加速比?”
  • 推荐理由: 代表推理性能天花板
  • 学习路径建议: 读架构概述 → 对比 TRT-LLM vs vLLM benchmark

学习顺序建议

第1阶段(1-2天):建立体感 Ollama(跑 1B/3B/7B 感受规模差异)→ LM Studio(好 UX)→ Chatbot Arena(质量手感)

第2阶段(1周):选型能力 OpenRouter(定价地图)→ Artificial Analysis(厂商对比)→ HF Leaderboard(benchmark)

第3阶段(1-2周):技术深度 vLLM(推理引擎原理)→ llama.cpp(量化 Q2-Q8)→ TensorRT-LLM(性能上限)

第4阶段(持续):前沿洞察 Speculative Decoding → Knowledge Distillation(模型矩阵逻辑)

继续探索

展开学习路线

学习路线

AI 产品路线

04 / 11
查看完整路线
  1. 01Agent 系统:值得学习的项目与资源
  2. 02AI 产品设计模式:值得学习的产品案例
  3. 03AI Product Engineer:12 周求职学习路线图
  4. 04模型部署与选型 — 值得学习的项目与资源当前
  5. 05评估与安全 — 值得学习的项目与资源
  6. 06AI 记忆系统 — 值得学习的项目与资源
  7. 07多模态 — 值得学习的项目与资源
  8. 08AI Product Engineer:项目学习路线网
  9. 09Prompt Engineering — 值得学习的项目与资源
  10. 10RAG(检索增强生成)— 值得学习的项目与资源
  11. 11Tool Calling / Function Calling — 值得学习的项目与资源
  • #模型部署
  • #学习资源
  • #选型
  • #推理优化
  • #AI 产品

COMMUNITY DISCUSSION

评论

使用 GitHub 账号登录后参与讨论,评论会同步到 GitHub Discussions。