这篇适合谁读
这篇适合正在把 AI 产品、Agent、RAG、评估和部署能力整理成项目作品集的人阅读。它更像一份公开学习索引,帮助你快速判断某个方向为什么值得学、应该看哪些项目、最后能沉淀成什么能力。
对应 JD 能力:多模态理解、Vision/Audio 产品设计、图文交互
1. LLaVA
- 链接: https://github.com/haotian-liu/LLaVA
- 一句话: 最流行的开源多模态图文理解模型,视觉指令微调实现接近 GPT-4V
- 学习价值: ⭐⭐⭐
- 涉及领域: [Vision, Multi-modal LLM, Instruction Tuning]
- 对应 JD 能力: “什么是视觉指令微调?多模态模型训练流程?”
- 推荐理由: 架构简单清晰,理解多模态模型的”Hello World”
- 学习路径建议: 先读论文 → 看架构图 → 跑 Gradio demo
2. CLIP (OpenAI)
- 链接: https://github.com/openai/CLIP
- 一句话: 图文对比学习模型,理解图片和文字的语义匹配
- 学习价值: ⭐⭐⭐
- 涉及领域: [Vision, Multi-modal Representation Learning, Zero-shot]
- 对应 JD 能力: “什么是图文对比学习?Zero-shot 分类如何实现?”
- 推荐理由: 多模态领域的基石
- 学习路径建议: 看 OpenAI 博客 → 理解 contrastive loss → 体验 zero-shot demo
3. Whisper (OpenAI)
- 链接: https://github.com/openai/whisper
- 一句话: 通用语音识别模型,支持多语言转写和翻译
- 学习价值: ⭐⭐⭐
- 涉及领域: [Audio, Speech Recognition, Speech Translation]
- 对应 JD 能力: “语音产品技术选型要考虑什么?”
- 推荐理由: 语音是多模态重要模态,Whisper 是行业标杆
- 学习路径建议:
pip install openai-whisper跑 demo
4. SAM / SAM 2 (Meta)
- 链接: https://github.com/facebookresearch/segment-anything
- 一句话: 通用图像分割模型,通过点/框/文字提示分割任意物体
- 学习价值: ⭐⭐⭐
- 涉及领域: [Vision, Image Segmentation, Prompt-based Vision]
- 对应 JD 能力: “产品中如何做一键抠图或智能编辑?”
- 推荐理由: 展示”视觉版 ChatGPT”的可能性
- 学习路径建议: 玩在线 demo → 理解三个核心组件
5. GPT-4o / GPT-4V (OpenAI)
- 链接: https://platform.openai.com/docs/guides/vision
- 一句话: 全模态原生模型,支持文本/图像/音频输入输出
- 学习价值: ⭐⭐⭐
- 涉及领域: [Vision, Audio, Multi-modal LLM, Real-time Voice]
- 对应 JD 能力: “多模态模型产品化要考虑哪些问题?语音交互怎么设计?”
- 推荐理由: 代表多模态产品的最高水准
- 学习路径建议: 体验 ChatGPT 多模态 → 读技术报告 → Vision API 文档
6. Google Gemini
- 链接: https://deepmind.google/technologies/gemini/
- 一句话: Google 原生多模态模型,从训练起融合文本/图像/音频/视频
- 学习价值: ⭐⭐
- 涉及领域: [Vision, Audio, Video, Multi-modal LLM]
- 对应 JD 能力: “原生多模态是什么意思?和 GPT-4o 差异?”
- 推荐理由: “从一开始就多模态”的理念
- 学习路径建议: 读技术报告(多模态预训练部分)→ 对比 GPT-4o
7. Apple Intelligence 多模态
- 链接: https://developer.apple.com/apple-intelligence/
- 一句话: Apple 设备端多模态 AI,覆盖图像/文本/语音/屏幕内容
- 学习价值: ⭐⭐
- 涉及领域: [Vision, Audio, On-device AI, Multi-modal Interaction]
- 对应 JD 能力: “设备端 vs 云端多模态各有什么优劣?隐私保护怎么做?”
- 推荐理由: 消费电子多模态落地范式——本地化、隐私优先
- 学习路径建议: 看 WWDC Apple Intelligence 介绍视频
8. HF 多模态模型排行榜
- 链接: https://huggingface.co/models?pipeline_tag=image-to-text&sort=trending
- 一句话: HuggingFace 汇聚了几乎所有主流多模态模型
- 学习价值: ⭐⭐⭐
- 涉及领域: [Vision, Audio, Multi-modal LLM, Model Evaluation]
- 对应 JD 能力: “如何评估和对比不同多模态模型?”
- 推荐理由: 学习多模态的”实验基地”
- 学习路径建议: 浏览 Trending → 用 Space 体验 3-5 个模型
9. 多模态 RAG (LlamaIndex)
- 链接: https://docs.llamaindex.ai/en/stable/examples/multi_modal/
- 一句话: 图文混合的检索增强生成系统
- 学习价值: ⭐⭐
- 涉及领域: [Multi-modal RAG, Document Understanding, Retrieval]
- 对应 JD 能力: “如何同时检索文本和图片?”
- 推荐理由: 企业落地多模态最热门的方向
- 学习路径建议: 理解三大策略(Text-only/Vision/Hybrid)→ 跑 demo
学习顺序建议
第1-2周:CLIP → LLaVA → GPT-4o/Gemini(建立基础认知) 第3-4周:Whisper → SAM → HF 排行榜(扩展模态) 第5-6周:多模态 RAG → Apple Intelligence(产品落地)
COMMUNITY DISCUSSION
评论
使用 GitHub 账号登录后参与讨论,评论会同步到 GitHub Discussions。