多模态AI
视觉-语言·音频-文本·跨模态
- 001 中级 CLIP与对比视觉语言预训练 从InfoNCE到Sigmoid损失,深入理解CLIP和SigLIP的对比学习机制
- 002 中级 从CLIP到BLIP-2:Q-Former模态桥接 理解Q-Former如何作为可训练瓶颈连接冻结视觉编码器和冻结LLM
- 003 进阶 Chameleon与早期融合Token统一模型 理解VQ-VAE图像分词器和共享词表的早期融合多模态架构
- 004 中级 ColPali与视觉原生文档RAG 理解ColPali如何跳过OCR直接嵌入页面图像实现视觉原生检索
- 005 进阶 Emu3:下一token预测用于图像和视频生成 理解Emu3如何仅用下一token预测在图像生成上击败扩散模型
- 006 进阶 Flamingo与门控交叉注意力 理解Flamingo如何通过门控交叉注意力实现少样本多模态推理
- 007 进阶 InternVL3:原生多模态预训练 理解InternVL3如何通过原生预训练消除后置对齐债务
- 008 进阶 Janus-Pro:解耦编码器统一多模态模型 理解Janus-Pro如何通过解耦视觉编码器同时优化理解和生成
- 009 进阶 LLaVA-OneVision:单图像、多图像、视频统一模型 理解LLaVA-OneVision如何通过统一token预算和课程训练实现三场景统一
- 010 中级 LLaVA与视觉指令微调 理解LLaVA如何用简单MLP投影器和GPT-4生成指令数据实现VLM
- 011 进阶 MIO与任意到任意流式多模态模型 理解MIO如何通过四种分词器和一个Transformer实现任意模态间的流式转换
- 012 进阶 Show-o与离散扩散统一模型 理解Show-o如何用掩码离散扩散实现并行图像生成
- 013 进阶 Qwen-VL家族与动态FPS视频 理解Qwen-VL家族的M-RoPE、动态FPS采样和结构化Agent输出
- 014 进阶 Transfusion:自回归文本+扩散图像统一Transformer 理解Transfusion如何在单一Transformer中同时运行NTP和扩散两种损失
- 015 中级 Vision Transformer与Patch-Token原语 深入理解ViT的Patch-Token流水线,从图像到序列token的完整转换过程
- 016 中级 任意分辨率视觉:Patch-n-Pack与NaFlex 理解如何处理可变分辨率图像,从NaViT打包到AnyRes平铺和M-RoPE
- 017 进阶 全能模型:Qwen2.5-Omni与Thinker-Talker分离架构 理解Thinker-Talker分离架构如何实现流式实时语音对话
- 018 进阶 具身VLA:RT-2、OpenVLA、pi0与GR00T 理解视觉-语言-动作模型的演进,从离散动作token到流匹配动作专家
- 019 中级 多模态RAG与跨模态检索 理解跨文本、图像、音频和视频的多模态RAG检索融合与生成接地
- 020 进阶 多模态Agent与计算机使用 理解GUI接地、动作schema和多模态Agent循环的端到端计算机使用架构
- 021 中级 开源VLM方案:什么真正重要 从MM1、Idefics2、Cambrian-1等消融实验中提炼VLM设计的关键决策
- 022 中级 文档与图表理解 理解文档AI的三代演进:OCR管道、无OCR模型和VLM原生方案
- 023 中级 视频语言模型:时间Token与定位 理解视频VLM的时间编码方案、帧采样策略和时间定位输出格式
- 024 进阶 百万Token上下文下的长视频理解 理解暴力上下文、环形注意力和Agent检索三种长视频扩展路径
- 025 中级 音频语言模型:从Whisper到Audio Flamingo 3 理解从语音识别到音频推理的演进路径,包括log-Mel频谱图和音频Q-Former