多模态AI 知识地图
模块知识结构与学习路径 | 25 篇文档
该模块暂无知识地图
文档索引
CLIP与对比视觉语言预训练 从InfoNCE到Sigmoid损失,深入理解CLIP和SigLIP的对比学习机制
从CLIP到BLIP-2:Q-Former模态桥接 理解Q-Former如何作为可训练瓶颈连接冻结视觉编码器和冻结LLM
Chameleon与早期融合Token统一模型 理解VQ-VAE图像分词器和共享词表的早期融合多模态架构
ColPali与视觉原生文档RAG 理解ColPali如何跳过OCR直接嵌入页面图像实现视觉原生检索
Emu3:下一token预测用于图像和视频生成 理解Emu3如何仅用下一token预测在图像生成上击败扩散模型
Flamingo与门控交叉注意力 理解Flamingo如何通过门控交叉注意力实现少样本多模态推理
InternVL3:原生多模态预训练 理解InternVL3如何通过原生预训练消除后置对齐债务
Janus-Pro:解耦编码器统一多模态模型 理解Janus-Pro如何通过解耦视觉编码器同时优化理解和生成
LLaVA-OneVision:单图像、多图像、视频统一模型 理解LLaVA-OneVision如何通过统一token预算和课程训练实现三场景统一
LLaVA与视觉指令微调 理解LLaVA如何用简单MLP投影器和GPT-4生成指令数据实现VLM
MIO与任意到任意流式多模态模型 理解MIO如何通过四种分词器和一个Transformer实现任意模态间的流式转换
Show-o与离散扩散统一模型 理解Show-o如何用掩码离散扩散实现并行图像生成
Qwen-VL家族与动态FPS视频 理解Qwen-VL家族的M-RoPE、动态FPS采样和结构化Agent输出
Transfusion:自回归文本+扩散图像统一Transformer 理解Transfusion如何在单一Transformer中同时运行NTP和扩散两种损失
Vision Transformer与Patch-Token原语 深入理解ViT的Patch-Token流水线,从图像到序列token的完整转换过程
任意分辨率视觉:Patch-n-Pack与NaFlex 理解如何处理可变分辨率图像,从NaViT打包到AnyRes平铺和M-RoPE
全能模型:Qwen2.5-Omni与Thinker-Talker分离架构 理解Thinker-Talker分离架构如何实现流式实时语音对话
具身VLA:RT-2、OpenVLA、pi0与GR00T 理解视觉-语言-动作模型的演进,从离散动作token到流匹配动作专家
多模态RAG与跨模态检索 理解跨文本、图像、音频和视频的多模态RAG检索融合与生成接地
多模态Agent与计算机使用 理解GUI接地、动作schema和多模态Agent循环的端到端计算机使用架构
开源VLM方案:什么真正重要 从MM1、Idefics2、Cambrian-1等消融实验中提炼VLM设计的关键决策
文档与图表理解 理解文档AI的三代演进:OCR管道、无OCR模型和VLM原生方案
视频语言模型:时间Token与定位 理解视频VLM的时间编码方案、帧采样策略和时间定位输出格式
百万Token上下文下的长视频理解 理解暴力上下文、环形注意力和Agent检索三种长视频扩展路径
音频语言模型:从Whisper到Audio Flamingo 3 理解从语音识别到音频推理的演进路径,包括log-Mel频谱图和音频Q-Former