从「CV 用 CNN、NLP 用 Transformer」的两套范式,到「一个 Transformer 统一视觉与语言」。本模块讲清统一架构如何把图像变成「视觉 Token」,让大语言模型直接「看懂」图片。
ViT 证明了 纯 Transformer 能做视觉,CLIP 打通了图文对齐,而 BLIP / BLIP-2 / LLaVA 进一步把视觉编码器 + 连接器 + 大语言模型拼成一个能看图说话的统一系统。
过去视觉靠卷积网络(CNN)、语言靠 Transformer。统一的关键一步,是把图像「切格子 + 拉平 + 投影」成一串和文字词元同构的向量序列,让同一套注意力机制通吃两种输入。
ViT 把图片切成固定大小的方块(patch),线性投影成向量,再加位置编码——得到一串「视觉 Token」。
视觉 Token 与文本 Token 进入同一个 Transformer,靠自注意力捕捉长程依赖,模态差异被「对齐」抹平。
文本经分词(BPE / WordPiece)变成词元向量——天然就是 Transformer 的原生输入格式。
以 LLaVA、BLIP-2 为代表的现代视觉-语言大模型,几乎都是「组件拼接」思路:冻结预训练好的视觉编码器和语言模型,只训练中间负责对齐的连接器。
「翻译官」怎么做,决定了模型的体量、成本和效果。三种主流连接器各有取舍。
| 连接器 | 代表模型 | 机制 | 特点 | 代价 |
|---|---|---|---|---|
| 线性投影 / MLP | LLaVA | 一个线性层 / 两层 MLP 直接投影 | 最轻量、实现简单、训练快 | 视觉信息保留较粗 |
| Q-Former | BLIP-2 | 32 个可学习 query 向量查询图像特征 | 压缩视觉信息、对接冻结 LLM 更稳 | 结构更重、训练目标更复杂 |
| 交叉注意力 | Flamingo | 在 LLM 层间插入 cross-attention 门控 | 图文深度融合、上下文学习强 | 改动 LLM 内部、训练成本高 |
四集围绕同一主线层层递进:为什么 Transformer 能统一 → 统一架构怎么搭 → 代表模型怎么落地。以下为基于课程结构与实拍画面核对的导航性要点。
破题:从「CV 用 CNN、NLP 用 Transformer」讲起,引出统一动机——为什么需要一个能同时处理视觉与语言的模型。
BV11v4y1k7zn · cid 1278015822架构对照:实拍画面显示讲师在 ViT 架构图旁逐层比对 NLP Transformer 编码器,讲清视觉与语言两条支路如何汇入同一骨架。
BV11v4y1k7zn · cid 1278018427 · 画面已实证对齐机制:视觉编码器 + 连接器 + LLM 的三段式如何协同,视觉 Token 如何被投影进语言空间。
BV11v4y1k7zn · cid 1278026854落地与演进:代表模型(BLIP / BLIP-2 / LLaVA 一脉)的训练范式、冻结策略与统一趋势,为后续 SAM / GLIP / Stable Diffusion 模块铺垫。
BV11v4y1k7zn · cid 1278026900统一不是一步到位,而是三条技术线索逐步汇合的结果。
图像切 patch + 线性投影 + 位置编码,全程无 CNN,证明 Transformer 骨架可迁移到视觉。
4 亿图文对对比学习,图像与文本编码到共享语义空间,打通模态语义。
ViT + BERT + 因果解码器统一建模,配合字幕自举(bootstrapping)提升数据质量。
冻结视觉编码器与 LLM,只训练 Q-Former / 线性投影,视觉指令微调让模型真正「看图对话」。
前两模块(ViT、CLIP)打地基,本模块把二者合流;后续 SAM、GLIP、Stable Diffusion 都建立在这一统一架构之上。