MODULE 03 · 第 9–12 集

多模态大模型
一统 NLP 和 CV

从「CV 用 CNN、NLP 用 Transformer」的两套范式,到「一个 Transformer 统一视觉与语言」。本模块讲清统一架构如何把图像变成「视觉 Token」,让大语言模型直接「看懂」图片。

核心命题

ViT 证明了 纯 Transformer 能做视觉,CLIP 打通了图文对齐,而 BLIP / BLIP-2 / LLaVA 进一步把视觉编码器 + 连接器 + 大语言模型拼成一个能看图说话的统一系统。

4本模块集数(9–12)
3统一架构三大件
2被统一的范式:CV + NLP
降级说明:本模块 4 集在 B 站均确认存在官方 AI 中文字幕,但本次会话字幕正文导出通道(页面直抓 / CDN / 脚本)全部超时或不可用。本导航以已实证的课程分集结构 + 第 10 集实拍画面 + 权威公开资料交叉核对合成,技术内容与课程主题严格对应。

本页导览

① 统一范式 CV 与 NLP 如何汇入同一 Transformer
② 三段式 眼睛 / 翻译 / 大脑的分工
③ 连接器 线性投影 vs Q-Former vs 交叉注意力
④ 分集导航 9–12 集逐集要点
⑤ 演进 从 ViT 到 LLaVA 的时间线
TransformerViTCLIP BLIPBLIP-2LLaVA 视觉 TokenQ-Former
01 / 统一范式

一个 Transformer,两种模态

过去视觉靠卷积网络(CNN)、语言靠 Transformer。统一的关键一步,是把图像「切格子 + 拉平 + 投影」成一串和文字词元同构的向量序列,让同一套注意力机制通吃两种输入。

CV 侧 · 视觉

图像 → Patch 序列

ViT 把图片切成固定大小的方块(patch),线性投影成向量,再加位置编码——得到一串「视觉 Token」。

→视觉 Token 化
统一 · Transformer

同一套注意力

视觉 Token 与文本 Token 进入同一个 Transformer,靠自注意力捕捉长程依赖,模态差异被「对齐」抹平。

←文本 Token 化
NLP 侧 · 语言

文本 → 词元序列

文本经分词(BPE / WordPiece)变成词元向量——天然就是 Transformer 的原生输入格式。

统一前提:输入都表示为向量序列
统一引擎:自注意力 Self-Attention
统一结果:一个骨架做多模态任务
课程实证:第 10 集画面即「ViT ↔ NLP Transformer」对照讲解
02 / 三段式架构

眼睛 · 翻译 · 大脑

以 LLaVA、BLIP-2 为代表的现代视觉-语言大模型,几乎都是「组件拼接」思路:冻结预训练好的视觉编码器和语言模型,只训练中间负责对齐的连接器。

👁

视觉编码器

「眼睛」 · 通常是 CLIP-ViT
  • 把原始像素编码成视觉特征向量 Zv
  • 常用 CLIP ViT-L/14 或 SigLIP 变体
  • 提取形状、颜色、语义等视觉信息
  • 通常冻结,不参与微调
⚡

连接器

「翻译」 · 唯一负责对齐
  • 把视觉特征 Zv 投影成「视觉 Token」Hv
  • 让 Hv 维度与 LLM 词表空间一致
  • LLaVA 用线性投影,BLIP-2 用 Q-Former
  • 这是唯一训练的轻量部件
🧠

大语言模型

「大脑」 · 如 Llama / Vicuna
  • 接收视觉 Token + 文本指令
  • 用注意力计算两者的逻辑联系
  • 像处理文本一样「看图说话」
  • 输出答案、描述、推理结果
03 / 连接器对比

三种「对齐」方案

「翻译官」怎么做,决定了模型的体量、成本和效果。三种主流连接器各有取舍。

连接器代表模型机制特点代价
线性投影 / MLP LLaVA 一个线性层 / 两层 MLP 直接投影 最轻量、实现简单、训练快 视觉信息保留较粗
Q-Former BLIP-2 32 个可学习 query 向量查询图像特征 压缩视觉信息、对接冻结 LLM 更稳 结构更重、训练目标更复杂
交叉注意力 Flamingo 在 LLM 层间插入 cross-attention 门控 图文深度融合、上下文学习强 改动 LLM 内部、训练成本高
04 / 分集导航

第 9 – 12 集逐集要点

四集围绕同一主线层层递进:为什么 Transformer 能统一 → 统一架构怎么搭 → 代表模型怎么落地。以下为基于课程结构与实拍画面核对的导航性要点。

EP · 09

多模态大模型一统 NLP 和 CV · 01

时长 13:19 · 对应选集第 9 集

破题:从「CV 用 CNN、NLP 用 Transformer」讲起,引出统一动机——为什么需要一个能同时处理视觉与语言的模型。

BV11v4y1k7zn · cid 1278015822
EP · 10

多模态大模型一统 NLP 和 CV · 02

时长 16:52 · 对应选集第 10 集

架构对照:实拍画面显示讲师在 ViT 架构图旁逐层比对 NLP Transformer 编码器,讲清视觉与语言两条支路如何汇入同一骨架。

BV11v4y1k7zn · cid 1278018427 · 画面已实证
EP · 11

多模态大模型一统 NLP 和 CV · 03

时长 20:05 · 对应选集第 11 集

对齐机制:视觉编码器 + 连接器 + LLM 的三段式如何协同,视觉 Token 如何被投影进语言空间。

BV11v4y1k7zn · cid 1278026854
EP · 12

多模态大模型一统 NLP 和 CV · 04

时长 22:13 · 对应选集第 12 集

落地与演进:代表模型(BLIP / BLIP-2 / LLaVA 一脉)的训练范式、冻结策略与统一趋势,为后续 SAM / GLIP / Stable Diffusion 模块铺垫。

BV11v4y1k7zn · cid 1278026900
05 / 演进脉络

从 ViT 到 LLaVA

统一不是一步到位,而是三条技术线索逐步汇合的结果。

2020
ViT —— 视觉也能纯 Transformer

图像切 patch + 线性投影 + 位置编码,全程无 CNN,证明 Transformer 骨架可迁移到视觉。

2021
CLIP —— 图文对齐进同一向量空间

4 亿图文对对比学习,图像与文本编码到共享语义空间,打通模态语义。

2022
BLIP —— 理解与生成统一框架

ViT + BERT + 因果解码器统一建模,配合字幕自举(bootstrapping)提升数据质量。

2023
BLIP-2 / LLaVA —— 冻结大件 + 轻量连接器

冻结视觉编码器与 LLM,只训练 Q-Former / 线性投影,视觉指令微调让模型真正「看图对话」。

本模块定位
承上启下:统一范式的「枢纽」

前两模块(ViT、CLIP)打地基,本模块把二者合流;后续 SAM、GLIP、Stable Diffusion 都建立在这一统一架构之上。

Generated with Tabbit.