跳到正文
动手理解 · CONCEPT LAB

同一张街景,CV 和 VLM 各自做什么?

专用 CV 常输出框、掩码、文字与轨迹;VLM 常用语言组织开放任务。两者都可能出错,可靠系统要让输出契约、目标域评测与执行门控协作。

已经发生 正在观察 接下来
01 / 03

状态传导图

CAM 相机帧
TOOLS 检测 / 分割 / OCR
AUX 按需跟踪 / 深度
STATE 结构化候选
VLM 高层理解

相机帧经专用工具形成候选证据;置信度、模型版本、时间戳和目标域验收结果都应随状态保存。

观察点 01

检测器把像素变成结构化候选状态

目标检测给边界框,分割给掩码,OCR 读文字,跟踪器给跨帧 ID。这些输出便于规则、测量和审计,但仍可能受域偏移、遮挡、阈值和标定误差影响。

此刻要记住

结构化输出更容易验证,不等于模型天然稳定或输出就是事实。

基础 · 计算机视觉 / Computer Vision

CV 的前世今生:从手工特征到视觉—语言协作

计算机视觉(CV,Computer Vision)研究怎样从图像和视频中提取可用信息。本页用三个相互重叠的里程碑阶段建立历史直觉,再区分分类、检测与三类分割,最后讲清:VLM(Vision-Language Model,视觉语言模型)与专用 CV 并非简单替代关系。

01 · 为什么难

对机器来说,一张图只是「一堆数字」

以常见的 8-bit RGB(Red–Green–Blue,红绿蓝三通道)图像为例,机器接收的入口可以表示成一个 高×宽×3 的数值张量。同一只猫换个角度、光线、遮挡或背景,像素值会大幅变化,可类别仍应保持一致。CV 的核心难题之一,就是从会变化的观测中学习对任务有用、相对稳定的表示;定位、几何、时序与不确定性同样重要。

典型数字入口
1920×1080×3 = 6,220,800 个通道值;若原图是 8-bit RGB,每个通道通常编码为 0–255。进入模型前还可能被缩放、归一化、裁剪或转成浮点张量。
任务需要的表示
分类只需回答“猫”,检测还要给框,分割要给像素掩码,跟踪要跨帧保持身份。所谓“看懂”不是单一能力,而是一组需要分别定义和评测的任务。
02 · 前世今生

三个教学阶段:特征工程、深度学习、基础模型与多模态

这不是完整史学分期,也不是前后替代的三道闸门:手工方法早于 1999 年,CNN(Convolutional Neural Network,卷积神经网络)也早于 AlexNet;今天三类方法仍可能共存。这里用代表里程碑观察「视觉表示主要由谁、用什么监督信号决定」。

三段历史的核心变化是“表示由谁设计”:手工特征主要靠人定义,CNN 从任务数据中学习,基础模型进一步用大规模预训练统一表示。后一个时代并没有让前面的专用任务消失。

手工特征长期主导(本页取 1999–2011 代表点)

人定义表示,分类器仍会学习
并不是“没有学习”,而是特征提取主要由人设计,再交给 SVM(Support Vector Machine,支持向量机)、AdaBoost(Adaptive Boosting,自适应提升)等学习器:SIFT(Scale-Invariant Feature Transform,尺度不变特征变换)于 1999 年提出,用局部关键点与描述子增强尺度、旋转变化下的匹配稳定性;Viola–Jones(2001)把 Haar-like 特征、积分图、AdaBoost 与级联分类器组合成快速目标检测框架;HOG(Histograms of Oriented Gradients,方向梯度直方图)(2005)用局部梯度方向直方图描述形状,并在论文中配合线性 SVM 做行人检测。瓶颈是表示和任务耦合较强,换域或换目标往往要重做特征、阈值与数据流程。

深度学习 CNN 成为主流(2012–2019)

从任务数据与损失中学习表示
2012 年 AlexNet 是深度学习视觉的重要转折,但常见的 15.3% top-5 test error(正确类别未进入前五名的测试图比例)不是“单个网络只用约 120 万张图”的结果。论文先用 ILSVRC(ImageNet Large Scale Visual Recognition Challenge,ImageNet 大规模视觉识别挑战)约 120 万张训练图训练 5 个相似 CNN,平均预测后在 ILSVRC-2012 验证集得到 16.4%;另外两份带第六卷积层的 CNN 先在 ImageNet Fall 2011 的约 1500 万张图、2.2 万类上预训练,再在 ILSVRC-2012 上微调。论文把这两份模型与前 5 个模型组成 7-CNN 集成,最终在 ILSVRC-2012 测试集得到 15.3%,第二名为 26.2%。2015 年 ResNet(Residual Network,残差网络)成功训练 152 层网络,其集成模型在 ImageNet test set 报告 3.57% top-5 error。这个数字低于当时特定 ImageNet 标注实验估计的约 5.1% 人类 top-5 error,但不等于机器的一般视觉能力超过人类;PReLU(Parametric Rectified Linear Unit,参数化修正线性单元)论文更早报告 4.94%,并谨慎表述为“据作者所知”首次低于该人类口径。网络结构、数据增强、损失和标签仍由人设计,“从数据学习特征”不等于模型自己决定全部学习过程。
🔗 CNN 也是一种神经网络 → 架构家族

基础模型与多模态扩展(2020–至今)

大规模预训练 + 提示或任务接口
ViT(Vision Transformer,视觉 Transformer)于 2020 年提交论文,把图像切成 patch 序列交给 Transformer;论文证明纯 Transformer 在大规模预训练和迁移后可成为强视觉骨干。DINO(self-DIstillation with NO labels,无标签自蒸馏)与 DINOv2 等自监督路线减少对人工类别标签的依赖,但仍依赖数据策展、增强和训练目标。SAM(Segment Anything Model,官方模型名)团队通过 data engine 构建 SA-1B:超过 10 亿个掩码、约 1100 万张获授权且注重隐私的图像;模型接收点、框或掩码提示并评估零样本迁移,不等于会自动给每个掩码命名,也不保证所有专业域都准确。SAM 2(2024)把可提示视觉分割扩展到图像与视频。CLIP(Contrastive Language–Image Pre-training,对比式图文预训练)(2021)在 4 亿图文对上学习图文表示,成为后来视觉语言系统的重要技术来源之一。
🔗 ViT/patch 与 VLM 分阶段训练 → VLM 训练;扩散/生成 → 架构家族
03 · 核心任务

CV 到底输出什么:分类、框、掩码、关键点与轨迹

同一张猫的照片,监督信号和输出契约不同,就会成为不同任务。尤其要分清:语义分割、实例分割和可提示分割不是同一件事。

同一只猫的四类计算机视觉任务:图像分类、目标检测、分割、姿态估计
同一只猫,四种输出:① 分类(整图标签)· ② 检测(类别 + 框)· ③ 前景/实例掩码(像素归属)· ④ 姿态估计(关键点骨架)。图中的“分割”不是所有分割任务的统一定义。
任务问什么代表模型
图像分类这张图是什么类别?AlexNet、ResNet、ViT
目标检测有哪些物体、各在哪(框)?Faster R-CNN、YOLO(You Only Look Once) 系列、DETR(DEtection TRansformer)
语义分割每个像素属于哪种语义类别?通常不区分同类个体FCN(Fully Convolutional Network,全卷积网络)、U-Net、DeepLab
实例分割每个物体实例各自对应哪块像素?Mask R-CNN、Mask2Former
可提示分割给定点、框或掩码提示,返回对应掩码;默认不负责类别命名SAM、SAM 2
文本提示 / 开放词汇检测用类别名、名词短语或指代表达查询并定位固定训练标签表之外的具名概念;并非任意句子或任意物体都保证可检出Grounding DINO、YOLO-World
其他姿态、OCR(Optical Character Recognition,光学字符识别)、跟踪、人脸、深度与 3D 重建…各有任务定义与专用评测
开放词汇 ≠ 经典开放集
Grounding DINO 论文自称 open-set object detector,但文献中的术语并不完全统一。经典开放集目标检测(Open-Set Object Detection,OSOD)通常要求同时检测已知与未见物体,并把未见物体统一标成 unknown开放词汇目标检测(Open-Vocabulary Object Detection,OVD)则借助文本类别名、描述或视觉—语言知识查询并命名更广的概念。两类协议可能重叠,不能直接当成同义词。
04 · 和 VLM 的关系

VLM 把视觉表示与语言接口接到一起,但没有单一架构

VLM把视觉与语言放进同一训练或推理系统。对 LLaVA(Large Language and Vision Assistant)等架构,可以用「视觉编码器 + 跨模态连接 + LLM(Large Language Model,大语言模型)」建立直觉;CLIP 是图像/文本双编码器,本身没有生成式 LLM;Flamingo 用 Perceiver Resampler(感知器重采样器)与 gated cross-attention(门控交叉注意力)连接冻结的视觉和语言模型;原生早融合模型又会更早混合不同模态。因此“三段式”只是常见路线,不是 VLM 的定义。

一种常见开源路线:视觉编码器(常为 ViT 或 CLIP/SigLIP 系列;SigLIP 全称 Sigmoid Loss for Language-Image Pre-training,即基于 sigmoid 损失的图文预训练)→ 连接器 projector / resamplerLLM。Projector 通常负责维度映射但未必减少 token;resampler 常把可变数量视觉特征汇聚为固定或更少的表示。具体实现可能只做其中一种,也可能完全不用这类连接器。
只画“图片 → 视觉编码器 → LLM”会漏掉 VLM 的另一半:Tokenizer 只把文字映射为整数 token IDs,还要经过 embedding lookup 才得到文本向量。视觉表示可以与文本嵌入拼接成输入序列,也可像 Flamingo 一样进入语言主干内部的 cross-attention 层;不存在适用于所有 VLM 的单一“主干前融合框”。
视觉 token 怎么数
一张 224×224 图片若切成不重叠的 16×16 patch,每边有 224÷16=14 个 patch,总共 14×14=196 个 patch token(再视架构决定是否加 class token)。若分辨率翻倍到 448×448,patch 数变成 28×28=784,是 4 倍。只比较视觉 token 之间的稠密自注意力配对、忽略可选 class token 与文本 token,且保持其他条件不变时,配对数才会从 196² = 38,416 变成 784² = 614,656,正好是 16 倍;整网时间与显存不一定按 16 倍增长,因为还有 MLP(Multilayer Perceptron,多层感知机)、卷积、连接器和实现优化。这就是动态分辨率、裁剪、视觉 token 汇聚与 resampler 的成本动机。

所以「CV 被 VLM 取代」并不成立。VLM 仍建立在视觉表示、数据与评测之上;有些系统还显式调用检测、分割、OCR 和跟踪工具。专用模型、通用 VLM 或组合系统,要按输出契约、延迟、数据、硬件与失败风险选择。
🔗 VLM 怎么训、视觉 token 怎么来 → VLM 与 LLM 训练差异;跨模态连接器 → 多模态融合

05 · 各自优势

专用 CV vs VLM:任务专门优化与开放语言接口

这不是谁取代谁,而是不同优化目标。可以先用这条经验规则筛选:需求固定且强约束延迟 / 功耗 / 像素级输出时,先评估专用 CV;任务开放、依赖语言指令或跨任务迁移时,先评估 VLM。最终仍要在自己的数据和硬件上测。

🎯 专用 CV 模型 目标明确

常见优势:输出格式固定,容易围绕特定数据、延迟、功耗和像素指标优化,较小模型可做实时或边缘部署。
常见短板:类别或任务变化时可能要补数据、重训或更换头部;开放语言交互能力有限。结构化输出并不自动等于稳定可靠,域外数据、遮挡、天气和传感器漂移仍需专门验证。
场景:工业质检、自动驾驶感知、医疗影像、实时检测。

🧠 VLM 视觉语言模型 任务开放

常见优势:同一接口接收自然语言任务;在相应数据、分辨率与训练目标支持下,可做问答、描述、OCR、开放词汇或跨任务迁移。
常见短板:大模型通常算力与内存成本更高;坐标、计数、密集小目标和像素边界仍可能不稳定。但“小 VLM 一定比专用模型慢”“VLM 一定定位弱”都不是无条件定律。
场景:图文问答、文档/截图理解、agent 看屏操作、内容审核。

📊 一个可核查的通用模型案例
微软 Florence-2 论文给出 232M 与 771M 参数两个规模,用统一的 sequence-to-sequence(序列到序列)表示和文本任务提示处理 caption、检测、grounding、分割等任务;配套 FLD-5B 由 data engine 自动标注、过滤和迭代改进,包含 1.26 亿张图上的 54 亿条视觉标注。它证明“一套权重可以覆盖多种任务”是可行路线,但不能据此推出它在每个数据集、延迟或像素指标上都胜过专用模型。
06 · 趋势

融合:端到端联合建模,或让 VLM 与视觉工具协作

一种常见工程路线是分工协同:VLM 解释开放指令或做高层规划,检测、分割、OCR、跟踪等模块提供结构化感知;也有端到端模型直接联合训练。“VLM 像大脑、CV 像眼睛”只是一种系统类比,不能当作唯一架构或能力高低排序。

动作会改变世界,因此“看一帧后规划到底”并不可靠。每轮都要重新感知并核对动作结果;只有新证据满足停止条件才能进入“已验证完成”,权限拒绝、高风险、证据不足或预算耗尽则应补证据、拒绝或转人工。
方向怎么融合 · 代表
开放词汇检测把文本编码与视觉特征引入检测器,但实现并不相同:Grounding DINO使用 feature enhancer、language-guided query selection 与 cross-modality decoder 做紧密跨模态融合;YOLO-World用 RepVL-PAN 与 region-text contrastive loss。后者论文的 35.4 Fixed AP、52.0 FPS特指重参数化 YOLO-World-L:预训练组合包含 Objects365(O365)、GoldG(不含 COCO 图像的 GQA + Flickr30K grounding 数据)和 Conceptual Captions 3M(CC3M)的伪标注子集 CC3M-Lite(约 24.6 万张;官方项目页记作 CC-250K),再在 LVIS minival 上做零样本评测;速度在单张 NVIDIA V100、未使用 FP16 或 TensorRT 等额外加速的条件下测得。这个结果不能外推为所有模型、数据与部署都“实时”(AP 为 Average Precision,平均精度;FPS 为 Frames Per Second,每秒帧数)
概念级分割SAM 3论文 v1 于 2025-11-20 提交,把概念提示定义为短名词短语、图像样例或二者结合,面向图像与视频中匹配实例的检测、分割和跟踪;这比点/框提示更开放,但仍受训练概念、提示歧义与场景分布约束
VLM + 专用协同VLM 可解释任务、选择工具和组织结果;专用 CV 可提供框、掩码、文字、深度与轨迹。两边都要用目标域数据验证,不能预设 VLM 必然更会推理或专用模型必然更精确
VLA(Vision-Language-Action,视觉-语言-动作)机器人领域把图像、语言与动作联合建模:RT-2把动作表示成文本 token;OpenVLA是 7B 开放模型,论文称训练于 97 万条真实机器人演示;π0在预训练 VLM 上构建 flow-matching 架构生成连续动作,π0.5再用多机器人、网页、语义子任务与低层动作等异构数据做协同训练。它们展示的是不同动作表示与数据路线,不是统一配方

一句话趋势:任务边界在融合,但评测不能混在一起。框的 AP、掩码的 IoU(Intersection over Union,交并比)、问答正确率、动作成功率、延迟与安全失败率分别回答不同问题;“一个模型能输出很多格式”不等于每项都已达到生产要求。

资料来源

核查口径与原始资料

手工特征SIFT(ICCV 1999) · Viola–Jones(CVPR 2001) · HOG(CVPR 2005)
CNN 转折AlexNet · ResNet · PReLU 与 ImageNet 人类口径
检测任务Faster R-CNN · YOLO · DETR
分割任务FCN · U-Net · DeepLab v3 · Mask R-CNN · Mask2Former
视觉预训练ViT · DINO · DINOv2
图文与 VLM 架构CLIP · SigLIP · Flamingo · LLaVA
提示分割Segment Anything · SAM 2 · SAM 3
通用、开放词汇与开放集Florence-2 · Grounding DINO · YOLO-World · 经典 OSOD 的 unknown 口径
VLART-2 · OpenVLA · π0 · π0.5

页面于 2026-07-15 按原始论文与出版页逐项复核;其中 SAM 3 锚定 arXiv v1(2025-11-20),π0 采用截至本次核查的 arXiv v4(2026-01-08)。“超人类”“分割一切”“任意文字”“通用模型”等说法均限定到具体数据集、提示方式、任务定义和模型范围,不外推为一般能力。

速查表

一张表回顾 CV & VLM

问题答案
CV 是什么让机器从图像/视频中提取类别、位置、掩码、文字、深度、姿态或轨迹等任务信息
三个教学阶段① 手工特征主导表示,分类器仍学习 ② CNN 从任务数据与损失中学习表示 ③ 大规模预训练、提示接口与多模态;三者时间重叠,并非严格替代
关键转折2012 AlexNet 7-CNN 集成(ILSVRC-2012 test top-5 error 15.3%,第二名 26.2%)、2015 ResNet 集成(ImageNet test 3.57%)、2020 ViT、2021 CLIP、2022 Flamingo、2023 SAM / LLaVA / RT-2;百分比均是特定评测口径
核心任务分类(整图标签)、检测(框)、语义分割(像素类别)、实例分割(实例掩码)、可提示分割(按提示出掩码),以及姿态/OCR/跟踪
VLM 和 CV 关系很多 VLM 复用 ViT/CLIP 等视觉骨干并接入语言模型;也有双编码器、cross-attention 与早融合等不同架构
专用 CV 优势容易针对固定输出、延迟、功耗和像素指标优化;结构化不等于天然可靠,换域仍要验证和适配
VLM 优势自然语言接口、开放任务与迁移能力强;成本、定位和密集视觉指标需按具体模型实测
怎么选用自己的数据、指标和硬件比较;可单用专用模型、单用 VLM,也可让 VLM 调用结构化视觉工具