状态传导图
相机帧经专用工具形成候选证据;置信度、模型版本、时间戳和目标域验收结果都应随状态保存。
观察点 01
检测器把像素变成结构化候选状态
目标检测给边界框,分割给掩码,OCR 读文字,跟踪器给跨帧 ID。这些输出便于规则、测量和审计,但仍可能受域偏移、遮挡、阈值和标定误差影响。
结构化输出更容易验证,不等于模型天然稳定或输出就是事实。
专用 CV 常输出框、掩码、文字与轨迹;VLM 常用语言组织开放任务。两者都可能出错,可靠系统要让输出契约、目标域评测与执行门控协作。
状态传导图
相机帧经专用工具形成候选证据;置信度、模型版本、时间戳和目标域验收结果都应随状态保存。
观察点 01
目标检测给边界框,分割给掩码,OCR 读文字,跟踪器给跨帧 ID。这些输出便于规则、测量和审计,但仍可能受域偏移、遮挡、阈值和标定误差影响。
结构化输出更容易验证,不等于模型天然稳定或输出就是事实。
状态传导图
语言目标、带来源的候选证据和历史状态共同进入规划;缺证据时应追问、重拍或换工具。
观察点 02
VLM 读取图像或 CV 工具结果,再结合“找出口”“比较两张图”之类任务生成解释或计划。覆盖任务更多不代表每个答案正确,坐标、计数、OCR 和因果解释都要分别验收。
VLM 提供开放语言接口;不能由输出语气推断它真的看准了。
状态传导图
执行动作后环境已经变化,旧图像不能继续当作当前事实;高风险动作还需要权限校验、确认与可审计结果。
观察点 03
VLM 提出点击、导航或机器人动作,安全层检查权限与空间约束,执行后再读取新帧。这个反馈闭环能发现计划与现实不一致。
可靠视觉 Agent 不是一次“看图回答”,而是感知—行动—再感知。
你现在应该能解释:可靠视觉 Agent 不是一次“看图回答”,而是感知—行动—再感知。
计算机视觉(CV,Computer Vision)研究怎样从图像和视频中提取可用信息。本页用三个相互重叠的里程碑阶段建立历史直觉,再区分分类、检测与三类分割,最后讲清:VLM(Vision-Language Model,视觉语言模型)与专用 CV 并非简单替代关系。
以常见的 8-bit RGB(Red–Green–Blue,红绿蓝三通道)图像为例,机器接收的入口可以表示成一个 高×宽×3 的数值张量。同一只猫换个角度、光线、遮挡或背景,像素值会大幅变化,可类别仍应保持一致。CV 的核心难题之一,就是从会变化的观测中学习对任务有用、相对稳定的表示;定位、几何、时序与不确定性同样重要。
1920×1080×3 = 6,220,800 个通道值;若原图是 8-bit RGB,每个通道通常编码为 0–255。进入模型前还可能被缩放、归一化、裁剪或转成浮点张量。这不是完整史学分期,也不是前后替代的三道闸门:手工方法早于 1999 年,CNN(Convolutional Neural Network,卷积神经网络)也早于 AlexNet;今天三类方法仍可能共存。这里用代表里程碑观察「视觉表示主要由谁、用什么监督信号决定」。
同一张猫的照片,监督信号和输出契约不同,就会成为不同任务。尤其要分清:语义分割、实例分割和可提示分割不是同一件事。
| 任务 | 问什么 | 代表模型 |
|---|---|---|
| 图像分类 | 这张图是什么类别? | AlexNet、ResNet、ViT |
| 目标检测 | 有哪些物体、各在哪(框)? | Faster R-CNN、YOLO(You Only Look Once) 系列、DETR(DEtection TRansformer) |
| 语义分割 | 每个像素属于哪种语义类别?通常不区分同类个体 | FCN(Fully Convolutional Network,全卷积网络)、U-Net、DeepLab |
| 实例分割 | 每个物体实例各自对应哪块像素? | Mask R-CNN、Mask2Former |
| 可提示分割 | 给定点、框或掩码提示,返回对应掩码;默认不负责类别命名 | SAM、SAM 2 |
| 文本提示 / 开放词汇检测 | 用类别名、名词短语或指代表达查询并定位固定训练标签表之外的具名概念;并非任意句子或任意物体都保证可检出 | Grounding DINO、YOLO-World |
| 其他 | 姿态、OCR(Optical Character Recognition,光学字符识别)、跟踪、人脸、深度与 3D 重建… | 各有任务定义与专用评测 |
unknown;开放词汇目标检测(Open-Vocabulary Object Detection,OVD)则借助文本类别名、描述或视觉—语言知识查询并命名更广的概念。两类协议可能重叠,不能直接当成同义词。VLM把视觉与语言放进同一训练或推理系统。对 LLaVA(Large Language and Vision Assistant)等架构,可以用「视觉编码器 + 跨模态连接 + LLM(Large Language Model,大语言模型)」建立直觉;CLIP 是图像/文本双编码器,本身没有生成式 LLM;Flamingo 用 Perceiver Resampler(感知器重采样器)与 gated cross-attention(门控交叉注意力)连接冻结的视觉和语言模型;原生早融合模型又会更早混合不同模态。因此“三段式”只是常见路线,不是 VLM 的定义。
224×224 图片若切成不重叠的 16×16 patch,每边有 224÷16=14 个 patch,总共 14×14=196 个 patch token(再视架构决定是否加 class token)。若分辨率翻倍到 448×448,patch 数变成 28×28=784,是 4 倍。只比较视觉 token 之间的稠密自注意力配对、忽略可选 class token 与文本 token,且保持其他条件不变时,配对数才会从 196² = 38,416 变成 784² = 614,656,正好是 16 倍;整网时间与显存不一定按 16 倍增长,因为还有 MLP(Multilayer Perceptron,多层感知机)、卷积、连接器和实现优化。这就是动态分辨率、裁剪、视觉 token 汇聚与 resampler 的成本动机。所以「CV 被 VLM 取代」并不成立。VLM 仍建立在视觉表示、数据与评测之上;有些系统还显式调用检测、分割、OCR 和跟踪工具。专用模型、通用 VLM 或组合系统,要按输出契约、延迟、数据、硬件与失败风险选择。
🔗 VLM 怎么训、视觉 token 怎么来 → VLM 与 LLM 训练差异;跨模态连接器 → 多模态融合
这不是谁取代谁,而是不同优化目标。可以先用这条经验规则筛选:需求固定且强约束延迟 / 功耗 / 像素级输出时,先评估专用 CV;任务开放、依赖语言指令或跨任务迁移时,先评估 VLM。最终仍要在自己的数据和硬件上测。
常见优势:输出格式固定,容易围绕特定数据、延迟、功耗和像素指标优化,较小模型可做实时或边缘部署。
常见短板:类别或任务变化时可能要补数据、重训或更换头部;开放语言交互能力有限。结构化输出并不自动等于稳定可靠,域外数据、遮挡、天气和传感器漂移仍需专门验证。
场景:工业质检、自动驾驶感知、医疗影像、实时检测。
常见优势:同一接口接收自然语言任务;在相应数据、分辨率与训练目标支持下,可做问答、描述、OCR、开放词汇或跨任务迁移。
常见短板:大模型通常算力与内存成本更高;坐标、计数、密集小目标和像素边界仍可能不稳定。但“小 VLM 一定比专用模型慢”“VLM 一定定位弱”都不是无条件定律。
场景:图文问答、文档/截图理解、agent 看屏操作、内容审核。
一种常见工程路线是分工协同:VLM 解释开放指令或做高层规划,检测、分割、OCR、跟踪等模块提供结构化感知;也有端到端模型直接联合训练。“VLM 像大脑、CV 像眼睛”只是一种系统类比,不能当作唯一架构或能力高低排序。
| 方向 | 怎么融合 · 代表 |
|---|---|
| 开放词汇检测 | 把文本编码与视觉特征引入检测器,但实现并不相同:Grounding DINO使用 feature enhancer、language-guided query selection 与 cross-modality decoder 做紧密跨模态融合;YOLO-World用 RepVL-PAN 与 region-text contrastive loss。后者论文的 35.4 Fixed AP、52.0 FPS特指重参数化 YOLO-World-L:预训练组合包含 Objects365(O365)、GoldG(不含 COCO 图像的 GQA + Flickr30K grounding 数据)和 Conceptual Captions 3M(CC3M)的伪标注子集 CC3M-Lite(约 24.6 万张;官方项目页记作 CC-250K),再在 LVIS minival 上做零样本评测;速度在单张 NVIDIA V100、未使用 FP16 或 TensorRT 等额外加速的条件下测得。这个结果不能外推为所有模型、数据与部署都“实时”(AP 为 Average Precision,平均精度;FPS 为 Frames Per Second,每秒帧数) |
| 概念级分割 | SAM 3论文 v1 于 2025-11-20 提交,把概念提示定义为短名词短语、图像样例或二者结合,面向图像与视频中匹配实例的检测、分割和跟踪;这比点/框提示更开放,但仍受训练概念、提示歧义与场景分布约束 |
| VLM + 专用协同 | VLM 可解释任务、选择工具和组织结果;专用 CV 可提供框、掩码、文字、深度与轨迹。两边都要用目标域数据验证,不能预设 VLM 必然更会推理或专用模型必然更精确 |
| VLA(Vision-Language-Action,视觉-语言-动作) | 机器人领域把图像、语言与动作联合建模:RT-2把动作表示成文本 token;OpenVLA是 7B 开放模型,论文称训练于 97 万条真实机器人演示;π0在预训练 VLM 上构建 flow-matching 架构生成连续动作,π0.5再用多机器人、网页、语义子任务与低层动作等异构数据做协同训练。它们展示的是不同动作表示与数据路线,不是统一配方 |
一句话趋势:任务边界在融合,但评测不能混在一起。框的 AP、掩码的 IoU(Intersection over Union,交并比)、问答正确率、动作成功率、延迟与安全失败率分别回答不同问题;“一个模型能输出很多格式”不等于每项都已达到生产要求。
| 手工特征 | SIFT(ICCV 1999) · Viola–Jones(CVPR 2001) · HOG(CVPR 2005) |
| CNN 转折 | AlexNet · ResNet · PReLU 与 ImageNet 人类口径 |
| 检测任务 | Faster R-CNN · YOLO · DETR |
| 分割任务 | FCN · U-Net · DeepLab v3 · Mask R-CNN · Mask2Former |
| 视觉预训练 | ViT · DINO · DINOv2 |
| 图文与 VLM 架构 | CLIP · SigLIP · Flamingo · LLaVA |
| 提示分割 | Segment Anything · SAM 2 · SAM 3 |
| 通用、开放词汇与开放集 | Florence-2 · Grounding DINO · YOLO-World · 经典 OSOD 的 unknown 口径 |
| VLA | RT-2 · OpenVLA · π0 · π0.5 |
页面于 2026-07-15 按原始论文与出版页逐项复核;其中 SAM 3 锚定 arXiv v1(2025-11-20),π0 采用截至本次核查的 arXiv v4(2026-01-08)。“超人类”“分割一切”“任意文字”“通用模型”等说法均限定到具体数据集、提示方式、任务定义和模型范围,不外推为一般能力。
| 问题 | 答案 |
|---|---|
| CV 是什么 | 让机器从图像/视频中提取类别、位置、掩码、文字、深度、姿态或轨迹等任务信息 |
| 三个教学阶段 | ① 手工特征主导表示,分类器仍学习 ② CNN 从任务数据与损失中学习表示 ③ 大规模预训练、提示接口与多模态;三者时间重叠,并非严格替代 |
| 关键转折 | 2012 AlexNet 7-CNN 集成(ILSVRC-2012 test top-5 error 15.3%,第二名 26.2%)、2015 ResNet 集成(ImageNet test 3.57%)、2020 ViT、2021 CLIP、2022 Flamingo、2023 SAM / LLaVA / RT-2;百分比均是特定评测口径 |
| 核心任务 | 分类(整图标签)、检测(框)、语义分割(像素类别)、实例分割(实例掩码)、可提示分割(按提示出掩码),以及姿态/OCR/跟踪 |
| VLM 和 CV 关系 | 很多 VLM 复用 ViT/CLIP 等视觉骨干并接入语言模型;也有双编码器、cross-attention 与早融合等不同架构 |
| 专用 CV 优势 | 容易针对固定输出、延迟、功耗和像素指标优化;结构化不等于天然可靠,换域仍要验证和适配 |
| VLM 优势 | 自然语言接口、开放任务与迁移能力强;成本、定位和密集视觉指标需按具体模型实测 |
| 怎么选 | 用自己的数据、指标和硬件比较;可单用专用模型、单用 VLM,也可让 VLM 调用结构化视觉工具 |