Supervision 入门答疑:这些框架到底该选哪个
Ultralytics / RF-DETR / Detectron2 / SAM / VLM 是三种框架吗?该选哪个?零基础向的两个前置问题,外加 YOLO 许可证这个真金白银的坑
写完 Supervision 教学文档 之后,冒出来两个更前置的问题——都是零基础容易卡住的地方:
- Ultralytics、RF-DETR、Detectron2、SAM 这些,是三种框架吗?
- 这么多框架,我该选哪个?
这篇专门回答这两个。代码层面的对照写在 换模型对照手册 里。
问题一:这是三种框架吗?
短答
不是。 那几行是教学文档流程图里 同一列(“推理框架”那一格)的内容, 按行读会误以为分了三类。它们全都在同一层:负责跑模型、出结果。
为什么容易看混:两个维度被写在一起了
理解 CV 领域的名词,只需要先分清这两个问题:
问题一:这个 AI 要「做什么事」? → 任务类型 问题二:这个 AI 是「谁家做的」? → 模型 / 框架名字
打个比方:
- 任务 = “我要拍人像还是拍风景”
- 框架 = “我用佳能还是尼康”
两回事。你看到的那个列表,把这两个维度混在了一起。拆开:
维度一:做什么事(任务类型)
| 任务 | 通俗说法 | 输出是什么 | 典型应用 |
|---|---|---|---|
| 分类 Classification | 这张图是什么 | 一个标签 | 质检良品/次品判定 |
| 检测 Detection | 图里有什么、在哪 | 一堆方框 + 类别 | 人流统计、车牌定位 |
| 分割 Segmentation | 精确抠出轮廓 | 像素级掩码 | 医学影像、后期抠图 |
| 姿态 Pose / KeyPoints | 关节点在哪 | 一堆坐标点 | 健身动作纠正、跌倒检测 |
| OCR | 认字 | 文字内容 | 票据识别、车牌读数 |
| VLM 视觉大模型 | 看图说话、听人话找东西 | 自然语言 | ”找出没戴安全帽的人” |
检测和分割的区别,一句话记住: 检测给你一个方框(框里还有背景),分割给你精确的轮廓(只有物体本身)。
维度二:谁家做的(框架 / 模型)
| 名字 | 是什么 | 出品方 |
|---|---|---|
| Ultralytics | 一家公司,出品 YOLO 系列 | Ultralytics(美国) |
| ├ YOLOv5 / v8 / v11 | 是 YOLO 的版本迭代,不是三个东西 | 同上 |
| RF-DETR | 一个检测模型 | Roboflow(Supervision 的东家) |
| Detectron2 | 一个检测/分割框架 | Meta(Facebook) |
| MMDetection | 一个”模型大全”框架 | 上海人工智能实验室 |
| SAM / SAM3 | 分割模型(Segment Anything) | Meta |
| PaddleDet | 检测框架 | 百度飞桨 |
| VLM / LMM | 视觉大模型的统称(如 GPT-4V、Qwen-VL) | 各家 |
顺带解释:YOLO 是什么
YOLO = You Only Look Once(你只需看一眼)。
它是一类目标检测模型的名字。之所以叫”只看一眼”,是因为它一次性把整张图 扫完就给出所有框,而不是像老方法那样在图上反复滑动窗口去试 —— 所以快, 快到能处理实时视频(每秒几十帧)。
v5 / v8 / v11 是它的版本号,越新越准也越快,用法基本一样。 入门直接用 v8 或 v11 即可,不用管历史版本。
问题二:这么多框架,我该选哪个?
结论先给
你就用 Ultralytics YOLO,不用纠结。 其余几家都是”遇到特定的墙才换”的备选。
六家横向对比
| 框架 | 一句话 | 优点 | 缺点 | 什么场景选它 |
|---|---|---|---|---|
| Ultralytics YOLO | 事实标准,全网教程最多 | 三行代码跑通;快,能实时;检测/分割/姿态/追踪全都有;社区最大,出问题一搜就有答案 | AGPL-3.0 许可证 —— 商用要么开源你的全部代码,要么买商业授权(约 $2000+/年) | 学习、内部使用、原型验证、个人项目 |
| RF-DETR | Roboflow 自研,YOLO 的商用替代 | Apache 2.0,商用免费;精度比同级 YOLO 更高;和 Supervision 无缝配合(直接返回 Detections) | 生态新,中文教程少;训练更吃显存 | 要交付给客户的商业项目 |
| Detectron2 | Meta 出品,研究界老牌 | 模块化好,改模型结构方便;文档扎实 | 上手门槛高;速度不如 YOLO;更新已放缓 | 需要魔改模型内部结构 |
| MMDetection | 上海 AI Lab,模型最全 | 收录了几乎所有论文里的模型(100+);配置文件驱动,换模型只改配置 | 配置系统极其复杂,新手劝退;安装依赖容易崩 | 做研究、要横向对比多个算法 |
| SAM / SAM3 | Meta 的”万能抠图” | 不用训练,点一下就能精准分割任何东西 | 不认识物体是什么(只给形状不给名字);慢,吃显存 | 精细抠图、辅助标注、影视后期 |
| VLM(视觉大模型) | 用自然语言下指令 | 零训练,直接说”找出图里所有戴安全帽的人”;需求改了改提示词就行 | 慢(几秒一张)、贵(按次收费)、位置精度不如专用检测模型 | 需求多变、无标注数据、离线批处理 |
两个必须知道的坑
坑一:YOLO 的许可证是真金白银的事 ⚠️
Ultralytics 用的是 AGPL-3.0 协议。含义是:
你拿它做出来的软件如果对外提供服务(卖给客户、部署成网站都算), 你的整套代码必须一并开源。不想开源,就得买商业授权。
很多团队做到交付验收才发现这条,被迫返工重来。所以第一天就要定:
| 用途 | 选谁 | 为什么 |
|---|---|---|
| 学习 / 自己内部用 | Ultralytics YOLO | 随便用,没问题 |
| 要卖给客户 / 对外服务 | RF-DETR | Apache 2.0,商用无限制 |
Supervision 之所以宝贵,正在这里:中间隔了一层统一的 Detections,
换模型只改一行 from_ultralytics() → model.predict(),业务代码一行不动。
选错的代价从”重写整个项目”降到”改一行”。
坑二:SAM 不是检测器
SAM 只回答”这块区域的轮廓在哪”,不回答”这是什么” —— 它压根没有类别概念。
所以它不是 YOLO 的竞品,实际用法是两者配合:
- YOLO 找到目标在哪 —— 给方框 + 类别
- SAM 把轮廓精细抠出来 —— 给像素级掩码
三步落地建议
- 先用 Ultralytics YOLO + Supervision 把整个流程跑通 目的是学「怎么做」,不是学「用哪个模型」。验收标准:能对一张图出框、对一段视频做追踪。
- 确定项目要不要商用 要商用就换 RF-DETR。因为中间隔着 Supervision,换模型只改一行代码。
- 遇到具体问题再加工具,不要提前加 抠图不够准 → 加 SAM;小目标漏检 → 加 InferenceSlicer;需求天天变 → 考虑 VLM。
一页速查:选型决策卡
| 问题 | 否 | 是 |
|---|---|---|
| Q1 这个项目要卖钱 / 对外提供服务吗? | Ultralytics YOLO(v8 或 v11),直接开干 | RF-DETR,避开 AGPL |
| Q2 需要精确到像素的轮廓吗? | 用检测就够(方框) | YOLO-seg 够用;要极致精度上 YOLO + SAM |
| Q3 有标注好的训练数据吗? | ① VLM 用自然语言直接检测 ② SAM + autodistill 自动标注,再训小模型 | 常规路线,训练自己的模型 |
| Q4 要在论文 / 研究里横向对比多种算法吗? | 别碰,配置系统会劝退你 | MMDetection(模型最全) |
不管选谁,中间都用 Supervision 接一层 —— 换模型的成本就只剩一行代码。
名词对照表(速记)
| 缩写 | 全称 | 中文 |
|---|---|---|
| CV | Computer Vision | 计算机视觉 |
| YOLO | You Only Look Once | 一类实时检测模型 |
| DETR | DEtection TRansformer | 用 Transformer 做检测的模型架构 |
| SAM | Segment Anything Model | 万物分割模型 |
| VLM | Vision Language Model | 视觉语言(多模态)大模型 |
| LMM | Large Multimodal Model | 多模态大模型,同 VLM |
| OBB | Oriented Bounding Box | 旋转框(可倾斜的检测框) |
| mAP | mean Average Precision | 检测任务的核心精度指标 |
| NMS | Non-Maximum Suppression | 非极大值抑制,去掉重复的框 |
| SAHI | Slicing Aided Hyper Inference | 切片辅助推理,用于小目标 |
| AGPL | Affero GPL | 一种”传染性”开源协议,商用需注意 |