CVAT 图像视频标注工具实战指南:Docker 一键部署 + AI 辅助标注教程
2026/9/10 22:23:00 网站建设 项目流程

CVAT 图像视频标注工具实战指南:Docker 一键部署 + AI 辅助标注教程

【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat

训练视觉模型前,你多半卡在同一个环节:手上几百张图、几十段视频,得逐个框出"人"和"车"。人工框一天下来手都酸,进度却慢得让人怀疑人生。CVAT(Computer Vision Annotation Tool)就是干这件事的:一个可自托管的图像、视频与 3D 点云标注平台,支持矩形、多边形、骨架等标注工具,还能接入 YOLO、SAM 这类模型先自动打一遍底,你只做修正。

项目速览

项目说明
定位开源的视觉数据标注平台,为视觉 AI 构建高质量数据集
开源协议MIT(/serverless下个别模型资产另有许可,使用前看一眼)
核心能力图像/视频/点云标注、AI 辅助标注、团队任务分配、质量审核、20+ 格式导入导出
部署方式Docker Compose 自托管;另有托管版 CVAT Online 可先在浏览器试用
适用对象个人开发者、需要标注数据做模型训练的团队、需要管理标注流程的组织

装好之后它就是一个网址,团队里谁都能登录干活,数据留在你自己的机器上。

数据怎么进来

建任务时上传入口支持四种来源:本地电脑、已挂载的文件共享、远程地址、云存储(S3、Azure Blob、Google Cloud 等)。图像方面,Pillow 支持的 JPEG、PNG、TIFF 都能读;视频走 FFmpeg 解码,MP4、AVI、MOV 都行;3D 场景用.pcd.bin点云。一次可以传一个压缩包含整批图片的归档,不必逐张上传,详见 getting_started/overview.md。

标注怎么做

进入任务后,左侧工具栏就是标注工作台:矩形、多边形、椭圆、画笔(含"沿已有边界绘制"的自动描边)、关键点、骨架,3D 场景下则是 cuboid。它的工作方式值得先理解一条——首帧标好,后续帧自动传播:你在视频第 1 帧框住一辆车,CVAT 会把这个框沿时间轴跟过去,形成 track,你只需在跟踪漂移的地方手动修两下,比逐帧手框省力得多。

嫌手动也慢?就挂模型。仓库自带一批基于 Nuclio 的 serverless 预置模型(YOLOv7、RetinaNet、SAM、TransT 跟踪、HRNet 姿态等,列表见 serverless/),在标注界面打开 Automatic annotation 面板,选模型、把模型输出的类别映射到你定义的标签、设好阈值,点 Annotate,整段视频的框就自动铺满:

3D 点云则提供顶视/侧视/前视三视口联动的立方体标注,适合自动驾驶这类场景:

标完之后质量怎么保证?项目、任务、Job 三级结构把工作切给不同标注员;评审员可以在结果里留 issue、打回返工;还能用 Ground Truth 和 Honeypot 检查计算每个标注员的准确率,这套逻辑在后端 quality_control/ 模块里。

结果怎么导出、对接模型

导出时选目标格式即可:COCO、YOLO、Pascal VOC、KITTI、MOT 等 20 余种,导出到本地或云端。反过来也能把这些格式的旧标注导入继续编辑,迁移成本很低。想走自动化路线的话,pip install cvat-sdk装 Python SDK 或pip install cvat-cli装命令行工具,就能用脚本批量建任务、传数据、拉导出文件,接口定义可参考 cvat/schema.yml。

快速上手

前提:机器上装好 Docker Engine 和 Docker Compose。

  1. 拉取代码:git clone https://gitcode.com/GitHub_Trending/cvat/cvat
  2. 进入目录启动整套服务:cd cvat && docker compose up -d
  3. 创建管理员账号:docker exec -it cvat_server bash -ic 'python3 ~/manage.py createsuperuser'
  4. 浏览器打开http://localhost:8080,登录后新建项目、上传数据、定义标签,开始标注
  5. (可选)启用 AI 辅助标注:docker compose -f docker-compose.yml -f components/serverless/docker-compose.serverless.yml up -d,再按 annotation/auto-annotation/ 文档部署需要的模型

全程不到半小时能跑通第一个标注结果。

实战对照

你的任务具体做法预期效果
视频里批量框行人/车辆YOLOv7 自动标注铺底,人工修正漏检相比纯人工逐帧框选,返修工作量大幅下降,人只做校对
医学图像精细分割多边形 + 画笔工具,开"沿边界绘制"自动吸附边界贴合度高,单帧耗时短于纯手绘
视频跟踪标注首帧手框,TransT 跟踪器传播一段几十秒的视频通常只需修几处漂移点
点云目标标注Standard 3D 模式下用 cuboid,三视口联动调整顶/侧/前视角同时核对,位置更准

生态集成

开发侧三件套:Python SDK、CLI 工具、REST API,覆盖建任务到导出的全链路。数据侧可对接 S3、Azure Blob、Google Cloud 等对象存储,标注文件不必在本地和服务器之间来回倒。需要看标注吞吐和活跃情况时,仓库里自带 ClickHouse + Grafana 分析栈(见 components/analytics/)。

选型与避坑

  • 先试水:用浏览器版 CVAT Online 免费档验证流程,确认标注规范再决定是否自托管。
  • 中小团队:选 Community 版自托管,MIT 协议,数据不出内网;要改代码也自由。
  • 企业:需要 SSO、审计日志、SLA 时看 Enterprise 版本。
  • 浏览器:主要测试过 Chrome/Edge,Firefox 可用但有坑,Safari 不支持。
  • 没有 GPU 能跑吗:能。预置模型跑 CPU 即可,只是自动标注慢一些,数据量特别大再考虑 GPU。
  • 担心数据安全:自托管版本所有数据落在你自己的基础设施里,这正是它和托管版最大的区别。

一句话小结

CVAT 把"上传数据、自动打标、人工修正、审核、导出喂模型"整条链路收进一个自托管的 Web 应用,MIT 协议、Docker 一条命令起步、20 多种格式随你进随你出。只要你的项目要喂视觉模型,这套工具链值得放进备选清单。

【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询