CVAT 图像视频标注工具实战指南:Docker 一键部署 + AI 辅助标注教程
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
训练视觉模型前,你多半卡在同一个环节:手上几百张图、几十段视频,得逐个框出"人"和"车"。人工框一天下来手都酸,进度却慢得让人怀疑人生。CVAT(Computer Vision Annotation Tool)就是干这件事的:一个可自托管的图像、视频与 3D 点云标注平台,支持矩形、多边形、骨架等标注工具,还能接入 YOLO、SAM 这类模型先自动打一遍底,你只做修正。
项目速览
| 项目 | 说明 |
|---|---|
| 定位 | 开源的视觉数据标注平台,为视觉 AI 构建高质量数据集 |
| 开源协议 | MIT(/serverless下个别模型资产另有许可,使用前看一眼) |
| 核心能力 | 图像/视频/点云标注、AI 辅助标注、团队任务分配、质量审核、20+ 格式导入导出 |
| 部署方式 | Docker Compose 自托管;另有托管版 CVAT Online 可先在浏览器试用 |
| 适用对象 | 个人开发者、需要标注数据做模型训练的团队、需要管理标注流程的组织 |
装好之后它就是一个网址,团队里谁都能登录干活,数据留在你自己的机器上。
数据怎么进来
建任务时上传入口支持四种来源:本地电脑、已挂载的文件共享、远程地址、云存储(S3、Azure Blob、Google Cloud 等)。图像方面,Pillow 支持的 JPEG、PNG、TIFF 都能读;视频走 FFmpeg 解码,MP4、AVI、MOV 都行;3D 场景用.pcd、.bin点云。一次可以传一个压缩包含整批图片的归档,不必逐张上传,详见 getting_started/overview.md。
标注怎么做
进入任务后,左侧工具栏就是标注工作台:矩形、多边形、椭圆、画笔(含"沿已有边界绘制"的自动描边)、关键点、骨架,3D 场景下则是 cuboid。它的工作方式值得先理解一条——首帧标好,后续帧自动传播:你在视频第 1 帧框住一辆车,CVAT 会把这个框沿时间轴跟过去,形成 track,你只需在跟踪漂移的地方手动修两下,比逐帧手框省力得多。
嫌手动也慢?就挂模型。仓库自带一批基于 Nuclio 的 serverless 预置模型(YOLOv7、RetinaNet、SAM、TransT 跟踪、HRNet 姿态等,列表见 serverless/),在标注界面打开 Automatic annotation 面板,选模型、把模型输出的类别映射到你定义的标签、设好阈值,点 Annotate,整段视频的框就自动铺满:
3D 点云则提供顶视/侧视/前视三视口联动的立方体标注,适合自动驾驶这类场景:
标完之后质量怎么保证?项目、任务、Job 三级结构把工作切给不同标注员;评审员可以在结果里留 issue、打回返工;还能用 Ground Truth 和 Honeypot 检查计算每个标注员的准确率,这套逻辑在后端 quality_control/ 模块里。
结果怎么导出、对接模型
导出时选目标格式即可:COCO、YOLO、Pascal VOC、KITTI、MOT 等 20 余种,导出到本地或云端。反过来也能把这些格式的旧标注导入继续编辑,迁移成本很低。想走自动化路线的话,pip install cvat-sdk装 Python SDK 或pip install cvat-cli装命令行工具,就能用脚本批量建任务、传数据、拉导出文件,接口定义可参考 cvat/schema.yml。
快速上手
前提:机器上装好 Docker Engine 和 Docker Compose。
- 拉取代码:
git clone https://gitcode.com/GitHub_Trending/cvat/cvat - 进入目录启动整套服务:
cd cvat && docker compose up -d - 创建管理员账号:
docker exec -it cvat_server bash -ic 'python3 ~/manage.py createsuperuser' - 浏览器打开
http://localhost:8080,登录后新建项目、上传数据、定义标签,开始标注 - (可选)启用 AI 辅助标注:
docker compose -f docker-compose.yml -f components/serverless/docker-compose.serverless.yml up -d,再按 annotation/auto-annotation/ 文档部署需要的模型
全程不到半小时能跑通第一个标注结果。
实战对照
| 你的任务 | 具体做法 | 预期效果 |
|---|---|---|
| 视频里批量框行人/车辆 | YOLOv7 自动标注铺底,人工修正漏检 | 相比纯人工逐帧框选,返修工作量大幅下降,人只做校对 |
| 医学图像精细分割 | 多边形 + 画笔工具,开"沿边界绘制"自动吸附 | 边界贴合度高,单帧耗时短于纯手绘 |
| 视频跟踪标注 | 首帧手框,TransT 跟踪器传播 | 一段几十秒的视频通常只需修几处漂移点 |
| 点云目标标注 | Standard 3D 模式下用 cuboid,三视口联动调整 | 顶/侧/前视角同时核对,位置更准 |
生态集成
开发侧三件套:Python SDK、CLI 工具、REST API,覆盖建任务到导出的全链路。数据侧可对接 S3、Azure Blob、Google Cloud 等对象存储,标注文件不必在本地和服务器之间来回倒。需要看标注吞吐和活跃情况时,仓库里自带 ClickHouse + Grafana 分析栈(见 components/analytics/)。
选型与避坑
- 先试水:用浏览器版 CVAT Online 免费档验证流程,确认标注规范再决定是否自托管。
- 中小团队:选 Community 版自托管,MIT 协议,数据不出内网;要改代码也自由。
- 企业:需要 SSO、审计日志、SLA 时看 Enterprise 版本。
- 浏览器:主要测试过 Chrome/Edge,Firefox 可用但有坑,Safari 不支持。
- 没有 GPU 能跑吗:能。预置模型跑 CPU 即可,只是自动标注慢一些,数据量特别大再考虑 GPU。
- 担心数据安全:自托管版本所有数据落在你自己的基础设施里,这正是它和托管版最大的区别。
一句话小结
CVAT 把"上传数据、自动打标、人工修正、审核、导出喂模型"整条链路收进一个自托管的 Web 应用,MIT 协议、Docker 一条命令起步、20 多种格式随你进随你出。只要你的项目要喂视觉模型,这套工具链值得放进备选清单。
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考