从拿到素材到交付数据集:CVAT 数据标注工作流的 4 个环节
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
Computer Vision Annotation Tool(CVAT)是一个开源的数据标注平台,覆盖 2D 框、多边形、掩码、关键点和 3D cuboid 标注。如果你是算法工程师或数据标注负责人,需要把原始素材变成可训练的标注数据,下面这套流程是我实际用下来的顺序。
环节一:Docker 3 行起服务,5 分钟进标注页
前提:机器装好 Docker 和 Docker Compose,建议 8GB 以上内存、50GB 以上磁盘。
端口:前端默认监听 8080,和本地服务冲突时改 docker-compose.yml 里的端口映射即可。
浏览器:官方主要测试 Chromium 系浏览器(Chrome、Edge),Firefox 可能有兼容问题。
启动完整服务栈:克隆仓库、拉起容器、创建管理员账号,一条命令链做完:
git clone https://gitcode.com/GitHub_Trending/cvat/cvat cd cvat docker compose up -d docker exec -it cvat_server bash -ic 'python3 ~/manage.py createsuperuser'打开http://localhost:8080用刚建好的账号登录,任务列表页就是所有标注工作的起点。
环节二:建任务、定标签,标出第一帧
CVAT 的层级是Project → Task → Job:项目归组相关数据集,任务是一批数据,Job 是分配给某个人的工作切片,进度按 Job 统计。
- 新建任务:选择数据类型(图像、视频或点云)并上传,本地文件、压缩包、S3/Azure/Google Cloud 云存储都可以。
- 定义标签:如
car、person,每个标签配独立颜色,再挂属性(遮挡、截断等);属性分固定值(如年龄)和每帧可变值(如可见度)两种。 - 分配 Job:把 Job 指派给标注员,状态会走
new → in progress → completed。
编辑器里鼠标悬停任意控件都能看到它的快捷键:N下一帧、P上一帧、Ctrl+Z撤销,全部可在设置里自定义,完整清单见 shortcuts.md。
环节三:视频任务省一半时间
Track 模式与插值
视频逐帧画框是浪费。切到Track 模式后只在关键帧画形状,CVAT 对中间帧做线性插值,你只需要修正目标快速移动或被遮挡的帧。
刷笔工具
做掩码级标注时,刷笔比手画多边形快:直接刷出掩码区域,工具会把像素结果转成多边形,还带像素级和底层两种刷法。
自动标注:接入预训练模型
CVAT 的自动标注跑在 serverless 模型服务上,仓库自带检测(YOLOv7、Faster R-CNN)、分割(SAM)、姿态估计(HRNet)等现成模型。先加上 serverless 组件再起服务:
docker compose -f docker-compose.yml -f components/serverless/docker-compose.serverless.yml up -d用nuctl把模型函数部署上去,它们就会出现在编辑器的 Auto Annotation 对话框里。典型流程:选模型、框选区域、生成结果、人工修正。骨架标注是常见用途之一:
环节四:3D 场景的 cuboid 怎么画
自动驾驶这类激光雷达数据建 3D 任务:点云和相机图片一起上传后,在 3D 画布里画 cuboid,多个相机视角同步显示,也可以直接输入尺寸参数修正。工作区的完整说明在 3d-task-workspace.md。
环节五:多人协作不乱阵脚
质检与共识
多人标注同一批数据时用Consensus模式:多个副本独立标注后合并,直接算出标注员之间的一致率。更严格的 Ground Truth 和 Honeypot 校验走服务端 API 触发,机制见 consensus.md。
导出数据集,直接进训练
标完在 Job 上导出:COCO(JSON)、YOLO(TXT)、PASCAL VOC、KITTI 按需选,拿到的就是训练脚本能读的文件,不用写转换脚本。各格式的读写实现在 cvat/apps/dataset_manager/formats/,想程序化管理的话pip install cvat-sdk可以用 Python 完成任务创建、上传和导出。
我的建议:先按上面的命令把社区版跑起来,扔十几张图建一个任务,从定标签到导出 COCO 完整走一遍,这套工作流就顺了。
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考