CVAT 入门:从 Docker 本地部署到第一次计算机视觉标注的完整指南
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
CVAT(Computer Vision Annotation Tool)是一个开源的计算机视觉标注平台,覆盖图像、视频和 3D 点云,内置 AI 自动标注、质量检查和团队协作。这篇文章带你用 Docker 装好 CVAT,再建第一个任务、画出第一个标注,目标是三十分钟拿到第一个结果,而不是背下一堆命令。
先花两分钟,回答三个问题
动手前先想清楚,能少走不少弯路。
第一,你需要 CVAT 吗?如果你手里有图像、视频或点云数据,要产出训练用的数据集,而且不想自己从零写标注页面,它值得跑起来。如果只是想转换几张图的格式,在线工具更快。
第二,单人还是团队?数据都放在一台机器上,团队则共用同一个 CVAT 实例:按 job 分配任务、按角色控制权限,进度互相可见。后文会点到协作的部分,单人可以直接跳过。
第三,怎么部署?本地试用就是 Docker Compose 一条命令的事,本文按这个走;如果你们已有 K8s 集群,仓库里的 Helm Chart 是另一条路,这里不展开。
CVAT Docker 一键部署:五条命令到页面打开
这一步解决"把整套平台拉到本机"。做完后,浏览器打开 localhost 能看到登录页。硬件上 16GB 内存、20GB 空闲磁盘比较从容,Docker 20.10 以上即可。
git clone https://gitcode.com/GitHub_Trending/cvat/cvat cd cvat docker compose up -d首次启动要拉取后端、前端、PostgreSQL、Redis 等镜像,快则几分钟,慢则十几分钟。跟进行度的命令是:
docker compose logs -f看到各容器依次变为 Up 就可以停掉日志、打开浏览器了。注意不用手动跑 migrate——数据库初始化在容器启动时自动执行。
拉镜像慢或失败?这是国内网络最常见的坎。两个办法:换一台网络好的机器docker pull后docker save打包,再本机docker load导入;或者给 Docker daemon 配置国内镜像加速器。
终端提示 permission denied?说明当前用户没有 docker 权限。图快就sudo docker compose up -d顶上,长期用则把用户加进 docker 组后重新登录。
8080 端口冲突怎么改
浏览器打不开,lsof -i:8080一看端口被占,别慌,改一行映射就行。打开 docker-compose.yml,找到 nginx 服务的 ports 段:
ports: - 9080:8080左边换成任意空闲端口,重启docker compose up -d,然后访问 http://localhost:9080。
登录即管理员:第一个注册账户就是超级用户
启动后进注册页,填邮箱和密码。CVAT 的机制是第一个注册的账户自动成为管理员,不需要钻进容器敲 createsuperuser。注册成功即进入主界面,此时项目列表是空的,这正是开始的地方。
第一个标注:上传一张图,画一个矩形
这一步解决"把数据放进去,画点东西出来"。做完后你能在画布上看到一个带标签的框。
点 New Task,选类型(Image 或 Video),填名字,定义标签比如 car,然后上传文件——单张图、视频或 zip 包都行。进入任务后会落到具体的 job 里,顶部工具栏是矩形、多边形、椭圆、画笔等工具。选矩形拖一个框,右侧点一下 car 标签,保存,第一个标注完成。视频则画一帧后自动向后续帧传播,不用逐帧点。
遇到密集的小目标,可以切到画笔按像素涂抹再自动成框,交互式标注的工具集比"只有矩形框"丰富不少。
让 AI 先画:CVAT 自动标注的用法
人工逐帧画太慢时,这一步解决"机器先出草稿,人来改"。
创建任务时直接选自动标注的模型,比如人体姿态估计,CVAT 会按模型自动生成对应标签——body、face、hands 都替你建好,然后照常上传数据。跑完得到的 AI 结果只是草稿,价值在于你只需逐个框做核对和微调,而不是从零画起。
3D 点云标注:给激光雷达数据打 3D 框
做自动驾驶感知的会关心这部分。上传 .bin / .pcd 点云后,画布换成三维视图:主视口加 Top、Side、Front 三个正交视角,在 3D 视图里拖出 cuboid 框,四个视图同步联动,机器人环境理解和三维重建也是同一套流程。
标注完成后:导出数据和看进度
这一步解决"成果怎么拿走、团队干了多少"。
任务详情里选 Request dataset,格式从 COCO、Pascal VOC 到 CVAT 自有格式都有,下载即用。项目层面的统计页把每个标签的框数、总形状数列出来,谁标了多少、卡在哪,团队负责人一眼可见。
团队协作顺带说清:项目所有者邀请成员,把 job 分下去,标注员只能看到分配给自己的任务,权限从 admin 到 annotator 逐级收窄。
卡住了看这里
三个坑基本覆盖所有新手问题:镜像拉不动,走加速器或 save/load 转存;docker 没权限,进 docker 组;8080 被占,改 ports 左边一位。再往后卡住,翻一遍 README 和 官方文档,里面每个功能都有更细的说明。
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考