CVAT 入门指南:LiDAR 点云标注与 3D 框怎么打
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
给模型团队交付一批街景点云数据:几千帧 LiDAR 扫描,每帧都要框出车辆、行人。听起来机械,做起来才知道 LiDAR 点云标注有多磨人。CVAT 是这样一个开源标注平台,把 3D 点云标注装进了浏览器,从导入、画 3D 框到质检导出都能完成。
LiDAR 点云标注为什么难
一个 3D 框要定 7 个参数:中心坐标、长宽高、朝向角。俯视图里一辆车就是个矩形,朝向角偏了 10 度根本看不出来;透视视图里远处的车位置偏了几厘米也照样"看着挺对"。单靠一个视角判断空间关系,错误很容易溜过去,必须多视角交叉核对。
量也是问题。单帧 LiDAR 数据动辄几百万个点,序列场景要上千帧。全程手画框,团队还没交付模型团队就要先离职。点云标注这件事,既要扛住数据量,又要守住精度,工具选错了就是双倍痛苦。
先体验:CVAT 的 3D 标注画布
打开一个 3D 任务,你会看到一个四联窗口:顶部主窗口是透视图,底部并排挂着 Top、Side、Front 三个正交投影视图。点云由 WebGL 直接渲染,转起来不卡;四个视图背后的 CVAT 3D 标注源码 是独立模块,TypeScript 编写,鼠标键盘操作各视图互相同步。
官方对这套界面的说明在 3D 任务工作区文档。如果任务里还带了关联相机图像,透视图里可以叠出 context image,3D 框和真实画面对着看,类别判断不容易跑偏。
点云标注上手三步
第一步:导入点云数据。新建任务时把维度设为 3D,上传 zip 压缩或单文件均可。CVAT 服务端会识别数据维度,并把点云统一转换成 PCD 处理。常见 LiDAR 点云标注格式对照如下:
| 格式 | 扩展名 | 典型用途 |
|---|---|---|
| PCD | .pcd | 点云数据交换的标准格式,CVAT 直接支持 |
| BIN | .bin | 自动驾驶数据集里常见的原始 LiDAR 扫描 |
| PLY | .ply | 通用几何点/面数据,建模与扫描领域常用 |
目前服务端开箱即用的是 PCD 与 BIN,其他格式的点位可以离线转成这两种再上传。
第二步:多视图标注。在透视图拖出 3D 框后,去投影视图里精修:Top 核对平面位置和朝向,Side 微调高度与尺寸,Front 确认前后关系。选中对象时,三个投影视图只渲染这个对象,相当于给它开了独立镜头,精修体验很顺手。
第三步:属性与标签。右侧面板切 Objects 视图管理对象、切 Labels 视图维护类别,支持按 ID 或标签排序,显示着色可选 Label、Instance、Group。给每个 3D 框绑上类别,再挂颜色、尺寸这类自定义属性,一帧的标注才算闭环。
效率与质量怎么抓
提效一条线:CVAT 可以挂接模型服务做服务器端预标注,训练好的检测模型先把框打上,标注员从"画"变成"改";时序场景里再叠上跟踪和插值,把前一帧的结果带到当前帧,重复劳动少一大截。
把关一条线:Review 审核模式加共识机制做交叉验证,同一份作业两人独立标、结果互检;质量报告按你配置的规则算匹配度,不达标的框能直接定位出来。作业可以分配到个人,进度面板和评论系统让问题有处可查、有人认领。
规模化与生态
性能上,大规模点云靠体素降采样、空间索引和分块加载来扛,避免整帧数据一次性塞进浏览器,已处理结果走缓存复用。生态上,CVAT 提供 Python SDK 和 REST API,建任务、传数据、拉结果全都能脚本化:
# cvat_sdk:远程创建 3D 点云任务 from cvat_sdk.api_client import Client client = Client('http://localhost:8080') client.login(username='admin', password='...') task = client.tasks.create( name='street_lidar', labels=[{'name': 'car'}, {'name': 'pedestrian'}], size=200, segmentation='cuboids', # 3D 任务 ) task.upload_data('scene.zip')自动驾驶数据集标注、高精地图要素标注、机器人导航数据生产,这几类场景它都能接住;开源标注平台属性意味着可以本地部署,数据不用出内网。
写在最后
- 四视图协同:透视图加 Top/Side/Front 三个投影视图,3D 框画完还能精修
- PCD、BIN 点云格式开箱即用,服务端自动做维度识别与格式转换
- 预标注、Review 审核、质量报告内置,交付前过一遍质检流程
- SDK 加 REST API 全接口开放,标注流程能直接嵌进你的数据管线
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考