news 2026/9/10 16:13:16

CVAT 入门指南:LiDAR 点云标注与 3D 框怎么打

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
CVAT 入门指南:LiDAR 点云标注与 3D 框怎么打

CVAT 入门指南:LiDAR 点云标注与 3D 框怎么打

【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat

给模型团队交付一批街景点云数据:几千帧 LiDAR 扫描,每帧都要框出车辆、行人。听起来机械,做起来才知道 LiDAR 点云标注有多磨人。CVAT 是这样一个开源标注平台,把 3D 点云标注装进了浏览器,从导入、画 3D 框到质检导出都能完成。

LiDAR 点云标注为什么难

一个 3D 框要定 7 个参数:中心坐标、长宽高、朝向角。俯视图里一辆车就是个矩形,朝向角偏了 10 度根本看不出来;透视视图里远处的车位置偏了几厘米也照样"看着挺对"。单靠一个视角判断空间关系,错误很容易溜过去,必须多视角交叉核对。

量也是问题。单帧 LiDAR 数据动辄几百万个点,序列场景要上千帧。全程手画框,团队还没交付模型团队就要先离职。点云标注这件事,既要扛住数据量,又要守住精度,工具选错了就是双倍痛苦。

先体验:CVAT 的 3D 标注画布

打开一个 3D 任务,你会看到一个四联窗口:顶部主窗口是透视图,底部并排挂着 Top、Side、Front 三个正交投影视图。点云由 WebGL 直接渲染,转起来不卡;四个视图背后的 CVAT 3D 标注源码 是独立模块,TypeScript 编写,鼠标键盘操作各视图互相同步。

官方对这套界面的说明在 3D 任务工作区文档。如果任务里还带了关联相机图像,透视图里可以叠出 context image,3D 框和真实画面对着看,类别判断不容易跑偏。

点云标注上手三步

第一步:导入点云数据。新建任务时把维度设为 3D,上传 zip 压缩或单文件均可。CVAT 服务端会识别数据维度,并把点云统一转换成 PCD 处理。常见 LiDAR 点云标注格式对照如下:

格式扩展名典型用途
PCD.pcd点云数据交换的标准格式,CVAT 直接支持
BIN.bin自动驾驶数据集里常见的原始 LiDAR 扫描
PLY.ply通用几何点/面数据,建模与扫描领域常用

目前服务端开箱即用的是 PCD 与 BIN,其他格式的点位可以离线转成这两种再上传。

第二步:多视图标注。在透视图拖出 3D 框后,去投影视图里精修:Top 核对平面位置和朝向,Side 微调高度与尺寸,Front 确认前后关系。选中对象时,三个投影视图只渲染这个对象,相当于给它开了独立镜头,精修体验很顺手。

第三步:属性与标签。右侧面板切 Objects 视图管理对象、切 Labels 视图维护类别,支持按 ID 或标签排序,显示着色可选 Label、Instance、Group。给每个 3D 框绑上类别,再挂颜色、尺寸这类自定义属性,一帧的标注才算闭环。

效率与质量怎么抓

提效一条线:CVAT 可以挂接模型服务做服务器端预标注,训练好的检测模型先把框打上,标注员从"画"变成"改";时序场景里再叠上跟踪和插值,把前一帧的结果带到当前帧,重复劳动少一大截。

把关一条线:Review 审核模式加共识机制做交叉验证,同一份作业两人独立标、结果互检;质量报告按你配置的规则算匹配度,不达标的框能直接定位出来。作业可以分配到个人,进度面板和评论系统让问题有处可查、有人认领。

规模化与生态

性能上,大规模点云靠体素降采样、空间索引和分块加载来扛,避免整帧数据一次性塞进浏览器,已处理结果走缓存复用。生态上,CVAT 提供 Python SDK 和 REST API,建任务、传数据、拉结果全都能脚本化:

# cvat_sdk:远程创建 3D 点云任务 from cvat_sdk.api_client import Client client = Client('http://localhost:8080') client.login(username='admin', password='...') task = client.tasks.create( name='street_lidar', labels=[{'name': 'car'}, {'name': 'pedestrian'}], size=200, segmentation='cuboids', # 3D 任务 ) task.upload_data('scene.zip')

自动驾驶数据集标注、高精地图要素标注、机器人导航数据生产,这几类场景它都能接住;开源标注平台属性意味着可以本地部署,数据不用出内网。

写在最后

  • 四视图协同:透视图加 Top/Side/Front 三个投影视图,3D 框画完还能精修
  • PCD、BIN 点云格式开箱即用,服务端自动做维度识别与格式转换
  • 预标注、Review 审核、质量报告内置,交付前过一遍质检流程
  • SDK 加 REST API 全接口开放,标注流程能直接嵌进你的数据管线

【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/10 16:13:13

北京点众科技公司客服最新推出扣款热线服务退款指南!

在数字经济与游戏产业深度融合的浪潮中,游戏企业既是数字娱乐体验的创造者,更是合规运营与用户权益的守护者。游科技”)自2020年9月成立以来,依托腾讯集团的资源优势,以游戏运营与服务为核心赛道,在多元产品…

作者头像 李华
网站建设 2026/9/10 16:12:59

VTK坐标系统与Picker机制深度解析

1. VTK Picker与坐标系统核心解析 在三维可视化开发中,精准的交互操作离不开坐标系统的精确定位。VTK作为经典的可视化工具库,其Picker机制和坐标转换体系构成了交互功能的基础设施。我曾在医疗影像导航系统开发中,花了整整两周时间解决一个由…

作者头像 李华
网站建设 2026/9/10 16:12:47

手部穴位关键点识别:多通道融合与亚像素回归实战

简介:本资源是一套基于Python实现多通道手部穴位关键点识别的完整深度学习项目,面向计算机视觉初学者、中医药信息化研究者及AI医疗方向实践者,解决传统手诊中穴位定位依赖经验、缺乏量化标准的问题。项目以YOLOv8为核心模型,融合…

作者头像 李华