做图像分类、目标检测或者三维点云任务时,很多开发者都会遇到一个很朴素的烦恼:同一个物体,只要旋转了一个角度,网络输出的结果就可能完全跑偏。为了缓解这种问题,最常见的做法是随机旋转增强,把不同角度的样本“喂”给网络。可问题往往没有这么简单——增强可以提升训练集的覆盖度,却不能从结构上保证模型对旋转真的有稳定的响应能力。
这篇文章围绕Rotational Equivariance in Machine Learning展开,也就是机器学习和深度学习里的“旋转等变性”。我会先解释旋转等变和旋转不变这两个容易被混淆的概念,再分析为什么普通卷积神经网络先天缺乏旋转等变能力,接着介绍主流的实现思路,并提供一个基于 PyTorch 的小实验来验证普通卷积的旋转敏感性。文章适合刚接触几何深度学习的新手,也适合希望在图像、点云、分子等任务中引入旋转等变结构的开发者。
1. 一个让普通卷积失效的问题
先来看一个非常常见的场景。假设我们有一个训练好的图像分类模型,训练集里的“汽车”基本都是水平摆放,车头朝左。测试时出现同一辆汽车,但视角被旋转了 30 度。对人类的视觉系统来说,这仍然是同一辆车,分类结果不应该改变。但传统卷积神经网络不一定能给出正确答案,因为卷积核在二维网格上学习到的特征,例如车轮和车身的相对位置,会随着旋转发生明显变化。
你可能会说:这个问题好解决,只要在训练时加入随机旋转增强,把数据样本做得足够多,模型不就能适应了吗?数据增强确实有效,但它的本质是在“数据分布”层面做补偿,不是让网络结构本身掌握旋转对称性。它更像用大量样本来掩盖结构上的不足。
那么,是否存在一种网络结构,能够让模型天然地“理解”旋转,而不是靠大量数据去硬学?这正是旋转等变性要讨论的问题。如果把“物体在图像中旋转”,看成是对输入施加了一个旋转变换,就很自然地会问:当输入发生了旋转,模型内部的特征和输出应该发生什么变化?
这个问题的答案分为两种:
- 输出保持完全不变,例如物体分类结果不会因为图像旋转而改变。
- 输出跟着旋转,例如检测模型产生的检测框、分割模型产生的像素级掩码,应该随图像同步旋转。
第二种需求就对应了旋转等变性。它并不是一个只在论文里出现的高级概念,而是真实工程任务中非常普遍的需求。
2. 什么是机器学习中的旋转等变性
2.1 旋转不变性与旋转等变性的区别
先给一个直观定义。
如果一个模型记为函数 (f),现在输入是一张图像 (x),我们对图像做一个旋转变换 (R),得到 (R(x))。
如果模型在旋转前后给出的结果完全一样,也就是:
[ f(R(x)) = f(x) ]
那么把这种性质称为旋转不变性(Rotation Invariance)。图像分类是一个典型任务,因为“旋转后是否还是同一只猫”这个语义不取决于角度,分类标签通常不会因为旋转而改变。
但是如果模型输出本身带有空间结构,比如分割掩码、检测框、像素级关键点,那么旋转后输出也应该跟着旋转。假设对输出特征执行同一个旋转操作 (R),期望满足:
[ f(R(x)) = R(f(x)) ]
这就是旋转等变性(Rotation Equivariance)。
为了减少符号上的压力,可以把这两个概念用一个简单例子理解:把一张“向右箭头”图片输入网络。
- 如果网络输出结果是“右”,那么旋转后图像还应该输出“右”,这是旋转不变性,因为类别没有方向。
- 如果网络输出的是一个箭头位置图,原图箭头向右,旋转后箭头指向下,那么输出特征图里的箭头也应该指向下,这就是旋转等变性。
两者容易混淆,一个简单判断方法是看任务输出是否携带空间方向信息。只关心“有没有某类物体”的分类任务,更多需要旋转不变;关心“物体在哪里、朝向哪里”的任务,通常会需要旋转等变。
用一张表来总结区别:
| 性质 | 数学表达 | 典型任务 |
|---|---|---|
| 旋转不变性 | (f(R(x)) = f(x)) | 图像分类、全局回归 |
| 旋转等变性 | (f(R(x)) = R(f(x))) | 语义分割、目标检测、位姿估计 |
| 混合形式 | 特征层等变、顶层不变 | 先提取旋转等变特征,再做全局池化完成分类 |
实际网络中,等变和不变并不互斥。很多旋转等变网络先把底层特征做成对旋转同步变化的表示,到了最上层需要全局标签时,再利用旋转维度的池化把等变特征转换为不变特征。
2.2 普通CNN为什么先天不具备旋转等变性
这个问题的根源在于卷积网络的设计原则。
卷积神经网络之所以对“平移”有很强的适配能力,是因为同一个卷积核会在输入的所有空间位置重复滑动,这种参数共享机制使它天然具有平移等变性。把一个物体在图像中移动几个像素,网络的卷积响应也会对应移动,因此平移等变在普通CNN里几乎是“免费”的。
但旋转变换不是这样。CNN的卷积核形状通常是矩形,例如 (3\times3) 或 (5\times5),这些卷积核本身带有明确的“方向偏好”。一个专门提取横向边缘的卷积核,很难响应纵向边缘,除非网络在别的卷积核里重新学一套纵向模板。
你可能会说:数据量足够大时,网络可以在同一层中学习到多个方向的卷积核。这种说法有一定道理,深度学习模型确实能通过海量数据隐式覆盖多个角度,但请注意:
- 这属于数据驱动的近似行为,不是模型结构对旋转的数学承诺。
- 网络需要额外参数来记住不同方向的模式,而不是利用旋转对称性来共享参数。
- 对训练集里出现频率低的方向,比如某些特殊旋转角度,模型泛化效果通常较差。
- 当数据中存在噪声、遮挡或样本量受限时,这种近似覆盖往往不可靠。
所以,普通CNN虽然可以实现平移等变,却没有先天旋转等变能力。要让网络真正对旋转保持稳定的结构诱导偏置,就需要显式设计包含旋转对称性的模型结构。
2.3 旋转等变性在哪些场景更关键
旋转等变性并不是所有任务都需要,但在以下场景中会非常关键。
第一类是图像方向不固定的视觉任务。比如遥感图像中的建筑物、船舶,由于卫星拍摄方向和目标摆放没有统一朝向,目标在图像中可以呈现任意旋转角度;医学病理切片、显微镜图像也常出现细胞或组织的任意朝向;工业缺陷检测中,产品可能在传送带上发生不同角度翻转。这些数据如果直接交给普通CNN,往往需要做大量增强。
第二类是三维几何与点云任务。三维点云里的物体可以在空间中任意旋转,例如用扫地机器人扫描到的椅子、用自动驾驶激光雷达捕获到的车辆,都不存在整齐统一的“世界方向”。模型如果把一个方向的椅子记住了,换一个方向就容易失效。点云分类和部件分割任务中引入旋转等变结构,能够显著降低对视角多样性的依赖。
第三类是分子性质预测和物理模拟。分子的几何结构在三维空间中做任意旋转,都不会改变它的化学性质,因此分子的能量、属性预测函数应该满足旋转不变性;而力场中的每个原子受力方向会随分子旋转而旋转,所以力预测等任务需要旋转等变性。这类数据通常样本量小、标注成本高,结构对称性约束非常有用。
第四类是目标检测和位姿估计。当模型不仅要识别物体,还要输出带方向的边界框、抓取位姿、车辆朝向时,普通分类网络常用的全局池化会丢掉方向信息。旋转等变特征可以将“响应位置”与“响应方向”同时保存在特征里,方便后续网络回归位姿。
3. 实现旋转等变性的主要技术路线
旋转等变性听起来很高深,但工程上并不是只能靠从头写论文模型来实现。下面几种路线各有优缺点,从最简单的数据层处理到严格的结构化卷积,横向对比会更容易理解。
3.1 数据增强:最朴素但最不彻底
最常见的方案是在训练时对输入做随机旋转。PyTorch 里通常这样写:
train_transform = transforms.Compose([ transforms.RandomRotation(30), transforms.ToTensor(), # 其他标准化 ])这个方案的优点是实现成本极低,对已有模型结构没有侵入性,也不需要改网络。它能让网络在一定程度上适应旋转后的输入分布。
缺点也很明显:
- 网络参数依然没有共享不同旋转方向的模式。
- 模型在角度采样足够密集、增强强度足够大时,表现可能变好,但需要更多训练数据与训练时间。
- 如果旋转角度超出了训练时设置的范围,模型依然容易崩溃。
- 它不能保证输出的结构跟随输入旋转,例如分割掩码的边界仍需要解码层来对齐方向。
因此,数据增强适合作为一种通用兜底手段,但很难用“让模型学会旋转”来描述它的作用,更准确的说法是“让模型见过更多旋转样本”。
3.2 主方向对齐:用预处理规避旋转
另一种思路是在输入进入网络前,先估计物体的主方向,