图像分类
判断整张图像属于哪个预定义类别,是深度学习在图像处理中最成熟的方向。
- 核心架构:CNN 通过卷积层、池化层和全连接层自动学习层次化特征。经典模型包括 LeNet-5、AlexNet、VGG、GoogLeNet/Inception 系列、ResNet(残差连接解决梯度消失)、DenseNet(密集连接增强特征复用)、EfficientNet(复合缩放优化效率)等。
- 视觉 Transformer:ViT 将图像切分为 Patch 序列,利用自注意力机制建模全局依赖;Swin Transformer 引入滑动窗口机制,在保持计算效率的同时捕捉长程关系。
- 迁移学习:利用在 ImageNet 等大规模数据集上预训练的模型(如 ResNet50),通过微调快速适应特定领域任务,大幅降低标注数据需求。
目标检测
在图像中定位并识别多个物体,同时输出类别和边界框。
- 两阶段检测器:先生成候选区域,再对候选区域分类和回归。代表算法有 R-CNN、Fast R-CNN、Faster R-CNN,精度高但速度相对较慢。
- 单阶段检测器:直接在图像上进行密集预测,速度快,适合实时应用。代表算法有 YOLO 系列(YOLOv5/v8/v11 等)和 SSD。
- 基于 Transformer 的检测器:DETR 将目标检测转化为集合预测问题,利用自注意力机制实现端到端检测,无需 NMS 后处理。
图像分割
将图像划分为具有语义意义的区域,精度达到像素级别。
- 语义分割:为每个像素分配类别标签。FCN(全卷积网络)奠定了深度学习分割的基础;DeepLab 系列引入空洞卷积和条件随机场(CRF)提升边界精度。
- 实例分割:区分同一类别的不同个体。Mask R-CNN 在 Faster R-CNN 基础上增加掩码预测分支,实现检测与分割的统一。
- 全景分割:语义分割与实例分割的结合,同时处理可数物体和不可数背景区域。
- 编码器-解码器架构:U-Net 及其变体(3D U-Net、Attention U-Net、UNet++、UNet 3+)通过跳跃连接融合浅层细节与深层语义特征,在医学图像分割中广泛应用。
图像生成与编辑
从噪声或条件输入创造新图像,或对现有图像进行编辑。
- 生成对抗网络(GAN):生成器与判别器对抗训练。变体包括 StyleGAN(高质量人脸生成)、CycleGAN(无配对风格迁移)、Pix2Pix(配对图像翻译)、SRGAN(超分辨率)等。
- 变分自编码器(VAE):基于概率图模型学习数据潜在表示,从潜在空间采样生成新图像,生成多样性好。
- 扩散模型:通过逐步去噪过程从随机噪声生成图像,是当前图像生成的主流范式。代表模型有 DDPM、Stable Diffusion、DALL·E 等,生成质量高且支持文本条件控制。
- 图像修复(Inpainting):基于 GAN 或扩散模型,根据周围上下文信息填补缺失或损坏的图像区域。
图像复原与增强
改善退化图像的质量,恢复丢失的细节信息。
超分辨率重建
从低分辨率图像恢复高分辨率细节。早期方法如 SRCNN 通过三层卷积实现超分;ESRGAN 引入残差密集块和对抗训练,显著提升视觉质量;SwinIR 将 Swin Transformer 引入超分任务,捕捉长程依赖。
图像去噪
- 监督方法:使用成对的干净/含噪图像训练,如 DnCNN。
- 自监督方法:仅需含噪图像即可训练,通过巧妙的损失函数设计实现去噪,如 Noise2Void。
- 结合注意力机制:精准定位噪声区域,在去噪的同时保留纹理细节。
图像去模糊
利用深度学习从模糊图像中恢复清晰内容,包括非盲去模糊(已知模糊核)和盲去模糊(未知模糊核)两种设定。
低光照增强
基于 Retinex 理论与深度学习的结合,将图像分解为光照图和反射图分别处理,提升暗区亮度的同时避免过曝。
图像去雾/去雨
利用深度学习建模雾/雨的物理退化过程,从退化图像中恢复清晰场景。ViT 变体在此类任务中展现了跨模态增强的潜力。
风格迁移与色彩处理
- 风格迁移:将一幅图像的艺术风格应用到另一幅图像上。Gatys 等人的方法基于内容损失和风格损失的联合优化;CycleGAN 实现无配对数据的风格转换。
- 图像着色:将灰度图像自动转换为彩色图像,通常采用条件 GAN 或编码器-解码器架构。
图像融合
将多源图像信息整合为一幅高质量图像。
- 多聚焦图像融合:深度学习结合注意力机制,自动选择各源图像中清晰区域进行融合。
- 多模态图像融合:如红外与可见光融合、医学影像中 CT/MRI/X 射线的跨模态融合,提升信息完整性和诊断准确性。
三维视觉与重建
- 深度估计:从单目或双目图像预测场景深度图。
- 三维重建:NeRF(神经辐射场)利用神经网络隐式表示三维场景,实现新视角合成;3D Gaussian Splatting 进一步提升渲染效率。
- 点云处理:PointNet 等模型直接处理无序三维点云数据,用于三维目标识别和场景理解。
关键支撑技术
贯穿上述各类方法的通用技术模块:
| 技术 | 作用 |
|---|---|
| 注意力机制 | SE(通道注意力)、CBAM(空间+通道)、自注意力,使模型聚焦关键区域 |
| 特征金字塔网络(FPN) | 多尺度特征融合,提升不同大小目标的检测能力 |
| 数据增强 | 随机裁剪、翻转、CutMix、Mosaic 等扩充训练数据多样性 |
| 正则化 | Dropout、DropConnect、L2 正则化防止过拟合 |
| 模型轻量化 | 知识蒸馏、剪枝、量化、NAS(神经架构搜索),推动边缘部署 |
| 自监督/对比学习 | MoCo、SimCLR 等框架减少对标注数据的依赖 |
📌 总结来说,基于深度学习的图像处理方法已形成覆盖分类、检测、分割、生成、复原、增强、融合、三维重建等全方位的技术体系。底层架构从 CNN 演进到 Transformer 再到扩散模型,学习范式从全监督拓展到自监督、弱监督和少样本学习。各方法之间并非孤立——例如 GAN 和扩散模型既用于图像生成,也用于超分辨率和去噪等复原任务——体现了深度学习在图像处理领域强大的通用性和灵活性。