海洋科学  2025, Vol. 49 Issue (8): 1-10   PDF    
http://dx.doi.org/10.11759/hykx20241211001

文章信息

丁辰, 王瑞富, 孟俊敏. 2025.
DING Chen, WANG Ruifu, MENG Junmin. 2025.
基于CCD图像的海浪波高反演方法探索
Research on sea wave height estimation methods utilizing CCD imaging
海洋科学, 49(8): 1-10
Marine Sciences, 49(8): 1-10.
http://dx.doi.org/10.11759/hykx20241211001

文章历史

收稿日期:2024-12-11
修回日期:2025-02-11
基于CCD图像的海浪波高反演方法探索
丁辰1,2, 王瑞富1, 孟俊敏2     
1. 山东科技大学, 山东 青岛 266590;
2. 自然资源部第一海洋研究所, 山东 青岛 266061
摘要:本文基于深度学习方法, 利用工业电荷耦合器件(Charge Coupled Device, CCD)摄像机拍摄的海浪图像及对应测波雷达获取的有效波高数据, 开展了海浪有效波高的反演研究。为准确提取图像中的有效波高信息, 对图像进行了倾斜校正, 并将校正图像输入改进后的EfficientNetB7模型进行反演。反演实验结果表明, 本文提出的方法较可行, 对比ResNet152、InceptionV3、DenseNet264等传统卷积神经网络模型, 反演精度更高。通过这一方法, 本文探索并验证了深度学习技术在复杂海况下进行波高反演的潜力, 为相关领域的研究提供了新的技术路径。
关键词有效波高反演    卷积神经网络    海浪图像    透视变换    图像回归    
Research on sea wave height estimation methods utilizing CCD imaging
DING Chen1,2, WANG Ruifu1, MENG Junmin2     
1. Shandong University of Science and Technology, Qingdao 266590, China;
2. First Institute of Oceanography, Ministry of Natural Resources, Qingdao 266061, China
Abstract: This study investigates a deep learning-based method for retrieving significant wave height (SWH) using wave images captured by an industrial charge-coupled device (CCD) camera and corresponding SWH measurements from a wave radar. To accurately extract SWH information, the images were first tilt-corrected and then input into an improved EfficientNetB7 model for inversion. Experimental results demonstrate that the proposed method is highly feasible and achieves superior inversion accuracy compared with traditional convolutional neural network models, including ResNet152, InceptionV3, and DenseNet264. This study explores and validates the potential of deep learning techniques for SWH inversion under complex sea conditions, providing a new technical pathway for related research.
Key words: significant wave height inversion    convolutional neural networks    ocean wave images    perspective transformation    image regression    

海浪是海洋动力学预测的重要的对象。有效波高作为描述海浪的一个重要参数, 提供了海浪高度分布的一个统计度量, 有效波高的测量和分析, 在海洋工程建设、海洋灾害预警、海上航行与作业安全等方面具有极其重要的作用。

近年来, 对波高的研究和观测活动显著增加。传统测量有效波高的方法如利用波浪浮标、测波雷达和遥感卫星等, 能够在一定程度上获取海浪参数, 但也各自存在一些限制。波浪浮标等现场仪器具有实时性和准确性的优点, 但由于仪器成本高昂、受天气条件限制等, 无法实现大规模区域观测。而测波雷达和遥感卫星, 虽然能够避免单点测量的限制, 但测波雷达的成本高昂、需要定期校准和维护; 遥感卫星虽然能获取大范围的数据, 但其获取的数据的时间连续性往往有限。因此, 当前测波方法的挑战之一就是寻找更经济、有效且稳定的波高获取方法, 以满足不同尺度和环境条件下的海洋监测需求。

随着深度学习技术的快速发展, 神经网络模型在海洋科学研究中的应用日益广泛。相比于传统的参数反演方法, 深度学习技术能够自动提取数据中的非线性关系和复杂模式, 从而实现更高效、精准的海浪参数提取。此外, 海浪图像现场观测设备具有安装便捷、成本低廉的优势, 将深度学习与海浪图像数据相结合, 可充分发挥两者优势, 提高海洋参数反演的准确性和适用性。

根据模型输入数据的不同, 现有的方法主要分为利用单张图像和序列图像2种。使用单张图像作为输入主要依赖图像的纹理特征和空间信息, 多用于海浪分类和近岸海浪反演。Kang等[1]提出了一种卷积神经网络方法来辅助海浪的分类, 并在精度和模型计算速度方面与其他传统模型进行了比较, 其准确度达到了96.23%。Chen等[2]提出了基于卷积神经网络的双目立体测量海浪提取和匹配方法。Buscombe等[3]开发了一种基于神经网络模型的远程海浪测量技术, 根据海浪图像反演波高和周期, 并对校正前后图像的反演结果进行了比较。Yoon等[4]使用卷积神经网络, 分析了CCTV(Closed Circuit Television)图像的波形观测, 并通过3个不同的数据集找到了利用CCTV观测波形的最佳方法。Bai等[5]使用无人机获取海洋环境图像信息, 并通过卷积网络自动提取海浪特征, 实现了从单个图像推断区域海浪变化, 并对海浪状况进行了分类。Huang等[6]利用近岸海浪图像和相关浮标数据进行波高反演, 并结合风速等气象数据与图像特征融合来提高反演的精度。

输入序列图像则是利用时间序列信息进行海浪的精确反演, 这一方法通过连续帧图像捕捉海浪变化, 能够更全面地反映海浪的动态特性。Kim等[7, 8]利用近岸视频图像, 基于对抗性生成网络实现了对海浪的跟踪以及瞬时波速的估计, 将模型分为了视频增强、水动力学场景分离和海浪跟踪3部分。随后提出了一种多视图水面高程估计方法, 基于波浪水槽实验, 通过卷积神经网络从波高观测的视频中提取波高信息, 进行水位高程估计。Wu等[9]考虑了时空信息, 采用三维卷积移动神经网络, 结合3DCNN和可分离卷积, 将RGB相机采集的实时视频数据作为模型输入, 提取视频连续帧间的信息, 同时反演波高和周期。Choi等[10]采用ConvLSTM的双向时序预测模型, 从一组连续海洋图像中估计实测有效波高。Song等[11]提出了一个由近岸监测视频确定波高的多级时空特征融合的网络。Kim等[12]基于序列图像, 利用LSTM和CNN预测平均波高, 在模型数据集的构建过程中, 加入了数据增强技术。

综上所述, 尽管现有方法已能基于视频数据精确反演波高, 但大多数研究主要依赖于时间序列信息, 且基于图像数据的相关研究多集中于海浪分类任务或近岸海域的波高反演, 相较之下, 利用图像数据的开阔海域波浪反演研究仍存在一定的空白。本文旨在探索并尝试利用固定平台摄像机拍摄的CCD图像, 结合测波雷达提供的有效波高数据, 通过神经网络模型提取海浪图像的深层特征, 学习海浪图像与有效波高之间的映射关系, 从而实现在开阔海域复杂海况下有效波高的估算。通过这一方法, 我们不仅能够实现开阔海域海浪的监测, 还为现有基于图像和视频反演海浪波高的技术提供了有效的补充和拓展。

1 数据源 1.1 研究区域

本文数据依托于番禺30-1平台(PY30-1)上安装的CCD工业摄像机, 以及搭载于平台的测波雷达。番禺30-1平台位于南海北部(20°14′41″N, 114°56′28.7″E)。相较于近岸海浪, 此处开阔海域的海浪波高分布更为广泛, 且海浪传播方向更加复杂, 采集到的海浪图像涵盖了多种不同条件下的海浪特征。这种海浪环境为利用深度学习模型提取图像中的海浪特征提供了理想条件, 从而提升了模型所学习特征的泛化能力。

1.2 数据介绍

本文图像数据来自MV-VS078FM-L型号的工业CCD摄像机, 固定于平台54 m高处的甲板护栏外侧, 朝向东南。摄像机工作时间为上午6时至下午6时, 拍摄工作时长约为12 h, 每隔5 s拍摄一次并将图像保存进主机, 分辨率固定为768×1 024, 拍摄倾角约61°。摄像机运行时间为2011年8月至2013年7月, 期间由于台风, 平台断电, 累计停机70多天。

波高数据来自C波段测波雷达, 雷达安装于平台上, 其观测区域与摄像机拍摄区域具有一定重叠, 用于同步采集海浪参数和海流参数, 选取有效波高数据作为后续反演实验的标签数据。雷达工作时间为全天候, 其观测频率为每2~3 min一次, 其监测时段为2011年2月至2012年7月。

图像和有效波高数据的时间段覆盖范围如图 1所示, 摄像机运行时间和雷达的工作时间的重叠时间段为2011年8月至2012年7月, 此时间段既有图像数据, 又有有效波高数据。因此, 本文使用此重叠时间段的数据进行后续实验, 用于深度学习数据集构建工作, 将其作为输入图像和标签数据。

图 1 CCD图像数据和测波雷达有效波高数据的覆盖时间段 Fig. 1 Overlapping time period of CCD image data and significant wave height data from the wave radar
2 方法

本文研究方法主要包括数据集构建和模型构建两部分。数据集构建涵盖了对训练和测试数据的处理方法, 包括数据的匹配与筛选、图像的预处理和数据集的合理划分。模型构建包括基准模型选择与模型改进两个方面。

2.1 数据集构建 2.1.1 数据匹配和筛选

由于测波雷达的观测时间与相机拍摄时间并不完全对齐, 为了构建足够大的数据集, 本文将测波雷达观测时间后5 s内拍摄的图像视为与该时刻有效波高数据的匹配图像。此做法是基于波高通常不会发生瞬时突变, 且测波雷达的观测时间间隔并不长, 因此, 将5 s内的图像视为与一个波高值对应是合理且可行的。

在完成图像与波高数据的初步匹配后, 需要进一步对数据进行筛选。考虑到极高海况的图像数据过少, 本实验只采用5 m以下的波高进行训练和测试。一般情况下拍摄的海浪图像如图 2(a)(b)(c)所示, 从左至右其匹配的有效波高分别为1.0 m、2.0 m、3.0 m。此外, 在摄像机的连续拍摄过程中, 图像不可避免地会包含一些干扰信息, 可能会影响图像质量。例如, 存在强烈耀斑、降雨或值守船等干扰物的图像, 如图 2(d)(e)(f)所示。为确保数据集的有效性和反演结果的准确性, 本文在构建数据集时剔除了这些干扰图像, 保留剩余的图像用于数据集的构建。最终匹配测波雷达数据并可用于数据集构建的图像数量为67 005。

图 2 实验相关的图像示例 Fig. 2 Examples of images related to the experiment
2.1.2 图像预处理

由于图像的RGB信息对波高反演并非关键因素, 本文将RGB图像转换为灰度图像以简化数据处理流程。此外, 在光照较强的时间段, 太阳光的反射常常导致图像中出现不同程度的耀斑。对于那些因强烈耀斑导致信息严重丢失的图像, 已通过人工方式删除; 而对于存在较弱耀斑的图像, 考虑到数据集构建的充分性, 这些图像仍作为有效的数据被保留。

然而, 这类图像由于耀斑的影响, 像素值分布不均匀, 可能对模型的特征提取和量化带来一定影响。为了减轻上述问题, 本文采用了CLAHE(限制对比度自适应直方图均衡化)方法对图像进行预处理。CLAHE方法能够有效改善亮度变化较大的图像, 通过平衡不同区域的亮度, 使图像整体视觉效果更加均衡。不仅能有效提升图像的局部细节表现, 还能减少由光照变化或耀斑造成的图像亮暗不均, 进而增强模型对图像特征的提取能力。

此外, 考虑到摄像机在拍摄过程中存在一定的倾斜角度, 模型对这种几何畸变可能表现出较弱的鲁棒性, 本文对图像进行了倾斜校正。但由于图像中缺少足够的控制点, 直接通过传统的倾斜校正方法进行处理较为困难, 因此本文采用了一种基于相机参数的透视变换方法。如图 3所示, 依据小孔成像模型和透视原理, 对拍摄视场的形状进行分析。假定视场为近端窄、远端宽的等腰梯形, 这种假设源于透视投影的特点, 即相机光轴与被摄物体之间存在一定的倾角时, 会导致成像中的平行线向消失点收敛, 从而产生透视变形。本文假设在与拍摄方向平行的方向上, 视场的最小实际长度为H, 与拍摄方向垂直的方向上, 近端和远端的实际宽度分别为$ B_{1} $$ B_{2} $

图 3 相机成像示意图 Fig. 3 Camera imaging diagram

首先, 根据相机参数计算视场角$ \alpha_{x} $$ \alpha_{y} $, 公式如下:

$ {\alpha _x} = 2 \cdot {\text{arctan}}\left( {\frac{a}{{2f}}} \right), $ (1)
$ {\alpha _y} = 2 \cdot {\text{arctan}}\left( {\frac{b}{{2f}}} \right), $ (2)

其中f为相机内部焦距, ab为相机成像元的实际物理尺寸。

然后, 基于小孔成像模型, 通过相机成像的几何关系, 计算视场倾斜拍摄区域中的$ B_{1} $$ B_{2} $以及H:

$ {B_1} = \frac{h}{{{\text{cos}}\left( {\beta - \frac{{{\alpha _y}}}{2}} \right)}} \cdot {\text{tan}}\left( {\frac{{{\alpha _x}}}{2}} \right) \cdot 2, $ (3)
$ {B_2} = \frac{h}{{{\text{cos}}\left( {\beta + \frac{{{\alpha _y}}}{2}} \right)}} \cdot {\text{tan}}\left( {\frac{{{\alpha _x}}}{2}} \right) \cdot 2, $ (4)
$ H = h\left[ {{\text{tan}}\left( {\beta + \frac{{{\alpha _y}}}{2}} \right) - {\text{tan}}\left( {\beta - \frac{{{\alpha _y}}}{2}} \right)} \right], $ (5)

其中, β为拍摄倾角, h为拍摄高度, 其余参数与上述一致。

基于相机参数和小孔相机模型中的几何关系, 且已知相机焦距f为5 mm、拍摄倾角β为61.435°、拍摄高度h为54 m、相机成像元的实际物理尺寸a×b为4.761 6×3.571 2 mm2, 可计算得到拍摄区域视场的实际范围为$ B_{1} $=68 m, $ B_{2} $=311 m, H=296 m。

透视变换方法是一种基于几何变换的校正方法, 通过矩阵运算将二维图像从一个平面投射到另一个平面, 按透视投影原理重新映射图像中的点, 以校正视角变形[13]。透视变换的关键在于找到变换前后对应的4组点。根据上述计算结果, 以视场左上角为原点(0, 0), 确定了视场4个角点的相对坐标。假设一个像素点的分辨率为2 m, 则右上角的相对坐标为(663, 0), 左下角为(263, 591), 右下角为(399, 591)。这样, 原图像中的四个角点(0, 0)、(1023, 0)、(0, 767)、(1023, 767)分别对应视场中的4个角点(0, 0)、(663, 0)、(263, 591)、(399, 591), 形成4组对应点。将这4组对应点代入透视变换的矩阵公式:

$ \left( {\begin{array}{*{20}{c}} X \\ Y \\ 1 \end{array}} \right) = \left( {\begin{array}{*{20}{c}} {{a_{11}}}&{{a_{12}}}&{{a_{13}}} \\ {{a_{21}}}&{{a_{22}}}&{{a_{23}}} \\ {{a_{31}}}&{{a_{32}}}&1 \end{array}} \right)\left( {\begin{array}{*{20}{c}} x \\ y \\ 1 \end{array}} \right). $ (6)

可求解得到变换矩阵的8个未知参数$ a_{11} $$ a_{32} $, 从而得到了该对应关系下的变换矩阵; 其中(x, y)为原图像中4个角点的像素点坐标, 即(0, 0)、(1023, 0)、(0, 767)、(1023, 767); (X, Y)为梯形视场4个角点的相对坐标, 即(0, 0)、(663, 0)、(263, 591)、(399, 591)。

最后, 将求解出的变换矩阵应用到图像的所有像素点上, 实现对图像的校正。校正后图像尺寸为592×664, 对校正图像进行剪切, 保证图像整体的清晰度以及去除部分无信息区域, 剪切后的尺寸为300×400, 校正并剪切后的图像如图 4所示。校正后的图像像素与像素之间的距离与实际距离具有相应的比例, 通过将校正后的图像输入网络进行训练, 能够还原因倾斜拍摄而造成的像素间的相对位置关系畸变, 更有利于模型学习海浪图像间的普遍特征。

图 4 校正剪切后的图像 Fig. 4 Corrected and sheared images
2.1.3 数据集划分

根据深度学习的数据集划分原则, 本文将处理后的图像数据集按照4∶1的比例划分。然而, 同一天拍摄的图像环境条件相似, 如果将同一天的图像分别分配到训练集和测试集, 可能导致数据污染的问题。模型在这种特定的测试集下表现良好, 但泛化性能差。最理想的划分方式应是基于时间序列的方式, 即将数据集中的前一整段时间的数据用于训练, 后续时间段的数据用于测试。这种方法能够有效避免数据污染问题, 从而提高模型的泛化能力。同时考虑到模型数据集的数据分布差异过大也会影响模型泛化性能。因此, 为了进一步确保波高分布在训练集和测试集中的一致性, 本文在构建数据集时, 首先按照日期对数据进行初步划分, 然后将每天的数据作为一个整体在训练集和测试集之间进行调整。这样不仅有效避免了数据泄露的风险, 还确保了在相似波高分布条件下模型进行训练与测试。最终训练集和测试集分别包含54 038张和12 967张图像, 波高值分布如图 5所示。经过调整后, 两个数据集在各自数据中的组间比例趋于一致, 使得在利用测试集验证模型时, 获得更加精确和可靠的结果。

图 5 训练集(a)、测试集(b)的数据组成 Fig. 5 Composition of the training (a) and testing (b) datasets
2.2 模型构建与改进 2.2.1 基准模型介绍

本文选择EfficientNetB7[14]作为基准模型进行实验。EfficientNet架构通过结合复合缩放策略和神经架构搜索技术, 在图像输入分辨率、网络深度和特征图通道数3方面进行协同优化, 以提升网络性能。EfficientNetB7则是EfficientNet架构中参数量最大的网络模型, 其参数设置是基于EfficientNetB0和特定的复合缩放因子φ生成的。EfficientNetB7的大部分层由多个移动翻转瓶颈卷积(MBConv)模块堆叠而成, 尤其是在网络的较高层, MBConv模块是其主要的构建单元, 该模块整合了深度可分离卷积、捷径连接和注意力机制。深度可分离卷积通过分解卷积操作大幅减少计算量, 捷径连接则有效缓解了梯度消失问题, 从而提升了网络的训练稳定性, 注意力机制则进一步增强了特征提取能力, 优化了模型的整体性能。

2.2.2 模型改进

为了进一步提升模型性能, 本文对EfficientNetB7进行了改进。在保持原有模型架构基本不变的前提下, 对模型的激活函数、注意力机制以及输出层结构进行了优化, 以期在多个评估指标上取得更佳表现。改进方案主要包括以下3个方面: 首先将MBConv模块中的Swish激活函数替换为Mish激活函数, 旨在通过增强非线性映射特性提高模型的表达能力。Mish激活函数的数学表达式为:

$ {\text{Mish}}\left( x \right) = x \cdot {\text{tan}}h\left( {\ln \left( {1 + {e^x}} \right)} \right). $ (7)

相较于Swish激活函数, Mish在多项实验中表现出更优的性能[15]。其主要优势包括更平滑的导数曲线以及更强的非线性特性。此外, Mish激活函数还可以提高模型在复杂任务中的泛化能力, 提升优化过程的稳定性。

其次, 传统的SE模块被BAM(Bottleneck Attention Module)替代, 进一步增强了模型的注意力机制。SE模块通常仅限于通道注意力, 而BAM通过结合通道注意力和空间注意力机制, 能够在捕捉特征图中的关键信息方面表现得更加高效[16]。BAM模块并行计算每个通道和每个空间位置的注意力权重, 然后通过广播机制将两者相加, 生成最终的注意力分布。这样, 对于海浪图像, 不仅可以在特征图的通道层面上实现不同的注意力权重分配, 还能够对图像的空间特征进行相应的权重调整。

最后, 本文对模型的输出层结构进行了调整, 采用了3层逐步减少神经元数量的全连接层, 并在其中插入2个丢弃层(Dropout), 以减少过拟合风险。通过这种结构优化, 模型在保持高效的同时, 进一步提升了其在复杂任务中的泛化性能。

通过以上改进, 优化后的模型框架如图 6所示, 在保持EfficientNetB7基础架构优势的同时, 通过多个关键模块的优化提升模型的整体性能。

图 6 网络框架结构及模型的输入输出流程 Fig. 6 Network architecture and input-output flow of the model
3 结果与讨论 3.1 实验设置

本文针对不同模型间的性能比较、图像校正方法的有效性验证以及评估本文提出的模型改进方法, 设计了3组对比实验。实验在配备16GB显存的Tesla V100 GPU上进行, 基于PyTorch深度学习框架完成模型的训练和测试。具体的超参数设置及训练策略如下: 批量大小设为4, 数据在每次迭代时随机打乱; 损失函数采用均方根误差(RMSE), 优化算法使用Adam优化器, 初始学习率为1×10-4。模型的训练轮次(epoch)设定为100, 并启用早停机制, 5个epoch内最小RMSE没有下降, 则停止训练。最终选择测试集上RMSE表现最佳的模型作为最终模型。

在模型评估过程中, 选用了多种常用的回归任务评估指标, 包括均方根误差(RMSE, 记为ERMS)、均方误差(MSE, 记为EMS)、平均绝对误差(MAE, 记为EMA)、决定系数(R2)和平均绝对百分比误差(MAPE, 记为EMAP)。这些指标能够从多个角度衡量模型的回归性能。RMSE和MAE的单位与预测值相同, MAE对异常值鲁棒性强, 而MSE对异常值较为敏感。R2用于衡量模型对数据的拟合程度, MAPE则提供相对误差的度量。各评估指标的计算公式如下:

$ {E_{{\text{RMS}}}} = \sqrt {\frac{1}{n}\mathop \sum \limits_{i = 1}^n {{\left( {{y_i} - {{\hat y}_i}} \right)}^2}} , $ (8)
$ {E_{{\text{MS}}}} = \frac{1}{n}\mathop \sum \limits_{i = 1}^n {\left( {{y_i} - {{\hat y}_i}} \right)^2}, $ (9)
$ {E_{{\text{MA}}}} = \frac{1}{n}\mathop \sum \limits_{i = 1}^n \left| {{y_i} - {{\hat y}_i}} \right|, $ (10)
$ {R^2} = 1 - \frac{{\mathop \sum \limits_{i = 1}^n {{({y_i} - {{\hat y}_i})}^2}}}{{\mathop \sum \limits_{i = 1}^n {{({y_i} - {{\bar y}_i})}^2}}}, $ (11)
$ {E_{{\text{MAP}}}} = \frac{1}{n}\mathop \sum \limits_{i = 1}^n \frac{{\left| {{y_i} - {{\hat y}_i}} \right|}}{{{y_i}}}, $ (12)

其中, n表示所使用的图像数量, $ \hat{y}_{i} $代表模型反演的有效波高值, $ y_{i} $为测波雷达获取的有效波高值, $ \bar{y}_{i} $则为$ y_{i} $的平均值。

3.2 实验结果

本文分别对ResNet152、InceptionV3、DenseNet264以及改进后EfficientNetB7模型进行了独立训练, 并计算了各模型在测试集上的评估指标, 结果如表 1所示。EfficientNetB7在波高反演任务中的表现优于其他模型, 在RMSE、MAE等5个评估指标上均具有显著优势。这些结果表明, EfficientNetB7在反演精度和模型性能方面具有较强的优越性。

表 1 不同方法的对比实验 Tab. 1 Comparison experimental results of different methods
输入 模型 ERMS/m EMA/m EMS/m2 EMAP R2
校正图像 ResNet152 0.373 0.282 0.140 0.155 0.834
校正图像 InceptionV3 0.330 0.251 0.109 0.138 0.871
校正图像 DenseNet264 0.326 0.252 0.107 0.145 0.874
校正图像 EfficientNetB7 0.315 0.241 0.099 0.136 0.883
原始图像 EfficientNetB7 0.329 0.253 0.108 0.144 0.872

此外, 本文还评估了图像校正方法的有效性, 设置了原始图像和透视变换校正图像两种图像输入方式。对于输入的原始海浪图像, 考虑到图像尺寸过大不利于模型的学习, 将图像调整为192×256的大小。处理后的图像将作为未经校正的原始海浪图像, 与校正图像进行比较。采用改进后的EfficientNetB7模型对这些处理后的图像进行了训练和测试。实验结果表明, 经过校正的图像相比原始图像具有一定的性能提升, 这表明图像校正对模型性能具有积极影响。

最后, 本文分别对模型改进的3个方法进行了对比实验。实验分别将激活函数Mish替换为原始的模型中的Swish, 将注意力机制BAM替换为原始模型中的SE模块, 将输出层的3层全连接层替换为单层全连接层, 实验结果如表 2所示。模型的3种改进方法确实在一定程度上提升了模型的性能, 但改进效果较为有限, 提升幅度较小。这可能是因为EfficientNet本身架构的高效性以及神经网络框架搜索的复杂性。因此, 对模型框架自身结构的优化已难以显著提升模型的整体性能。

表 2 优化模块的对比实验 Tab. 2 Comparison experiments of optimization modules
激活函数 注意力机制 输出层 ERMS/m EMA/m EMS/m2 EMAP R2
Mish BAM Linear3 0.315 0.241 0.099 0.136 0.883
Swish BAM Linear3 0.321 0.251 0.103 0.147 0.878
Mish SE Linear3 0.322 0.250 0.104 0.149 0.877
Mish BAM Linear1 0.321 0.242 0.103 0.131 0.879
3.3 结果分析

为了分析图像校正方法对模型性能的提升效果, 本文对测试集中12 967张图像的反演值与真实值进行了比较, 如图 7所示。图 7(a)为输入校正图像的模型结果, 图 7(b)为输入原始图像的模型结果。虽然使用原始图像时整体的RMSE与使用校正图像时差别不大(如表 1所示), 但在极值的反演, 尤其是极大值的反演上, 使用校正图像明显优于原始图像, 而使用原始图像的模型对大于4 m的海浪图像基本没有反演能力。此外, 由于大于4 m的图像在整个数据集中较少, 这也导致了两种输入的整体误差差异较小, 但事实上使用原始图像并不能在整个数据集上进行很好的反演预测, 以下分别计算了各波高范围内的RMSE, 结果如表 3所示。

图 7 模型基于不同输入得到的反演结果 Fig. 7 inversion results obtained by the model using different inputs

表 3 各波高范围的RMSE Tab. 3 RMSE for each wave height range
波高/m 经过校正后的ERMS/m 不经校正的ERMS/m
0~1 0.208 0.218
1~2 0.273 0.299
2~3 0.347 0.330
3~4 0.398 0.407
4~5 0.506 0.758

校正图像的性能提升主要体现在大于4 m的海浪图像反演上, 校正图像使得模型能够通过有限的样本获取波浪的泛化特征, 同时在其他部分的表现也基本优于原始图像。这表明图像校正显著增强了模型在极值反演中的能力, 提升了整体预测的准确性。

本文从测试集中选取了2011年9月17日至9月26日的连续时间段, 反演结果示例如图 8(a)所示。该时间段内, 相较于单点反演结果, 反演值在相邻时间段之间表现出明显的波动, 这可能是由于测试集中每日约有200个数据点, 图像质量对日间预测值的波动影响较大, 导致日间数据方差较大。通过对数据进行逐小时平均计算, 如图 8(b)所示, 尽管存在数据点的波动, 但计算的平均值总体上与标签数据较为一致, 反映出模型在捕捉长期趋势方面的有效性, 通过这种平均反演值能够提升本方法的可靠性。

图 8 连续时间有效波高反演 Fig. 8 Continuous time significant wave height inversion
4 结论

本文利用开阔海域的海浪图像数据进行研究, 相较于视频数据, 图像数据具有易于获取的优势, 而开阔海域相比近岸图像能够帮助模型学习更多样的海浪特征; 此外, 所用图像的最大有效波高可达到5 m, 显著丰富了数据集的多样性和覆盖范围。使用了67 005张海浪图像及对应的测波雷达获取的有效波高数据, 构建了一个大规模、高质量的海浪图像数据集。通过按照日期对数据进行划分及后续采用的调整策略, 避免了数据污染的风险, 确保了在相似波高分布条件下对模型的精确评估。这一数据处理方法有效提升了模型训练的可靠性和结果的可信度。

还结合视场实际范围和透视变换, 对倾斜拍摄的海浪图像进行了校正。这一校正步骤显著提升了模型在高波高图像上的反演性能, 为在缺乏控制点的情况下进行海浪图像反演提供了新的思路和方法。对EfficientNetB7模型进行了3方面的改进: 采用Mish激活函数、引入BAM注意力机制以及将输出层改为3层全连接层。通过对比实验验证了这些改进对模型性能的提升效果。与其他传统卷积神经网络模型的对比实验结果表明, 改进后的EfficientNetB7模型在有效波高反演的精度上显著优于ResNet152、InceptionV3、DenseNet 264等模型, 进一步验证了本文所提方法的优势与有效性。综上, 本文所提方法在数据获取、处理及模型训练等方面均展现出一定的可行性和实用性, 能够在复杂海况下反演有效波高。

尽管所提方法在反演有效波高方面已经表现出合理的反演预测能力, 但现有模型的精度仍有待提高, 当前模型存在进一步优化的空间。并且本文仅探讨了卷积神经网络在海浪图像反演中的应用, 对其他神经网络在这一领域的适用性有待进一步实验验证。

参考文献
[1]
KANG L S. Wave monitoring based on improved convolution neural network[J]. Journal of Coastal Research, 2019, 94(SI): 186-190.
[2]
CHEN C H, LU C W, YANG Y. Long-distance sea wave sparse matching algorithm for sea level monitoring system[J]. Journal of Marine Science and Engineering, 2023, 11(2): 391. DOI:10.3390/jmse11020391
[3]
BUSCOMBE D, CARINI R J, HARRISON S R, et al. Optical wave gauging using deep neural networks[J]. Coastal Engineering, 2020, 155: 103593. DOI:10.1016/j.coastaleng.2019.103593
[4]
YOON J, KIM S, KIM I, et al. Detection of wave parameters using CCTV images-based on deep learning algorithm[J]. Journal of Coastal Research, 2021, 114(SI): 281-284.
[5]
BAI H, HAO Y C, QU J M, et al. Recognition of wave characteristics in dredging construction area based on visual information[J]. Proceedings of SPIE, 2023, 12707(000): 11.
[6]
黄文华, 胡伟, 崔学荣, 等. 基于深度学习的近岸海浪图像反演有效波高算法研究[J]. 中国海洋大学学报(自然科学版), 2024, 54(6): 35-44.
HUANG Wenhua, HU Wei, CUI Xuerong, et al. Research on significant wave height inversion algorithm based on deep learning for offshore wave images[J]. Periodical of Ocean University of China, 2024, 54(6): 35-44.
[7]
KIM J, KIM J, KIM T, et al. Wave-tracking in the surf zone using coastal video imagery with deep neural networks[J]. Atmosphere, 2020, 11(3): 304. DOI:10.3390/atmos11030304
[8]
KIM J, KIM T, OH S H, et al. Deep visual domain adaptation and semi-supervised segmentation for understanding wave elevation using wave flume video images[J]. Scientific Reports, 2021, 11(1): 21776. DOI:10.1038/s41598-021-01157-x
[9]
WU H F, ZHANG Y Y, WANG J, et al. iOceanSee: a novel scheme for ocean state estimation using 3D mobile convolutional neural network[J]. IEEE Access, 2020, 8: 153774-153786. DOI:10.1109/ACCESS.2020.3018270
[10]
CHOI H, PARK M, SON G, et al. Real-time significant wave height estimation from raw ocean images based on 2D and 3D deep neural networks[J]. Ocean Engineering, 2020, 201: 107129. DOI:10.1016/j.oceaneng.2020.107129
[11]
宋巍, 周旭, 毕凡, 等. 近岸海浪视频浪高自动检测[J]. 中国图象图形学报, 2020, 25(3): 507-519.
SONG Wei, ZHOU Xu, BI Fan, et al. Automatic wave height detection from nearshore wave videos[J]. Journal of Image and Graphics, 2020, 25(3): 507-519.
[12]
KIM Y H, CHO S, LEE P S. Wave height classification via deep learning using monoscopic ocean videos[J]. Ocean Engineering, 2023, 288: 116002. DOI:10.1016/j.oceaneng.2023.116002
[13]
齐占辉, 张锁平. 非标定点下的图像校正算法[J]. 光电工程, 2009, 36(1): 31-35.
QI Zhanhui, ZHANG Suoping. Non-calibration points algorithm for the image correction[J]. Opto-ElectronicEngineering, 2009, 36(1): 31-35.
[14]
TAN M X, LE Q. Efficientnet: Rethinking model scaling for convolutional neural networks[J]. arXiv preprint arXiv. 1905: 11946, 2019.
[15]
MISRA D. Mish: A self regularized non-monotonic activation function[J]. arXiv preprint arXiv: 1908.08681, 2019.
[16]
PARK J, WOO S, LEE J Y, et al. Bam: Bottleneck attention module[J]. arXiv preprint arXiv: 1807.06514, 2018.