迁移学习解决小样本
Grad-CAM 显示 S 波起跳对地震重要,S 长周期尾波对爆破重要
模型预测错误的事件中,多数是分析师标记错误
1. Introduction(引言)
1.1 研究背景
现代台网记录到越来越多的非天然信号(滑坡、工业爆破等)
→ 区分天然地震与非天然信号对地震危险性分析重要
→ 爆破污染目录会导致 b 值被高估(引用 Gulia & Wiemer 2019)
→ 分类非天然信号对"环境地震学"、"城市地震学"、"法医地震学"也有价值
→ 在矿区:监控小震级爆破对安全生产和非法采矿检测有用
1.2 已有方法的局限
| 方法类别 | 方法 | 局限 |
|---|---|---|
| 基于震源参数 | 位置/发震时间 | 需要准确的前置分析,限制实时应用 |
| 基于波形(人工特征) | Lg 谱比、P/S 比值、ML-Mc 差等 | ① 人工特征的泛化性差(跨区域性能下降);② 高噪声时小事件难以可靠测量 |
1.3 DL 方法的优势与问题
优势:
深度学习可从数据中自动提取隐性特征
→ 特征在训练中贪婪搜寻,输出→输入映射
→ 可能比人工定义特征更具代表性
问题:
DL 模型参数量大 → 需要大量高质量标记数据防过拟合
→ 有些地区监测历史短、地震活动性低、缺少人工标记
→ 解决办法:迁移学习(利用富数据区的知识,迁移至缺数据区)
1.4 本文方案
加州(数据充足) → 直接训练 CNN
用大数量标记的地震和爆破
肯塔基(地震仅 150 个) → 迁移学习(以加州模型为起点,微调/冻结)
加州模型先验知识 + 少量肯塔基标记数据
通用策略:数据增强缓解两类区的类别不平衡
关键引文链:
- Gulia & Wiemer (2019): 爆破污染→b 值高估→大震概率低估
- Linville et al. (2019): DL 用于事件分类的先驱工作
- Chai et al. (2020): DL 迁移学习用于地震相位拾取
- Yosinski et al. (2014): DL 特征的可迁移性理论
2. Data(数据)
2.1 Southern California(南加州)—— Table 1 的核心
| 项目 | 数值 |
|---|---|
| 数据源 | SCSN, 2011–2020 |
| 最终数据量 | 29,075 地震 (583,706 条记录) + 6,632 爆破 (77,707 条记录) |
| 类别比 | ~4.4:1(事件级),~5.5:1(记录级) |
| 台站 | 337 个 |
| 震中距 | ≤100 km |
| 震级范围 | EQ: -0.48 < ML < 5.51;QB: 0.17 < ML < 2.56 |
预处理流程(记录在 2.1 段末):
原始波形 (100 Hz, HH[E|N|Z])
↓ 去趋势 + Hanning 窗 + 全局归一化(三分量最大标准差归一化)
↓ PhaseNet P 波拾取(理论到时 ±3 s 内搜索)
↓ 质量控制:SNR > 0 dB + PhaseNet 概率 > 0.3
↓ 1–15 Hz 带通滤波
↓ 截取:P 波前 5 s ~ 后 55 s → 输入维度 [3, 5500]
用 PhaseNet 代替 SCSN 官方拾取 → 拾取量更大(更丰富的训练数据)
用低 SNR 阈值(> 0 dB)→ 增加训练数据的多样性,增强模型对噪声的鲁棒性
数据选择细节:
- 从 SCSN 目录中每 6 个地震保留 1 个 → 缓解原始类别不平衡
- Ridgecrest 2019 余震移除 → 避免对特定序列过拟合
- 最终数据集有 1,721,092 条三分量地震记录 + 312,911 条爆破记录
2.2 Eastern Kentucky(东肯塔基)—— 与你最相关的数据
| 项目 | 数值 |
|---|---|
| 数据源 | Miao et al. (2020) 已编译数据集 |
| 时间范围 | 2015.6–2019.3 |
| 地震量 | 仅 150 个(2,091 条记录) |
| 爆破量 | 4,218 个(56,643 条记录) |
| 类别比 | ~28:1(爆破占优)← 与加州完全相反 |
| 台站 | 35 区域台 + 13 EKMMP 临时台 |
| 震中距 | 多数 >100 km(比加州远) |
两数据集的关键差异(论文原文强调):
| 维度 | 加州 | 肯塔基 |
|---|---|---|
| 数据量 | 大(~660k 记录) | 小(~59k 记录,少一个量级) |
| 少数类 | 爆破(~11%) | 地震(~3.4%) |
| 区域地质 | 活跃构造区,高速减 | 稳定区,低速减衰减 |
| 台网密度 | 密(~21 站/事件) | 疏(~13 站/事件) |
| 震中距 | 多数 < 100 km | 多数 > 100 km |
3. Methods(方法)
3.1 Data Division and Augmentation
时间顺序分割(Table 1 详细列出):
加州:
训练集: 2011.1–2018.9(70%: 20,353 EQ + 4,643 QB)
验证集: 2018.9–2019.7(10%: 2,907 EQ + 663 QB)
测试集: 2019.7–2020.12(20%: 5,815 EQ + 1,326 QB)
肯塔基:
训练集: 2015.6–2017.10(70%: 105 EQ + 2,952 QB)
验证集: 2017.10–2018.1(10%: 15 EQ + 421 QB)
测试集: 2018.1–2019.3(20%: 30 EQ + 845 QB)
关键原则:
- 事件级分割:来自同一事件的所有记录归入同一子集 → 防止数据泄露
- 时间顺序分割:模拟真实在线监测场景(与随机分割不同)→ 评估更真实
数据增强策略:
| 策略 | 加州(少数类=爆破) | 肯塔基(少数类=地震) |
|---|---|---|
| 随机时间偏移(核心) | 爆破×5,地震×1 | 地震×16,爆破×1 |
| 通道丢弃 | 随机丢 1–2 分量 | 同左 |
| 数据缺口 | 随机 <11s 段置零 | 同左 |
| 波形裁剪 | 随机 <50% 缩小动态范围 | 同左 |
| 叠加噪声 | 幅度比 <0.2 | 同左 |
随机时间偏移的设计原理(论文未明说但可以推理):
- 时间偏移给出不同的 P 波位置相对于固定 60s 窗口
- 同一事件的不同偏移版本,CNN 学到的是 P-S 相对时差等不变特征
- → 相当于数据量 × 增强倍数
增强是针对 SNR > 1 dB 的记录,低 SNR 的记录不变,以防噪声增强导致模型混乱。
其他尝试(论文 Section 5 提及):
- 加州还尝试了降采样多数类(地震降采样)和代价敏感学习,但不如上采样效果好
- 上采样(随机偏移)增加数据多样性 → 效果优于降采样
3.2 CNN Architecture
前向传播:
输入: 三分量波形 [3, 5500]
↓
┌─ Conv1: kernel=7, stride=4 → 输出 [32, 1373]
│ BN → ReLU → MaxPool
├─ Conv2: kernel=5, stride=2 → 输出 [64, 686]
│ BN → ReLU → MaxPool
├─ Conv3: kernel=5, stride=2 → 输出 [128, 342]
│ BN → ReLU → MaxPool
├─ Conv4: kernel=5, stride=2 → 输出 [128, 170]
│ BN → ReLU → MaxPool
├─ Conv5: kernel=5, stride=2 → 输出 [256, 84]
│ BN → ReLU → MaxPool
├─ Conv6: kernel=5, stride=2 → 输出 [256, 84] ← stride=2 但输入 170→84 需要 padding=1
│ BN → ReLU → MaxPool
↓
Dropout (rate=0.3) → FC → Softmax → [2](EQ 概率, QB 概率)
结构特点:
- 6 层卷积:逐层增加通道数(32→64→128→256),逐步减小序列长度
- 每层都带 BatchNorm:加速收敛 + 正则化
- 每层都带 MaxPool:下采样 + 平移不变性
- Dropout 0.3 在 FC 层前:防过拟合
- 总参数量:131,866(约 0.5 MB)→ 小模型,防小数据过拟合
- 训练:15 epoch,A100(40GB)约 19 hr
- Early stopping:验证集 loss 连续 5 个 epoch 不降则停止 → 防过拟合
输入: δv/v 时间序列 [1, T]
↓
Conv(小kernel=3~7, stride=1~2) 若干层
↓
Dropout → FC → Sigmoid → [0,1](前兆概率)
参数量应保持小(< 50k)以防过拟合。
3.3 Transfer Learning(核心内容)
为什么要迁移学习(原文 3.3 前三段):
加州模型 131,866 参数,训练在 661,413 条记录上
肯塔基仅 58,734 条记录(少一个数量级)
→ 从零训练 → 过拟合风险大
→ 直接应用加州模型 → 因台站类型/震中距/衰减不同而效果差
→ 解决方案:迁移学习
迁移学习在先前地震学中的应用:
- Zhu et al. (2019): PhaseNet 从汶川迁移到俄克拉荷马
- Chai et al. (2020): PhaseNet 从区域台网迁移到微地震数据(更高的采样率 + 更小的数据量)
三种策略的实验设计(核心实验):
| 策略 | 初始化 | 训练方式 | 适用条件 |
|---|---|---|---|
| I. 直接应用 | 加州模型权重 | 不训练 | 仅当两区域数据分布几乎相同 |
| II. 从头训练(Re-train) | 随机初始化 | 在肯塔基数据上全参数训练 | 数据量充足时 |
| III. 微调(Fine-tuning) | 加州模型权重 | 所有层继续在肯塔基训练 | 目标域与源域有差异但有足够标签 |
| IV. 冻结(Freezing) | 加州模型权重 | 冻结浅层,仅更新最后一层 | 目标域数据极少 |
微调 vs. 冻结的区别:
Fine-tuning: 更新整个网络所有参数
→ 目标域与源域差异大时更灵活
Freezing: 冻结浅层(通用特征提取器)+ 仅更新深层(分类器)
→ 目标域数据极少、与源域分布相似时更好
论文实验的实际选择:
- 加州模型直接到肯塔基:失败(F1=0.092)
- 迁移学习(微调 + 冻结):都优于从头训练
- 冻结略逊微调(因为跨区域差异大)→ 选微调作为"迁移学习"代表
→ 对你的启示:
Step 1: 在数据丰富的矿区 A 预训练 δv/v 前兆检测模型
→ 学习通用的 δv/v 特征提取器
Step 2: 在你的目标矿区用迁移学习(微调)
→ 冻结浅层(通用 δv/v 特征层)
→ 微调高层(矿区特异性前兆分类层)
Step 3: 数据增强(×16 随机偏移 + 加噪)
→ 相当于将正样本量从 N 扩展到 16N
4. Results(结果)
4.1 California Model Performance
Table 2 完整结果:
| 指标 | EQ(单站) | QB(单站) | EQ(台网平均) | QB(台网平均) |
|---|---|---|---|---|
| 精确率 | 0.984 | 0.782 | 0.995 | 0.985 |
| 召回率 | 0.962 | 0.896 | 0.997 | 0.977 |
| F1 | 0.973 | 0.835 | 0.996 | 0.981 |
| 准确率 | 0.953 | — | 0.993 | — |
台网平均的显著提升:
爆破 F1: 0.835 → 0.981(+17.5%)
地震 F1: 0.973 → 0.996(+2.3%)
多数类提升小,少数类提升巨大
原因:单站可能因局部噪声/路径效应做出误判 → 多站投票可压制噪声。
类别不平衡的影响(原文分析):
准确率有欺骗性:如果全判为地震,也有 86.7% 准确率
→ 不能用准确率评估 → 用 F1 和 PR 曲线
论文用 PR 曲线 + Average Precision(AP)评估:
AP(EQ) = 1.00, AP(QB) = 0.93
性能与物理参数的关系(Fig. 6):
| 因素 | 趋势 | 原因 |
|---|---|---|
| SNR ↑ | 召回率 ↑ | 信号质量直接决定分类准确率 |
| 震中距 ↑ | 召回率 ↓ | 远距离信号衰减,SNR 降低 |
| 震级 | EQ 无明显关联 | — |
| 深度 | EQ 召回率随深度↑ 微增 | 地震深、爆破浅 → 深度是有效区分特征 |
→ 前兆检测也需要考虑 SNR/震中距的影响
4.2 Transfer Learning to Kentucky
三种策略对比(Table 3):
| 模型 | 准确率 | EQ F1 | QB F1 |
|---|---|---|---|
| 加州模型直接应用 | 31.0% | 0.092 | 0.443 |
| 从头训练 | 98.5% | 0.776 | 0.992 |
| 迁移学习(微调) | 99.0% | 0.869 | 0.995 |
核心发现:
迁移学习比从头训练 EQ F1 提升 0.869→0.776(+12%)
→ 迁移学习保留了加州模型学到的通用波形特征
→ 在数据稀缺时,先验知识弥补了样本不足
迁移学习对少数学的增益更大:地震 F1 +12%,爆破 F1 +0.3%
→ 少数类(地震)受益于通用特征提取器的迁移知识
样本效率实验(Fig. 7 – 对你最关键):
| 地震样本量 | 从头训练 F1 | 微调 F1 | 冻结 F1 |
|---|---|---|---|
| 30 | ~0.5(剧烈波动) | ~0.75(稳定) | ~0.73(稳定) |
| 60 | ~0.65(不稳定) | ~0.80 | ~0.78 |
| 105 | ~0.70 | ~0.82 | ~0.79 |
结论:
→ 从头训练:F1 在 30~105 样本范围内剧烈波动
→ 迁移学习(微调/冻结):F1 稳定且一直优于从头训练
→ 即使仅 30 个正样本,迁移学习也能达到 F1~0.75
→ 随着正样本数增加(30→105),迁移学习的 F1 仍稳步提升
直接应用加州模型为何失败(论文分析):
主要原因:震中距差异
→ 移除 >100 km 的肯塔基样本后,爆破召回率从 28.6% 升至 63.6%
→ 说明跨区域直接应用的瓶颈在震中距分布
4.3 Grad-CAM 可解释性分析
Grad-CAM 工作原理(Appendix C):
对最后一个卷积层(256 个特征图 × 84 长度)
→ 计算类别得分对每个特征图的梯度 → 得到每个特征图的权重(eq. C1)
→ 加权求和特征图 → ReLU 激活(只保留正贡献,eq. C2)
→ 插值到输入分辨率(5500 点)→ 热力图
加州结果(Fig. 8):
| 事件类型 | 模型关注区域 | 物理含义 |
|---|---|---|
| 地震(多数) | S 波起跳 + S 波尾波 | 地震有清晰的 S 起跳(剪切源) |
| 爆破(多数) | 低频 S 波尾波(无清晰 S 起跳) | 爆破缺乏高频 S 波(各向同性/张裂源) |
| 爆破(少数) | P 波 + P 尾波 | 极少数 S 波极弱的爆破 |
肯塔基结果(Fig. 9):
加州模型学到的特征在肯塔基相同
→ 即使震中距 >100 km(Fig. 9b/d)
→ 说明 S 波起跳 vs. S 尾波是跨区域通用的区分特征
→ 解释了迁移学习为什么有效
错误预测的 Grad-CAM(Fig. S6):
- 被误判为爆破的地震:S 波较弱 → 看起来像爆破
- 被误判为地震的爆破:有冲击性的 S 起跳 → 看起来像地震
5. Discussion and Conclusions
5.1 与已有方法的比较
| 方法 | 数据 | 准确率 | 特点 |
|---|---|---|---|
| Allmann et al. (2008) P 波谱拟合 | 加州 | ~90%(台网级) | 依赖人工特征,SNR>3dB |
| Miao et al. (2020) 多窗谱+ANN | 肯塔基 | EQ F1=0.353, QB F1=0.985 | 人工设计多窗谱特征 |
| Linville et al. (2019) 谱图+CNN | 犹他 | — | 用谱图(需旋转分量) |
| Kong et al. (2022) DL+物理特征 | 多区域 | — | 结合 P/S + ML-Mc 物理特征 |
| 本文 | 加州+肯塔基 | EQ F1=0.869, QB F1=0.995 | 无需人工特征,无旋转,迁移学习跨区域 |
本文优点:
- 输入预处理最少化(不计算谱图、不旋转分量)→ 易泛化到其他区域
- 模型小(0.5 MB,1600 样本/秒)→ 易集成到实时系统
- 迁移学习策略使跨区域使用容易
本文局限:
- 仅 6 层 CNN,未尝试更先进的架构(Transformer, GNN)
- 仅二分类,未包括诱发地震/矿震等中间类型
- 数据增强策略需要在具体区域调试(不同区域的随机偏移最优倍数不同)
5.2 实用考虑
输入窗口长度的选择:
55 s vs 35 s 测试:
加州:35 s 稍好(准确率 95.4% vs 95.3%)
肯塔基:55 s 更好(98.3% vs 98.5%)
原因:肯塔基震中距更大 → P-S 分离大 → 尾波长 → 需要更长窗口
→ 窗口长度应根据区域 P-S 分离时间确定
→ 对你:δv/v 序列长度应根据前兆时间窗口确定(Wu 2023 的 2-10 天窗口)
数据增强策略的比较(论文实验):
上采样(随机偏移):最佳(爆破召回率 89.6%)
原因:增加了数据多样性
降采样多数类:F1 下降(EQ -1.1%, QB -12.1%)
原因:减少了训练数据总量和多样性
代价敏感学习:爆破召回率 83.0%(不如上采样的 89.6%)
→ 对你的启示:上采样(时间抖动)是对少数类最有效的增强策略
台网平均 vs. 深度分类(Fig. S11):
深度分类(<2 km=爆破, >2 km=地震):
EQ 召回率 92.0%,爆破召回率 90.3%
深度分类边界模糊(Fig. S11a)
台网平均概率(阈值 0.5):
EQ 召回率 99.7%,爆破召回率 97.7%
分类边界清晰(Fig. S11b)
结论:台网平均概率 >> 深度分类
5.3 未来使用建议
最核心的段落(Discussion 末段):
"When applying our classification models to other areas, we strongly recommend using the transfer learning strategy. ... rather than pursuing an optimal universal model, customizing models that work optimally for specific regions is probably a more viable pathway. With the help of transfer learning, regions with short seismic monitoring histories could have high-quality deep learning models comparable to those in well-instrumented regions at an economical price."
模型还能揭示目录中的误标(重要发现):
加州测试集 51 个误判事件中,16 个(31%)可能是分析师标记错误
→ 利用模型的"误判"可反向发现历史目录中的错误
→ 你的地震目录也可能有误标 → 模型输出的"异常"可能揭示目录遗漏
需要进一步改进的方向:
- 第三类事件(如诱发地震)可能介于地震和爆破之间(双力偶+各向同性混合)
- 包括其它类型事件可进一步减少模糊性
6. 整体评价与对你论文的价值
6.1 核心贡献
- 小样本场景下迁移学习的系统验证:与你的煤矿前兆正样本稀少场景完全对应
- 台网平均可大幅提升少数类 F1(+15%+):你的多台站 δv/v 同样适用
- 时间顺序分割的原则性强调:你的模型评估也必须按时间分割
- Grad-CAM 可解释性验证物理合理性:你的前兆模型也需可解释性
- 模型可揭示目录误标:你的地震目录可能存在误标