RainCodec:面向潜扩散生成式预报的公里尺度小时降水变分自编码表征
编号:287
访问权限:仅限参会人
更新:2026-08-03 14:21:35 浏览:0次
张贴报告
摘要
以潜扩散模型为代表的生成式人工智能是强降水短临预报、集合成员生成与公里尺度降尺度的重要技术路线之一。其通行范式先以自编码器(tokenizer)将高维降水场压缩为低维潜表征,再在潜空间训练生成模型,因此 tokenizer 的重建保真度将显著限制下游模型可实现的细节保真:对流核、雨区边界与小尺度谱结构一旦在压缩中丢失便难以恢复。小时降水场具有强零膨胀与重尾特征——本研究区内达到 0.1 mm/h 的有效像元仅占 12.9%,达到 50 mm/h 的有效像元约占百万分之十——针对降水特性的 tokenizer 设计尚缺乏系统研究。
本文基于 2022–2025 年暖季(5–10 月)四川区域 CMPA 多源融合网格降水分析(0.01°、逐小时,17,649 个时次,按时间序贯划分训练/验证/评估集),构建条件化 KL 正则变分自编码器 RainCodec(雨码),以256×256 降水裁剪为输入,压缩为 32×32×8 潜表征(每轴 8 倍),并向模型提供高程、坡度、坡向等地形通道与月—时周期协变量。针对零膨胀问题,提出受统计学 hurdle 模型启发的发生门控双头解码:重建场为发生概率门与非负强度之积,发生头由湿/干指示监督;第二阶段以 48 谱段径向对数功率谱损失微调。
在单随机种子的匹配但非析因对比中,双头门控方案将六阈值(0.1mm/h、1mm/h、5mm/h、10mm/h、20mm/h、50mm/h)平均 CSI 由 0.490 提升至 0.807,50 mm/h 频率偏差由 4.45 改善至约 1.00,最大虚警率降至原来的约 1/5;在覆盖 92 个日期的分层评估子集上,其各阈值 CSI 点估计均为最高,0.1–5 mm/h 的95% 置信区间(按日期分块重采样估计)与两类单头基线均不重叠(更高阈值因极端样本有限而部分重叠)。谱微调使归一化对数降水空间的径向谱散度由 0.169 降至 0.032;判别器损失与自适应权重诊断提示,所测两组配置中 PatchGAN 对抗项的有效贡献可能很弱,严格归因仍需纯谱损失与纯对抗对照实验。RainCodec 在完整评估季节上掩膜 RMSE 为 0.179 mm/h,0.1–50 mm/h 阈值 CSI 为 0.92–0.61(该季节曾参与模型版本择优,上述指标宜视为评估性能而非严格独立检验结果);潜空间八通道均活跃、边缘分布接近高斯,检查点内嵌下游潜扩散所需的缩放因子。
需要说明,本文仅评估模型对单时次降水场的压缩与重建能力,并未对未来时刻作出预报,实际短临预报效果尚待接入下游生成模型后检验。上述研究为四川暴雨等灾害天气的潜扩散预报与极端降水情景生成提供了经重建指标评估的候选表征基础,发生门控解码与谱约束微调亦具有推广至其他稀疏灾害要素场的潜力,后续仍需开展跨区域、跨要素验证。
关键词
小时降水;潜扩散模型;变分自编码器;发生门控解码;谱约束;四川盆地
发表评论