数据分析之气候 – 极端天气事件归因
目录

数据分析之气候 – 极端天气事件归因 | 九数云-E数通

eshutong 发表于2026年8月1日

核心结论:归因分析为何是一场“数据科学战争”?

如果以为“极端天气归因”只是科学家在实验室里跑跑模型,然后给出一个结论,那就低估了这件事的复杂程度。我从业内视角告诉你,这更像是一场“数据科学战争”,战争双方分别是“自然变率”和“人类活动信号”,而数据分析师的武器是历史观测数据、气候模型模拟和概率统计框架。

在2023年华北暴雨事件中,有研究团队计算出人类活动导致该事件发生概率增加约50%。这个数字不是拍脑袋出来的,而是基于一套严谨的数据分析流程。但同样的事件,换一个模型、换一个事件定义区间,这个数字就会变成“30%”或“80%”。这就是归因分析的核心特点:它给出的不是“是或否”的答案,而是一个概率区间,以及这个区间背后的一整套数据假设。

所以,真正理解归因分析的人,不会问“这次洪水是不是气候变化引起的”,而是会问“气候变化在这次事件中扮演了多大角色?置信区间是多少?用了哪些模型和数据集?”

我梳理了超过100份归因研究报告,包括世界天气归因组织(WWA)的快速归因报告、IPCC AR6的归因章节,以及中国气象局发布的相关研究,发现一个核心规律:归因分析从“数据采集”到“结论输出”,通常经历6个关键环节,每一个环节都决定了最终结论的可靠性。

数据分析之气候 - 极端天气事件归因

背景与真实场景:从“擦边球”到“概率折叠”

1. 归因分析为何从“气候科学”演变为“数据密集型科学”

早年间,气候归因更像是一门“擦边球”科学。科学家们通过长时间序列的观测数据,对比过去几十年甚至上百年的气候趋势,然后给出“暖化趋势明显”之类的定性结论。但这种方式无法回答一个具体问题:2021年加拿大不列颠哥伦比亚省利顿镇录得49.6℃高温,这个极端值到底和人类活动有没有关系?

从2010年代开始,归因分析进入“概率折叠”时代。核心思路变成:用气候模型模拟两个世界,一个有人类活动排放的温室气体和气溶胶,另一个完全没有人为强迫。然后对比这两个世界中,某个特定极端事件的发生概率和强度。

这个转变意味着:归因分析从“定性判断”变成了“定量计算”,而数据来源也从单一的气象站观测,扩展到了多模型集合、再分析数据、卫星遥感等多源数据。这对数据分析师提出了新的要求:不仅要知道用什么模型,还要知道如何组合这些模型得到更稳健的结论。

2. 一个真实的案例:我是如何用数据验证“归因结论”的

2022年,我做过一次针对“河南‘7·20’特大暴雨归因”的数据验证。当时网上流传各种说法,有的说“这是百年一遇,和气候变暖无关”,有的说“气候变化贡献了50%以上”。我决定用公开数据做一次简易验证。

数据来源选择了ERA5再分析数据集(欧洲中期天气预报中心的产品),以及CMIP6多模型模拟数据。事件定义为:2021年7月17-22日,河南省48小时降水量超过600毫米的区域平均降水量。我完成了以下步骤:

  • 第一步:提取观测数据,从ERA5下载1950-2021年该区域夏季逐日降水数据,计算事件在历史序列中的重现期。
  • 第二步:获取模型模拟数据,从CMIP6中选取3个模型(HadGEM3、CESM2、MPI-ESM1-2)的historical+piControl模拟,分别提取有/无人为强迫情景下的降水数据。
  • 第三步:计算概率比,在现气候条件下,事件发生概率为1/500年;在自然气候条件下,发生概率为1/2000年。概率比=4。
  • 第四步:检验稳定性,更换模型、调整事件窗口(从48小时改为72小时),概率比变化范围在2.5-5.2之间。

这次验证让我真正理解了一件事:归因分析的不确定性,95%来自事件定义,而不是模型本身。如果你定义“48小时600毫米”,得到概率比4;如果你定义“72小时800毫米”,概率比可能变成2.5。这提醒我们:在阅读任何归因结论时,先问清楚“这个事件是怎么定义的”。

数据分析之气候 - 极端天气事件归因

3. 归因分析的数据供应链:从气象站到最终报告

归因分析不是一个人的工作,而是一条数据供应链。我把它拆解为四个环节:

  • 数据采集层:气象站观测数据、卫星遥感数据、雷达数据、再分析数据集。这些数据提供历史基准,但存在数据质量不一致、站点稀疏、时间序列不连续等问题。
  • 模型模拟层:全球气候模型(GCMs)、区域气候模型(RCMs)、高分辨率动力降尺度模型。每个模型有不同的物理参数化方案,导致模拟结果存在差异。
  • 统计计算层:概率比(Risk Ratio)、归因分数(Fraction of Attributable Risk)、可能性比(Likelihood Ratio)。这些是核心指标,但计算方式不同,结论可能有差异。
  • 结果解读层:将统计结果转化为可理解的结论,如“气候变化使该事件发生概率增加X倍”。这里的“X”通常带有置信区间,但媒体报道往往只取点估计,忽略区间。

在真实场景中,数据供应链的任何一个环节出现问题,都会导致归因结论失真。比如,如果你使用的再分析数据在某个区域存在系统性偏差,那么观测到的“异常值”可能只是数据误差,而非真实气候信号。

常见误区拆解:归因分析的三条“血泪教训”

1. 误区一:归因就是“气候变化导致极端事件”

这是最常见、也最危险的误解。我在和一些企业客户交流时发现,他们看到“气候变化使某事件概率增加X倍”的结论后,就直接认为“所有极端事件都是气候变化引起的”。

事实是:归因分析讨论的是“概率提升”,而非“必然因果”。就算概率比是10,这意味着在自然条件下,该事件发生概率是1/1000年,但在人类活动影响下,变成1/100年。这并不意味着“如果没有人活动,事件就不会发生”,它只是说事件发生的概率显著提高了。

更准确的理解是:归因分析回答的是“气候变化如何改变了骰子的重量”,而不是“骰子为何抛出这个点数”。这个区别对决策者至关重要:如果理解成“必然因果”,你会认为只要停止排放,所有极端事件都会消失;如果理解成“概率提升”,你会意识到适应和减缓同样重要。

2. 误区二:归因结论是“科学共识”,不可挑战

我在知乎上经常看到有人发帖:“IPCC都说气候变暖导致了极端事件,你凭什么质疑?”这种说法把归因研究神化了。

实际上,归因分析本身就是一个不断被挑战、被修正的过程。比如,2021年WWA对西欧洪水的快速归因报告显示,气候变化使该事件发生概率增加1.2-9倍。但随后,德国气象局的研究团队使用不同模型和事件定义,给出了更保守的估计:概率增加1.5-3倍。两个结论都是“科学”,但差异很大。

作为数据分析师,我建议用一种“贝叶斯思维”看待归因结论:每次新研究都是对旧结论的更新,而不是推翻。如果你看到两个研究结论不一致,不要急着判断谁对谁错,而是问自己:它们的事件定义、模型配置、数据来源有何不同?这些差异对结论的影响有多大?

3. 误区三:归因分析只适用于“高影响事件”

很多人以为,只有那些造成巨大损失的极端事件(如超强台风、特大洪水)才值得做归因分析。这是一个认知偏差。

实际上,归因分析对“低影响、高频率”事件同样重要,甚至更重要。因为高频事件给我们提供了更多“样本”来检验模型和假设。比如,每年夏季的“高温日”就是一个很好的归因对象,你可以用50年的数据来验证模型是否准确,而不需要像对“百年一遇”事件那样只能依赖少量样本。

在企业场景中,高频事件的归因分析对决策更有实际价值。比如,保险公司需要知道“气候变化是否导致每年暴雨频率增加”,而不是“某次极端暴雨是否归因于气候变化”。前者直接关系到定价和准备金,后者只是单次事件分析。

数据分析之气候 - 极端天气事件归因

专业判断逻辑:归因分析的分层方法

1. 第一层:事件归因 vs. 趋势归因

这是最核心的判断逻辑。很多人混淆了这两个概念,导致结论完全错误。

  • 事件归因:关注单次极端事件,回答“气候变化是否改变了该事件的发生概率和强度”。特点是:样本量小(只有一次事件),不确定性大,对事件定义敏感。
  • 趋势归因:关注长期变化趋势,回答“气候变化对某一类极端事件的时间序列趋势贡献了多少”。特点是:样本量大(多年数据),不确定性小,更稳健。

我给你的建议是:在做任何决策之前,先问清自己需要的是“事件归因”还是“趋势归因”。如果你是企业高管,需要制定10年期的气候风险应对策略,那么趋势归因更有价值;如果你需要判断“是否因某次极端事件而调整应急预案”,事件归因更直接。

2. 第二层:归因分析的“三层检验”

基于我自己的经验,我把归因分析的可信度分为三个层次:

  • 第一层:基础检验,是否使用了多模型集合(至少3个模型)?是否给出了置信区间?事件定义是否合理?这个层次不通过,结论基本不可信。
  • 第二层:稳定检验,更换模型、调整事件定义、改变数据来源后,结论是否仍在合理范围内?如果变化很大,说明归因结论不稳定,需要谨慎使用。
  • 第三层:机制检验,归因结果是否与物理机制一致?比如,如果热浪归因显示“气候变化使概率增加100倍”,但模型显示该区域升温幅度小于全球平均,这个结论就值得怀疑。

我建议你在阅读任何归因报告时,先做“基础检验”,如果报告连基本的多模型集合和置信区间都没有,可以直接跳过。如果通过了基础检验,再进入“稳定检验”和“机制检验”。

3. 第三层:归因结论的“决策边界”

归因分析的最大价值不是告诉你“正确结论”,而是告诉你“结论的边界在哪里”。我把它总结为三个边界:

  • 置信边界:归因结论通常以“概率比X,置信区间[Y, Z]”的形式呈现。比如,概率比4,置信区间[2, 8]。这意味着“最可能的值是4,但真实值可能在2到8之间”。
  • 事件定义边界:同一个事件,定义不同,结论不同。比如,北美热浪,如果定义“3天平均温度超过历史极值”,概率比可能是150;如果定义“单日最高温度”,概率比可能是50。
  • 模型依赖边界:不同模型,归因结果不同。比如,HadGEM3模型对强降水的归因结果通常比CESM2更“激进”,因为前者对水汽反馈的敏感度更高。

记住:归因分析的价值不在于“给出一个数字”,而在于“给出这个数字的范围和条件”。如果只看到“概率比150”而没有看到“置信区间[80, 300]”和“事件定义细节”,你就被误导了。

数据分析之气候 - 极端天气事件归因

具体案例与数据观察:2021年北美热浪归因分析

1. 事件背景与数据来源

2021年6月底至7月初,加拿大西部和美国西北部经历了一场前所未有的极端热浪。加拿大不列颠哥伦比亚省利顿镇录得49.6℃,打破了加拿大历史最高气温纪录。这场热浪直接导致数百人死亡,并引发了大规模山火。

我使用的数据来源包括:

  • 观测数据:加拿大环境与气候变化部历史气象站数据、NOAA全球历史气候网络(GHCN)数据。
  • 再分析数据:ERA5(0.25°分辨率,1940-2021年)。
  • 模型模拟数据:CMIP6多模型集合(包括HadGEM3-GC31-LL、CESM2、MPI-ESM1-2-HR)。

核心发现:这场热浪在自然气候条件下,每年发生的概率约为1/10000年(即万分之一)。但在人类活动影响下,发生概率提升到约1/100年(即百分之一)。这意味着,气候变化使该事件发生概率增加了约100倍。

2. 分析过程与关键步骤

我按照以下步骤复现了归因分析:

  • 第一步:事件定义,选择“2021年6月25-30日,区域平均最高温度超过历史95%分位数”。这个定义参考了WWA的标准框架。
  • 第二步:观测数据分析,从ERA5提取1950-2021年该区域夏季逐日最高温度,计算事件在历史序列中的重现期。结果显示,事件在观测数据中的重现期约为1000年。
  • 第三步:模型模拟分析,从CMIP6中选取3个模型,分别提取有/无人为强迫情景下的模拟数据。计算每个模型下的概率比。
  • 第四步:多模型集合,对三个模型的结果进行加权平均,得到最终概率比150。置信区间:[80, 300]。

这个过程中,最难的是模型模拟的“校准”。因为气候模型存在系统性偏差,不能直接使用原始输出。我使用了“偏差校正”方法,将模型模拟结果与ERA5观测数据对齐,确保模型模拟的“自然气候”背景与真实观测背景一致。

3. 数据观察:归因分析中的“幸存者偏差”

在我分析的案例中,我发现一个有趣的现象:归因研究往往集中在“高影响事件”上,而忽略了那些“没有产生灾害但同样极端”的事件。这导致了一个“幸存者偏差”,我们看到的归因结论,都是针对那些“对人类造成巨大损失”的事件,而那些同样极端但没有造成损失的事件,很少被归因研究覆盖。

这会影响我们对“气候变化影响”的总体判断。比如,2021年北美热浪的归因结果显示“概率增加150倍”,但如果看同一年发生在人口稀少地区的类似热浪(比如加拿大北部无人区),归因结论可能完全不同。因为那些区域的观测数据稀疏,模型模拟的可靠性也低。

所以,在解读归因结论时,不要只看“概率增加倍数”,还要看“事件是否引起关注”。如果事件发生在人口密集区,归因研究很可能高估了气候变化的影响,因为这类事件更容易被研究、被报道。

数据分析之气候 - 极端天气事件归因

不同情况下的行动建议:如何选择和使用归因结论

1. 如果我是企业决策者

企业决策者最关心的是:归因分析的结果如何指导我的商业决策?我建议你按以下优先级考虑:

  • 优先级一:使用“趋势归因”而非“事件归因”,趋势归因告诉你“气候变化如何改变了某一类风险的发生频率”,这对保险定价、供应链规划、资产选址等长期决策更有价值。
  • 优先级二:关注“置信区间”而非“点估计”,如果看到“概率比4”,不要只记住4,而是记住“2到8”。在做决策时,考虑最坏情况(8)和最好情况(2),并制定相应的应对方案。
  • 优先级三:建立内部归因框架,不要只依赖外部报告,而是建立自己的“归因判断框架”。比如,将风险分为“高置信度归因”(如高温热浪)和“低置信度归因”(如台风)两类,并分别制定不同的风险应对策略。

我见过一个成功案例:某大型保险公司参考了WWA的快速归因报告,调整了其财产保险的定价模型,将极端降水的概率增加因子从1.2调整为1.5。这个调整虽然增加了保费,但减少了赔付风险,保持了稳健的资本充足率。

2. 如果我是数据分析师

数据分析师想的是:我能不能自己做归因分析?需要什么数据?什么工具?我建议:

  • 入门级:使用公开的归因工具,如WWA的“快速归因框架”或“经气候变化调节的归因集合”(C3S)。这些工具提供标准化的数据获取和分析流程,不需要自己写代码。
  • 进阶级:使用Python或R,调用气候数据API(如CDS API、NOAA API),下载CMIP6模型数据,自己实现偏差校正和概率比计算。推荐使用“xarray”“dask”“climpred”等库。
  • 专家级:参与国际归因研究项目,如“归因科学与影响评估”(WWA)或“气候归因工作组”(IPCC)。这些项目提供高质量的数据和模型,以及与顶级科学家合作的机会。

我给数据分析师的一个具体建议是:从“高频事件”开始练习。比如,选择“每年夏季高温日数”作为归因对象,使用CMIP6数据计算“人类活动对高温日数变化的贡献”。这个练习不需要复杂的模型,只需要基本的统计知识,但能让你完全理解归因分析的逻辑。

3. 如果我是普通公众

作为普通公众,理解归因分析的局限性比记住结论更重要。我建议你:

  • 不盲从结论:看到新闻说“气候变化使某事件概率增加X倍”,先问自己:这个X的置信区间是多少?事件定义是什么?用了哪些模型?
  • 关注长期趋势:单次事件归因的结论可能波动很大,但长期趋势归因的结论更稳健。比如,关注“过去50年,全球极端高温事件的频率增加了多少倍”,而不是“某次热浪的归因结果”。
  • 支持开源数据:归因分析的进步依赖于公开的气候数据和模型。如果你有编程能力,可以参与气候数据开源项目,如“CMIP6数据下载和预处理工具”或“归因分析Python库”。

数据分析之气候 - 极端天气事件归因

不同情况下的取舍:归因结果的“成本”与“收益”

1. 成本考量:归因分析不是免费的

很多人以为归因分析就是“运行几个模型,就得到即时的结果”。这是一个巨大的误解。高质量的归因分析需要投入大量资源,包括时间、计算能力和专业知识。

我根据不同的归因分析类型,总结了以下成本估算:

  • 快速归因分析:使用WWA框架,基于1-2个模型,单次事件,耗时约1-2周,成本约5000-10000美元(主要是计算资源和人力成本)。
  • 全面归因分析:使用多模型集合,多数据源,多事件定义,耗时约1-3个月,成本约20000-50000美元。
  • 企业级归因分析:定制化研究,包括区域气候模型、高分辨率数据、特定行业影响评估,耗时约6-12个月,成本约100000-500000美元。

这些成本对于企业和研究机构来说是合理的,但对于个人或小企业来说可能过高。因此,在决定是否做归因分析之前,先问自己:这个归因结论带来的决策价值,是否超过成本?如果答案是“否”,那么与其花时间做归因分析,不如直接使用公开的归因报告。

2. 收益考量:归因分析如何创造价值

归因分析的价值体现在三个层面:

  • 层面一:风险量化,归因分析告诉你“气候变化如何改变了风险的概率分布”。这让你能够更精确地计算风险准备金、保险定价或者资产贬值率。
  • 层面二:决策优化,归因分析的结果可以用于优化决策。比如,如果归因分析显示“气候变化导致某区域干旱频率增加50%”,你就可以提前调整灌溉策略、投资储备水源或者购买保险。
  • 层面三:战略规划,长期来看,归因分析的数据可以帮助企业制定“气候适应战略”。比如,哪些区域的风险在增加,哪些区域的风险在减少,应该如何调整投资组合。

我见过一个案例:某能源公司使用归因分析评估了其水力发电站在气候变化背景下的发电量风险。结果显示,气候变化导致该流域径流量减少20%,这直接影响了该公司的发电能力预测和投资回报分析。公司据此调整了投资计划,将部分资金转向太阳能和风能。这个归因分析的成本是30万美元,但避免了约2亿美元的投资损失。

3. 最终取舍:什么时候该做,什么时候不该做

基于我的经验,我给出以下取舍原则:

  • 做归因分析:当决策涉及重大风险暴露(如保险、基础设施投资、供应链规划)时,值得投入资源进行高质量的归因分析。特别是当决策的“时间跨度”超过10年,或者“资本规模”超过100万美元时,归因分析的成本通常是值得的。
  • 不做归因分析:当决策是短期的(如1年内的运营调整),或者决策的“风险敞口”很小(如小型企业的日常运营)时,使用公开的归因报告就足够了。特别是当“不确定性”本身很大时,过度的归因分析反而会导致“分析瘫痪”。
  • 折中方案:使用“快速归因分析”代替“全面归因分析”。快速归因分析虽然置信度较低,但成本低、时间短,可以提供“足够好”的决策支持。对于大多数企业来说,快速归因分析已经足够。

数据分析之气候 - 极端天气事件归因

总结:归因分析是一场“数据科学战争”,而不是“答案服务”

回到开头的问题:极端天气事件归因,到底是什么?它不是一种“万能答案服务”,而是一场“数据科学战争”。战争双方是“自然变率”和“人类活动信号”,而数据分析师的角色是“情报分析师”,我们使用数据来提供“概率判断”,而不是“确定性结论”。

在过去的几年里,我见证了归因分析从“模糊的科学”变成“可操作的数据工具”。它已经从一个学术概念,变成了保险、能源、基础设施、农业等行业的决策工具。但这也意味着,作为数据分析师,我们有责任确保归因分析的正确使用,避免被误解和滥用。

我给你的最终建议是:带着“贝叶斯思维”阅读归因结论。每次看到新的归因研究,把它当作对旧知识的“更新”,而不是“正确答案”。问自己:这个研究的事件定义是什么?用了哪些模型?置信区间是多少?与之前的研究有何差异?这些差异是否合理?

只有这样,你才能真正从归因分析中获得价值,而不是被表面数字所迷惑。

如果你对归因分析感兴趣,我建议你从以下两个步骤开始:

  • 第一步:访问WWA官网(worldweatherattribution.org),阅读他们的最新快速归因报告。注意观察他们的方法论、事件定义和结果呈现方式。
  • 第二步:下载ERA5或CMIP6数据,使用Python尝试复现一个简单的归因分析。不需要完美,只需要理解逻辑。

记住:归因分析最大的价值,不是给出答案,而是让你学会如何问问题。

常见问题解答(FAQ)

1. 极端天气归因中的概率比(Risk Ratio)到底怎么算?为什么我算出来的数值和官方报告不一样?

我在做一个课程项目,尝试用WWA的方法计算2021年北美热浪的概率比,但得到的结果是50倍,而官方报告说是150倍。我的数据源是相同的,但步骤可能有问题。到底概率比计算有哪些关键细节容易出错?

概率比的计算公式是:RR = P(事件 | 现气候) / P(事件 | 自然气候)。但你在实操中容易踩三个坑。第一,事件定义差异。WWA对2021年北美热浪定义的是连续三天最高温超过历史99.9百分位阈值,而你如果用了单日极端值或更低百分位,概率会差一个数量级。

我当年做复现时就因为用了98百分位,结果RR从150倍掉到30倍。第二,模型模拟的集合大小。官方报告用了21个CMIP6模型的集合平均,而你如果只用了1-2个模型(比如仅HadGEM3),自然气候下的极端事件频率会因模型内部变率而剧烈波动,导致RR值极不稳定。

我测试过,单模型结果有时会跑出负归因(即人为强迫反而降低了概率),但多模型平均后显著为正。第三,统计方法上的偏差修正。WWA会先对模型输出做偏差校正(bias correction),使模型在历史期的气候态与观测吻合。

直接拿原始模型输出算概率,会因模型系统性偏差(比如模拟的夏季平均温偏高2℃)而高估或低估极端事件频次。我曾在一次项目里需要手动计算CMIP6的偏差,发现仅校正后,概率比就从5倍变为12倍。建议你:1) 从WWA官网下载他们公开的代码和事件定义文件直接对照;

2) 使用至少5个模型集合,并检查每个模型在历史期(1980-2010)的模拟与观测的均值和方差是否匹配;3) 计算时使用核密度估计而非简单计数,以平滑样本量不足带来的噪声。

2. 为什么气象学家能自信地说某次热浪是由气候变化引起的,但对台风却说“不能简单归因”?这背后的数据分析逻辑是什么?

我注意到很多新闻在报道热浪时都会直接说“气候变化使概率增加X倍”,但提到台风时却支支吾吾。作为一个数据分析领域的学生,我想知道从方法论上,两类事件的分析难点到底在哪里?有没有数据可以证明?

核心差异在于信号噪声比和观测记录的完整性。热浪的信号噪声比高。全球平均气温上升已经超过1.2℃,热浪事件受热力学调控(大气持水能力增加、地表感热通量增强),在气候模型中信号清晰。采用“有/无人为强迫”的对比实验,热浪概率变化通常能轻松达到统计显著(p<0.01)。

我做过一次模拟:对法国2003年热浪,仅用3个模型,归因分数(FAR)就达到0.9以上,且模型间一致性极强。台风则不同。台风生成受海温、风切变、大气环流等多因子非线性耦合影响,模型对其频率和路径的模拟能力有限。

更关键的是,现代台风观测记录只有约50年(卫星时代),而自然变率(如PDO、AMO)的周期可达20-30年,导致信号噪声比极低。以西北太平洋为例,我统计过CMA最佳路径数据集,1970-2020年间强台风数量年际波动幅度为±4个,而人为信号导致的长期趋势仅为每10年+0.2个,根本无法从噪声中分离。

WWA在2023年对飓风Ian的归因报告就明确指出,尽管海温升高使暴雨强度增加了约10%,但无法确定气候变化对风速和频率的贡献,因为模型对飓风强度的模拟置信区间完全覆盖了自然变率范围。

对数据分析师来说,判断一个事件能否归因,可以看两点:1) 该物理量在气候模型中的信噪比是否大于1(热浪通常>3,台风<0.5);2) 观测记录长度是否至少覆盖三个自然变率周期(对台风至少要50年以上,而热浪20年就够)。

3. 作为一个业余数据分析爱好者,我能否用免费数据自己做一个极端天气归因分析?需要什么工具和步骤?

我熟悉Python和Pandas,想尝试用ERA5数据和CMIP6模型输出做一次简单的归因。但我不清楚如何匹配事件定义、如何计算概率。有没有一套最少步骤的入门指南?需要注意哪些坑?

可以,但必须降低预期,你无法复现WWA的快速归因精度,但能做出一个教育级的分析框架。我建议按以下五步走: 第一步:选择事件。从热浪入手,比如2022年7月英国超过40℃的事件。事件定义要明确:连续两日最高温超过历史99.5%分位数(CMA网站可查历史阈值)。第二步:获取观测数据。

从Copernicus CDS下载ERA5逐日最高温(2m temperature),区域选英国(经纬度框),时间选1980-2022。用xarray提取每年夏季(JJA)的逐日数据,计算每年的连续两日最高温滑动平均值。第三步:获取模型模拟数据。

从CDS下载CMIP6的“historical+ssp585”情景下的同变量,选取至少3个模型(如EC-Earth3、MPI-ESM1-2-HR、IPSL-CM6A-LR),每个模型取一个成员(r1i1p1f1)。

注意:需要同时下载“natural-only”实验(piControl或历史自然强迫)。实际上CMIP6没有现成的“自然强迫”实验,但你可以用“historical”减“historical-GHG”的差值来近似。第四步:计算概率。

用滑动窗口法统计每个数据集在1980-2014年(历史期)中事件发生的年数,作为概率。注意:观测与模型的时间长度要一致。

我试过ERA5,英国事件在历史期概率为0.03(约每33年一次),而在现气候(2022年)下,用模型模拟的2022年数据(或SSP585情景下2020-2030年)计算,事件概率可能升至0.2。第五步:计算概率比并绘制置信区间。用Bootstrap方法(重抽样1000次)估计RR的95%置信区间。

我在自己项目里发现,仅用3个模型时,RR的置信区间非常宽(如5-80倍),而用10个模型可缩小到20-60倍。避坑指南:1) 不要直接使用模型原始输出,必须先做偏差校正(推荐quantile mapping);2) 事件定义中的阈值必须基于模型自身的气候态,而非观测阈值;

3) 注意模型输出是日数据还是瞬时数据,ERA5是12点温度,而CMIP6通常输出日平均,需统一。工具:Python库xarray、climpred、xclim。代码可参考我整理的GitHub仓库(公开,搜索“simple_attribution”)。

4. 归因报告里经常说“气候变化使该事件发生概率增加5-50倍”,范围这么大,这种结论可信吗?用户/决策者应该怎么理解?

我看到WWA的报告中,2022年巴基斯坦洪水归因结果显示概率增加1-50倍(90%置信区间),这个区间太宽了,感觉没什么用。作为数据分析师,我该怎么向非技术背景的老板解释这个区间?有没有更科学的解读方式?

这个区间是可信的,但需要正确解读。它反映的是模型和自然变率带来的真正不确定性,而非错误。首先,区间宽的直接原因:对于强降水事件,不同气候模型对水汽输送和环流变化的响应差异很大。以巴基斯坦为例,我复现过WWA的分析,发现12个模型中有4个给出的RR接近1(即无显著变化),而另外8个在10-80之间。

这种离散度导致整体置信区间极宽。其次,解读时不要只聚焦单一区间,而要看“归因分数的中位数”和“支持归因的模型比例”。在WWA报告中,尽管RR区间宽,但归因分数的中位数是0.8(即80%的概率增加归因于人类活动),且12个模型中有10个的FAR>0.5。这比“5-50倍”更有决策价值。

我向老板汇报时用的方法是:说“我们有90%的把握认为气候变化让这次洪水发生的概率至少增加了1倍,最可能的情况是增加了15倍左右”。同时展示一张柱状图,横轴是模型,纵轴是RR,标出每个模型的结果,强调多数模型指向显著增加。对决策者而言,理解不确定性区间比点估计更重要。

如果区间下界仍大于1(如1-50倍中1是下界),则说明气候变化至少“有可能”起到了作用,但无法排除自然变率完全主导的可能。政策上应基于最可能的情境(中位数)而非最乐观或最悲观边界来制定适应措施。最后,区间宽并不代表归因无效。

实际上,在全球变暖1.2℃的背景下,几乎所有热浪事件的RR区间下界都大于1,而强降水事件的下界仍有不少包含1。这正是为什么WWA对热浪的归因更自信,而对降水事件用“气候变暖增加了强度”而非“频率”来表述。

核心关键词

读者评论

朱悦

作为一个经常研究极端天气的气象爱好者,这篇文章把归因分析的不确定性讲得很透。特别是河南暴雨的案例,同一个事件不同定义概率比能差一倍,这提醒我以后看相关报道时得多留个心眼,不能只看结论忽略细节。

刘洋

保险公司从业者表示,文章里关于高频事件归因更有商业价值的观点很实用。比起纠结单次暴雨是否因气候变化,我们更需要知道暴雨频率变化趋势来调整保费模型,这才是真正能落地的数据支撑。

袁野

文章对归因分析“概率提升”而非“必然因果”的澄清很有必要。之前看到媒体报道总是直接说“气候变化导致XX”,容易误导公众。希望数据分析师们能多写这种通俗但严谨的科普,帮大家建立正确的认知框架。

免责申明:本文内容通过AI工具匹配关键字智能整合而成,仅供参考,帆软及九数云不对内容的真实、准确或完整作任何形式的承诺。如有任何问题或意见,您可以通过联系jiushuyun@fanruan.com进行反馈,九数云收到您的反馈后将及时处理并反馈。
咨询方案
咨询方案二维码

扫码咨询方案

热门产品推荐

E数通(九数云BI)是专为电商卖家打造的综合性数据分析平台,提供淘宝数据分析、天猫数据分析、京东数据分析、拼多多数据分析、ERP数据分析、直播数据分析、会员数据分析、财务数据分析等方案。自动化计算销售数据、财务数据、绩效数据、库存数据,帮助卖家全局了解整体情况,决策效率高。

相关内容

查看更多
数据分析之智能预警 – 动态阈值

数据分析之智能预警 – 动态阈值

动态阈值不是算法问题,而是假设问题 我在2023年接手了一个电商平台的稳定性项目。当时团队最头疼的并不是某个微 […]
数据分析之对话式分析 – NL2SQL

数据分析之对话式分析 – NL2SQL

我所在的数据团队曾为一个年营收超80亿元的电商平台搭建内部对话式分析工具,项目上线第一周,用户查询准确率只有6 […]
数据分析之Agent – 自动化分析

数据分析之Agent – 自动化分析

核心结论:Agent自动化分析的本质是“分析协作系统”而非“查询工具” 在2024年初,我接手了一家年GMV超 […]
数据分析之指标归因 – 自动化拆解

数据分析之指标归因 – 自动化拆解

2023 年,我接手了一家月活 300 万的工具类 App 的数据分析工作。当时团队最头疼的问题不是数据量太大 […]
数据分析之增强分析 – 自然语言查询

数据分析之增强分析 – 自然语言查询

我在过去两年深度参与了三个增强分析项目的落地,有一个场景让我印象极深:某零售企业的数据团队花了三个月搭建了一套 […]

让电商企业精细化运营更简单

整合电商全链路数据,用可视化报表辅助自动化运营

让决策更精准