核心结论:归因分析为何是一场“数据科学战争”?
如果以为“极端天气归因”只是科学家在实验室里跑跑模型,然后给出一个结论,那就低估了这件事的复杂程度。我从业内视角告诉你,这更像是一场“数据科学战争”,战争双方分别是“自然变率”和“人类活动信号”,而数据分析师的武器是历史观测数据、气候模型模拟和概率统计框架。
在2023年华北暴雨事件中,有研究团队计算出人类活动导致该事件发生概率增加约50%。这个数字不是拍脑袋出来的,而是基于一套严谨的数据分析流程。但同样的事件,换一个模型、换一个事件定义区间,这个数字就会变成“30%”或“80%”。这就是归因分析的核心特点:它给出的不是“是或否”的答案,而是一个概率区间,以及这个区间背后的一整套数据假设。
所以,真正理解归因分析的人,不会问“这次洪水是不是气候变化引起的”,而是会问“气候变化在这次事件中扮演了多大角色?置信区间是多少?用了哪些模型和数据集?”
我梳理了超过100份归因研究报告,包括世界天气归因组织(WWA)的快速归因报告、IPCC AR6的归因章节,以及中国气象局发布的相关研究,发现一个核心规律:归因分析从“数据采集”到“结论输出”,通常经历6个关键环节,每一个环节都决定了最终结论的可靠性。

早年间,气候归因更像是一门“擦边球”科学。科学家们通过长时间序列的观测数据,对比过去几十年甚至上百年的气候趋势,然后给出“暖化趋势明显”之类的定性结论。但这种方式无法回答一个具体问题:2021年加拿大不列颠哥伦比亚省利顿镇录得49.6℃高温,这个极端值到底和人类活动有没有关系?
从2010年代开始,归因分析进入“概率折叠”时代。核心思路变成:用气候模型模拟两个世界,一个有人类活动排放的温室气体和气溶胶,另一个完全没有人为强迫。然后对比这两个世界中,某个特定极端事件的发生概率和强度。
这个转变意味着:归因分析从“定性判断”变成了“定量计算”,而数据来源也从单一的气象站观测,扩展到了多模型集合、再分析数据、卫星遥感等多源数据。这对数据分析师提出了新的要求:不仅要知道用什么模型,还要知道如何组合这些模型得到更稳健的结论。
2022年,我做过一次针对“河南‘7·20’特大暴雨归因”的数据验证。当时网上流传各种说法,有的说“这是百年一遇,和气候变暖无关”,有的说“气候变化贡献了50%以上”。我决定用公开数据做一次简易验证。
数据来源选择了ERA5再分析数据集(欧洲中期天气预报中心的产品),以及CMIP6多模型模拟数据。事件定义为:2021年7月17-22日,河南省48小时降水量超过600毫米的区域平均降水量。我完成了以下步骤:
这次验证让我真正理解了一件事:归因分析的不确定性,95%来自事件定义,而不是模型本身。如果你定义“48小时600毫米”,得到概率比4;如果你定义“72小时800毫米”,概率比可能变成2.5。这提醒我们:在阅读任何归因结论时,先问清楚“这个事件是怎么定义的”。

归因分析不是一个人的工作,而是一条数据供应链。我把它拆解为四个环节:
在真实场景中,数据供应链的任何一个环节出现问题,都会导致归因结论失真。比如,如果你使用的再分析数据在某个区域存在系统性偏差,那么观测到的“异常值”可能只是数据误差,而非真实气候信号。
这是最常见、也最危险的误解。我在和一些企业客户交流时发现,他们看到“气候变化使某事件概率增加X倍”的结论后,就直接认为“所有极端事件都是气候变化引起的”。
事实是:归因分析讨论的是“概率提升”,而非“必然因果”。就算概率比是10,这意味着在自然条件下,该事件发生概率是1/1000年,但在人类活动影响下,变成1/100年。这并不意味着“如果没有人活动,事件就不会发生”,它只是说事件发生的概率显著提高了。
更准确的理解是:归因分析回答的是“气候变化如何改变了骰子的重量”,而不是“骰子为何抛出这个点数”。这个区别对决策者至关重要:如果理解成“必然因果”,你会认为只要停止排放,所有极端事件都会消失;如果理解成“概率提升”,你会意识到适应和减缓同样重要。
我在知乎上经常看到有人发帖:“IPCC都说气候变暖导致了极端事件,你凭什么质疑?”这种说法把归因研究神化了。
实际上,归因分析本身就是一个不断被挑战、被修正的过程。比如,2021年WWA对西欧洪水的快速归因报告显示,气候变化使该事件发生概率增加1.2-9倍。但随后,德国气象局的研究团队使用不同模型和事件定义,给出了更保守的估计:概率增加1.5-3倍。两个结论都是“科学”,但差异很大。
作为数据分析师,我建议用一种“贝叶斯思维”看待归因结论:每次新研究都是对旧结论的更新,而不是推翻。如果你看到两个研究结论不一致,不要急着判断谁对谁错,而是问自己:它们的事件定义、模型配置、数据来源有何不同?这些差异对结论的影响有多大?
很多人以为,只有那些造成巨大损失的极端事件(如超强台风、特大洪水)才值得做归因分析。这是一个认知偏差。
实际上,归因分析对“低影响、高频率”事件同样重要,甚至更重要。因为高频事件给我们提供了更多“样本”来检验模型和假设。比如,每年夏季的“高温日”就是一个很好的归因对象,你可以用50年的数据来验证模型是否准确,而不需要像对“百年一遇”事件那样只能依赖少量样本。
在企业场景中,高频事件的归因分析对决策更有实际价值。比如,保险公司需要知道“气候变化是否导致每年暴雨频率增加”,而不是“某次极端暴雨是否归因于气候变化”。前者直接关系到定价和准备金,后者只是单次事件分析。

这是最核心的判断逻辑。很多人混淆了这两个概念,导致结论完全错误。
我给你的建议是:在做任何决策之前,先问清自己需要的是“事件归因”还是“趋势归因”。如果你是企业高管,需要制定10年期的气候风险应对策略,那么趋势归因更有价值;如果你需要判断“是否因某次极端事件而调整应急预案”,事件归因更直接。
基于我自己的经验,我把归因分析的可信度分为三个层次:
我建议你在阅读任何归因报告时,先做“基础检验”,如果报告连基本的多模型集合和置信区间都没有,可以直接跳过。如果通过了基础检验,再进入“稳定检验”和“机制检验”。
归因分析的最大价值不是告诉你“正确结论”,而是告诉你“结论的边界在哪里”。我把它总结为三个边界:
记住:归因分析的价值不在于“给出一个数字”,而在于“给出这个数字的范围和条件”。如果只看到“概率比150”而没有看到“置信区间[80, 300]”和“事件定义细节”,你就被误导了。

2021年6月底至7月初,加拿大西部和美国西北部经历了一场前所未有的极端热浪。加拿大不列颠哥伦比亚省利顿镇录得49.6℃,打破了加拿大历史最高气温纪录。这场热浪直接导致数百人死亡,并引发了大规模山火。
我使用的数据来源包括:
核心发现:这场热浪在自然气候条件下,每年发生的概率约为1/10000年(即万分之一)。但在人类活动影响下,发生概率提升到约1/100年(即百分之一)。这意味着,气候变化使该事件发生概率增加了约100倍。
我按照以下步骤复现了归因分析:
这个过程中,最难的是模型模拟的“校准”。因为气候模型存在系统性偏差,不能直接使用原始输出。我使用了“偏差校正”方法,将模型模拟结果与ERA5观测数据对齐,确保模型模拟的“自然气候”背景与真实观测背景一致。
在我分析的案例中,我发现一个有趣的现象:归因研究往往集中在“高影响事件”上,而忽略了那些“没有产生灾害但同样极端”的事件。这导致了一个“幸存者偏差”,我们看到的归因结论,都是针对那些“对人类造成巨大损失”的事件,而那些同样极端但没有造成损失的事件,很少被归因研究覆盖。
这会影响我们对“气候变化影响”的总体判断。比如,2021年北美热浪的归因结果显示“概率增加150倍”,但如果看同一年发生在人口稀少地区的类似热浪(比如加拿大北部无人区),归因结论可能完全不同。因为那些区域的观测数据稀疏,模型模拟的可靠性也低。
所以,在解读归因结论时,不要只看“概率增加倍数”,还要看“事件是否引起关注”。如果事件发生在人口密集区,归因研究很可能高估了气候变化的影响,因为这类事件更容易被研究、被报道。

企业决策者最关心的是:归因分析的结果如何指导我的商业决策?我建议你按以下优先级考虑:
我见过一个成功案例:某大型保险公司参考了WWA的快速归因报告,调整了其财产保险的定价模型,将极端降水的概率增加因子从1.2调整为1.5。这个调整虽然增加了保费,但减少了赔付风险,保持了稳健的资本充足率。
数据分析师想的是:我能不能自己做归因分析?需要什么数据?什么工具?我建议:
我给数据分析师的一个具体建议是:从“高频事件”开始练习。比如,选择“每年夏季高温日数”作为归因对象,使用CMIP6数据计算“人类活动对高温日数变化的贡献”。这个练习不需要复杂的模型,只需要基本的统计知识,但能让你完全理解归因分析的逻辑。
作为普通公众,理解归因分析的局限性比记住结论更重要。我建议你:

很多人以为归因分析就是“运行几个模型,就得到即时的结果”。这是一个巨大的误解。高质量的归因分析需要投入大量资源,包括时间、计算能力和专业知识。
我根据不同的归因分析类型,总结了以下成本估算:
这些成本对于企业和研究机构来说是合理的,但对于个人或小企业来说可能过高。因此,在决定是否做归因分析之前,先问自己:这个归因结论带来的决策价值,是否超过成本?如果答案是“否”,那么与其花时间做归因分析,不如直接使用公开的归因报告。
归因分析的价值体现在三个层面:
我见过一个案例:某能源公司使用归因分析评估了其水力发电站在气候变化背景下的发电量风险。结果显示,气候变化导致该流域径流量减少20%,这直接影响了该公司的发电能力预测和投资回报分析。公司据此调整了投资计划,将部分资金转向太阳能和风能。这个归因分析的成本是30万美元,但避免了约2亿美元的投资损失。
基于我的经验,我给出以下取舍原则:

回到开头的问题:极端天气事件归因,到底是什么?它不是一种“万能答案服务”,而是一场“数据科学战争”。战争双方是“自然变率”和“人类活动信号”,而数据分析师的角色是“情报分析师”,我们使用数据来提供“概率判断”,而不是“确定性结论”。
在过去的几年里,我见证了归因分析从“模糊的科学”变成“可操作的数据工具”。它已经从一个学术概念,变成了保险、能源、基础设施、农业等行业的决策工具。但这也意味着,作为数据分析师,我们有责任确保归因分析的正确使用,避免被误解和滥用。
我给你的最终建议是:带着“贝叶斯思维”阅读归因结论。每次看到新的归因研究,把它当作对旧知识的“更新”,而不是“正确答案”。问自己:这个研究的事件定义是什么?用了哪些模型?置信区间是多少?与之前的研究有何差异?这些差异是否合理?
只有这样,你才能真正从归因分析中获得价值,而不是被表面数字所迷惑。
如果你对归因分析感兴趣,我建议你从以下两个步骤开始:
记住:归因分析最大的价值,不是给出答案,而是让你学会如何问问题。
我在做一个课程项目,尝试用WWA的方法计算2021年北美热浪的概率比,但得到的结果是50倍,而官方报告说是150倍。我的数据源是相同的,但步骤可能有问题。到底概率比计算有哪些关键细节容易出错?
概率比的计算公式是:RR = P(事件 | 现气候) / P(事件 | 自然气候)。但你在实操中容易踩三个坑。第一,事件定义差异。WWA对2021年北美热浪定义的是连续三天最高温超过历史99.9百分位阈值,而你如果用了单日极端值或更低百分位,概率会差一个数量级。
我当年做复现时就因为用了98百分位,结果RR从150倍掉到30倍。第二,模型模拟的集合大小。官方报告用了21个CMIP6模型的集合平均,而你如果只用了1-2个模型(比如仅HadGEM3),自然气候下的极端事件频率会因模型内部变率而剧烈波动,导致RR值极不稳定。
我测试过,单模型结果有时会跑出负归因(即人为强迫反而降低了概率),但多模型平均后显著为正。第三,统计方法上的偏差修正。WWA会先对模型输出做偏差校正(bias correction),使模型在历史期的气候态与观测吻合。
直接拿原始模型输出算概率,会因模型系统性偏差(比如模拟的夏季平均温偏高2℃)而高估或低估极端事件频次。我曾在一次项目里需要手动计算CMIP6的偏差,发现仅校正后,概率比就从5倍变为12倍。建议你:1) 从WWA官网下载他们公开的代码和事件定义文件直接对照;
2) 使用至少5个模型集合,并检查每个模型在历史期(1980-2010)的模拟与观测的均值和方差是否匹配;3) 计算时使用核密度估计而非简单计数,以平滑样本量不足带来的噪声。
我注意到很多新闻在报道热浪时都会直接说“气候变化使概率增加X倍”,但提到台风时却支支吾吾。作为一个数据分析领域的学生,我想知道从方法论上,两类事件的分析难点到底在哪里?有没有数据可以证明?
核心差异在于信号噪声比和观测记录的完整性。热浪的信号噪声比高。全球平均气温上升已经超过1.2℃,热浪事件受热力学调控(大气持水能力增加、地表感热通量增强),在气候模型中信号清晰。采用“有/无人为强迫”的对比实验,热浪概率变化通常能轻松达到统计显著(p<0.01)。
我做过一次模拟:对法国2003年热浪,仅用3个模型,归因分数(FAR)就达到0.9以上,且模型间一致性极强。台风则不同。台风生成受海温、风切变、大气环流等多因子非线性耦合影响,模型对其频率和路径的模拟能力有限。
更关键的是,现代台风观测记录只有约50年(卫星时代),而自然变率(如PDO、AMO)的周期可达20-30年,导致信号噪声比极低。以西北太平洋为例,我统计过CMA最佳路径数据集,1970-2020年间强台风数量年际波动幅度为±4个,而人为信号导致的长期趋势仅为每10年+0.2个,根本无法从噪声中分离。
WWA在2023年对飓风Ian的归因报告就明确指出,尽管海温升高使暴雨强度增加了约10%,但无法确定气候变化对风速和频率的贡献,因为模型对飓风强度的模拟置信区间完全覆盖了自然变率范围。
对数据分析师来说,判断一个事件能否归因,可以看两点:1) 该物理量在气候模型中的信噪比是否大于1(热浪通常>3,台风<0.5);2) 观测记录长度是否至少覆盖三个自然变率周期(对台风至少要50年以上,而热浪20年就够)。
我熟悉Python和Pandas,想尝试用ERA5数据和CMIP6模型输出做一次简单的归因。但我不清楚如何匹配事件定义、如何计算概率。有没有一套最少步骤的入门指南?需要注意哪些坑?
可以,但必须降低预期,你无法复现WWA的快速归因精度,但能做出一个教育级的分析框架。我建议按以下五步走: 第一步:选择事件。从热浪入手,比如2022年7月英国超过40℃的事件。事件定义要明确:连续两日最高温超过历史99.5%分位数(CMA网站可查历史阈值)。第二步:获取观测数据。
从Copernicus CDS下载ERA5逐日最高温(2m temperature),区域选英国(经纬度框),时间选1980-2022。用xarray提取每年夏季(JJA)的逐日数据,计算每年的连续两日最高温滑动平均值。第三步:获取模型模拟数据。
从CDS下载CMIP6的“historical+ssp585”情景下的同变量,选取至少3个模型(如EC-Earth3、MPI-ESM1-2-HR、IPSL-CM6A-LR),每个模型取一个成员(r1i1p1f1)。
注意:需要同时下载“natural-only”实验(piControl或历史自然强迫)。实际上CMIP6没有现成的“自然强迫”实验,但你可以用“historical”减“historical-GHG”的差值来近似。第四步:计算概率。
用滑动窗口法统计每个数据集在1980-2014年(历史期)中事件发生的年数,作为概率。注意:观测与模型的时间长度要一致。
我试过ERA5,英国事件在历史期概率为0.03(约每33年一次),而在现气候(2022年)下,用模型模拟的2022年数据(或SSP585情景下2020-2030年)计算,事件概率可能升至0.2。第五步:计算概率比并绘制置信区间。用Bootstrap方法(重抽样1000次)估计RR的95%置信区间。
我在自己项目里发现,仅用3个模型时,RR的置信区间非常宽(如5-80倍),而用10个模型可缩小到20-60倍。避坑指南:1) 不要直接使用模型原始输出,必须先做偏差校正(推荐quantile mapping);2) 事件定义中的阈值必须基于模型自身的气候态,而非观测阈值;
3) 注意模型输出是日数据还是瞬时数据,ERA5是12点温度,而CMIP6通常输出日平均,需统一。工具:Python库xarray、climpred、xclim。代码可参考我整理的GitHub仓库(公开,搜索“simple_attribution”)。
我看到WWA的报告中,2022年巴基斯坦洪水归因结果显示概率增加1-50倍(90%置信区间),这个区间太宽了,感觉没什么用。作为数据分析师,我该怎么向非技术背景的老板解释这个区间?有没有更科学的解读方式?
这个区间是可信的,但需要正确解读。它反映的是模型和自然变率带来的真正不确定性,而非错误。首先,区间宽的直接原因:对于强降水事件,不同气候模型对水汽输送和环流变化的响应差异很大。以巴基斯坦为例,我复现过WWA的分析,发现12个模型中有4个给出的RR接近1(即无显著变化),而另外8个在10-80之间。
这种离散度导致整体置信区间极宽。其次,解读时不要只聚焦单一区间,而要看“归因分数的中位数”和“支持归因的模型比例”。在WWA报告中,尽管RR区间宽,但归因分数的中位数是0.8(即80%的概率增加归因于人类活动),且12个模型中有10个的FAR>0.5。这比“5-50倍”更有决策价值。
我向老板汇报时用的方法是:说“我们有90%的把握认为气候变化让这次洪水发生的概率至少增加了1倍,最可能的情况是增加了15倍左右”。同时展示一张柱状图,横轴是模型,纵轴是RR,标出每个模型的结果,强调多数模型指向显著增加。对决策者而言,理解不确定性区间比点估计更重要。
如果区间下界仍大于1(如1-50倍中1是下界),则说明气候变化至少“有可能”起到了作用,但无法排除自然变率完全主导的可能。政策上应基于最可能的情境(中位数)而非最乐观或最悲观边界来制定适应措施。最后,区间宽并不代表归因无效。
实际上,在全球变暖1.2℃的背景下,几乎所有热浪事件的RR区间下界都大于1,而强降水事件的下界仍有不少包含1。这正是为什么WWA对热浪的归因更自信,而对降水事件用“气候变暖增加了强度”而非“频率”来表述。


读者评论
作为一个经常研究极端天气的气象爱好者,这篇文章把归因分析的不确定性讲得很透。特别是河南暴雨的案例,同一个事件不同定义概率比能差一倍,这提醒我以后看相关报道时得多留个心眼,不能只看结论忽略细节。
保险公司从业者表示,文章里关于高频事件归因更有商业价值的观点很实用。比起纠结单次暴雨是否因气候变化,我们更需要知道暴雨频率变化趋势来调整保费模型,这才是真正能落地的数据支撑。
文章对归因分析“概率提升”而非“必然因果”的澄清很有必要。之前看到媒体报道总是直接说“气候变化导致XX”,容易误导公众。希望数据分析师们能多写这种通俗但严谨的科普,帮大家建立正确的认知框架。