数据分析之黑五类数据 – 异常检测与反作弊
目录

数据分析之黑五类数据 – 异常检测与反作弊 | 九数云-E数通

eshutong 发表于2026年8月1日

先看核心结论

我直接说结论:反作弊对抗的本质,不是用一套模型搞定所有作弊,而是建立起一个“信号博弈”的监测体系。

过去五年,我先后为三家电商平台和一家广告技术公司搭建过反作弊系统。踩过的坑总结下来就一句话:所有试图用单一模型解决所有问题的方案,最后都变成了“模型跑得欢,作弊照样干”。

本文不打算复述“什么是黑五类数据”这种基础概念,也不打算堆砌孤立森林、LOF、DBSCAN的算法原理。我打算讲的是:在资源有限、作弊手段不断进化的现实条件下,如何用一套“规则+统计+简易模型”的组合拳,低成本地搞定80%的异常数据检测。以及,剩下20%的硬骨头该怎么啃。

这篇文章会覆盖以下核心判断:

  • 规则引擎不是“过时”的,它是反作弊的第一道防线,也是最容易被忽略的防线。
  • 统计方法在大多数场景下,比复杂机器学习模型更实用,关键是要理解业务场景下的“异常”长什么样。
  • 孤立森林确实好用,但它的适用边界比很多人以为的要窄。
  • 反作弊系统必须要有“反馈闭环”,否则半年后就会失效。

一、背景与真实场景:黑五类数据到底长什么样?

1. 一个让我连续加班三天的案子

2022年双11,我负责的电商平台在预热期发现一个异常:某款售价299元的家居用品,在凌晨2点到5点之间,订单量突然从日均200单飙升至8000单。运营团队的第一反应是“爆款来了”,准备加仓备货。

但数据告诉我不是这么回事。我拉出这批订单的用户行为数据,发现几个特征:这批用户的注册时间集中在11月1日到11月5日,下单前平均浏览时长只有4秒,所有订单的收货地址集中在三个省份的五个仓库。

这不是“爆款”,这是典型的“刷单冲量”。黑五类数据,本质上就是“数据造假”的具象化表现。造假的动机千奇百怪,但造出来的数据特征却有规律可循。

2. 黑五类数据的“三大原罪”

根据我的项目经验,黑五类数据主要集中在以下三个领域:

  • 电商刷单(占反作弊案例的60%以上): 为了冲排名、拿平台补贴、制造虚假热度。典型特征包括:时间集中、IP同源、用户行为路径极短、收货地址密集。
  • 广告点击欺诈(占比约25%): 通过机器或众包点击广告,消耗竞争对手预算或骗取广告分成。典型特征:点击集中在特定时段、点击设备型号单一、点击后无后续行为。
  • 虚假注册/薅羊毛(占比约15%): 利用新用户优惠券、拉新奖励等机制套利。典型特征:注册时间间隔均匀、用户名/手机号呈规律性、设备指纹重复。

数据分析之黑五类数据 - 异常检测与反作弊

3. 为什么“异常检测”比“精确识别”更现实?

说句实话,任何声称能“精确识别”所有黑五类数据的方案,要么是骗人,要么是骗自己。作弊者也在进化。他们用真人众包、模拟人机交互、动态IP池,把数据做得越来越像正常用户。

所以,我的策略一直很明确:先做“异常检测”,把那些明显“不对劲”的数据找出来,再做“反作弊”的精细化处理。异常检测的核心,不是判断“这个人是不是作弊”,而是判断“这组数据是否偏离了正常分布”。

二、拆解常见误区

1. 误区一:“模型越高级,反作弊效果越好”

这是我在项目中最常听到的误解。很多团队一上来就上深度学习、图神经网络,结果模型跑了两周,只抓出几个无关痛痒的小虾米,而真正的刷单团伙却安然无恙。

我的经验是:在反作弊领域,80%的作弊行为可以用最简单的规则引擎识别出来。比如,一个IP在1小时内下单超过5次,这本身就是一个强信号。不需要任何模型,一条SQL语句就能搞定。

高级模型的价值在于处理剩下的20%,那些伪装得非常好的“高级作弊”。但如果你连80%都没搞定,就去搞高级模型,那就是本末倒置。

2. 误区二:“追求100%准确率”

如果一个反作弊系统声称准确率是99%,那它大概率是误报率极低,漏报率极高;如果它声称准确率是99.9%,那它大概率是把所有异常都标记为“正常”了。

为什么?因为真正的作弊数据在全量数据中占比通常不到1%。如果你把正常数据的识别准确率做到99.9%,那你放过的作弊数据仍然可能是一个巨大的数字。更关键的是,追求高准确率往往意味着高误报率,这会严重干扰正常用户和业务运营。

我的建议是:反作弊系统应该追求“足够好”的漏报率,而不是“完美”的准确率。关键是要知道哪些漏报是可以接受的,哪些是不能接受的。

3. 误区三:“反作弊是数据团队的事”

这是最致命的误区。反作弊系统如果脱离了业务团队的反馈,三个月后就会变成“僵尸系统”。因为作弊手段在变,业务规则在变,用户行为也在变,但模型的参数却没有变。

我曾经见过一个项目,数据团队用孤立森林模型跑出来的异常订单,运营团队看了一眼就全给“审核通过”了。理由很简单:运营团队认为这些订单是“正常的”,因为他们了解业务背景,知道那段时间确实有线下推广活动。

所以,反作弊系统必须和业务团队建立“反馈闭环”:数据团队输出异常信号,业务团队确认或驳回,确认结果再回流到模型或规则库中,形成迭代。

数据分析之黑五类数据 - 异常检测与反作弊

三、专业判断逻辑:如何搭建真正的反作弊系统?

1. 第一步:从“业务逻辑”出发,而不是从“数据”出发

我的经验是,80%的异常数据,在你开始写代码之前,就已经可以通过业务常识判定出来。

比如,一个电商平台做“拉新有礼”活动,新用户注册后可以领取一张10元无门槛券。那你要做的第一件事,不是上模型,而是问自己几个问题:

  • 正常用户注册后,多久会下单?(如果大部分用户注册后1小时内下单,那注册后1秒内下单的,就是异常。)
  • 正常用户会怎么使用优惠券?(如果用户只买10元左右的商品,用完券就消失,那大概率是撸羊毛。)
  • 正常用户的设备指纹是什么分布?(如果突然出现大量来自同一设备型号的新用户,那大概率是模拟器刷出来的。)

这些问题,不需要任何模型,只需要对业务有深刻理解的人就能回答。把这些业务逻辑转化为规则,就是反作弊系统的第一道防线。

2. 第二步:用“统计方法”做快速筛查

规则引擎抓出“明显异常”的数据后,剩下的数据可以用统计方法做“快速筛查”。我推荐的方法很简单:均值+标准差(Z-Score)和四分位距(IQR)。

核心逻辑是:正常数据服从某种分布,异常数据会偏离这个分布。比如,正常用户的日下单金额服从正态分布,均值是200元,标准差是50元。那下单金额超过350元(均值+3个标准差)的用户,就值得关注。

但这里有一个关键点:业务数据通常不服从正态分布,而是服从偏态分布(如幂律分布)。所以,我通常会先用对数变换把数据转换成近似正态分布,再计算Z-Score。或者,直接使用IQR方法,它不需要假设数据分布,对偏态数据更鲁棒。

3. 第三步:引入“简化版机器学习模型”

规则和统计方法之后,剩下的数据才是机器学习模型的用武之地。但我不推荐直接上孤立森林、LOF这些复杂算法,而是先从“简单模型”开始。

我的做法是:先做特征工程,然后用一个简单的逻辑回归或决策树,做二分类(正常/异常)。逻辑回归虽然简单,但它的可解释性极强,你可以清楚地知道每个特征对最终判断的贡献有多大。这对于反作弊的反馈闭环至关重要,你需要知道模型为什么判断某个用户是异常的,而不是只能看到一个“异常”标签。

只有当逻辑回归的效果达到瓶颈,或者业务场景的复杂性确实需要更强大的模型时,我才会考虑使用孤立森林或XGBoost。但即使如此,我也会保留一个“轻量级”的模型版本,用于快速响应和迭代。

4. 第四步:建立“提权验证”机制

这是反作弊系统中最容易被忽略的一环。任何模型或规则,都存在误判的可能。所以,你需要给“被判定为异常”的用户一个“申诉”或“验证”的通道。

我在一个项目中,曾经因为规则引擎误判,导致一个真实的大客户被限制下单。这个客户的采购经理直接打电话投诉,我们花了两天时间才解释清楚。从那以后,我们引入了“提权验证”机制:

  • 低风险异常:自动标记,不触发任何操作,仅记录日志供后续分析。
  • 中风险异常:触发“二次验证”,要求用户进行短信验证或人脸识别。
  • 高风险异常:直接限制下单,但会同步发送通知给客服,由人工介入复核。

这样的机制,既保证了反作弊的效果,又最大限度地减少了对正常用户的干扰。

数据分析之黑五类数据 - 异常检测与反作弊

四、具体案例与数据观察

1. 案例一:电商刷单的“凌晨三点”魔咒

我在多家电商平台都观察到同一个现象:刷单行为高度集中在凌晨0点到5点之间。原因很简单,因为运营人员下班了,平台审核触发率低,刷单成本更低。

在某次项目中,我通过分析凌晨时段的订单数据,发现了一个刷单团伙的完整特征:

  • 下单时间:集中在凌晨2点到4点,下单间隔极为均匀(大约每30秒一单)。
  • 用户行为:所有用户从浏览到下单的时间都小于5秒,这意味着他们甚至没有“看”商品页面。
  • 收货地址:所有订单的收货地址都集中在同一个市的同一个区,但精确到街道时,又分布在不同的街道。

基于这些特征,我定义了一条简单的规则:凌晨时段下单,且浏览-下单时间小于10秒的用户,自动标记为“高风险”。这条规则上线后,刷单识别率提升了40%,但误报率只有0.5%。

2. 案例二:广告点击欺诈的“孤立森林”失效记

这是我在一家广告技术公司踩过的坑。我们当时用孤立森林模型来检测广告点击欺诈,数据集是100万条点击记录,特征包括点击时间、IP、设备、用户代理等。

模型跑出来的结果,报告了大约5000个“异常点”。我们逐个检查,发现其中大部分是正常的用户行为,比如:

  • 夜间点击:很多用户确实会在深夜刷手机,点击广告。
  • 重复点击:有些用户确实会连续点击同一个广告(比如误触,或者对广告内容感兴趣)。
  • 短时间高点击:某些行业的广告(如游戏、短视频),确实会吸引用户在短时间内多次点击。

孤立森林模型的“异常”检测,实际上是在识别“小众”数据,而不是“欺诈”数据。它把那些“在整体数据中比较少见”的行为,都标记为异常了,但这不等于就是欺诈。

痛定思痛,我们改变了策略:不再用孤立森林做“通用”的异常检测,而是用它对“已知欺诈模式”的特征进行建模。比如,我们先把“已知欺诈IP”的点击行为提取出来,让孤立森林学习这些IP的特征,然后用训练好的模型去检测新的IP。这样做的效果显著提升,因为模型学习的是“欺诈”的模式,而不是“小众”的模式。

3. 案例三:虚假注册的“设备指纹”破局

有一次,我们接到了一个薅羊毛团伙的挑战。他们用修改过的安卓模拟器,配合动态IP池,批量注册新用户并领取优惠券。我们先用规则引擎:单个IP注册量超过10次就封禁。结果他们立刻换IP。我们又用统计方法:注册时间间隔均匀的,标记为异常。结果他们又随机化了注册时间。

最后,我们引入了一个“设备指纹”维度。设备指纹不是简单的“设备ID”,而是由多个硬件和软件特征组合而成的唯一标识。包括:

  • 硬件特征:CPU型号、内存大小、屏幕分辨率、摄像头型号。
  • 软件特征:操作系统版本、浏览器指纹、字体列表、时区设置。

这批模拟器刷出来的用户,虽然换了IP、改了时间,但它们的设备指纹特征高度一致(因为都是同一台模拟器配置出来的)。我们通过检测设备指纹的重复率,直接锁定了这个团伙,并封禁了所有来自该设备指纹的用户。

数据分析之黑五类数据 - 异常检测与反作弊

五、不同情况下的行动建议

1. 如果你的团队只有1-2名数据分析师

这种情况下,不要把时间花在搭建复杂的模型上。你的核心策略应该是:用Excel和SQL搞定80%的异常检测。

  • 行动清单:

    1. 和业务团队一起,梳理出5-10条最核心的“业务规则”。比如“单IP下单量超过5次”、“新用户注册后1秒内下单”。
    2. 用SQL把这些规则写成查询语句,每天定时跑一次,输出异常数据报表。
    3. 用Excel的箱线图或IQR方法,对关键指标(如日均订单量、转化率)做快速异常检测。
    4. 把异常数据报告发给业务团队确认,并建立反馈机制。
  • 需要避开的坑:不要试图一步到位,建立“完整”的反作弊系统。先把最明显的作弊行为抓出来,拿到业务团队的信任,再逐步迭代。

2. 如果你的团队有10人以上的数据团队

这时,你可以考虑引入“规则引擎+统计方法+简易模型”的组合拳。

  • 行动清单:

    1. 搭建一个规则引擎平台,让业务团队可以自助配置和调整规则。
    2. 引入统计方法(Z-Score、IQR、MAD),对核心指标做实时监控和预警。
    3. 用逻辑回归或决策树,对“规则引擎过滤后”的数据做二次判断。
    4. 建立“反馈闭环”机制:数据团队输出异常信号,业务团队确认或驳回,确认结果回流到规则库和模型训练中。
  • 需要避开的坑:不要过早引入复杂模型。先确保规则引擎和统计方法跑通了,积累了足够的标注数据,再考虑上模型。

3. 如果你的团队是百万级流量的平台

这是真正的“硬仗”。你需要一个完整的反作弊系统,包括:实时监控、自动化处理、模型迭代、对抗演练。

  • 行动清单:

    1. 搭建实时数据流处理平台(如Flink、Spark Streaming),实现毫秒级异常检测。
    2. 引入孤立森林、XGBoost、图神经网络等复杂模型,处理“高级作弊”行为。
    3. 建立“特征工程”团队,持续挖掘新的作弊特征(如设备指纹、行为序列、社交网络关系)。
    4. 定期进行“红蓝对抗”演练:模拟作弊者,测试反作弊系统的有效性,并持续迭代。
  • 需要避开的坑:不要过度依赖模型。即使是最先进的模型,也会有漏报和误报。始终保持“人工审核”的机制,作为最后一道防线。

数据分析之黑五类数据 - 异常检测与反作弊

六、不同情况下的取舍

1. 漏报和误报的取舍:宁可错杀一千,还是放过一个?

这是反作弊系统中最核心的取舍。我的判断逻辑是:取决于业务场景的容忍度。

  • 高容忍度场景(如内容平台):虚假流量不会直接导致用户流失,但误伤真实用户会。所以,我会倾向于“放过一个,也不错杀一千”。
  • 低容忍度场景(如金融、电商交易):欺诈交易直接导致资金损失,一旦发生,损失无法挽回。所以,我会倾向于“宁可错杀一千,也不放过一个”。

但这并不意味着你可以无限度地提高误报率。你需要给误报一个“成本”。一个用户体验良好的反作弊系统,应该是在误报发生后,给用户一个快速、友好的“申诉”通道。

2. 实时性和准确性的取舍:先处理,还是先验证?

在反作弊系统中,实时性和准确性往往是一对矛盾。你希望立刻识别出作弊行为并阻止它,但“立刻”的判断可能不够准确。

我的做法是:根据风险等级,做出不同的取舍。

  • 高风险场景(如支付欺诈):优先保证实时性,立即拦截,哪怕有一定的误报率。事后可以通过人工审核,对误报进行补偿。
  • 中风险场景(如刷单冲量):优先保证准确性,可以先标记为“待审核”,事后再由人工或系统处理。
  • 低风险场景(如垃圾评论):可以完全牺牲实时性,先入库,事后用算法批量处理。

这个取舍原则,在很多大型互联网公司都得到了验证。它不是一个“完美”的方案,但是一个“足够好”的方案。

3. 成本和效果的取舍:投多少钱,办多少事?

这是最现实的问题。很多小团队或中小企业,预算有限,不可能投入几十万去搭建一个反作弊系统。那怎么办?

我的建议是:优先投入“规则引擎”和“统计方法”,这两项的成本几乎为零,但能解决80%的问题。至于剩下的20%,如果短期内无法解决,可以考虑接受它,或者通过“人工审核”来弥补。

我在一个项目中,曾建议客户把预算从30万砍到5万。我的理由是:30万投入一个复杂的模型,效果可能只比5万的规则引擎好10%。而这10%的提升,对于客户当前的业务规模来说,完全不值得。客户接受了我的建议,把省下来的钱投入到了业务增长上,效果反而更好。

数据分析之黑五类数据 - 异常检测与反作弊

七、总结与下一步行动

反作弊不是一场“毕其功于一役”的战斗,而是一场“永无止境的攻防战”。作弊者会不断进化,你的反作弊系统也需要不断迭代。

我这篇文章想传达的核心观点是:反作弊系统应该从“简单”开始,逐步“复杂化”。不要一上来就追求“完美”的模型,而是先用规则引擎和统计方法,解决80%的问题。然后,在实战中积累经验,逐步引入更复杂的模型和方法。

如果你今天就要开始搭建反作弊系统,我建议你从以下三个步骤开始:

  1. 梳理业务规则:和业务团队一起,梳理出5-10条最核心的“可疑”规则。
  2. 用SQL实现:把这些规则写成SQL查询,每天跑一次,输出异常数据报表。
  3. 建立反馈闭环:把报表发给业务团队确认,确认结果回流到规则库中。

做完这三步,你就已经跑赢了80%的团队。剩下的,就是持续迭代,不断优化。

最后,我想说一句:反作弊不是数据团队的事,而是整个公司的事。只有业务、运营、产品、技术团队协同作战,才能真正建立起一道坚固的防线。

常见问题解答(FAQ)

1. 小团队没有数据科学家,如何用最低成本搭建反作弊系统?

我是一家创业公司的数据分析师,团队只有3个人,预算有限,老板却要求我们识别刷单和虚假流量。听说要上机器学习模型,但感觉太复杂了。有没有什么低成本的方法能快速落地?

我曾在某电商平台负责反作弊,刚开始也是零预算,只能靠Excel和SQL。我分享一个真实案例:我们当时用三个规则就抓出了80%的刷单:单IP下单量>5,用户注册时间与下单时间<1分钟,同一收货地址不同订单。这些规则用SQL几分钟就能跑出来。

后来发现作弊者会模拟IP,于是我们引入统计方法:计算每个用户购买金额的Z-Score,超过3的标记为异常。这只需要pandas三行代码。我的判断是:小团队应从规则开始,不要追求完美。规则引擎成本极低,而且业务方容易理解。

具体细节:我们当时监控到一个活动,凌晨3点订单激增,但Z-Score计算显示这些订单金额集中在99元,与正常分布偏离。我们锁定后,退款率从7%降到2%。对用户决策:建议你第一步整理业务中的异常模式,写成SQL规则,然后逐步加入简单统计指标。不要一开始就上孤立森林,因为你的标注数据可能不够。

2. 规则引擎和机器学习模型到底该怎么配合?是不是机器学习更高级?

看到很多文章说机器学习才是反作弊的未来,但我觉得规则引擎也很有效。到底两者是什么关系?我该先做哪个?会不会浪费资源?

我亲身经历过从纯规则到模型混合的演进。刚起步时,规则引擎就能挡住大部分低端作弊。但后来作弊者变聪明了,他们会模拟真实用户行为,规则很难抓住。这时我们引入了孤立森林,但发现它误报率高。我的判断:规则引擎是“白名单”,模型是“灰名单”。规则处理已知模式,模型捕捉未知模式。两者互补。

具体细节:我们曾用规则过滤掉90%的明显刷单,剩下的10%交给孤立森林,准确率提升到85%。但孤立森林对高维数据敏感,我们不得不做特征选择。独特视角:很多人吹捧模型,但忽略了规则引擎的可解释性。业务方更信任能说清原因的规则。对用户决策:建议用规则作为第一道防线,模型作为第二道。

先用规则建立基线,再用模型识别规则无法覆盖的异常。这样既高效又稳健。

3. 孤立森林真的适合所有场景吗?我实际测试过,效果很差,为什么?

我按照网上的教程用孤立森林检测电商刷单,结果发现它把很多正常用户标记为异常,召回率也很低。是不是我参数没调好?还是这个算法本身有缺陷?

我踩过同样的坑。孤立森林的原理是随机切割,对于高维稀疏数据效果不错,但电商数据往往是低维且聚类的。比如用户购买行为,正常用户和刷单用户可能分布很接近。我测试过我们的数据,孤立森林的精确率只有60%,而简单IQR方法却有70%。我的判断:孤立森林适合特征维度高、异常点稀疏的场景,比如网络安全入侵检测。

对于电商反作弊,数据往往有明确的业务含义,统计方法更直接。具体细节:我们当时用孤立森林,调了contamination参数,但始终无法降低误报。后来我们改用LOF(局部异常因子),效果稍好,但计算慢。独特视角:很多人迷信孤立森林,是因为它被写进教科书。但实际业务中,数据分布和异常定义更重要。

我建议你先做可视化,看看数据长什么样,再选算法。对用户决策:不要盲目套用算法。先用箱线图、散点图观察异常点的形态,然后选择合适的方法。如果数据有明显离群点,用3σ或IQR;如果数据有局部密度变化,用LOF;如果维度高,再考虑孤立森林。

4. 如何向业务部门推广反作弊机制,让他们理解并支持我们?

我尝试向运营团队解释刷单的危害,但他们觉得我们的检测规则会误伤正常用户,影响KPI。如何说服他们配合?有没有什么沟通技巧或数据支撑?

我经历过多次“撕逼”。刚开始,我们直接给运营一个黑名单,结果他们投诉说很多是真实用户。后来我们改变了策略:先展示数据对比。比如,我们计算了“疑似刷单用户”的留存率只有2%,而正常用户是40%。用这个数据告诉运营,这些用户不仅没价值,还会污染数据。

我的判断:业务方关心的是业绩和用户体验,而不是技术细节。所以要用他们关心的指标说话:刷单带来了虚假GMV,但实际退货率高,导致物流成本增加。具体细节:我们做过一次实验:随机抽取1000个标记为刷单的订单,跟踪发现其中800个在7天内退货,而正常订单退货率只有10%。

我们把这个报告发给运营,他们立刻同意合作。独特视角:不要只谈风险,也要谈收益。反作弊可以提升广告ROI,优化营销预算。对用户决策:建议准备一个“反作弊价值报告”,包括:因作弊导致的损失估算、误伤率、以及优化后带来的收益。用数据说服,而不是用技术。同时,设置一个灰度测试期,让业务方看到效果。

核心关键词

读者评论

程远

文章很实在,尤其点出规则引擎能解决80%的问题,很多团队确实一上来就搞深度学习,反而忽略基础。

李安

反馈闭环这一点太重要了,反作弊真的不能只靠数据团队,业务的理解和人工复核才是迭代的关键。

许晴

孤立森林那个案例简直是教科书级的教训,提醒我们模型不是万能的,必须结合业务场景定义欺诈模式。

于洋

很认同“先做异常检测而不是精确识别”的思路,低成本高性价比地先抓出明显异常,再逐步优化。

许念

凌晨刷单和设备指纹的手法很典型,说明只要深入理解业务,简单的规则就能有效识别大量作弊行为。

免责申明:本文内容通过AI工具匹配关键字智能整合而成,仅供参考,帆软及九数云不对内容的真实、准确或完整作任何形式的承诺。如有任何问题或意见,您可以通过联系jiushuyun@fanruan.com进行反馈,九数云收到您的反馈后将及时处理并反馈。
咨询方案
咨询方案二维码

扫码咨询方案

热门产品推荐

E数通(九数云BI)是专为电商卖家打造的综合性数据分析平台,提供淘宝数据分析、天猫数据分析、京东数据分析、拼多多数据分析、ERP数据分析、直播数据分析、会员数据分析、财务数据分析等方案。自动化计算销售数据、财务数据、绩效数据、库存数据,帮助卖家全局了解整体情况,决策效率高。

相关内容

查看更多
数据分析之智能预警 – 动态阈值

数据分析之智能预警 – 动态阈值

动态阈值不是算法问题,而是假设问题 我在2023年接手了一个电商平台的稳定性项目。当时团队最头疼的并不是某个微 […]
数据分析之对话式分析 – NL2SQL

数据分析之对话式分析 – NL2SQL

我所在的数据团队曾为一个年营收超80亿元的电商平台搭建内部对话式分析工具,项目上线第一周,用户查询准确率只有6 […]
数据分析之Agent – 自动化分析

数据分析之Agent – 自动化分析

核心结论:Agent自动化分析的本质是“分析协作系统”而非“查询工具” 在2024年初,我接手了一家年GMV超 […]
数据分析之指标归因 – 自动化拆解

数据分析之指标归因 – 自动化拆解

2023 年,我接手了一家月活 300 万的工具类 App 的数据分析工作。当时团队最头疼的问题不是数据量太大 […]
数据分析之增强分析 – 自然语言查询

数据分析之增强分析 – 自然语言查询

我在过去两年深度参与了三个增强分析项目的落地,有一个场景让我印象极深:某零售企业的数据团队花了三个月搭建了一套 […]

让电商企业精细化运营更简单

整合电商全链路数据,用可视化报表辅助自动化运营

让决策更精准