去年第三季度,我帮一家做家居类目的跨境卖家做商品分析诊断。他们的运营总监打开一张销量趋势图给我看,30天移动平均线,配色专业,旁边还叠了同比涨幅。我问了一个问题:这张图,让你上个月做成了哪三个决定?他停了十几秒,说,好像一个都没有。
这不是个例。在我接触过的商品分析团队里,超过一半的销量趋势工作,最后都停在"看图"这一步:曲线画出来了,周会开完了,该补的货还是凭经验补,该清的库存还是拖到下个季度。问题不在于他们不会用工具,而在于他们从来没认真设计过"选型方法",也就是什么业务问题,该配什么趋势分析方式。
这篇内容我想把这件事讲透:销量趋势的选型方法到底怎么设计,判断依据是什么,不同规模的团队该怎么取舍。文中涉及的数据,我会明确区分"真实观察"和"示意推演",你可以按自己的业务条件去套。
先把我的核心判断放前面,后面所有内容都是在论证这三句话。
第一,销量趋势方法的优劣,脱离了决策场景就不成立。移动平均在爆品补货预测上表现稳定,在长尾 SKU 上却会系统性高估,因为长尾商品的销量是间歇性的,大部分时间卖 0,平均值算出来的是一个不存在的"日常水平"。
第二,预测更准和决策更好,是两件事。我见过一个团队把 WAPE 从 24% 优化到 17%,但因为模型输出的是"某个数字",运营看不懂也不敢信,最后还是按自己的经验下单,库存周转天数一点没降。准确性提升没有转化为决策采纳率,等于零。
第三,选型的本质是四个约束条件的交集:业务目标、数据条件、解释沟通成本、系统与团队承载能力。少考虑任何一个,方案都会在落地阶段崩掉。
所以设计选型方法的第一步,不是问"哪种预测算法好",而是先问"我要用这个趋势结论去驱动哪个动作"。动作决定了精度要求、更新频率、颗粒度和可解释性的下限。

要理解选型为什么重要,先要看清趋势分析在实际工作中是怎么失效的。我复盘过至少六家公司的商品分析流程,失效路径惊人地一致。
有一家做小家电的卖家,同一个 SKU,运营看的图是"近 7 天日销折线",结论是"断崖式下滑,赶紧降价";商品经理看的图是"近 90 天周均",结论是"整体平稳,无需动作";老板看的是"月度同比柱状图",结论是"同比增长 12%,形势向好"。
三个人都没错,因为三张图的时间窗、颗粒度、平滑方式完全不同。7 天折线放大了周末效应和一次直播带来的尖峰回落;90 天周均抹掉了这次下滑;月度同比跨过了两个大促节点。这不是数据问题,是选型问题,没有人先定义"这个 SKU 的决策动作需要什么时间窗"。
另一个更普遍的现象是:趋势分析做了,但转化不出动作。我用一个模拟漏斗来说明这条流失链的典型形态。

很多人会把上述问题归因于"工具不行"或"数据不全"。但我的观察恰好相反:大多数团队的原始数据已经够用了,缺的是一套把数据翻译成动作的选型规则。
比如"哪些 SKU 值得做趋势分析"这个问题,标准很明确:近 90 天有持续动销、波动率在可解释范围内、且对应的决策动作(补货/清货/调价)真实存在。这三个条件一卡,12000 个 SKU 里可能只剩 2500 个需要纳入趋势监控,告警量立刻降到可处理的量级。
下面这六个误区,我在实际项目里几乎每次都能撞见至少三个。它们的共同特征是:看起来都很"专业",但都会让趋势分析偏离决策。
这是最普遍的一个。团队花大力气对比算法,把 WAPE 作为唯一 KPI,最后选了一个准确率最高但完全黑箱的模型。结果是运营看不懂预测逻辑,不敢按预测下单,模型输出被当参考数字挂在报表角落里。
我的判断是:准确率是门槛条件,不是选型条件。当两个方法的精度差距在 3-5 个百分点以内时,优先选可解释性更强、业务方能参与校验的那个。
爆品和长尾商品的销量数据分布完全不同。爆品日销连续、波动主要来自促销和投放;长尾商品则是间歇性需求,大量日期为 0,偶尔出一单。
用同一套移动平均去处理这两类数据,爆品会被平滑得反应迟钝,长尾商品会被算出一个虚高的"日常销量水平"。分层选型不是精细化洁癖,而是数学前提。
这是最隐蔽、也最伤人的一个。一个大促把某 SKU 的月销量拉高 3 倍,趋势线呈现陡峭上升,系统判定为"高增长潜力品",追加备货。结果大促结束后回落到原水平,库存直接积压。
缺货造成的假趋势方向相反但同样致命:某爆品因为断货 10 天,销量曲线掉下来,被判定为"趋势走弱",触发清库存或降投。实际是供给问题,不是需求问题。
这两个坑有一个共同解法:在趋势计算前,先给数据打上促销标记和缺货标记。没有这一步,后面所有方法都是在错误输入上做精密运算。
MAPE 的分母是真实值。当某个 SKU 某天真实销量是 1,预测是 3,MAPE 就是 200%。这种极端值会把整体评估结果拉爆,让团队误判"方法不行",进而放弃对长尾 SKU 做任何趋势管理。
更合理的做法是用 WAPE(加权绝对百分比误差),它把分母换成整体销量总量,天然给大销量 SKU 更高权重。或者用 MASE,用朴素基线做归一化。评估指标的选择,本身就是选型的一部分。
销量涨了 20%,是件数涨了还是客单价涨了?是新客增加还是老客复购?是自然流量还是投放拉动?这三个问题对应完全不同的动作。
只画一条总销量趋势线,等于把所有信息压成一个数字。我的做法是至少做一层量价拆解:销量变化 = 购买人数变化 × 人均件数变化 × 件均价格变化。这一层拆完,绝大多数"看不懂的趋势"会立刻变得可解释。
品类结构会变,渠道会变,竞争格局会变。两年前用移动平均很合适,现在新品占比翻倍、促销节奏加密,方法就需要重估。选型不是一次性项目,而是需要每季度回测一次的常规动作。

说完误区,讲我的方法。我把销量趋势选型拆成四个维度,每个维度都对应一组可自检的问题。四个维度全部收敛之后,方法基本就唯一确定了。
这是最容易被跳过、却最重要的一维。三类目标对应完全不同的方法取向。
我常问客户一句话:这个趋势结论出来之后,谁会因为它改变行为?如果答不上来,说明业务目标还没定义清楚,此时做任何选型都是浪费。
数据条件是最硬的约束,它直接排除掉一部分方法。我通常按四个指标做体检。
| 数据特征 | 判断标准 | 直接排除的方法 |
|---|---|---|
| 可用历史长度 | 少于 2 个完整季节周期,无法稳定估计季节因子 | Holt-Winters、SARIMA、STL 分解 |
| 数据点连续性 | 零销量日期占比超过 40%,属于间歇性需求 | 移动平均、线性回归 |
| 波动率 | 变异系数(CV)长期高于 1.5,噪声大于信号 | 任何单序列精细建模 |
| 异常占比 | 促销/缺货/断码导致的异常点超过 15% | 所有方法都需先做标记与清洗 |
这里我要强调一个判断:当零销量占比超过 40%,就不该给这个 SKU 做日级趋势预测。正确做法是把它归到"间歇性需求"类目,用品类平均水平加安全库存策略来管理,或者用 Croston 类方法单独处理,而不是硬套一条趋势线。
这一维完全由组织决定,而不是由技术决定。同样一个方法,在数据团队内部沟通成本很低,在跟采购部门沟通时可能完全无法接受。
我的经验判断是:如果趋势结论的使用者需要向第三个人解释这个结论的由来,方法就必须具备可复述性。一个连运营主管都讲不清逻辑的模型,哪怕精度高 5 个点,也很难被真正采纳。
可复述性的检验方法很简单:让使用者在 3 分钟内,用自己的话说明"这个预测是怎么来的、什么情况下会不准"。讲不出来,就要降级换方法。
最后是承载能力,包括三件事:数据管道的更新频率、模型的重训与监控成本、以及有没有人能接住故障。
我见过太多"上线即巅峰"的项目:模型上线第一周效果很好,三个月后因为特征漂移、数据管道断流、负责人离职,输出彻底失准,但没人发现。如果团队无法承担持续的监控成本,宁可选一个笨但稳定的方法。
把四个维度收敛,我通常得到下面这张矩阵。它是可以直接拿去用的选型起点。
| 决策场景 | 数据条件 | 推荐方法组合 | 输出物 | 更新频率 |
|---|---|---|---|---|
| 爆品日常异常监控 | 日销连续、季节性强 | 同比 + 移动中位数 + 阈值告警 | 异常清单,含异常幅度和方向 | 每日 |
| 爆品补货预测 | 2 年以上历史、促销密集 | Holt-Winters + 促销标记修正 | 未来 4-8 周分周预测量 | 每周 |
| 常规 SKU 库存决策 | 历史 1 年左右、波动中等 | 加权移动平均 + 品类季节因子 | 安全库存与补货建议 | 每周 |
| 长尾 SKU 淘汰与清货 | 零销量占比高、间歇性 | 趋势质量打分(斜率+波动率+规模) | 分层清单(保留/观察/淘汰) | 每月 |
| 品类级经营归因 | 聚合后连续、口径稳定 | 量价拆解 + 结构贡献度分析 | 涨跌归因报告 | 每月 |

上面讲的框架如果只停在纸面上,很容易变成"正确的废话"。我说一个实际做过的项目,把框架落到具体动作上。
客户是一家同时经营亚马逊和独立站的跨境卖家,在售 SKU 约 8600 个。原来的做法是:所有 SKU 用同一套 30 天移动平均算趋势,系统每天自动输出"上升/持平/下降"三个标签,推送给运营。
问题在第一次复盘时就暴露了:8600 个 SKU 里有 5100 多个处于长期零销量或极低频状态,它们的移动平均值常年是一个虚高的小数字,系统持续标记为"持平",占据了运营的信息带宽。真正需要关注的爆品异常,反而淹没在里面。
这个项目的第一个动作不是建模,而是把口径统一。跨平台的数据有三个必须先解决的问题:币种、时间区、以及订单口径(含取消与退货)。
我们用的是数跨境(https://shukuajing.jiushuyun.com/?utm_source=seo&utm;_plan=est&utm;_unit=gys)的多平台数据整合和商品分析模块。选它的原因很实际:这个客户没有自己的数据仓库,用工具把亚马逊和独立站的订单、商品、库存数据拉到同一口径下,比自建管道快得多。
在这一步我做的最关键动作,是在趋势看板里加了两列标记字段:促销标记和缺货标记。具体做法是把营销日历里的活动时段和库存为 0 的日期打成布尔字段,趋势计算时可以直接剔除或单独处理。
这一步看起来朴素,但它带来的收益远超后面所有建模优化。改造后重新看历史趋势,之前被判定为"持续增长"的 47 个 SKU 里,有 31 个的增长其实来自两次大促的叠加,日常基线是平的。
口径打通之后,我们按近 90 天销量规模和波动率做了三层切分。分层的 SQL 逻辑大致如下。
— SKU 销量趋势分层:按近 90 天销量规模 + 趋势斜率 + 波动率打标
WITH base AS (
SELECT
sku_id,
SUM(sales_qty) AS qty_90d,
REGR_SLOPE(SUM(sales_qty), dt) AS trend_slope,
STDDEV(SUM(sales_qty)) / NULLIF(AVG(SUM(sales_qty)), 0) AS cv
FROM dwd_order_item
WHERE dt >= DATE_SUB(CURRENT_DATE, 90)
AND order_status = 'paid'
GROUP BY sku_id, dt
)
SELECT
sku_id,
qty_90d,
trend_slope,
cv,CASE
WHEN qty_90d >= 3000 AND cv = 300 AND cv < 1.2 THEN 'B_常规'
ELSE 'C_长尾'
END AS trend_tier
FROM base;
分层之后的选型对应关系是这样的:
改造过程中我做了一件事:把三类 SKU 分别用三种方法回测,看精度到底差在哪里。结果推翻了我的一部分预设。

这个结果最值得记住的一点是:预测方法的最优选择是随数据稀疏程度变化的,不存在一个全局最优。爆品用简单方法就够,长尾反而需要更强的模型来做信息借用。
说两个我实际踩过的坑,比成功经验更有参考价值。
坑一:前期把季节性参数调得太激进。第一版 Holt-Winters 用了自动优化,某个爆品因为一次大促让季节因子被严重放大,导致预测值连续三周高出实际 40%。后来加了促销标记剔除,并把季节因子限定在合理区间内,问题才解决。
坑二:忽视了提前期与误差的关系。最初我们对外承诺"周级预测",但运营实际是按 4-8 周提前期下单的。用 1 周提前期的精度去承诺 8 周的业务场景,必然失望。后来我们把输出改成"分提前期误差区间",业务方按自己的提前期看对应的可靠性。

框架讲完之后,最实际的问题是:我这个团队现在该做什么。我按资源条件和业务特征分成五种情况,每种给出可以直接执行的动作顺序。
这类团队最容易被"方法论"劝退。我的建议是不要碰任何需要调参的模型,把精力放在两件事上。
这个阶段的目标不是精度,而是让趋势结论稳定地进入每周的补货讨论,养成用数据下决定的习惯。
这是最常见的中间状态,也是最容易做出成效的区间。核心动作是分层 + 回测。
这个阶段的关键判断是:不要试图用一套方法覆盖所有 SKU。分层的成本远低于把复杂模型调到能兼容所有情况的成本。
到这个规模,最大的瓶颈是口径,不是算法。多平台的币种、时间区、退货口径、促销定义不一致,会直接导致趋势结论互相矛盾。
我的建议是先做数据治理再谈模型:把订单、商品、库存三类数据统一到同一口径下,明确"销量"到底是指下单量、支付量还是净销量(扣除取消和退货)。口径一旦确定,很多"趋势异常"会自动消失。
如果团队没有自建数据仓库的能力,用现成的跨境数据分析平台做整合是更务实的选择。前面案例里提到的数跨境就是这个思路,先把多平台数据拉到统一口径,再在上面做分层看板,比从零搭管道快很多。
新品没有历史,所有依赖历史序列的方法都失效。这时候趋势分析的目标要转换:从"预测销量"转向"判断趋势形态"。
服装、节日礼品、户外用品这类品类,季节性是主线。此时同比是性价比最高的方法,但有两个必须处理的陷阱。
一是节假日错位。春节、感恩节在不同年份的公历日期不同,直接按月对比会失真,需要用"距节日周数"重新对齐时间轴。二是季节内趋势与跨年趋势要分开看,前者回答"今年这个季节卖得好不好",后者回答"这个品类的整体势能在涨还是跌",混在一起会得出矛盾结论。

选型的另一半是取舍。前面讲的是"怎么选",这一节讲"选的时候必须放弃什么"。我整理了五组最常遇到的矛盾。
这两者并非永远对立,但在长尾 SKU 上确实对立。全局模型能把长尾误差降下来,代价是单个 SKU 的预测逻辑无法解释。
我的取舍原则是:涉及资金占用量大的决策,选可解释性;涉及长尾资源分配的决策,可以接受黑箱。A 类爆品的补货金额大、错误代价高,必须能说清逻辑;C 类长尾的决策本质是排序和筛选,只要排序结果稳定,模型细节可以退让。
全自动化看起来效率最高,但会把系统性偏差放大。人工干预看起来稳妥,但会随人员流动而失效。
我的做法是按金额设阈值:单笔建议金额低于某个线,系统直接执行;超过这条线,强制人工确认并记录确认理由。这样既控制了人力投入,又保留了纠错通道。更重要的是,人工确认的理由会积累成宝贵的数据,用来反向发现模型的系统性偏差。
颗粒度越细,越贴近决策,但噪声越大、越不稳定。SKU 乘渠道乘日的趋势,常常波动到无法解读。
我的取舍原则是:趋势分析在时间维度上可以细,在商品维度上要适度聚合。日级趋势可以保留以捕捉突变,但商品维度上往往聚合到 SKC 或小类目更能发现真实规律。当一个 SKU 的日级趋势无法解读时,先问是不是颗粒度太细,而不是先怀疑数据。
这两者的权衡关系是必然的,前面案例里的双轴图已经说明了:提前期从 1 周拉到 12 周,误差接近翻三倍。真正的取舍不在于"能不能做得更准",而在于业务决策是否真的需要那么长的提前期。
很多时候,业务方说需要 12 周预测,实际是因为采购流程长。如果能缩短下单到到货的周期,需要的预测提前期自然缩短,精度要求也随之下降。这时候优化供应链比优化模型更有价值。
这是最容易被低估的一组取舍。复杂方案的初始开发成本明确可见,但持续维护成本往往被忽略:数据管道要监控、特征要更新、模型要重训、人员要交接。
我的经验判断是:如果团队无法承诺每季度至少一周的维护投入,就不要上需要持续调优的方案。一个每季度能稳定跑出结果的中等复杂度方案,长期收益远高于一个上线三个月后悄悄失准的复杂方案。

如果要把整篇文章压缩成一套可执行流程,就是下面四步。我建议按顺序做,不要跳步。
不要写"分析销量趋势",要写"每周二上午,根据过去 90 天趋势,决定 30 个 A 类 SKU 的下周补货量"。
这里的关键是必须出现人、时间、数量、动作四个要素。写不出这四个要素,说明这个趋势分析目标还不成立,先不要做选型。
对每个待分析的 SKU,至少检查四项:历史长度是否超过 2 个季节周期、零销量日期占比、变异系数、促销与缺货标记是否完整。
我在实际操作中会把这些检查做成一张表,凡是不满足条件的 SKU 直接降级到"清单模式",不进入预测流程。
按前面的决策矩阵给每层 SKU 配方法,然后做滚动回测,而不是一次性训练测试切分。时间序列用随机切分会导致信息泄漏,结论会严重乐观。
回测代码不需要复杂,核心逻辑是这样。
import numpy as np def wape(y_true, y_pred): """加权绝对百分比误差:以整体销量为分母,避免低销量 SKU 拉爆指标""" y_true, y_pred = np.asarray(y_true), np.asarray(y_pred) denom = np.abs(y_true).sum() return np.nan if denom == 0 else np.abs(y_true - y_pred).sum() / denom def rolling_backtest(series, model_fn, horizon=4, folds=6, min_train=12): """按时间滚动回测:每次用前面的数据训练,预测紧接的 horizon 期""" scores = [] n = len(series) for i in range(folds): cut = n - (folds - i) * horizon if cut < min_train: continue train, test = series[:cut], series[cut:cut + horizon] pred = model_fn(train, horizon) scores.append(wape(test, pred)) return float(np.mean(scores)), scores
回测结果要分提前期看,不要只看平均值。1 周提前期的误差和 8 周提前期的误差是两回事,混在一起看会掩盖真实问题。
我建议把选型复盘固定进季度节奏:每季度用最近一个季度的数据重跑回测,看各层误差是否劣化;同时复盘一次"决策采纳率",系统给出的建议有多少被实际执行,未执行的原因是什么。
后面这个指标比精度更重要。建议采纳率长期低于 50%,说明选型出了问题,而不是执行出了问题。
最后给一张可以直接拿去用的清单。每一项如果答"否",就要回到对应章节重新判断。
| 检查项 | 判断标准 | 不满足时的动作 |
|---|---|---|
| 决策动作是否明确 | 能写出人、时间、数量、动作四要素 | 暂停选型,先定义业务目标 |
| SKU 是否已分层 | 爆品/常规/长尾分开处理 | 用销量规模加变异系数做三层切分 |
| 数据标记是否完整 | 促销、缺货、退货三类标记齐全 | 补齐标记后再看趋势,否则结论不可信 |
| 历史长度是否足够 | 季节方法需至少 2 个完整季节周期 | 降级为同比或品类均值法 |
| 评估指标是否合适 | 使用 WAPE 或 MASE,不用 MAPE | 更换指标后重跑回测 |
| 是否做滚动回测 | 按时间滚动,覆盖多个提前期 | 重建回测流程 |
| 结论是否可复述 | 使用者能在 3 分钟内讲清逻辑与失效条件 | 降级到可解释性更强的方法 |
| 是否有维护承诺 | 每季度至少一周维护投入 | 降低方案复杂度 |
| 是否跟踪采纳率 | 建议采纳率有记录且高于 50% | 复盘选型与沟通方式,而非加压执行 |

写到这里,我想把最核心的一个观点再强调一次:销量趋势分析的分水岭,不在于你会不会用某个模型,而在于你能不能针对不同的决策场景,设计出匹配的方法组合。
这几年我看过太多团队在算法上反复投入,却始终解决不了"分析做了但没人用"的问题。根因往往很简单:他们一直在优化输入到输出的精度,却没有优化输出到动作的通道。而通道是否通畅,取决于选型时有没有认真考虑业务目标、数据条件、解释成本和承载能力这四个约束。
另外有一个反直觉的结论值得记住:趋势选型带来的最大收益,通常来自消除误判,而不是提升精度。在我做过的项目里,促销标记和缺货标记这两个最朴素的字段,带来的库存改善幅度超过了后面所有建模优化之和。所以在资源有限的情况下,先做数据标记和分层,再谈模型升级。
如果你现在正准备动手,我建议按这个顺序往下走:
选型方法本身并不复杂,难的是愿意承认"没有一个方法适合所有场景",并且愿意为不同的场景配不同的解法。当你开始用取舍的眼光看趋势分析,你和只会画曲线的人,就已经不在同一个层次了。
我做电商运营两年了,每天都要看销量曲线,但一直有个困惑:老板问‘这周销量为什么掉了’,我只会说‘可能是流量少了’。我看别人用移动平均、有人用时间序列,完全不知道我该用哪种。到底怎么先分清自己要解决的是哪种问题?
先把目标分类再选方法,三类目标的选型逻辑完全不同。监控型只关心‘有没有异常’,用移动平均或同比环比就够,核心是设阈值,比如周销量偏离近8周均值±20%就触发预警;预测型关心‘未来会怎样’,需要至少两个完整销售周期(通常13周以上)的数据,且必须先把促销、缺货、断码这些干扰项剔掉,再用指数平滑或回归;
归因型关心‘为什么涨跌’,要靠量价拆解和渠道、SKU维度下钻,而不是靠更复杂的模型。判断依据很简单:如果输出物是一张预警表,选监控型;如果是一份补货建议,选预测型;如果是一页复盘归因,选归因型。三类混着做,就会出现用复杂模型回答一个本该用对比就能说清的问题。
我们店有几百个SKU,很多商品一周就卖几十件,数据又短又抖,还带明显的季节波动。我试过套用别人推荐的模型,结果预测误差大得离谱。是不是数据条件不行就根本没法做趋势分析?
数据条件是选型的前置门槛,不是事后补救项。判断口径可以按三条线走:一是数据量,少于8到10个观测点基本不具备建模价值,这时只能做同环比和简单均值;二是有没有稳定季节性,如果连续两年同一月份方向一致,才考虑季节性分解,否则用移动平均加人工判断更稳;
三是波动性,用变异系数(标准差除以均值)衡量,超过0.5就说明噪声大,优先做数据清洗而不是换模型。小样本、高波动品类的可执行做法是:先按品类或价格带聚合,把SKU级的稀疏数据升到类目级,再在类目级做趋势判断,最后回到单品做人工修正。
不要为了用复杂方法而硬套,数据不支持时,轻量方法加业务经验反而是误差最小的方案。
我是中小团队的商品分析师,就我一个人管数据,没有数据团队支持。老板又要我搭一套趋势分析机制,我既没预算买BI高级模块,也没时间学ARIMA。有没有那种不依赖技术资源、能真正跑起来的落地步骤?
按‘目标,数据,验证,迭代’四步走,全部可以在Excel或现有报表工具里完成。第一步,明确输出物:是周度异常清单、还是月度销量预测表,先定交付格式,避免为了分析而分析;第二步,评估数据可用性:统计历史数据完整率、促销标记覆盖率、缺货天数占比,三个指标有一项低于80%就先补数据,不要急着建模;
第三步,小范围验证:选10到20个代表性SKU,用移动平均和同比环比两种轻量方法各跑一遍,对比预测值和实际值的偏差,谁的偏差小用谁,这一步通常一到两天能出结论;第四步,建立迭代机制:每月复盘一次误差,记录哪些商品误判、原因是什么,逐步调整阈值和方法组合。
判断依据是落地成本,不是方法先进程度,中小团队优先选能被非技术人员看懂和解释的方法,否则方案再好也推不动。
我之前踩过坑,看别人说某个模型准就拿来用,结果业务方根本看不懂,也没人维护,最后不了了之。我想知道常见的坑到底有哪些,有没有那种发布前能自己检查一遍的清单?
高频误区集中在四个地方,可以用一张自检清单逐条排除。第一,追求复杂模型:问自己‘这个方法业务方能一句话说清吗’,说不清就要降级;第二,忽略数据清洗:检查是否处理了促销、缺货、退货、异常大单,没处理就直接判不合格;
第三,一套方法用到底:按SKU分层抽查,爆品、长尾、季节性品是否用了不同口径,全一样就要重做;第四,不看业务反馈:检查方案里有没有固定的复盘周期和责任人,没有就补上。
可执行的自检顺序是:先确认输出物对应哪类目标(监控、预测、归因),再核对数据完整率和干扰项处理记录,然后看方法复杂度是否匹配团队能力,最后确认有没有迭代机制。四项里有一项不通过,就先别上线,返工的成本远低于上线后被业务方弃用。


读者评论
这篇文章把销量趋势选型讲得很透,尤其是“动作决定精度要求”这个观点,比单纯讨论算法实用多了。
长尾SKU用移动平均会系统性高估,这个坑我们踩过,后来换成趋势质量打分才解决分层运营的问题。
MAPE评估长尾确实不合理,一个SKU预测偏差就能拉爆整体指标,文章建议的WAPE和MASE值得试试。
促销和缺货标记必须提前做,否则趋势线完全是假的,我们去年大促后就吃了这个亏,积压了一批货。
选型不是一劳永逸,每季度回测很有必要,但中小团队人手有限,可能得优先保证数据口径和异常核查环节。