去年双十一结束后,我接手了一个合作品牌方的复盘项目。他们当季 SKU 数量比上一年增长了 42%,但 GMV 只涨了 6.8%,退货率从 11.3% 升到 19.7%,仓储成本多吃了将近 27 万的利润。运营负责人一开始的诉求很明确:帮我找出哪些商品该砍。但我花了两天把数据铺开之后发现,真正的问题不是"某个商品该砍",而是七个价格带里同时存在功能重叠、人群错位的商品组合,它们在页面内部彼此分流、在仓储端互相挤占库容,单看每一件都"还算能卖",合在一起才把整体利润拖下去。
这就是我后来反复跟团队强调的一句话,组合优化的第一步不是找爆款,而是找出"会拖垮整体的风险组合"。
这篇文章不打算重复"商品分析怎么做"的通用教程。我想把"组合优化"重新定义成一个风险排查的手段,然后完整讲清楚:从数据准备、组合视角、规则化排查,到小范围验证,一条能落地的实施路径到底长什么样。全文会以一个我实际操盘过的跨境美妆个护项目为背景,涉及的数据都经过脱敏,但比例关系和判断逻辑是真实的。
如果把"组合优化"理解成"从一堆商品里选出最值得推的那几个",那基本上就做废了。因为选品逻辑天然是向上找机会,它假设只要找到更好的商品,整体就会更好。但在 SKU 膨胀到一定规模之后,拖累整体的往往不是"没有被选中的商品",而是"已经被选中、但和其他商品结构性冲突的商品"。
我服务过的中小品牌里,一个普遍规律是:当 SKU 数量超过 300 之后,单商品维度的动销率和毛利率还能维持表面健康,但整个商品结构的贡献已经失真。原因很简单,单商品指标是静态快照,它看不到"这件商品抢了谁的位置、占了谁的库存、拉低谁的连带"。
我在实际项目里会把组合优化拆成四个层级,每一层的目标不同,判断口径也不同。顺序不能颠倒,因为上层没排干净,下层做什么都是无效动作。
| 层级 | 核心目标 | 典型判断口径 | 常见误用 |
|---|---|---|---|
| 单商品层 | 识别明显负贡献商品 | 毛利额、动销率、退货率 | 直接砍掉低毛利,误伤引流款 |
| 类目层 | 识别类目内部结构失衡 | 价格带密度、功能重叠度 | 只比类目总量,不看内部重叠 |
| 人群/渠道层 | 识别人群与商品错配 | 点击集中度、转化路径 | 把大盘转化当人群转化 |
| 库存与供应链层 | 识别资金占用与周转风险 | 库存周转天数、滞销占比 | 只看销售额,不看库容挤占 |
这四个层级里,最容易出致命问题的是第二层和第四层的交叉。类目内部结构重叠叠加库存挤占,会让一个看起来"每件都在卖"的组合,实际利润被反复摊薄。
逻辑很简单:增长优化是加法,风险排查是减法。加法做对了,收益是边际的;减法做错了,损失是系统性的。一个滞销商品占用的库容和资金,会直接影响其他商品的上架节奏和补货周期,这种损失是复利式扩散的。
我做过一个粗略测算:在快消个护类目里,一个占库容 3% 的高退货商品,平均会拖慢同仓储区域 5%-8% 的商品周转。这个数字不是来自某个权威报告,是我在四个项目里手工对比得出的经验值,仅供参考,但方向是稳定的,滞销不是孤立事件,它是会传染的。

背景还是那个美妆个护项目。品牌做的是跨境,主要面向东南亚和北美两个市场。2023 年之前主打 60 个左右的核心 SKU,整体运转健康:动销率 78%,毛利率 41%,库存周转 46 天。
2023 年为了冲规模,一口气扩到 210 个 SKU,覆盖了更多价格带和功能点。结果半年后出现三个信号:第一,整体动销率掉到 61%;第二,退货率从 11.3% 涨到 19.7%;第三,广告投产比从 3.2 掉到 2.1,但投放预算本身没变。看起来是"扩品失败",但到底是哪一部分失败,管理层说不清楚。
最开始运营团队给的诊断是"新品类没跑起来"。他们按销售额排了个序,发现新品销售额里前 20% 表现不错,后 80% 拖后腿,于是准备砍掉后 80%。
这个诊断的问题在于,它只做了单商品排序,没有做组合视角。我当时把数据重新铺开发现:那些"看起来拖后腿"的新品里,有相当一部分是为了给核心款做价格锚点而引入的,砍掉它们会导致核心款的价格感知变差。真正的风险不是这些锚点款本身,而是它们和某些主力 SKU 在功能、人群上完全重叠。
重新梳理之后,我把问题归到三类:
这三类风险有一个共同特点:单看任何一个商品,它们都是"合格的",毛利不低于 30%,动销不低于 50%,退货率不算离谱。问题全部出在组合关系上。

在复盘和咨询里,我见过很多团队做商品分析时会掉进同样几个坑。我把它们写下来,不是为了罗列,而是因为它们每一个都会让"组合优化"变成"无效优化"。
选品优化的隐含假设是"商品池里总有更好的选择",组合优化的隐含假设是"现有商品之间的关系出了问题"。前者向外找,后者向内看。当你把组合优化当成选品来做,你会不断引入新商品试图稀释问题,结果 SKU 越堆越多,问题越来越大。
很多团队会设"动销率低于 30% 就砍",但动销率是单品口径。一件商品动销率 25%,如果是新上的实验款,它的作用可能是测试新人群;如果是长期滞销款,才需要处理。同一个动销率数字,对应的风险性质完全不同。阈值可以作为初筛条件,但不能作为最终决策依据。
销售额排序是最容易被拿来用的,因为它直观。但销售额掩盖了两件事:商品的连带贡献和商品的引流贡献。一件商品自己卖得不差,但如果它挤掉了另一件连带能力更强的商品的位置,整体是亏的。
退货率和库存周转是两件事,但它们在高风险商品上往往同时发生。退货率高意味着商品回流,回流商品二次上架又会挤占新货上架空间,形成一个负向循环。只排查退货率或只排查库存,都会漏掉这批最危险的商品。
这是最贵的一个误区。组合优化动作往往牵涉价格、库存、投放,一旦调整就同时影响多个变量。没有小范围验证就直接全量放大,一旦方向错了,损失往往是调整前的几倍。

要把"风险排查"做成可执行的路径,第一步是把风险定义清楚。模糊的"风险"没有排查价值。我一般把商品组合里的风险分成四类,每一类有独立的判断逻辑。
贡献风险关注的不是"商品赚不赚钱",而是"商品相对组合整体是加分的还是减分的"。判断口径我会看三项:毛利额贡献、连带购买率、以及对组合整体客单价的影响方向。一个商品自己毛利不错,但如果它把组合客单价拉低、又挤占了高客单商品的推荐位,它就是负向贡献。
结构风险是四类里最隐蔽的。它不会直接体现在某个指标上,而是通过"看起来正常但就是打不爆"表现出来。判断方法是对每个价格带、每个功能、每个目标人群做密度统计,当一个细分格子里商品数量超过需求承载能力时,这个格子就是结构性风险区。
库存风险要看的不是绝对库存量,而是单位销售额对应的库存占用。一件商品销售额不错但库存周转慢,它的资金效率可能低于一件销售额一般的商品。我判断时会把"库存周转天数 / 毛利率"作为一个组合指标来看,比例异常的进入排查名单。
这一层最容易被忽略。连带风险指的是同一批商品内部,彼此拉低对方的购买概率或客单价。常见的场景是页面推荐里同时展示了两件功能高度重叠的商品,用户反复比较、迟迟不下单,最后流失。

所有组合分析的地基是数据口径。我在项目里最常遇到的情况是:同一个指标在不同报表里数字不一样,团队拿着两份数据吵了半天,最后发现问题出在口径,而不是出在业务。所以在进入排查之前,先把数据地基打平。
口径不平,后面所有组合判断都会失真。我的经验是:宁可花三天把口径对齐,也不要赶着一天出结论。
组合分析需要靠标签把商品切到不同格子里,所以标签体系必须覆盖四个维度:品类、价格带、人群、生命周期。这里每一个维度都不能太细,否则格子过碎,排查没有意义;也不能太粗,否则结构风险会被平均掉。
| 维度 | 建议粒度 | 为什么不能更细 | 为什么不能更粗 |
|---|---|---|---|
| 品类 | 二级品类(约 10-20 个) | 三级品类会让单格子样本不足 | 一级品类会掩盖功能重叠 |
| 价格带 | 按目标市场客单价分 5-7 档 | 分太多档会失去可比性 | 分太少档会把不同人群混在一起 |
| 人群 | 按核心使用场景分 3-5 类 | 按人口统计分过细无实际动作意义 | 不分人群无法识别错配 |
| 生命周期 | 新品、成长、成熟、衰退 | 再细分会导致阶段判断主观化 | 不区分阶段会误伤实验款 |
我一般会让团队先跑一张初筛表,字段固定下来,每周更新一次。核心字段包括:SKU、所属格子(品类 × 价格带 × 人群 × 生命周期)、毛利额贡献、动销率、退货率、库存周转天数、连带购买率、推荐位曝光占比。
这张表的作用不是直接给结论,而是把每一个商品放到"结构坐标"上。一旦某个格子里同时聚集了高退货、低周转、高曝光,那就是重点排查对象。
SKU_ID | 格子坐标 | 毛利贡献 | 动销率 | 退货率 | 周转天数 | 连带率 | 曝光占比
S10231 | 个护-A带-北美成熟 | 8.2% | 71% | 13% | 42d | 1.8 | 6.1%
S10488 | 个护-A带-北美成长 | 5.6% | 58% | 22% | 61d | 1.2 | 5.4%
S10702 | 个护-B带-东南亚成熟 | 3.1% | 44% | 27% | 88d | 0.9 | 4.8%
S11009 | 彩妆-A带-北美衰退 | 1.2% | 21% | 33% | 112d | 0.6 | 3.2%
上面这段是脱敏后的一小段初筛表结构。关键不是某一行的数值,而是格子里商品的聚集情况,当 B 带东南亚成熟格子里堆积了超过 20% 的 SKU 时,这个格子本身就是风险信号。

数据准备好之后,真正的工作才开始。组合分析的核心动作是切换视角:不再问"这件商品怎么样",而是问"这件商品放在这个格子里,对周围商品产生了什么影响"。
价格带是最先要排查的维度,因为它对用户决策的影响最直接。同一个价格带里如果塞了太多功能重叠的商品,用户会陷入比较疲劳,最终往往选那个"最不出错的"而不是"最合适的"。判断方法是看点击集中度:如果一个价格带里排名前三的商品拿走了超过 60% 的点击,说明这个带是健康的;如果点击分散到七八个商品,每个都不到 15%,那这个带就是拥堵区。
品类组合的风险主要来自功能重叠。同一品类里,两件商品如果解决的是一模一样的问题,只是包装、香型、容量不同,那么它们本质上是同一件商品的多个版本。这类商品如果同时铺量,会拉低整个品类的连带购买率。我的判断口径是看同类替代率,替代率高的商品应该做减法。
人群组合的风险是错配。典型场景是用高端线去承接被低价款吸引进来的人群,结果高端线客单价被拉低,同时低价款人群也没被高端线转化。判断方法是看分人群的转化路径,如果某个商品的点击人群和成交人群差异很大,说明它承接的人群和设计人群不一致。
在实操里,组合分析最难的不是思路,是把散落在多个系统里的数据拉到一起看。我团队目前常用的工具组合里,数跨境(官网 https://shukuajing.jiushuyun.com/?utm_source=seo&utm;_plan=est&utm;_unit=gys)承担的是"跨境商品分析"这一段。它的价值不在替代 BI,而在于把品类、价格带、退货、库存这些原本需要手工拼的字段,整合成可以直接按格子看的分析视图。
举一个具体用法:我把上面那张初筛表的需求整理成几个维度,在数跨境里做分组的组合分析。之前手工做一次完整排查大概需要 2-3 天(含数据清洗),用这个工具把重复性的聚合工作自动化之后,单次初筛时间压缩到 4-6 小时,而且每周可以重跑一次,让排查变成节奏化动作而不是一次性项目。
需要说明的是,工具解决的是效率问题,不是判断问题。结构风险的定义、格子的划分逻辑、阈值的设定,还是要靠业务判断。工具帮你把问题摆到桌面上,决定怎么处理仍然是人。
这一类商品是最难处理的。它们单看每一件都合格,但放一起就出问题。我一般会做三件事去识别:
三个都命中,基本可以判定为组合风险商品,处理方式通常是做减法,而不是继续优化单品页面。

到这里,排查逻辑已经跑通了。但真正让组合优化从"某个人擅长做"变成"团队能持续做"的,是规则化。规则的作用是让经验可复用、可迭代、可追溯。
我一般会把风险分成四级:观察、关注、预警、高危。每一级对应不同的排查动作和响应节奏。观察级每月复盘一次,高危级进入周度处理流程。
| 风险等级 | 触发条件示例 | 响应节奏 | 主要动作 |
|---|---|---|---|
| 观察 | 单个指标接近但未超阈值 | 月度复盘 | 监测变化,不主动调整 |
| 关注 | 两项指标同时异常但幅度小 | 双周复盘 | 加入下一轮优化候选 |
| 预警 | 三项指标明显恶化或结构重叠 | 周度排查 | 启动小范围验证 |
| 高危 | 影响组合客单价或库容挤占明显 | 即时处理 | 立即减量或下架,同步验证 |
等级体系的意义不是分类本身,而是让响应节奏有依据。否则所有问题都会被当成"重要紧急"处理,团队会被拖垮。
规则要写得足够具体,才能执行。举个例子,我把"结构风险"这条规则拆成三条可执行判断:
三条同时触发,判定为结构风险。规则不追求绝对精准,追求的是"触发时值得看一眼",剩下的交给人工判断。
规则不是写一次就完的。我一般会每季度做一次规则复盘,看两个东西:规则触发后的处理动作里,有多少最终被证明是正确的;以及被漏掉的高危商品有没有共同特征。前者决定规则要不要收紧,后者决定规则要不要扩展。
排查机制落地时,最大的坑是"数据分散、口径不一、跑一次要几天",最后排查机制形同虚设。我在数跨境里主要做三件事来固化机制:
这套机制跑下来,团队的排查节奏从"季度项目"变成"每周动作",响应速度的提升比单次结论的价值更大。组合优化的本质是持续性的风险管理,不是一次性项目。

识别出风险组合之后,接下来是动作。动作分四类:汰换、调价、重组、引流。四类动作的风险性质不同,验证方式也不同。这里我特别想强调一点:不要一次性全量执行,任何组合调整都要先小范围验证。
| 动作类型 | 适用场景 | 主要风险 | 验证重点 |
|---|---|---|---|
| 汰换 | 结构重叠、连带低、退货高 | 误伤实验款或引流款 | 观察整体动销与连带是否改善 |
| 调价 | 价格带拥堵、定位模糊 | 影响已购用户复购意愿 | 观察客单价与转化率联动 |
| 重组 | 品类或人群错配 | 调整后短期流量下跌 | 观察目标人群转化路径 |
| 引流 | 高价值商品曝光不足 | 拉低整体转化率 | 观察推荐位曝光与转化效率 |
我的做法是选 1-2 个格子做试点,把调整控制在这些格子内,其他格子不动作为对照。试点周期一般 2-3 周,观察四个指标:动销率、退货率、连带率、组合客单价。四个指标中有三个改善、且没有明显恶化项,才考虑放大。
试点阶段要严格控制变量。比如只做汰换,就不要同时调价;只做调价,就不要同时改页面推荐位。否则最后说不清是哪个动作起作用。
验证结果经常出现"看起来变了但不知道是不是巧合"的情况。我的处理方式是看趋势不看单点:连续两到三周指标同向变化,才算初步验证。单周期波动不要急着下结论。
另外要有心理准备:不是所有优化都会立刻带来正向变化。有些调整前两周动销反而下降,是因为老用户需要时间适应新的推荐结构。这时候如果没有耐心,很容易把正确的动作否定掉。

同一套路径,不同规模的团队执行方式不一样。我按团队和商品规模分了四类场景,给出对应的行动建议。
小团队不要一上来就搭体系。先选一次完整排查跑通,把口径、标签、初筛表、一次结构判断做完,哪怕结论粗糙。跑通之后,你才知道自己缺的是数据、工具还是判断标准。
这个阶段工具不用太复杂,一张 Excel 加上手动分组就能用。重点是建立一次完整的判断经验。
这个规模的团队最常见的问题是排查靠人、节奏靠临时。核心动作是把初筛表和标签体系固定下来,每周更新一次。同时开始做格子的密度统计,识别结构风险区。
到这个规模,手工拼数据的成本开始超过工具成本,可以用数跨境这类工具把聚合和分组自动化,把精力留给判断。
300 个 SKU 以上,靠人力排查已经不可靠。必须做风险等级体系和排查规则,并且每周执行一次。这个阶段最大的隐性成本是沟通成本,没有规则,每次讨论都要重新解释判断逻辑,效率极低。
这个阶段可以考虑数跨境的组合分析和存档能力,把规则、结果、动作记录下来,让机制能被审计和迭代。
到这个规模,组合分析已经不是项目,而是日常运营的一部分。它应该嵌入新品上架、投放预算分配、供应链补货这三个决策环节,而不是作为一个独立的分析动作存在。所有新商品上线前都要做结构重叠检查,所有投放调整都要先看目标格子的风险等级。

组合优化本质是一系列取舍。我把最常见的几个取舍点整理出来,帮你在决策时想清楚代价。
砍掉一件还在动销的商品,短期销量一定下降。但如果这件商品是结构重叠的,长期来看结构清晰带来的整体效率提升更大。取舍的关键是判断这件商品是不是真重叠,而不是它当前卖得怎么样。
很多团队追求"品类齐全"的用户体验,但齐全的代价是每个格子里的商品都不够突出。对于中小品牌,我倾向于优先保证核心格子的效率,再考虑品类扩张。齐全本身不是目的,能承接需求才是。
数据永远不可能完备。我的经验是:核心口径必须对齐,次要指标可以先粗后精。不要在数据准备阶段无限打磨,否则排查永远开始不了。用 70% 的数据跑通一次完整排查,比用 100% 的数据等一个季度更有价值。
规则会漏掉边界情况,人工判断会不稳定。我的取舍是:规则负责发现,人工负责决策。规则把值得看的商品筛出来,人工判断哪些真的需要处理。不要指望规则自动给动作,也不要指望人工每次都筛全。
这是最重要的一条。一次性排查解决当下问题,机制解决未来问题。如果只能选一个,我永远选机制。因为商品结构会随着上新、促销、人群变化持续漂移,没有机制,今天清理干净的格子半年后还会再堵。

最后,我把上面所有内容整理成一份可以直接照着走的检查清单。你可以在每个排查周期开始时过一遍,也可以在季度复盘时对照检查哪一环漏掉了。

回到最开始那句话:组合优化的第一步不是找爆款,而是找出"会拖垮整体的风险组合"。这篇文章里我做了几件在通用教程里不太会看到的事,把风险分成贡献、结构、库存、连带四类并给出各自的判断口径;把组合分析拆成价格带、品类、人群三层切换视角;把排查从一次性动作变成规则化机制;把不同规模团队的行动建议和取舍代价摊开来讲。
如果你现在要动手,我的建议是不要先想着搭体系,先跑通一次完整排查。选一个价格带、一个品类、一个格子,用你手头现有数据把初筛表跑出来,做一次结构判断,试着处理一件你怀疑是"组合风险"而不是"单品问题"的商品,然后观察两到三周。这一次经验的价值,比读十篇方法论都高。
跑通之后,再考虑把口径对齐、把标签固化、把规则写下来,用工具把重复环节自动化。机制是组合优化真正沉淀下来的地方。工具不是起点,也不该是终点,它只是让机制能持续运转的那部分基础设施。
我之前一直以为组合优化就是挑几个卖得好的商品重点推,结果推了两个月发现整体利润没涨,反而库存越压越多。后来才意识到可能是有些商品在拖后腿,但不知道该从哪里下手排查。
先做商品分层,再做风险定义,最后才是组合分析。具体来说,第一步把全部商品按贡献维度分成四层:核心贡献层(高毛利高动销)、潜力层(高毛利低动销)、流量层(低毛利高动销)、风险层(低毛利低动销或负贡献)。
第二步针对每一层定义不同的风险标准,比如核心层怕断货和退货率飙升,流量层怕毛利被侵蚀,风险层怕库存越滚越大。第三步才是把商品放回价格带、品类、人群、渠道这几个组合维度里看结构性错配。不要一上来就拉全量数据跑模型,先把分层做对,后面所有排查才有基准线。
判断依据是你自己的品类特性,不要求统一阈值,但分层逻辑必须先跑通。
我们店铺有几款商品单看数据都不错,毛利正、动销也还行,但运营总觉得整体品类结构不对劲。我就很困惑,单商品指标都过关,为什么放到组合里就出问题?这种情况到底该怎么识别?
单商品健康不等于组合健康,核心看三个信号。第一,看它是否在蚕食同价格带内其他商品的销量,做法是拉出同价格带商品的周销量相关性,如果两个商品销量此消彼长且总盘子没变大,说明内部互吃。第二,看它是否拉低了品类整体的连带率,比如某商品退货率正常但买了它的人很少再买同品类其他商品,说明它孤立了品类结构。
第三,看它是否占据了高流量位却只贡献了低毛利,把流量成本摊进去后实际是负贡献。判断标准不是绝对值,而是它加入组合前后,组合整体的毛利额、动销率、连带率有没有变好。如果加入后组合指标变差,哪怕单品数据好看,也要标记为结构性风险商品。
具体操作上,建议按价格带和品类各做一次“加入前 vs 加入后”的对比测算,用周粒度数据跑四周以上。
我们团队每次做商品风险排查,运营、财务、供应链各拿一套数,销量口径不一样、退货统计周期不一样、库存成本算法也不一样,开会光对数就吵半天。这种情况下排查还有意义吗?该怎么统一?
口径不统一是风险排查最大的隐性成本,必须先解决再谈分析。建议按三步走:第一步,指定一个“唯一数据源”,通常以订单完成时间作为销量和毛利的统一时间锚点,退货按原订单归属周期回算,而不是按下单时间或退款时间各算各的。
第二步,库存成本统一用移动加权平均,不要有的用先进先出有的用标准成本,否则毛利和周转没法横向比。第三步,把每个指标的计算逻辑写成一份口径文档,标注数据来源表、刷新频率、责任人和例外处理规则,每次排查前先确认版本一致。
判断依据很简单:如果两个人用同一份原始数据算同一个指标得不出同一个数,说明口径没统一。落地时不要追求一次到位,先把销量、毛利、库存、退货这四个核心指标的口径锁死,其余指标逐步补齐。
我们团队就几个人,没有数据分析师,每次排查都靠运营手动拉表、拍脑袋判断,这次查完下次又乱。我很想知道有没有不依赖复杂工具、小团队也能跑起来的排查机制。
小团队不需要复杂系统,关键是规则化和节奏化。具体做法:第一,固定一张风险初筛表,字段控制在十个以内,比如商品ID、品类、价格带、周销量、毛利额、库存天数、退货率、风险标记,每周固定时间更新一次。
第二,设定三条硬规则做初筛,比如连续三周负毛利直接标红、库存天数超过品类均值两倍标黄、退货率超过品类均值一点五倍标橙,规则写死在表格里,不靠人判断。
第三,每月做一次组合复盘,只看标红和标黄的商品,按价格带和品类两个维度看是否集中出现,如果某个价格带连续两个月标红商品占比上升,说明是结构性问题而不是个别商品问题。第四,优化动作先在小范围验证,比如先汰换三到五个风险商品,观察两周组合整体毛利和动销变化,确认有效再扩大。
判断依据是排查结果能不能稳定复现,如果每次换个人做结论就变,说明规则还不够硬。工具用表格加简单脚本就够,重点是把判断逻辑沉淀成规则,而不是依赖某个人的经验。


读者评论
这篇文章把组合优化讲成风险排查,角度确实少见。我们公司去年SKU翻倍后也遇到类似问题,动销率跌得厉害,但一直以为是新品不行,看了这篇才意识到可能是结构重叠导致的分流。
四类风险的框架很实用,尤其是结构风险和连带风险的区分。不过实际落地时,怎么量化‘需求承载能力’和‘相互蚕食’还是个难点,希望作者能再展开讲讲具体的计算口径。
瀑布图那部分挺有冲击力的,退货、库容、流量分流这些隐性损耗确实容易被忽略。但那个‘3%库容拖慢5%-8%周转’的经验值,样本量太小,只能当方向参考,不能直接套用到其他类目。
小范围验证这点太重要了。我们之前调整价格带和投放策略,没有做AB测试就直接全量上线,结果转化反而掉了,后来复盘发现是几个重叠款同时在抢流量,教训很深刻。