天猫数据:商品经理团队版教程:人群画像从准备到复盘
做天猫人群画像,最容易出现的结果是:报告里有年龄、城市、性别、消费层级,商品经理却依然不知道下一款商品该为谁设计。我的经验是,人群画像不是“把消费者描述清楚”,而是把消费者差异转化成商品决策、页面表达和复盘动作。如果团队只看平台标签,不把人群与商品、场景、价格和行为链路绑定,画像越精细,决策反而越容易失焦。
这篇教程以商品经理团队的实际工作流为主线,覆盖天猫数据的准备、采集、清洗、分群、解读、应用和复盘。文中的案例数据采用脱敏后的项目结构与情景模拟数据,数据口径主要参考店铺后台导出的访客、加购、收藏、支付、会员、退款和投放报表;涉及行业背景时,以中国互联网络信息中心公开报告和平台公开经营指标作为参考,不把模拟数据当作行业统计。
一张画像至少要回答五个问题:这批人是谁、在什么场景下产生需求、为什么选择当前商品、在哪一步放弃、下一步应该由谁采取什么动作。如果只能回答“女性、25至34岁、来自一线城市、消费能力较高”,它只是描述,不是经营工具。
我通常把人群画像是否合格,放在商品经理评审会上做一次反向测试:不看人群名称,只看画像内容,能否直接写出一个商品卖点、一个页面模块、一个价格策略和一个验证指标。若不能,说明画像仍停留在数据展示层。
同一个消费者,在不同购物任务中可能属于完全不同的人群。一个经常购买高端护肤品的人,在给孩子购买防晒用品时,可能更关注安全成分和使用便捷性,而不是品牌调性。商品经理如果只用会员等级或消费金额定义人群,就会错过真实的购买任务。
我建议团队采用三层结构:第一层是基础属性,用于确认人群边界;第二层是行为信号,用于判断真实兴趣;第三层是任务与阻碍,用于决定商品和内容。三层信息必须同时存在,否则画像要么过于宽泛,要么无法执行。
| 画像层级 | 核心问题 | 常见字段 | 能支持的决策 |
|---|---|---|---|
| 基础属性 | 这是谁 | 年龄段、地区、家庭阶段、消费层级 | 确定产品边界与沟通语气 |
| 行为信号 | 他做过什么 | 浏览、搜索、收藏、加购、支付、退款、复购 | 判断需求强度与购买阶段 |
| 任务场景 | 他为什么现在买 | 送礼、替换、囤货、解决痛点、临时应急 | 决定功能排序、包装和内容主题 |
| 阻碍因素 | 为什么没有买或没有复购 | 价格、规格、信任、使用门槛、物流、售后 | 确定改款、页面优化和服务动作 |
团队经常把规模最大的人群作为第一优先级,这是一个危险的简化。规模大不等于适合当前商品,转化高也不等于值得继续投入。真正需要优先研究的,是既有明确需求,又能被商品、内容或服务影响的人群。
可以用一个简单模型给人群排序:人群优先级分数=需求强度×商业价值×可影响程度÷执行成本。需求强度可由搜索、加购和咨询反映;商业价值可由支付金额、毛利和复购潜力反映;可影响程度则要看团队能否通过改款、内容或权益改变结果。

商品经理团队第一次做画像时,通常会先把所有能下载的数据都拉出来,最后得到几十张表和一堆无法解释的交叉分析。更稳妥的方式,是先写清楚本轮研究要支持哪个决策。
例如,“了解店铺消费者”不是一个合格问题;“判断春季轻户外系列应该优先服务通勤替换人群还是周末出游人群”才是合格问题。前者没有决策终点,后者可以明确数据范围、分群方法和验证指标。
同一份报表,在不同岗位手里很容易产生不同结论。运营把访客数理解为去重访客,投放人员可能使用曝光口径,财务则更关注支付成功和退款后的净收入。若不提前定义口径,会议上的争论往往不是观点不同,而是分母不同。
| 数据字段 | 建议口径 | 常见误读 | 负责人 |
|---|---|---|---|
| 访客人数 | 指定周期内去重访问店铺或商品详情页的人数 | 把页面访问次数当成人数 | 数据或运营 |
| 加购率 | 加购人数÷商品详情页去重访客 | 用加购次数除以曝光量 | 运营 |
| 支付转化率 | 支付买家数÷对应人群去重访客 | 把支付件数当成买家数 | 运营与财务 |
| 净成交金额 | 支付金额扣除退款后的有效成交金额 | 只看支付金额,忽略退款滞后 | 财务 |
| 复购率 | 观察窗口内再次支付人数÷基准期支付人数 | 把多件购买误判为复购 | 会员或数据 |
日常画像建议至少使用近30天和近90天两个窗口。30天用于捕捉近期需求与活动影响,90天用于观察稳定结构。若是季节性商品,应加入去年同期,但不能简单把两个周期的绝对数直接比较,而要同时看流量规模、价格、活动强度和库存状态。
我在实际复盘中见过一个典型错误:某款商品在大促期间来自低线城市的访客比例明显上升,团队据此认为产品已经实现人群扩张。拆开投放和优惠后才发现,变化主要来自一条低价引流计划,并没有形成稳定支付。任何人群变化,都必须经过“流量来源,行为深度,成交质量”三层验证。

天猫数据并不是天然干净的消费者事实。活动券、直播间专属价、店铺搜索词、联盟流量、异常订单和退款订单,都可能改变人群表现。画像前至少要标记四类污染源:活动期、投放期、价格变化期和库存异常期。
平台标签能够告诉我们“谁更可能出现”,却不一定告诉我们“为什么购买”。年龄、城市和消费层级是筛选条件,不是动机本身。真正的购买动机往往藏在搜索词、咨询内容、评价文本、退款原因和复购间隔里。
例如,同样是“高消费层级用户”,可能有人为了提升效率购买,有人为了家人购买,也有人只是被内容种草。三类人的商品优先级不同:效率型关心省时,家庭型关心安全和易用,种草型关心颜值与社交证明。把他们合并,会得到一个谁都不完全满意的产品。
高转化可能来自强意向搜索、老客回访、客服人工引导或限量优惠,并不代表这个人群能支撑更大规模。商品经理需要同时看三个维度:人群规模、转化效率和边际成本。
如果一个小人群的转化率很高,但扩量后成本迅速上升,团队就应该把它定位为“高效率验证人群”,而不是直接定义为“唯一核心人群”。核心人群需要具备可持续触达、可复制转化和足够的商品容量。
按年龄切分最容易,按城市切分也很直观,但单一维度往往解释力不足。商品决策更适合采用“行为阶段+购买任务+价值状态”的组合切分。
| 切分方式 | 优点 | 局限 | 适合用途 |
|---|---|---|---|
| 按年龄或性别 | 容易理解,便于初步描述 | 无法解释具体购买原因 | 内容语气和基础素材规划 |
| 按消费层级 | 有助于判断价格带 | 容易忽略使用场景 | 价格分层与款式组合 |
| 按行为阶段 | 能识别新客、犹豫、复购等状态 | 需要连续周期数据 | 投放、触达和页面承接 |
| 按购买任务 | 最接近商品使用价值 | 需要结合文本与访谈判断 | 商品定义、卖点排序和包装设计 |
如果高客单用户的退款率低于平均水平,只能说明两者在当前样本中同时出现,不能直接断言“高客单用户更满意”。还可能存在商品款式差异、客服服务差异、配送区域差异和订单复杂度差异。
我在团队评审时会要求每个结论至少写成三部分:观察到什么、可能由什么解释、准备如何验证。比如“会员用户转化率更高”只是观察;“可能因为会员更熟悉商品且享有权益”是解释;“对非会员展示同等服务承诺并进行小流量测试”才是验证方案。
当样本量下降后,任何比例变化都可能被少量订单放大。把人群细分到“某年龄段、某城市、某设备、某时段、某关键词”的组合,通常无法支撑商品决策。画像不是越细越专业,而是要细到足以改变动作,同时保留足够样本验证结果。

不同问题对应不同统计单位。研究复购,应以买家为单位;研究规格选择,可以以订单或商品件数为单位;研究场景,则可能需要以一次购买任务为单位。若用订单数分析用户规模,连买两件的人会被重复计算,结论自然偏向多件购买者。
商品经理应在报告首页明确三项内容:观察单位、时间窗口、排除规则。任何指标都要写出分母,例如“加购人数÷商品详情页去重访客”,而不是只写“加购率”。这一步看似基础,却是团队协作中最能减少争议的动作。
人群画像不能只看最终支付。对商品经理而言,浏览到加购、加购到支付、支付到收货、收货到复购,每一步都代表不同问题。浏览高但加购低,通常涉及需求表达或商品吸引力;加购高但支付低,可能是价格、信任、优惠或运费问题;支付高但退款高,则要回到商品预期管理。
| 阶段 | 关键指标 | 主要解释 | 可采取动作 |
|---|---|---|---|
| 触达 | 有效访客率、搜索进入占比 | 人群是否被正确吸引 | 调整标题、素材和投放定向 |
| 兴趣 | 停留、详情页滚动、收藏、加购 | 商品是否解决当前任务 | 重排卖点、补充对比和场景演示 |
| 决策 | 支付转化、优惠使用、咨询转化 | 购买阻力是否被消除 | 调整价格、权益、信任证明和客服话术 |
| 体验 | 退款率、差评主题、物流投诉 | 承诺是否与实际交付一致 | 改规格说明、包装、质检和售后 |
| 留存 | 复购间隔、关联购买率 | 商品是否形成持续价值 | 设计补充装、组合购和会员触达 |
平均值会掩盖人群差异。一个商品整体支付转化率为3.8%,并不说明所有人群都接近3.8%。可能是新客1.6%、老客8.9%、某个场景人群5.7%,平均值只是把不同问题压成了一个数字。
我更关注人群之间的相对差异:某人群的加购率是否显著高于整体、退款率是否显著低于整体、客单和毛利是否能够覆盖获取成本。差异越稳定,越值得进入商品策略;差异只在单次活动中出现,则更适合进入实验池。
数据不会直接告诉团队“应该增加一个防漏设计”或“应该缩小包装”。这需要把行为证据翻译成商品假设。翻译时,我会使用“信号,推断,动作,验证”的四格方法。
| 信号 | 推断 | 商品动作 | 验证指标 |
|---|---|---|---|
| 详情页中段停留高,咨询集中在使用方法 | 用户有兴趣,但对使用门槛不确定 | 增加步骤图、演示视频和低门槛试用规格 | 咨询转化率、加购率、退款原因 |
| 高频搜索词包含“替换、补充、耐用” | 用户可能处于旧品替换或持续使用阶段 | 开发补充装、耐用升级款或组合规格 | 关联购买率、复购间隔、单次购买件数 |
| 支付转化不低,但退款集中在尺寸不符 | 商品预期与实际规格存在落差 | 修改规格表达、增加实物参照和尺寸提示 | 尺寸相关退款率、差评率 |
如果团队同时改价格、主图、规格和权益,结果变好时无法知道哪个动作有效,结果变差时也无法及时止损。更好的做法是把画像结论拆成最小可验证单元:一个人群、一项假设、一个页面或商品动作、一个主要指标和一个观察周期。
例如,针对“通勤替换人群更在意省时”,可以先测试首屏是否把快速使用放在第一卖点,而不是立刻开发新规格。若加购率和咨询转化同步改善,再决定是否投入结构性改款。

下面这个案例来自一个日用消费品项目的脱敏复盘。团队计划推出一款价格高于旧款约35%的升级商品,初始定位是“高消费、重视品质的年轻女性”。这个定位并非完全错误,但它无法告诉团队为什么用户要购买升级版。
准备阶段,团队合并了近90天的商品访问、搜索、加购、支付、退款和会员数据,并补充查看了约1200条评价与客服咨询。最后有效样本约7.4万人,其中支付买家约6200人。所有数据按买家去重,退款订单单独标记,没有直接从有效成交中删除。
第一版画像显示,访问升级商品的人群以25至34岁女性为主,一二线城市占比约58%,中高消费层级占比约64%。如果只看到这里,团队很容易继续强化“年轻、高消费、城市女性”的内容表达。
但进一步拆解行为后,出现了三个明显群体:第一类是首次接触的新客,浏览多、加购少;第二类是旧款购买过两次以上的替换型老客,规模不大但支付转化高;第三类是受短视频内容吸引的场景型用户,收藏和咨询较高,但对规格与价格非常敏感。
| 人群 | 访客占比 | 支付转化率 | 退款率 | 主要阻碍 | 商品启示 |
|---|---|---|---|---|---|
| 首次接触新客 | 52% | 1.9% | 5.8% | 不了解升级价值 | 需要低门槛说明与基础款承接 |
| 替换型老客 | 23% | 7.4% | 2.6% | 担心升级后是否值得 | 应突出旧款痛点改善与换新权益 |
| 场景型用户 | 17% | 4.1% | 6.9% | 价格、规格和使用复杂度 | 需要场景套装、演示内容和清晰规格 |
| 其他探索人群 | 8% | 2.7% | 7.5% | 需求不稳定 | 暂不作为首发核心人群 |
替换型老客只占访客的23%,却贡献了约44%的升级商品支付金额。更重要的是,这类用户的退款率最低,咨询内容集中在“旧款哪里改善”“能不能直接替换”“使用寿命是否更长”。这说明他们不是被泛泛的品质宣传吸引,而是在评估一个明确的替换任务。
团队因此做了三项调整。第一,把首屏主卖点从“高品质升级”改成“针对旧款三个使用痛点的具体改善”;第二,为老客设置换新组合,而不是只提供全店通用优惠;第三,在详情页增加新旧版本对比、使用周期和适用场景说明。
团队没有马上重做整套产品,而是先进行页面和权益实验。实验组对替换型老客展示新旧版本对比、换新权益和真实使用演示,对照组继续使用原有的品质表达。实验持续14天,控制流量来源和价格条件,主要观察加购率、支付转化率和退款预警咨询。
在情景模拟数据中,实验组加购率由18.6%提升至24.3%,支付转化率由7.4%提升至9.1%,与规格不确定相关的咨询占比由29%下降至17%。由于观察周期较短,团队没有直接宣布长期成功,而是将“替换任务明确、对比信息有效”列为下一轮产品验证假设。

这次项目最有价值的结果,不是某个页面指标上涨,而是团队从“用户喜欢什么”转向“用户在什么任务下愿意为哪种改善付费”。运营、商品、设计和客服开始围绕同一组证据协作:运营确认流量是否匹配,商品判断痛点是否值得开发,设计负责让差异可见,客服补充未被报表记录的疑问。
复盘时还发现一个反例:场景型用户的收藏率很高,但支付转化不如替换型老客。团队没有把收藏直接解释为强购买意愿,而是进一步查看收藏后的回访和优惠领取。结果发现,部分用户只是把商品保存为“以后参考”,并未形成近期购买任务。因此,这类人群更适合内容培育和低成本再营销,不适合承担新品首发的库存目标。

完整复盘至少要回答四个层次的问题。第一,目标人群是否真的被触达;第二,目标人群是否理解了商品价值;第三,成交是否来自健康的价格和流量条件;第四,交付后是否形成了满意、复购或推荐。
如果只看支付转化,团队可能会误把大额优惠带来的短期成交当作画像成功。更稳妥的复盘要同时查看毛利、退款、客服压力、库存消耗和后续复购。商品经理的任务不是把某一个数字推到最高,而是在增长和经营质量之间找到可持续的平衡。
我建议每个核心人群都使用一张固定格式的复盘卡,避免每次复盘都重新组织表达。复盘卡不需要很复杂,但必须把人群、假设、动作和结果放在同一页。
实验组转化率从2%提升到3%,相对增长50%,但如果流量只有几百人,结论仍然不稳。反过来,一个大人群转化率只提升0.3个百分点,却可能带来更多有效订单和更高利润。
所以复盘应同时呈现百分点变化、相对变化和增量结果。例如“支付转化率提升1.7个百分点,提升约23%,在新增访客规模下多带来约260笔有效订单”。三种表达互相补充,才能让商品、运营和财务使用同一套结果。
| 复盘周期 | 适合观察 | 不适合下的结论 | 主要动作 |
|---|---|---|---|
| 每日 | 流量异常、库存、价格和页面故障 | 长期人群价值 | 排查异常与及时止损 |
| 每周 | 人群结构、素材表现、漏斗节点 | 复购和长期满意度 | 调整投放、内容和页面 |
| 每月 | 净成交、毛利、退款、会员结构 | 单次活动的偶然效果 | 调整商品和资源配置 |
| 季度或周期性 | 复购、生命周期和品类迁移 | 短期页面小改动效果 | 更新人群战略与产品路线 |

很多团队只记录支持自己判断的数据,不记录反例,久而久之画像会变成内部共识,而不是可检验的假设。每次复盘都应主动寻找反证:高转化是否只发生在老客?高客单是否由少数大额订单贡献?人群扩大后退款是否上升?收藏增加是否真的带来回访和支付?
如果一个结论经不起反证检查,就不应该直接写成商品战略。可以把它标记为“待验证假设”,保留在实验池中。专业的画像不是结论更肯定,而是知道结论在哪些条件下会失效。
数据不足时,不要假装拥有精细画像。可以使用相近品类的搜索词、竞品评价主题、客服预售问题、内容互动和小批量测试建立第一版假设。此时画像的任务不是精准预测,而是降低首轮试错成本。
这类问题首先要判断是人群变了、商品老化了,还是流量质量变了。建议把近30天与近90天的人群结构、搜索词、价格、投放计划、退款原因并排比较。如果新客占比增加而老客占比下降,可能是触达扩张但承接不足;如果老客也同步下滑,商品价值或体验可能已经衰减。
资源取舍上,不建议立即全面降价。降价可以短期修复转化,却可能损害价格锚点和老客预期。更稳妥的顺序是先验证卖点是否过时,再判断是否需要规格升级、组合调整或权益重构。
当人群过多时,建议采用“核心、增长、观察”三级管理,而不是给每个群体都设计一套完整方案。核心人群承担商品与库存,增长人群承担内容和投放验证,观察人群只保留低成本触达。
| 人群等级 | 进入条件 | 资源投入 | 退出条件 |
|---|---|---|---|
| 核心人群 | 需求明确、转化稳定、退款可控 | 商品、页面、投放和会员资源优先 | 连续两个周期价值下降或成本失控 |
| 增长人群 | 有兴趣信号但购买阻碍未解决 | 小流量实验、内容教育和权益测试 | 验证无改善或无法覆盖执行成本 |
| 观察人群 | 样本小、需求不稳定或证据不足 | 保留基础触达,不做重投入 | 出现连续有效行为后升级 |
这类人群最容易被误判为“爆款机会”。高转化说明商品承诺能够吸引购买,高退款则说明承诺、规格、体验或预期之间存在错配。商品经理不能只追求继续放量,而应先拆退款主题。
如果退款集中在尺寸、颜色或使用方法,优先修改页面信息和客服确认流程;如果集中在质量、耐用性或效果不符,问题就已经进入商品和供应链;如果集中在冲动购买后的后悔,则要重新评估优惠设计和内容表达是否过度刺激。

预算有限时,我会优先选择能够同时改善多个漏斗节点的动作。例如清晰的规格说明,可能同时降低咨询成本、提升支付转化、减少退款;而单纯增加曝光,通常只能放大现有问题。
商品经理、运营、数据和客服一起开一个不超过90分钟的工作会,只讨论三个问题:本轮要支持什么决策、成功由哪些指标定义、哪些数据不能直接使用。会议结束时,应形成一页纸的问题定义和口径表。
导出近30天、近90天以及必要的去年同期数据,按统一买家或访客口径整理。不要先做复杂模型,先完成从触达到支付、退款和复购的基础漏斗,并把活动、投放、价格和库存变化标记在时间轴上。
建议先用购买任务命名人群,例如“替换型”“尝鲜型”“礼赠型”“囤货型”“问题解决型”。每个人群都必须附带行为证据、主要阻碍、商品机会和验证指标。若只是属性标签,没有行为与任务,就暂不纳入核心画像。
选择一个核心人群和一个增长人群,各提出一个最小实验。实验不要同时改变太多变量,至少要保留对照条件,并记录流量来源、价格、素材版本、库存和客服策略。最后明确谁负责执行、谁负责读数、谁拥有停止或扩大的决策权。
实验结束后,不要只把结果写进汇报材料。将新的支付、退款、咨询和复购数据回填到人群复盘卡,检查原有假设哪些被支持、哪些被削弱、哪些只在特殊条件下成立。画像只有进入下一轮商品、页面和资源决策,才真正完成闭环。

消费者不是固定标签的集合,而是在不同场景、价格和商品任务中不断变化的人。今天的高价值老客,可能因为需求已被满足而进入沉默期;今天的价格敏感新客,也可能在第一次体验后成为稳定复购用户。画像需要记录状态变化,而不是把人永久锁定在某个标签里。
更多字段、更细分群和更漂亮的图表,都不能替代对商品问题的理解。真正有价值的画像,通常不是最复杂的那一张,而是能让团队在评审会上快速回答“为什么做、为谁做、先验证什么、什么情况下停止”。
建议你先选择一个正在开发或正在下滑的商品,限定一个明确决策,建立近30天与近90天双窗口数据,按照“行为阶段+购买任务+价值状态”切出不超过五类人群。然后为其中一类人群设计一个最小实验,用支付转化、退款质量和执行成本同时评估结果。
天猫数据真正的价值,不是告诉商品经理消费者长什么样,而是帮助团队判断:哪一类人正在完成什么购买任务,商品应该在哪个环节为他减少阻力,以及这项判断能否被下一轮结果验证。当人群画像能够持续影响商品定义、页面表达、库存配置和复盘节奏,它才不再是一份分析报告,而会成为商品团队的决策基础设施。
我准备人群画像时,最容易疑惑的是数据越多是不是越好。天猫后台、店铺人群、投放报表和客服记录都有一堆字段,但我不知道哪些数据应该进入同一张分析表,哪些数据混在一起反而会误导团队。
我做过一次家居收纳类目的画像项目,最初把近180天的访客、成交、加购、收藏、投放和客服数据全部合并,结果画像看起来很完整,实际却无法指导选品。原因是不同数据的统计口径和时间窗口不一致:投放数据按点击归因,成交数据按支付时间统计,客服记录又包含大量未成交咨询。
后来我把准备工作拆成“业务问题、数据口径、用户标识”三层。先明确画像要服务于什么决策,例如判断新品卖给谁、老客为什么复购,还是判断某个价格带是否值得扩充;再固定观察周期、成交口径和渠道范围,最后才决定抓哪些字段。
数据层建议字段主要用途常见误区 结果数据支付人数、支付件数、支付金额、退款金额判断真实购买价值把下单人数当成支付人数 行为数据访问、停留、收藏、加购、领券判断购买意向强弱把收藏直接等同于高意向 用户属性地域、年龄段、消费层级、活跃时间描述人群结构只看平台标签,不结合商品行为 反馈数据差评主题、客服问题、退货原因解释为什么买或不买只统计数量,不看具体语境 我通常会先建立一张“画像数据字典”,至少写清字段定义、统计周期、去重规则和负责人。
例如“成交用户”必须明确是支付成功用户还是付款后未退款用户;“老客”也要明确是历史购买过,还是近90天有复购行为。在那次项目中,清理口径后有效成交用户从4.8万降到3.9万,但画像稳定性明显提高。
团队最终发现,高价值人群并不是访问次数最多的人,而是“近90天购买两次以上、客单价高于均值1.6倍、对组合装有明显偏好”的用户。我的判断是,前期准备的目标不是收集最多字段,而是让每个字段都能回答一个明确的商品问题。
我所在的团队以前也做过这种项目,最后通常是数据同学输出一份报告,商品经理看完提几个意见,运营再单独拿去投放。这样的流程看似高效,但我担心每个人对人群的定义不一致,最后画像无法真正落到商品和营销动作上。
人群画像最容易失败的地方,不是分析能力不足,而是没有把“谁负责定义、谁负责验证、谁负责行动”分开。我测试过由单一分析人员包办的流程,报告交付时间缩短了约30%,但两周后的使用率很低,因为商品、运营和客服都不认可其中一部分结论。现在我会采用“小团队共创、角色分责”的方式。
商品经理负责把业务问题翻译成可验证的假设,数据人员负责口径和分群计算,运营负责检查渠道是否能触达,客服或用户研究人员负责解释行为背后的原因。
角色必须交付的内容不能替代的工作 商品经理目标人群假设、商品决策问题不能只凭经验定结论 数据人员分群规则、规模、转化和价值指标不能独自解释用户动机 运营人员触达渠道、素材和投放验证方案不能把点击率当成最终价值 客服或研究人员典型问题、反对理由、原话证据不能用少量个案代表整体 我会在项目开始时组织一次45分钟的口径会,只讨论三件事:这次画像要影响哪个决策、成功指标是什么、哪些结论必须通过后续实验验证。
会议结束后,把争议点写入任务清单,而不是在报告评审时临时争论。例如,商品团队曾认为“低价用户”是核心增量人群,但运营发现该人群的优惠点击率高,支付后的退款率也高。最终团队把目标改成“价格敏感但对基础功能满意、退款率低于店铺均值的人群”,并由运营做分层优惠测试。
画像因此从一份描述性报告,变成了团队共同执行的决策工具。
我以前看到过不少画像报告,内容很丰富:女性占比多少、哪个城市最多、年龄集中在哪个区间,但这些信息很难直接帮助我改商品。真正让我困惑的是,应该按照什么维度分群,才能发现用户为什么买、为什么不买,以及不同人群需要什么产品方案。
我的经验是,人群画像不能从“平台提供了哪些标签”开始,而应该从“用户在购买链路上做了什么”开始。年龄和地域适合做描述,不适合直接做策略;购买频次、客单价、品类偏好、优惠依赖度和退款行为,通常更接近商品决策。
我在一个厨房小家电项目中用过四层分群法:先按是否成交区分,再按价值区分,然后看购买动机代理指标,最后叠加渠道和生命周期。这样得到的不是一个笼统的“25,34岁女性”,而是可以行动的用户组。
人群识别规则示例观察到的行为对应动作 高价值复购人群90天内购买2次以上,客单价高于均值更关注组合方案和售后便利开发补充装或套装 高意向未成交人群加购或收藏,但14天内未支付反复查看规格和评价补充对比信息与场景内容 优惠驱动人群使用优惠券成交占比高于70%促销期转化明显,平时沉默控制优惠成本,测试阶梯权益 低质量流量人群访问高但停留短、退款率偏高被素材吸引但预期不匹配调整投放承诺和详情页首屏 我会要求每个分群同时满足三个条件:规模不能小到无法执行,行为差异要达到可观察程度,且必须能对应一个商品、内容或渠道动作。
实践中,我通常把单个核心分群的最低规模设为有效成交用户的5%,否则容易被偶然波动牵着走。还要特别防止“标签堆砌”。一次测试里,团队加入了十多个属性维度,最终生成了三十多个细分群,转化差异却没有稳定超过10%。删减到四个行为型人群后,商品和运营都能明确行动。
我的判断是,好的画像不是把用户描述得更细,而是把不同用户之间真正影响决策的差异找出来。
我以前把画像报告交付出去,就默认项目完成了,后来发现投放数据上涨并不代表画像有效。现在我想知道,应该用哪些指标验证画像是否帮助了商品决策,复盘周期多长比较合适,怎样区分真实效果和大促、季节等外部因素造成的波动。
我复盘画像项目时,不会只看点击率或单次成交额,而是把验证分成“画像准确性、动作执行度、业务结果”三层。因为一个人群可能很容易被触达,却没有利润;也可能短期转化一般,但复购和退款表现更好。在一次新品测试中,我们先根据画像筛出一组目标用户,再设置相似但未重点触达的对照组。
测试持续21天,期间不更换核心素材和优惠规则,避免把多个变量同时改变。
复盘层级核心指标判断标准示例 画像准确性目标人群占比、行为差异、标签稳定性目标组转化率至少连续两周高于对照组 动作执行度商品改版完成率、素材采用率、触达覆盖率关键动作完成率达到80%以上 业务结果支付转化率、毛利、退款率、复购率不能只看成交额,至少同时看利润和退款 那次测试中,目标组支付转化率从3.1%提升到4.4%,看起来增长明显,但优惠成本增加后,单笔毛利只提升了6%。
继续拆分后发现,真正贡献利润的是高复购倾向人群,而不是所有高点击用户。于是我们停止对低价值人群加大优惠,把预算转向复购潜力更高的细分组。复盘周期要跟业务周期匹配:快消类目可以按7天、14天、30天观察,耐用品则应增加考虑周期和售后周期。
我的建议是每次复盘都保留三份记录:原始假设、实际数据、下一步动作。如果只保存最终报告,团队很快就会忘记当初为什么这样分群,也无法判断是画像错了,还是执行过程出了问题。
最终,画像有效的标志不是报告写得漂亮,而是团队能在复盘后明确回答三个问题:哪类人群值得继续投入,哪类人群需要改变商品方案,哪条结论应该被撤销。能推动预算、商品和内容发生调整,才算真正完成了从准备到复盘的闭环。


读者评论
文章把人群画像和商品决策联系起来,这一点比较实用。尤其是用“人群、场景、任务”替代单纯标签,能避免团队只停留在年龄和城市等表层数据上。
数据口径和观察窗口部分值得参考。访客、支付、退款如果分母不一致,确实很容易导致团队得出相反结论,实际复盘时需要提前统一定义。
文中对模拟数据和行业数据的边界说明比较严谨,避免把项目案例误读成行业统计。不过部分分群模型仍需结合具体类目验证,不能直接套用。
高转化人群不一定是核心人群”的判断比较客观。除了转化率,还要看规模、获客成本和扩量后的表现,这对新品测试尤其重要。
文章覆盖了准备、清洗、分群到复盘的完整流程,但内容较多。团队落地时最好先围绕一个明确商品问题做小范围验证,再逐步扩展。