电商数据抓取最容易犯的错误,不是少抓了几个商品,而是把一张看起来完整的商品表,当成了可以直接用于选品的事实。品牌团队曾经拿着几千条商品记录讨论“哪个价格带更有机会”,最后才发现:同款商品被重复统计,活动价和日常价混在一起,累计销量与月销量没有区分,评价数甚至来自不同统计口径。选品研究的第一步不是抓更多数据,而是先证明数据值得被比较。
我判断一份电商数据是否具备分析价值,通常不会先看记录条数,而会先看四件事:是否完整、是否统一、是否合理、是否可追溯。这四个条件分别对应数据质量中的完整性、一致性、准确性和时效性。
完整性解决的是“关键字段有没有”;一致性解决的是“不同商品和平台能不能放在一起比较”;合理性解决的是“字段值是否可信”;可追溯性解决的是“出现争议时能不能回到原页面复核”。
例如,500条商品记录中有商品名称、图片、价格和链接,并不代表它适合做选品研究。如果其中80条没有抓取时间,60条没有规格信息,40条是同款不同链接,销量字段又同时存在“月销”“累计销量”和“已售”等表达,那么这张表更像商品目录,而不是决策数据。
“抓取某个品类的商品数据”不是一个完整任务。真正可执行的任务应该是:“判断某个价格带是否存在新品牌切入空间”“分析竞品差评集中在哪些功能”“比较不同规格的市场供给”“观察某个细分需求是否持续出现”。
问题不同,字段就不同。研究价格带,需要价格、促销方式、规格、品牌和商品数量;研究用户痛点,需要评价文本、问答、差评标签和使用场景;研究市场进入难度,则要关注品牌集中度、头部商品占比、同款重复率和店铺结构。
如果没有先定义决策问题,团队往往会陷入“能抓什么就抓什么”。这种做法短期看起来效率很高,长期却会产生大量无法解释的字段,增加清洗成本,也让分析人员误以为数据越多结论越可靠。
很多团队把校验放在报表输出之前,实际上已经太晚。数据一旦被多人复制、清洗、合并和导入分析工具,错误会沿着流程扩散,最后很难判断问题来自页面、采集、转换还是人工处理。
更稳妥的顺序是:先定义选品问题,再设计字段;完成小样本采集后先做质量检查;确认口径可用后再扩大采集范围;最终才进入看板、评分模型或选品会议。
| 阶段 | 要回答的问题 | 不通过时的处理 |
|---|---|---|
| 问题定义 | 这批数据要支持什么决策 | 重新明确品类、价格带或用户问题 |
| 字段设计 | 每个字段是否服务于决策 | 删除无关字段,补充关键字段 |
| 小样本测试 | 字段能否稳定获取和解释 | 调整采集规则和字段说明 |
| 质量校验 | 数据能否比较、复核和更新 | 标记异常、统一口径或暂停扩采 |
| 业务分析 | 数据是否能形成有限结论 | 降低结论强度,增加人工验证 |

品牌负责人通常最了解产品定位、供应链能力和目标人群,这是选品不可替代的经验。但经验容易受到成功案例、个人偏好和近期热门内容影响。一个品类在社交平台上频繁出现,不代表它适合当前品牌进入;一个商品销量很高,也不代表新品牌能够复制它的供应链和投放能力。
数据的作用不是替代经验,而是把经验变成可以检验的假设。比如团队认为“消费者愿意为更轻的材质支付溢价”,就需要观察不同重量、材质、价格带商品的供给情况,并从评价和问答中寻找对便携性、耐用性和价格的真实反馈。
如果数据不能支持或否定这个假设,它就只能算作观察材料,不能直接升级成产品立项结论。
单个爆款通常同时具备品牌认知、内容投放、渠道资源、评价积累和供应链优势。品牌商家如果只抓取爆款商品名称和销量,很容易把“头部商家的综合能力”误判成“品类本身的普遍需求”。
我更关注爆款周围的结构:同类商品是否大量跟随、价格是否高度集中、用户差评是否重复出现、头部品牌是否占据大部分评价和曝光,以及中腰部商品有没有稳定的成交迹象。
真正适合新品牌研究的,不一定是销量最高的商品,而可能是需求明确、竞争尚未完全锁死、用户不满可以被产品能力解决的细分空间。
选品研究往往需要同时查看商品详情、价格、评价、店铺、规格、上新时间和促销状态。人工浏览适合深度理解少量商品,但不适合持续追踪数百个竞品。规范化抓取的价值,在于把这些分散页面转换成具有统一字段和时间标签的观察样本。
这里要特别区分“自动化采集”和“自动化判断”。采集可以减少重复录入,判断仍然需要业务人员确认字段含义、识别异常和解释变化。任何把自动抓取直接等同于自动决策的方案,都把最重要的风险留给了结果使用者。
如果团队已经有商品表、竞品监测表或多平台经营数据,可以使用九数云这类数据分析工具将不同来源的数据进行连接、清洗、汇总和可视化。它更适合承担“把数据变成可观察的分析过程”,例如查看价格带分布、品牌集中度、异常记录、评价关键词和时间变化。
但工具不能替团队决定“销量字段到底代表什么”。在把数据接入分析平台之前,仍然要建立字段字典,明确数据来源、抓取时间、统计周期、单位和清洗规则。否则,图表越漂亮,错误结论越容易被接受。
商品身份字段是后续去重、合并和追溯的基础。至少应考虑商品标题、商品链接、平台、店铺名称、品牌、一级类目、二级类目、规格和商品状态。
其中,商品链接不能简单视为唯一身份。一个商品可能因为搜索入口、活动页、直播页或不同规格产生多个链接;同一链接也可能在不同时间对应不同价格和库存状态。因此,建议将“商品身份”和“商品快照”分开处理。
商品身份描述“它是谁”,商品快照描述“在某个时间点看到了什么”。价格、销量展示值、库存状态和促销标签通常属于快照字段,不应直接覆盖历史值。
“价格”是选品表中最容易被误用的字段。详情页可能同时出现标价、活动价、券前价、券后价、会员价、直播间价和多件优惠价。若只抓取页面上最醒目的数字,分析人员很难判断它代表消费者长期可获得的价格,还是特定活动下的短时价格。
我通常会至少保留原始价格文本、标价、当前展示价、优惠类型、到手价、价格抓取时间和促销状态。对于无法确认口径的价格,不建议强行填入“日常价格”,而应标记为“口径不明”。
| 价格字段 | 适合回答的问题 | 主要风险 |
|---|---|---|
| 标价 | 品牌对商品的名义定价如何 | 可能长期不成交,不能代表真实支付价格 |
| 活动价 | 大促期间的价格竞争如何 | 容易受活动周期影响,不能直接当常态价格 |
| 券后价 | 消费者在特定优惠条件下的支付门槛 | 不同用户获得优惠的条件可能不同 |
| 规格单价 | 不同容量、重量或件数的真实价格差异 | 需要统一计量单位,否则比较会失真 |
| 历史价格 | 价格是否长期稳定或频繁波动 | 必须记录采集时间和促销背景 |
“已售10万+”通常只是页面展示信息,不应未经确认就解释为某个自然月的销量。累计销量、近30天销量、月销、支付人数、件数和商品评价数,可能分别对应不同业务含义。
评价数量也不能直接除以销量后当成真实转化率。评价存在延迟、追评、合并评价和平台展示规则差异,销量与评价未必处于同一统计周期。这个比值可以作为观察信号,但不应包装成准确的购买评价率。
字段字典至少要写明五项内容:字段名称、原始表达、标准化方式、统计周期、可否跨平台比较。没有这五项说明,后续团队成员很容易用同一个字段做出不同解释。

评价文本本身不等于用户洞察。选品研究更关心的是用户为什么满意、为什么不满意,以及这些问题是否能够通过产品设计、包装、说明书或服务解决。
可以将评价和问答拆成几个业务维度:功能表现、尺寸规格、材质质量、使用难度、包装物流、售后服务、价格感知和适用场景。分类时保留原文片段和出现次数,避免只留下一个抽象标签。
例如,“太重”“携带不方便”“收纳麻烦”可能属于同一个便携性问题,但解决方法并不完全相同。前者可能需要改变材料,后两者可能需要重新设计结构。只有保留具体语境,产品团队才能将数据转化为方案。
价格为空、销量为空和销量为零不是一回事。价格为空可能是页面未加载、规格未选择、商品下架或抓取失败;销量为空可能是平台不展示,也可能是字段解析错误。直接填零会把“未知”伪装成“没有”,从而影响价格分布和需求判断。
我会给缺失字段增加状态,而不是只保留一个数值。例如:原始缺失、页面不展示、抓取失败、商品不适用、人工确认无值。这样在汇总时,可以决定哪些记录排除,哪些记录作为单独分组。
重复数据通常有三种层级。第一种是完全重复,商品链接和字段都一致;第二种是入口重复,同一商品从不同页面被采集;第三种是同款重复,不同店铺或不同标题销售相同或高度相似的产品。
如果选品研究的目标是统计供给数量,第三种重复必须谨慎处理;如果目标是研究消费者可见的竞争选择,则同款不同店铺又可能需要保留。去重不是技术动作,而是业务口径选择。
一个实用做法是设置两个数量:商品记录数和独立商品簇数量。前者反映消费者看到的供给入口,后者反映经过相似度判断后的产品集合。会议中必须明确使用哪一个数量。
价格字段可能同时出现“99”“99元”“¥99”“99.00”;销量可能出现“1.2万+”“12000”“约1万”;重量可能出现克、千克和斤。若没有标准化,系统会把同一数值当成多个类别。
标准化时要保留原始值。例如把“1.2万+”转为约12000时,不能删除原始表达,也不能把约数写成精确值。更准确的处理是增加“标准化数值”和“数值精度说明”两个字段。
对于带有“+”的销量,应视为区间或下限,而不是精准销量。若平台只提供模糊值,分析结论应使用“至少”“约”“展示值”等表述。
异常值不一定是错误。一个价格远高于同类商品,可能是高端规格,也可能是把套装价与单件价放在了一起;一个销量特别高,可能是爆款,也可能是历史累计值。删除异常值之前,必须先判断它是业务现象还是采集错误。
我常用中位数、四分位距和分组比较来做第一轮检查。比如在相同类目、规格和平台内,如果某商品价格明显偏离同类区间,就查看原页面的容量、套装数量、优惠条件和商品状态,而不是直接将其判定为错误。

同一个商品在普通工作日、直播活动日和大型促销期间,价格、销量展示和评价增长都可能不同。若把不同时间采集的数据放在同一张表里,不加时间标签地进行横向比较,结论很可能只是活动状态的差异。
至少要记录抓取日期、抓取时段、活动标签、价格状态和数据统计周期。如果研究的是日常定价,应优先使用非活动期样本;如果研究的是大促承接能力,则应单独建立活动期数据集。
时间校验还要防止“新数据覆盖旧数据”。历史快照被覆盖后,团队会失去判断价格波动、上新速度和促销依赖的能力。
不同平台可能使用相似的字段名称,但背后的统计逻辑并不一定相同。商品销量、评价数、店铺粉丝、热度和销售额等指标,都需要确认来源、时间范围和展示规则。
如果无法证明两个平台的字段具有相同定义,最安全的做法是分平台分析,再在结论层进行定性比较。例如可以比较“哪个平台的价格带更集中”“哪个平台的用户反馈更关注售后”,但不要直接将两个平台的销量相加后称为总市场规模。
异常处理日志不需要复杂。记录商品标识、异常类型、发现时间、处理动作、处理人和处理依据即可。比如某条记录因“套装规格未拆分”被移出单件价格分析,就应留下这个原因。
没有日志的数据清洗,往往会变成“谁改过、为什么改、改完影响了什么”都无法回答。对品牌团队来说,这不仅影响本次选品,还会影响下一轮复盘和供应链谈判。
| 校验维度 | 建议指标 | 示意合格线 | 超过合格线后的动作 |
|---|---|---|---|
| 完整性 | 核心字段缺失率 | 不高于10% | 补采、分层使用或降低结论强度 |
| 唯一性 | 疑似重复率 | 不高于8% | 建立商品簇并复核同款关系 |
| 一致性 | 单位未标准化比例 | 不高于3% | 暂停汇总,先统一单位 |
| 时效性 | 无法确认抓取日期的记录占比 | 不高于5% | 不得用于趋势判断 |
| 可追溯性 | 无法回到来源页面的记录占比 | 不高于2% | 移出核心样本或重新采集 |
表中的比例是项目启动时可以采用的建议基准,不是所有品类都适用的行业标准。高频变化品类、强活动品类和跨平台研究,往往需要更严格的时间与口径控制。
下面的案例用于演示流程,数字为情景模拟,不代表任何平台的真实市场统计。假设一家生活方式品牌准备研究便携类家居用品,希望判断两个问题:一是主流价格带是否已经高度拥挤;二是用户对便携性和耐用性的抱怨是否存在产品改进空间。
团队先选取三个平台的公开商品页面作为观察来源,按类目词和功能词采集500条记录。采集字段包括商品名称、品牌、店铺、规格、标价、展示价、销量展示值、评价数量、主要卖点、评价片段、商品链接和抓取时间。
在这个阶段,团队没有先做结论,而是先保留原始数据。原始表和清洗表分开存放,任何标准化都不覆盖原始字段。
500条记录中,有38条缺少价格字段,57条疑似重复,31条商品处于明显活动状态,22条的规格信息不足以判断是单件还是套装,另有一批销量字段使用“万+”等模糊表达。
如果直接计算平均价格,活动价和套装价会把结果拉偏;如果直接统计商品数量,重复链接会夸大供给密度;如果直接按销量排序,累计销量较高的老商品会压过近期上新的商品。
这就是质量校验的价值:它没有立即告诉团队“该不该进入”,但先阻止团队使用一组无法比较的数据做出过早判断。
团队将数据分为A、B、C、D四个等级。A级记录的关键字段完整、来源清楚、规格可识别,适合进入核心分析;B级记录存在少量缺失,但能够用于部分维度;C级记录口径不明,只用于发现线索;D级记录无法追溯或重复严重,不进入核心结论。
| 等级 | 记录数 | 主要特征 | 可支持的判断 |
|---|---|---|---|
| A级 | 318条 | 字段完整、时间清楚、规格可识别 | 价格分布、品牌结构、评价主题 |
| B级 | 44条 | 存在少量缺失或活动状态不完整 | 补充观察,不作为核心比例分母 |
| C级 | 61条 | 销量或评价口径不明 | 发现候选商品和问题线索 |
| D级 | 77条 | 重复严重、链接失效或规格无法确认 | 不进入核心分析,保留处理记录 |
注意,D级并不意味着这些商品不存在,而是说明它们不适合支持当前问题。未来如果研究的是搜索入口数量或页面覆盖率,部分D级记录可能仍有参考价值。
清洗后的A级记录显示,示例品类的供给主要集中在99至159元和159至239元两个区间。低于99元的商品数量不少,但其中一部分是配件、缩小规格或活动价;高于239元的商品数量较少,但品牌故事、材质和售后服务的表达更完整。
这时,团队没有把“商品少的高价带”直接认定为机会。高价供给少,可能意味着竞争不足,也可能意味着消费者对该价格缺少支付意愿。下一步必须结合评价内容、品牌认知和渠道触达成本进行验证。
同样,低价商品密集也不一定意味着无法进入。若用户在低价商品中反复抱怨耐用性、收纳结构或说明不清,而品牌具备相关研发和服务能力,低价带的高密度反而可以帮助团队找到改进方向。

团队对A级商品的评价片段进行人工抽样和主题归类。示例结果显示,“不方便携带”“收纳占空间”“使用步骤复杂”等问题反复出现;同时,“材质扎实”“清洁方便”“说明清楚”成为高频正向反馈。
这些结果不能直接证明某个功能一定能带来销量,但可以帮助产品团队把抽象需求拆成可执行任务。比如“便携性”可以进一步拆成重量、折叠结构、收纳体积和包装方式;“易用性”可以拆成安装步骤、配件数量和说明书清晰度。
更重要的是,评价主题需要与商品规格和价格带交叉查看。低价商品的差评可能集中在耐用性,高价商品的差评可能集中在“价格不值”。同一个词在不同价格带中的产品含义并不相同。

经过清洗和交叉观察,团队可以提出三条有限结论:第一,99至239元是供给较密集的主要区间,不能仅凭价格进入;第二,便携和收纳问题在评价中反复出现,值得做产品原型验证;第三,活动价和套装价对低价带判断影响较大,后续需要增加非活动期采样。
团队不能据此宣布“该品类一定值得进入”,因为仍缺少供应链成本、目标用户访谈、渠道获客成本、复购表现和真实支付意愿等信息。高质量数据的表现,不是让结论变得绝对,而是让结论的边界变得清楚。
无论使用表格、数据库还是九数云这类分析工具,字段字典都应该先于看板存在。字段字典要说明字段名称、数据类型、业务含义、来源、更新时间、清洗方式和使用限制。
例如“商品销量展示值”不能只写成销量。更准确的字段说明应包括:平台页面展示字段、是否累计、是否带模糊符号、抓取日期、是否允许跨平台比较。这样,后续做筛选和汇总时,分析人员不会把它误当成统一的周期销量。
原始层保存页面采集结果,不做覆盖;清洗层负责格式统一、去重、异常标记和字段补全;分析层只使用通过规则的记录,并保留筛选条件。
这种分层可以避免“为了做一个图表而改坏原始数据”。当业务人员质疑某个价格、销量或品牌分类时,可以从分析层回到清洗层,再回到原始页面。
很多选品看板只展示价格分布、销量排序和品牌数量,却不展示样本缺失率、重复率、数据更新时间和口径分布。这会让使用者忽略结论的可靠程度。
我建议在看板顶部增加数据状态区,至少展示当前样本量、核心字段完整率、疑似重复率、最近抓取时间、活动期记录占比和不可比记录数。
| 看板模块 | 业务用途 | 建议展示的质量信息 |
|---|---|---|
| 价格带分布 | 识别竞争集中区间 | 规格可识别率、活动价占比、价格缺失率 |
| 品牌结构 | 观察头部集中度 | 品牌标准化规则、无品牌记录占比 |
| 评价主题 | 发现用户问题 | 有效评价样本量、抓取时间范围、分类规则 |
| 商品趋势 | 观察上新和价格变化 | 快照数量、时间间隔、可比商品数 |
| 异常清单 | 支持人工复核 | 异常类型、商品链接、处理状态和责任人 |
分析工具适合承担格式转换、条件筛选、分组汇总、重复监测和图表刷新。它不适合替代业务人员判断商品是否为同款、促销价是否具有代表性、评价问题能否通过产品改进解决。
在九数云中搭建选品分析时,可以将价格带、品牌、店铺和评价主题做成可联动的视图,再把异常商品清单作为独立模块保留。使用者点击某个价格区间时,不只看到商品数量,还能看到该区间的缺失率、活动价占比和评价样本量。
这样做的目的不是让图表更复杂,而是让每个业务结论都带着它的证据条件。一个价格带如果只有少量有效记录,就不应该与另一个样本充分的价格带使用同样的结论强度。

不要一开始就追求大规模自动化。建议先选取50至100条商品记录,覆盖不同品牌、价格带、规格和店铺类型,人工检查字段是否能回答原始问题。
这个阶段的重点是发现字段设计错误。例如团队原本想研究“单件价格”,采集后才发现多数商品以套装销售;或者想比较月销量,却发现页面只有累计展示值。小样本测试可以在低成本下暴露这些问题。
取舍在于速度和准确性之间。小样本不适合证明市场规模,却适合验证研究方法。宁可用三天确认字段,也不要用三周采集后才发现数据无法比较。
应优先建立商品身份和历史快照,而不是每次重新生成一张孤立的商品表。每次抓取都记录时间、展示价、优惠状态、库存状态和页面链接。
如果只保留当前价格,团队只能看到“现在卖多少钱”,无法判断价格是否长期稳定、是否依赖大促、是否频繁调整。历史快照的价值在于支持变化解释。
取舍在于存储和维护成本增加,但换来更可靠的趋势判断。对于价格变化快、活动频繁的品类,这个成本通常值得;对于低频更新、价格稳定的工业品类,可以降低采集频率。
不要只按好评率或差评率排序。应建立评价主题分类,并抽取代表性原文,区分产品问题、物流问题、售后问题和预期落差。
如果用户抱怨“太小”,还要确认是商品尺寸小、页面描述不清,还是用户购买了不适合自己的规格。只有完成场景区分,产品团队才知道应该改产品、改页面还是改推荐逻辑。
取舍在于人工阅读成本较高,但它比单纯依赖关键词频次更接近真实问题。可以先用关键词做初筛,再对高频主题和高影响商品进行人工复核。
不要急于合并所有销量和评价字段。先建立平台口径表,标记每个平台的字段定义、统计周期、展示方式和更新频率。
能够统一的字段再合并,不能统一的字段分平台展示。跨平台比较可以先从价格区间、商品卖点、规格结构和评价主题开始,这些维度通常比直接加总销量更容易解释。
取舍在于分析结果可能不如“总销量排名”直观,但可信度更高。对品牌进入决策来说,可解释的差异通常比一个无法核验的总数更有价值。
可以进一步建立数据质量评分、异常阈值、版本管理和自动化监测。每次数据更新后,系统自动检查核心字段缺失率、重复率、价格异常率和数据延迟。
但不要因为有技术能力,就把所有字段都纳入模型。字段越多,维护和解释成本越高。应根据决策价值确定字段优先级,优先保证影响选品结论的字段稳定。
可以先用表格加人工规则完成最小闭环:商品链接、品牌、规格、价格、抓取时间、评价主题和异常备注。等业务问题稳定后,再引入自动化抓取和可视化分析。
预算有限不意味着可以忽略质量,只是把自动化程度降低。最不能省的是来源、时间、原始值和异常处理记录,因为这些字段决定后续是否能够复盘。

开展电商数据抓取前,应查看目标平台的服务条款、开放接口说明、账号权限和访问规则。不同平台、不同页面和不同账号状态,可能适用不同的使用条件。
本文不对某一种采集方式作“完全合法”或“可以无限制使用”的判断。具体行为是否合规,需要结合数据来源、访问方式、采集规模、使用目的和适用法律进行评估。
品牌选品通常需要商品、价格、规格、店铺和公开评价等信息,不需要收集与业务无关的个人联系方式、身份信息或其他敏感内容。
最小化采集不仅能降低隐私和合规风险,也能减少字段清洗成本。一个与决策无关的字段,即使抓取得到,也可能成为后续存储、共享和公开发布的风险来源。
自动化采集应遵守适用的平台规则,控制访问频率、并发量和任务范围。不要把高频、大规模访问描述为默认可行的操作方式,也不要为了追求数量而持续重复请求同一页面。
如果平台提供正式接口或授权数据服务,应优先评估其字段覆盖、更新频率、费用和使用范围。商业采购并不自动解决所有问题,但通常更容易获得明确的权限边界和服务说明。
公开可见不等于可以随意复制、公开展示或商业再利用。商品图片、评价文本、页面结构和经过整理的数据集合,可能涉及不同的知识产权或平台权益。
内部研究、对外发布和商业产品化的使用边界并不相同。若需要将原始评价、商品图片或大规模数据对外传播,建议进行专业审核,并优先使用必要的摘要、统计结果或经授权内容。
建议为每个采集任务记录数据来源、访问方式、使用目的、字段范围、保留期限和共享范围。这样可以在团队内部形成基本的责任边界,也方便后续复核项目是否发生了用途变化。
选品数据的质量不只有数值质量,也包括来源质量和使用质量。来源不明、用途不清的数据,即使统计结果看起来漂亮,也不适合成为品牌长期决策资产。
任务说明不需要写成长文,但应明确研究对象、决策问题、数据来源、时间范围、核心字段、排除规则和输出形式。它的作用是防止采集过程中不断增加无关字段,导致目标漂移。
例如,任务可以写成:“观察某细分品类在非大促期间的价格结构和用户对收纳便利性的反馈,重点比较单件规格,排除配件和无法确认规格的套装商品。”这比“抓取该品类所有商品”更容易执行和复核。
质量快照可以记录本次更新的总记录数、有效记录数、缺失率、重复率、异常率、活动期占比和无法追溯记录数。连续几次更新后,团队就能看到数据质量是否稳定。
如果商品数量突然增加,但有效记录没有增加,说明可能是搜索入口扩展、重复采集或页面结构变化,而不一定是市场供给增长。
数据团队擅长处理格式和结构,商品团队更了解规格、套装、促销和同款关系。去重规则、异常规则和价格归一化规则,最好由双方共同确认。
例如,技术上可以把同一标题的多个颜色视为重复,但商品团队可能认为颜色是消费者独立选择的重要维度。规则如果没有业务参与,数据会“处理得很干净”,却失去实际意义。
如果一次选品结果不理想,不要只归因于市场变化或执行问题,也要回看当时的数据字段是否遗漏了关键条件。比如没有记录渠道费用、交付周期、规格差异或活动依赖,模型自然无法解释后续表现。
好的数据体系会随着项目复盘不断增加有效字段、删除无效字段,并明确哪些指标只是线索、哪些指标可以支撑决策。它不是一次性建表,而是一个逐步校准的业务系统。

第一步,写清楚本轮选品要支持的一个决策,不要同时研究市场规模、价格、用户痛点和渠道机会。第二步,设计最小字段集,优先保证商品身份、价格、规格、时间、来源和用户反馈可追溯。
第三步,先采集50至100条小样本,检查缺失、重复、单位、异常、时间和口径。第四步,为记录建立A、B、C、D可用等级,不要把所有数据强行放入同一个统计口径。
第五步,再根据验证结果扩大采集范围,并将清洗层、分析层和原始层分开管理。需要可视化时,可以将规范化数据接入九数云等分析工具,让价格带、品牌结构、评价主题和异常状态在同一观察框架中呈现。
第六步,在选品会议中同时展示结论和限制条件。比如说明样本来自哪些平台、是否包含活动期、多少记录无法确认销量口径、哪些结论只适用于当前时间窗口。
不要问“抓了多少条”,先问“有多少条能被解释”。
不要把累计销量当成近期需求,不要把评价数当成真实订单,不要把活动价当成长期价格,不要把同款链接当成独立商品,也不要把一个爆款当成整个市场。
电商数据抓取的真正价值,不是把网页内容搬到表格里,而是把分散、变化、口径复杂的信息,整理成能够被比较、被复核、被持续更新的决策证据。
品牌商家如果只能记住一个动作,那就是:在扩大采集规模之前,先用一小批数据完成质量校验;在宣布市场机会之前,先把数据的来源、时间和适用边界写清楚。这一步看起来会让选品变慢,却能显著减少后续返工、误判和错误投入。
我刚开始做选品研究时,以为抓取的商品越多,结论就越可靠。后来整理了几百条竞品数据,才发现里面有重复商品、缺失价格、促销价混入日常价等问题。到底应该按照什么顺序检查,才能判断一份数据是否真的能用于选品?
我的经验是,先不要急着看销量排名,而要先检查数据是否具备“可比较、可追溯、可解释”这三个条件。选品数据最容易踩的坑,不是抓不到数据,而是抓到的数据看起来完整,实际却无法放在同一个口径下比较。
我通常会按以下顺序做初检: 检查项目重点问题处理方式 完整性价格、链接、类目、品牌、抓取时间是否缺失标记缺失,不要直接用0填充 唯一性同一商品是否因不同入口被重复记录按链接、店铺、规格组合去重 格式价格、销量、日期和规格单位是否统一统一单位后再计算 时间性数据是否采集于大促、直播或优惠券期间保留抓取时间并单独分组 可追溯性能否回到原商品页面核对字段含义保留来源链接和采集批次 有一个判断标准很实用:如果团队成员无法根据原链接复核一条记录,这条数据就不应该直接进入核心分析。
数据量可以少一些,但每条记录的来源、时间和字段含义必须说得清楚。我还建议给数据做等级标记。字段完整、时间明确、口径统一的数据可以标为A级;有少量缺失但能补采的数据标为B级;来源或指标定义不清的数据只能作为参考;无法追溯或重复严重的数据直接排除。这样比简单地把所有数据混在一张表里更不容易误导选品判断。
我在整理竞品表时遇到过一个很奇怪的现象:明明只研究了一个细分类目,最后却出现了上千个商品。仔细看才发现,同一款商品因为不同规格、不同活动入口和不同链接被重复统计了。只按商品标题去重不可靠,还有没有更稳妥的方法?
同款去重是选品数据里最容易被低估的一步。重复记录会直接抬高某个品牌、某个价格带甚至整个细分类目的商品数量,让你误以为市场竞争比实际更激烈,或者误判某个卖点非常普遍。我做清洗时不会只用商品标题作为唯一键,因为标题经常包含促销词、规格词和营销词。
同一商品可能出现“便携款”“升级款”“活动款”等不同标题,但核心商品并没有变化;反过来,同一个标题也可能对应不同容量或不同包装数量。更稳妥的做法是分三层判断: 第一层是精确去重。优先使用商品链接、平台商品编号或店铺内部商品编号。
如果链接完全相同,通常可以直接保留一条主记录,并把不同抓取时间作为历史记录保存。第二层是组合字段去重。对链接不同但疑似同款的记录,组合比较品牌、店铺、商品名称、规格、包装数量和主要图片信息。品牌相同、店铺相同、规格一致、标题主体高度相似时,可以列入疑似重复清单。第三层是人工复核。
对销量高、价格异常或会影响最终结论的记录,我不会完全依赖自动规则,而是打开原页面确认。一次清洗中,我曾把57条记录标为疑似重复,人工检查后合并了41条,剩下的16条其实是不同容量或不同套装,不能简单删除。
情况是否合并原因 同链接、同规格合并通常是重复采集 同款不同抓取时间保留历史,不重复计商品数可用于观察价格变化 同标题不同容量不直接合并规格可能影响价格和需求 同品牌同图片但不同店铺人工复核可能是分销、授权店或仿款 我的判断是:去重的目标不是让表格看起来更干净,而是让“商品数”“品牌数”和“竞争密度”更接近真实商业对象。
删除前一定要记录合并规则,否则后续复盘时很难解释为什么原始数据和分析数据不一致。
我以前做竞品分析时,习惯把商品页面上的价格和销量直接复制到表格里,再按销量排序。后来发现有的价格是券后价,有的是日常价;有的销量是累计值,有的销量展示方式也不同。品牌商家应该怎样避免被这些表面数据带偏?
价格、销量和评价数不能直接横向比较,核心原因不是数据一定错误,而是它们经常代表不同的统计口径。把不同口径的数据放进同一列计算,结果会非常精确,却未必有意义。价格至少要拆成标价、活动价、券后价和实际观察到的支付价。一次竞品采集里,我发现同一商品页面同时出现原价、促销价和会员价。
如果只保留最低价格,就会把一次性活动优惠误判成该品类的常态价格。我通常会增加三个字段:价格类型、抓取时间和是否处于活动期。分析价格带时,优先使用同一时间窗口、同一价格类型的数据;如果无法统一,就分别计算,而不是强行合并。销量也要特别谨慎。
页面上的销量可能是累计销量、近期销量、已售数量或平台展示的区间值。它们不能简单地当成月销量,更不能拿一个平台的累计值和另一个平台的周期值比较。
字段常见误读更稳妥的做法 价格把券后价当作长期售价记录价格类型和活动状态 销量把累计销量当作月销量记录原始展示口径和采集日期 评价数直接等同于订单数只作为用户反馈规模的参考 热度直接等同于销售额确认平台定义后再使用 评价数也不能直接等同于销量。
不同平台的评价机制、追评规则和展示方式可能不同,评价数量更适合用来观察反馈规模和内容趋势,而不是倒推出真实转化率。我的建议是,先把“能比较的数据”筛出来,再做均值、中位数或价格带统计。对于口径不明的数据,保留原值并标记为参考数据,宁可缩小样本,也不要为了得到一个漂亮的结论而混算。
我已经能抓取商品名称、价格、销量和评价,但最后还是不知道该不该进入某个品类。很多教程只讲如何收集数据,却没有说明清洗完成后应该怎样做判断。品牌商家如何避免把“热销”误认为“适合自己进入”?
质量校验完成后,数据的价值不是告诉你“哪个商品销量最高”,而是帮助你判断:这个市场是否有可进入的空间、用户到底在抱怨什么,以及你的供应链能力能否解决这些问题。我会把选品判断拆成四个问题。第一,需求是否真实且持续。不能只看一次热榜,而要观察多个时间点的价格、商品数量和用户反馈。
如果某个商品只在大促期间表现突出,就不能直接当作稳定需求。第二,竞争是否集中。一个品类销量高,不代表新品牌有机会。如果头部品牌占据绝大多数评价和内容曝光,进入门槛可能比商品数量显示的更高。相反,销量中等但卖点分散、用户差评集中在某个可改进环节的品类,反而值得进一步研究。
第三,用户是否存在明确未满足需求。我会把评价和问答中的问题按主题归类,例如尺寸、耐用性、便携性、包装、售后或使用门槛。只有当某类问题在多个商品、多个时间点反复出现,才值得把它作为产品改进假设。第四,机会是否匹配品牌能力。数据只能证明市场存在某种需求,不能证明你的工厂、成本、交付和渠道能够满足它。
比如某价格带销量高,但如果该价格已经低于你的合理成本,就不应因为热销而贸然进入。
观察结果可能结论下一步行动 销量高但促销依赖明显需求可能存在,价格敏感度也高核算成本并观察非活动期表现 评价多且差评集中在同一功能存在可验证的改进机会做用户访谈和样品测试 商品数量多但品牌分散竞争存在,头部集中度可能较低进一步分析细分价格带 数据来源和时间不一致结论可信度不足统一采集窗口后再分析 我通常不会用单一指标做最终决策,而是建立一个简单的四项评分表:需求信号、竞争密度、用户痛点和品牌匹配度,每项单独打分并写明证据。
若某个品类只有销量分数高,其他三项都缺乏支持,我会把它列为“继续验证”,而不是直接列为“值得进入”。最后要注意数据采集的合规边界。使用前应确认平台规则、数据来源权限、访问频率以及个人信息和内容使用范围。抓取到数据,不等于可以无限制保存、公开或商业化使用。


读者评论
文章把选品数据的核心从“抓得多”转向“能不能比较和复核”,这一点很实用。尤其是区分商品身份与商品快照,能避免历史价格和促销信息被覆盖。
对销量、评价数不能直接混用的提醒比较到位。很多分析确实会把累计销量当近期需求,文章建议建立字段字典,适合团队协作时统一口径。
缺失值不应简单填零这个细节很重要。将页面未展示、抓取失败和确实为零区分开,能减少价格带和需求判断被异常数据带偏。
文章对去重的讨论比较客观,同款不同店铺是否保留取决于研究目标。商品记录数和独立商品簇数量并行统计,确实更方便解释供给规模。
内容更偏方法论,适合刚开始做竞品研究的品牌团队。若能补充不同平台字段差异和实际清洗案例,读者会更容易直接落地。