ERP 去重后,客户记录少了,不等于增长策略有效;转化率升了,也不一定是渠道变好了。真正能支持决策的复盘,必须把三件事拆开:重复数据怎么识别、指标口径有没有改变、业务结果能否归因到增长动作。否则,团队很容易把“账面变干净”当成“增长有成效”,继续加预算,最后只是放大了错误结论。
ERP 里的重复记录,通常不是简单的“同一行数据被录了两遍”。同一家公司可能有多个联系人、多个直营网点、多个业务主体;同一个人也可能先以线索进入系统,后以客户身份建档。如果不先定义统计对象,直接按名称或手机号删记录,可能把真实业务关系误当成重复。
因此,我会先问清楚:我们要数的是客户主体、联系人、商机、订单,还是录入记录?去重后的数字必须对应一个明确业务实体。比如“客户数”按统一社会信用代码或经过核验的企业主体统计,“联系人”则按个人联系方式及其归属关系统计,两者不能共用一个去重规则。
假设某月去重后客户数下降 12%,销售线索转化率从 8% 上升到 10%。这两个变化本身只能说明:数据记录被重新整理,且按当前口径计算出的转化率提高了。它们不能单独证明某个投放渠道、营销活动或销售话术带来了增长。
去重是测量条件,策略验证是因果判断。前者回答“我们是否在数同一类对象”,后者回答“如果没有这项策略,结果是否会不同”。两者相关,但不是同一件事。
三套口径只要有一套在前后对比中发生变化,就应暂停直接下结论。先解释口径差异,再讨论业务表现,通常比先做漂亮的趋势图更重要。

企业客户数据常由多个入口进入:官网表单、销售手工录入、展会名单、代理商导入、客服工单、财务或订单系统同步。每个入口的字段习惯不同:公司名称可能带地区简称,手机号可能有国家码,联系人可能使用私人邮箱,渠道字段也可能填活动名称、平台名称或销售自定义文本。
这些差异经常被误解为“录入人员不认真”。实际排查时,问题通常不只在录入端,还可能来自系统边界、导入模板和业务流程。例如,市场团队按线索管理潜在客户,销售团队为了跟进又新建一条客户档案;如果系统没有明确的转化或关联动作,同一实体就可能以不同业务身份重复出现。
集团客户、连锁门店、经销商体系以及跨区域经营企业,天然存在母子公司、分支机构和品牌名称差异。若用公司名称相似度自动合并,可能把不同纳税主体并成一个客户;若只看手机号,公用总机、前台号码和销售代录号码又可能造成误判。
我判断一条记录是否应该合并时,不会只问“像不像”,还会问“合并后会不会破坏业务关系”。例如两家企业名称相似,但统一社会信用代码不同,往往应保留为独立主体;同一客户有不同联系人,则更适合把联系人挂到同一主体,而不是删除其中一条。
如果同一客户从广告线索、活动名单和销售导入三个入口重复出现,团队可能把一个客户当成三条新增线索。预算复盘时,渠道新增量被高估;销售跟进时,客户可能被多人重复联系;转化率计算时,分母和分子也可能来自不同实体口径。
但反方向的风险同样存在:过度合并可能把多个真实客户压成一个,低估渠道覆盖范围,甚至让某些销售团队的有效贡献消失。因此,去重项目的目标不能只有“减少重复数”,还要同时追踪误合并、漏合并和业务归属变化。
在动系统规则之前,我建议先抽取一段时间的数据,按来源、对象类型、关键字段完整度和疑似重复类型做分层盘点。抽样不是为了追求统计学上的复杂,而是为了弄清楚重复主要发生在哪里:导入批次、销售录入、渠道回传,还是系统间同步。
如果问题集中在某一个导入模板,先修模板可能比部署复杂的模糊匹配更有效;如果重复跨多个渠道持续发生,才需要考虑统一主数据、重复提示和人工复核队列。自动化应当接在业务规则之后,而不是替业务定义规则。
| 重复来源 | 常见表象 | 优先核查项 | 适合的处理方式 |
|---|---|---|---|
| 表格批量导入 | 同批次多行名称近似,字段格式不一 | 模板版本、导入日期、字段映射 | 先校正模板,再按批次预检和抽样 |
| 多渠道线索 | 同一客户在活动、官网、销售导入中多次出现 | 来源标签、首次触达时间、客户主体键 | 保留来源明细,合并主体,不抹掉触点 |
| 销售手工新建 | 客户已存在,但新档案缺少关联 | 搜索习惯、必填字段、权限和提示 | 改善录入前检索与重复提醒 |
| 系统同步 | 字段覆盖、状态回写或记录重复创建 | 同步键、接口重试逻辑、主从系统关系 | 核对接口唯一键及失败重放机制 |

名称相似度适合做候选提示,不适合在所有业务场景下直接作为合并依据。“华东某某科技有限公司”和“某某科技(华东)有限公司”可能是同一主体,也可能分别是母公司和区域公司。名称里带“集团”“分公司”“门店”等字样时,更需要业务关系字段辅助判断。
更稳妥的设计是把匹配结果分成高、中、低置信度。高置信度记录仍保留审计和撤销能力;中置信度进入人工复核;低置信度只标记为潜在关联,不自动改写主数据。阈值需要基于本企业样本校准,不能照搬其他团队的设置。
手机号可能是个人联系方式,也可能是企业总机、门店电话、代办人员号码或销售填写的临时联系方式。把手机号设为全局唯一键,可能导致多家企业被合并;把手机号当作完全无效字段,又会错过有价值的匹配信号。
我通常把字段分成“强标识”“辅助标识”和“业务属性”。强标识必须有明确适用对象,例如企业主体的统一社会信用代码;辅助标识用于生成候选,例如标准化后的电话、邮箱或地址;业务属性用于解释归属,例如渠道来源、客户等级、区域和销售负责人。字段强弱必须结合实体类型判断。
重复数下降可能来自正确合并,也可能来自误删、漏导入、筛选条件变化或统计范围缩小。只报“清理了多少条”无法说明数据质量变好。至少应同时报告合并后主体数量、待复核数量、撤销数量、抽样误合并率和漏合并率。
如果团队不记录合并前后的关系,后续就难以判断一条订单、一段沟通记录或一个渠道触点原本属于哪个客户。去重不是把旧信息抹掉,而是重新建立它们之间的归属关系。
转化率的分母一旦因去重减少,比例就可能机械性上升。举例来说,成交数不变,线索数减少,转化率自然会提高;这只说明计算结果变化,并不能说明新增了成交,也不代表线索质量真的改善。
增长复盘应把“新增实体数”“有效线索数”“商机数”“成交数”和“收入或毛利”分开看。若增长策略只让重复触达增加,却没有带来新增客户或更高质量的商机,那么表面的线索增长不应被当作成功。
一次性清洗全部历史数据听起来彻底,实际风险也高:规则不成熟时,错误会批量扩散;业务部门无法及时核验大量合并;历史口径变更还可能让旧报表与新报表无法衔接。
更可控的方式是按对象、来源和风险分批处理。先用一小批历史记录验证规则,再选择一个业务团队或渠道试运行,确认误合并与漏合并在可接受范围内后,逐步扩大范围。处理过程要保留版本、执行时间和回滚依据。

先为每个数据对象写一句业务定义,例如:“客户主体指具有独立交易或合同关系的组织;联系人指可被识别的自然人;线索指尚未完成销售资格确认的潜在业务机会。”定义不需要写得像技术规范,但必须让市场、销售、财务和数据团队理解一致。
如果集团与子公司分别签约、开票或履约,客户主体可能需要按法人主体管理;如果销售运营更关心集团层面的整体机会,可以另设集团归属字段。不要为了报表方便把两层关系压成一层。
规则最好写成可检查的条件,而不是“系统智能判断”。例如:统一社会信用代码完全相同,且记录对象均为企业主体时,生成高置信度匹配候选;标准化名称相似、地址相近但缺少强标识时,进入人工复核;只有电话相同而企业名称不同,则不自动合并。
标准化包括去除首尾空格、统一大小写、处理全半角、电话格式归一、常见后缀规范等。标准化不能擅自改变原始值,建议同时保留原始字段和规范化字段,便于回溯输入问题与匹配依据。
去重流程至少要回答四个问题:哪些记录会进入候选队列;由谁确认;确认后保留哪个主记录;发现错误后如何撤销。系统能否支持合并、关联、日志和回滚,要按实际版本及配置核实,不能假设所有 ERP 都具备同样的功能。
主记录选择也不应简单采用“创建时间最早”或“字段最多”。可以按业务规则综合考虑主体标识是否可靠、联系方式是否已验证、交易记录是否完整、当前负责人是否明确。被合并的旧记录应保留来源和关联关系,而不是直接删除。
增长评估开始前,先登记指标定义:分子、分母、对象、时间窗口、归属规则、数据来源和排除条件。以有效线索转化率为例,必须说清楚“有效线索”由谁判定、同一客户多个线索如何计数、转化的截止日期是什么。
| 指标 | 建议明确的口径 | 常见混淆 |
|---|---|---|
| 新增客户数 | 按首次满足客户定义的主体去重,记录归属日期 | 把联系人新增或重复建档当成新客户 |
| 有效线索率 | 有效线索数 ÷ 按既定规则统计的线索数 | 去重后分母变化,却拿旧周期结果直接比较 |
| 商机转化率 | 进入商机阶段的实体数 ÷ 符合进入条件的线索数 | 把商机记录条数当成客户主体数 |
| 获客成本 | 明确费用范围后,除以新增且符合定义的客户或订单 | 费用只计媒体支出,却把销售与运营成本排除 |
| 收入贡献 | 说明按合同额、确认收入、回款还是毛利统计 | 把订单金额、确认收入和实际回款混用 |
前后对比回答的是“实施前后有什么变化”,它容易受到季节性、预算、人员、价格、渠道政策和产品供给等因素影响。若策略在不同客户群中分批实施,可考虑保留暂未实施的相似组作为对照;若能随机分组,则更有利于判断策略增量,但要确认业务和合规条件允许。
没有合适对照组时,不代表不能复盘,而是结论强度要收敛。可以说“实施后观察到指标上升,变化与策略时间一致,但同期渠道结构变化可能影响结果”;不要把观察到的相关变化直接写成确定因果。
一个完整结论应包含结果、口径、误差和适用范围。例如:“在某一批次企业线索中,按统一社会信用代码和人工确认规则合并后,主体数低于原始记录数;抽样复核发现少量待处理候选。按固定窗口计算的有效线索率有所变化,但由于同期投放渠道调整,本轮数据不足以单独归因于话术实验。”
这样的表述不如“策略提升转化率”醒目,却更能帮助管理层决定下一步:继续扩大测试、先补齐渠道标记,还是重新设计对照组。复盘的价值不是给出最乐观的故事,而是减少下一笔错误投入。

为避免把示例误认为企业实测,我先说明边界:下面的业务背景、样本量和结果均为模拟数据,只用于展示复盘方法,不代表行业基准,也不应作为任何产品的效果承诺。真实项目需要使用经过授权、脱敏并可追溯的业务数据。
假设一家 B2B 企业用 ERP 管理客户和销售过程,同时通过官网表单、线上活动和销售导入获取潜在客户。团队准备测试一项增长策略:对重点行业客户增加定向内容触达,并调整销售首次跟进节奏。三个月后,管理层想判断策略是否有效。
模拟首月共有 4,800 条线索记录。初步规则将同一主体的近似记录放入候选队列,经人工复核后,确认 600 条属于重复记录,另有 180 条存在名称或联系方式冲突,暂不自动合并。最终得到 4,200 个可用于主体层分析的线索实体。
这里最重要的不是“少了 600 条”,而是每一种变化都有解释:哪些是同一企业从不同渠道重复进入;哪些只是同一企业的多个联系人;哪些缺少强标识,需要进一步核验。若把所有 600 条直接删除,渠道触点信息也可能一起消失。
模拟数据中,去重前记录口径下,成交数为 84,原始线索记录为 4,800,对应记录层成交比例约为 1.75%。去重后主体数为 4,200,若仍使用同样的 84 个成交对象,主体层比例约为 2.00%。这个上升来自分母变化,不能被解释成策略带来更多成交。
接下来需要把成交对象与去重后的主体逐一关联,检查成交是否也有重复、成交时间是否落在同一窗口、线索是否具备一致的来源归属。若分子仍按订单条数统计,分母却按客户主体统计,这个比例依然没有可靠解释。
进一步假设企业将重点行业客户分成两组:一组接受新触达策略,另一组维持原流程。模拟样本显示,策略组资格线索转商机的比例从基线期的 14% 变为测试期的 18%;对照组同期从 15% 变为 16%。简单比较测试期,只能看到策略组比对照组高 2 个百分点;观察两组各自变化,策略组提升 4 个百分点,对照组提升 1 个百分点,差异中的差异为 3 个百分点。
即便如此,仍要检查两组是否在客户规模、行业、来源渠道、销售经验和基线表现上接近。如果策略组拿到的是更成熟的线索,差异可能来自样本选择;如果同期销售人员调整了跟进频次,结果也可能被执行差异影响。这个例子只能说明一种比较思路,不能视为统计显著或普遍有效的结论。
假设模拟复盘进一步发现,策略组的有效线索率变化不大,但首次响应时间缩短,进入商机阶段的比例提高,而最终成交周期尚未拉开差异。合理结论应是“当前观察到前段销售过程改善,成交结果仍需继续观察”,而不是“增长已经带来收入提升”。
这类阶段性结论对行动更有帮助:若线索质量未变但商机率提升,可以继续验证销售跟进策略;若有效线索率下降,则需要回看定向内容是否吸引了更多不匹配人群;若成交金额暂时不变,则应延长观察窗口并检查周期性因素。
| 观察项 | 模拟测试组 | 模拟对照组 | 复盘解释 |
|---|---|---|---|
| 基线期线索转商机率 | 14% | 15% | 两组起点接近,但仍需检查样本结构 |
| 测试期线索转商机率 | 18% | 16% | 测试组高 2 个百分点,不能单独证明策略有效 |
| 基线到测试期变化 | 增加 4 个百分点 | 增加 1 个百分点 | 差异中的差异为 3 个百分点,属于模拟估计 |
| 成交收入 | 尚未观察到稳定差异 | 尚未观察到稳定差异 | 销售周期可能尚未结束,不能提前外推 |

我建议在复盘附件中保留最小必要字段:匿名主体键、原始来源、首次录入日期、去重规则版本、候选匹配依据、人工审核结果、策略分组、关键阶段日期和结果状态。具体字段应按权限与数据最小化原则确定,不要为了“以后可能有用”无边界复制客户个人信息。
报告正文则不需要暴露敏感明细。把指标口径、样本范围、排除规则、异常处理和限制说清楚,读者就能理解结论强度。需要进一步核验时,由有权限的人员按审计流程查看明细,而不是把含客户信息的原始表随报告广泛传播。
录入表单应先明确必填字段和格式规范。企业主体可以设置适合自身业务的识别字段;联系人记录应标明所属客户;渠道来源采用统一选项,而不是完全依赖自由文本。字段越多并不代表质量越高,关键是每个字段都有明确用途和维护责任。
录入前搜索也很重要。很多重复并非系统算法无法识别,而是使用者没有先查找现有记录。让搜索覆盖常见名称、规范化电话或已有编号,并在新建时提示可能匹配项,通常比事后批量清理更接近源头治理。
重复提示应提供匹配理由,例如“统一社会信用代码一致”或“名称及地址相似”,而不是只弹出“可能重复”。有理由的提示能让销售人员判断是否继续新增,也便于后续审计规则效果。
对高风险的自动动作要谨慎。比如自动覆盖联系方式、负责人、客户状态等字段,可能造成信息丢失。若系统无法安全合并,可先阻止新建或转入待审,不必为了减少点击步骤而牺牲关系完整性。
抽样要覆盖不同来源和置信度,而不是只检查容易合并的样本。可以对自动合并记录、人工确认记录、系统未匹配记录分别抽样,重点检查误合并、漏合并、来源丢失和归属变化。
发现问题后,不要只修正个别记录,还要判断原因属于规则、模板、权限还是培训。若同类错误持续出现,说明需要改流程或系统校验;若只发生在个别异常业务上,可能需要建立例外处理路径。
数据质量看板可关注候选重复率、确认合并率、人工审核时长、误合并率、漏合并率、关键字段完整率等;增长看板则关注有效线索、商机、成交、收入及获客成本。两个看板可以关联,但不应合并成一个“总效果分数”。
如果团队使用九数云等数据分析工具汇集 ERP、营销和销售数据,重点应放在字段映射、主体键、刷新频率和口径说明上。分析平台能帮助统一展示和追踪指标,但不能替代业务团队定义客户实体,也不能自动证明策略因果。实际连接方式、权限和可用字段需要按系统配置核实。

如果数据主要存放在 ERP 导出表和营销表格中,不必一开始就引入复杂算法。先统一主体定义、规范模板字段、建立来源编码,选一批近期数据手工验证常见重复类型。把规则写成操作说明,让新增、核验和合并的人知道各自责任。
小团队更应控制规则数量。先解决重复最严重的对象和来源,再扩展到其他业务模块。每周或每月复查一次即可作为起点,但具体节奏应由数据增长速度和错误影响决定,而不是把某个频率当作通用标准。
当不同渠道每天都在导入数据,人工逐条查重会形成瓶颈。可以先建立标准化字段、主体键和候选匹配规则,再将置信度较高的记录自动关联,中低置信度保留人工审核。要设置队列负责人和处理时限,否则“进入待复核”只是把积压从一处搬到另一处。
对渠道分析,建议保留首次来源、最近触点和辅助触点等不同归因字段,避免合并时只保留一个来源。客户可能先通过活动接触,再经销售培育成交;只保留最后一次来源,可能让渠道贡献被过度简化。
这类企业不适合只用单层客户档案。应先梳理集团、法人主体、经营网点、联系人和交易关系,必要时用上下级或关联关系表达。一个联系人可服务多个主体,一个主体也可能有多个业务地点,这些关系应建模,而不是靠删除重复记录解决。
如果短期无法重构主数据,可先在报表层区分集团口径和法人主体口径,并在每个指标旁标明层级。不要把集团客户数与法人客户数放在同一趋势线上作直接比较。
没有预先设计对照,不意味着必须放弃评估。先检查能否找到同期未覆盖但业务特征相近的客户群,或按渠道、区域、销售团队做分层对照。若无法建立可信对照,就以描述性复盘为主,交代同期活动、预算变化、人员调整和样本差异。
下一轮策略测试,应在实施前约定测试组、对照组、主要指标、最小观察周期和停止条件。不要等到结果出来后,再挑一个最有利的指标作为成功依据。
客户信息处理应遵循企业的数据分类、访问控制和适用法规要求。数据去重不意味着可以随意汇总、复制或跨部门共享。实施前确认字段用途、访问权限、保存期限、日志要求和脱敏方式;涉及个人信息时,按企业制度和适用要求评估处理依据与范围。
报表展示尽量使用必要的汇总指标或匿名标识。测试策略需要下钻明细时,由授权人员在受控环境完成,不要把完整客户名单放进开放共享文件,也不要将敏感字段带入不必要的分析工具。

自动合并可以缩短处理时间,但错误合并的代价可能很高,例如客户归属错乱、历史订单挂错主体或销售跟进冲突。若数据会触发合同、财务或服务动作,应优先控制误合并,宁可把边界记录送人工复核。
如果只是用于低风险的活动名单去重,且保留原始明细和撤销能力,可以接受更高程度的自动处理。判断标准不是“自动化越多越先进”,而是错误发生后会造成多大业务损失,以及能否快速发现和恢复。
统一口径便于管理层比较,但业务部门可能需要不同层级:市场关注首次来源,销售关注客户主体和负责人,财务关注合同或交易主体。不要用一个字段强行满足所有部门,而应明确核心口径,再保留有业务意义的辅助视角。
多口径的代价是解释成本更高。报表需要标注每个指标的实体层级、时间定义和归因规则,并避免同名指标在不同部门代表不同意思。若维护不了这些说明,就先收敛到少数稳定指标。
活动线索可能在短期内快速进入商机,但成交往往滞后。只看短窗口会低估长周期策略;把窗口拉得太长,又可能混入新的渠道、产品和价格变化。选择观察期时,应结合销售周期和策略作用机制,并把阶段性指标与最终结果分开报告。
如果决策需要尽快进行,可以先用领先指标判断执行是否按预期发生,例如触达率、有效回复率、进入商机比例;但预算扩大前,应明确这些指标只是中间信号,不等价于收入或利润增长。
发现旧口径有误时,继续沿用只为保持趋势连续,会让错误持续影响决策;直接重算所有历史数据,又可能让管理层难以理解报表为何变化。更稳妥的做法是保留旧口径结果和新口径重算结果,标记切换日期,解释差异来源。
若数据与合并关系可追溯,可以对关键历史期间重算并提供口径桥接;如果历史信息不足,就应明确从哪个日期开始使用新口径,不要制造虚假的长期可比性。
| 决策情境 | 优先目标 | 推荐做法 | 主要代价 |
|---|---|---|---|
| 误合并会影响合同或财务 | 准确与可回滚 | 强标识候选加人工确认,保留合并映射 | 处理速度较慢,审核成本较高 |
| 低风险名单需要快速整理 | 效率与可复核 | 规则化标准化、自动提示、抽样审核 | 仍需监控漏合并和异常样本 |
| 渠道归因是核心目标 | 保留触点关系 | 主体合并但保留首次、最近及辅助来源 | 数据模型和报表解释更复杂 |
| 策略效果需快速判断 | 获得阶段性信号 | 先看领先指标,再等销售周期验证成交 | 短期信号不能替代最终结果 |
| 历史口径已确认错误 | 纠正决策基础 | 保留旧值、重算新口径并做差异说明 | 历史趋势可能出现断点 |

我建议交付物不止一张结果图,而是一组能互相核验的材料:数据范围与抽取时间、实体定义、字段标准化规则、匹配规则版本、人工复核记录、合并与撤销日志、指标口径、测试设计、异常说明和结论限制。
如果篇幅有限,正文可以只呈现决策相关信息,详细规则和字段说明放入附件。关键是不要省略读者理解结果所需的条件,例如样本范围、统计窗口和是否存在同期策略变化。
每项都要指定负责人和完成条件。比如“统一来源字段”不是可验收任务;“新建线索必须从统一选项中选择来源,无法识别时进入待补充状态,并由运营负责人每周检查空值”才是可执行的规则。
如果今天就要启动,我会按这个顺序安排:先挑一个对象类型和一个数据来源;定义实体与关键字段;抽样验证匹配规则;记录人工判断及错误类型;建立固定口径的基线报表;再开始策略测试。每一步都留下版本和时间点,避免后续不知道指标变化来自哪里。
当数据质量达到团队设定的可用标准后,再扩大处理范围。可用标准不应由“重复率低于某个行业数字”决定,而应看业务影响:关键客户关系是否完整、误合并是否可控、指标能否复算、异常是否可追溯。
数据变少,可能是记录被合并;转化率变高,可能是分母变小;策略看起来有效,可能是同期条件变了。只有当实体、口径、流程和对照关系都经得起复核,增长结论才值得拿去做预算决策。
因此,ERP 数据录入复盘的起点不是寻找一个“万能去重按钮”,而是先定义要数的对象,再保留关系和证据,最后验证策略带来的增量。下一步不必一口气清理全库:选一类核心数据、一段明确时间窗和一个可核验的增长动作,从小范围规则测试开始,把“数据更干净”和“业务真的增长”分别证明。
我在整理客户数据时,发现同一家公司可能有简称、全称和不同联系人,手机号也未必一致。我不确定是按公司名称去重,还是把联系人、线索也一起合并;规则太宽怕误删,太严又清不干净。
先明确去重对象,再决定匹配字段。客户、联系人、销售线索和订单不是同一种实体:同一家公司可以有多个联系人,同一联系人也可能提交多条不同来源的线索,不能仅凭名称相似就合并。实操中可把规则分成三档:唯一标识完全相同的记录进入自动提示;名称、电话等多个字段高度匹配的记录进入人工复核;
只有名称相似或关键字段缺失的记录保留观察,不自动合并。手机号、邮箱、统一社会信用代码等字段是否可用,要以业务场景、数据授权和系统配置为准。例如,“华东科技有限公司”和“华东科技”名称接近,但若地址、统一标识和联系人信息都不同,直接合并可能造成误删。
更稳妥的做法是记录匹配依据、合并人、合并时间和原始记录编号,让后续可以解释或回滚。
我准备清理一批历史客户资料,里面既有重复录入,也有字段不完整的旧记录。我担心系统自动合并后找不回原始信息,也想知道人工复核应该重点看哪些内容。
不要从批量合并开始,先导出一份只读备份,并在测试环境或小批次上验证规则。建议先统计空值、格式差异和疑似重复组,再抽样检查系统识别结果;如果无法解释某条记录为何被判重,就不应直接自动合并。合并前至少确认主记录保留规则,例如保留信息更完整、最近更新或有明确负责人记录;
同时保存来源渠道、创建时间、跟进记录和关联订单等关键字段。不同 ERP 的合并能力并不相同,若系统不支持完整留痕,应先确认是否能导出映射表并制定人工回退流程。试运行可先选一小批记录,分别核对“应合并但未识别”和“不应合并却被识别”两类错误。
观察结果后再调整字段权重或人工复核条件,而不是只看系统报告的疑似重复总数。
我看到去重后的线索量减少了,但转化率看起来更高了。我不确定这是获客策略带来了更好的线索,还是分母变小后产生的统计变化;如果同期还做了促销,应该怎么判断?
不能只凭去重后转化率上升,就断定增长策略有效。先固定同一统计范围、时间窗口、线索定义和转化事件,再分别核对原始记录数、去重后的独立线索数、合格线索数及成交数,确认变化是否只是重复记录减少。
下面是用于说明口径的虚构示例,不是实际项目结果: 口径线索数成交数成交率 原始录入记录1000808.0% 去重后的独立线索8008010.0% 这个变化可能仅仅说明重复线索被移除,不能单独证明策略带来新增成交。若要评估策略,尽量比较相似人群或同期对照组,并记录渠道、预算、促销和跟进规则变化;
条件不允许时,结论应写成“观察到关联变化”,而不是“策略导致增长”。
我想把一次数据清理写成可复用的复盘,但只记录清理了多少条,感觉不足以说明价值。我也不希望把录入规范调整、渠道变化和增长策略的影响混在一起,应该怎样组织记录?
建议把复盘拆成数据质量、业务过程和策略效果三层。数据质量记录原始记录量、疑似重复量、确认重复量、误合并与漏合并抽查结果;业务过程记录新增来源、字段完整率和处理时长;策略效果记录明确的分子、分母、转化事件及统计周期。
例如,若某周期录入1000条线索,复核确认其中200条为重复,复盘应同时保留“1000条原始记录”和“800个独立线索”的口径,并说明重复判定规则、复核样本和异常处理方式。不能只发布去重后的数字,否则读者无法判断差异来自规则还是业务变化。结论部分可分为“确认事实、可能解释、尚未验证”三栏。
把系统版本、字段规则、策略上线时间、渠道调整和同期活动一并留档,下一次才能在相同口径下比较;若涉及客户信息,报告中应做必要脱敏,并按企业权限和适用要求控制访问。


读者评论
文章把客户主体、联系人和线索分开讨论很有必要;只按名称或手机号合并,确实可能把不同业务关系误处理。
转化率上升不一定代表策略有效,尤其是去重后分母变小、成交数没变时。前后比较应先固定统计口径。
分批验证并保留合并日志和回滚依据更稳妥,也应同时检查误合并与漏合并,不能只看清理数量。