ERP 导入前的 Excel 里有两条“华东精密有限公司”,一条留着采购订单,另一条挂着历史对账记录。把其中一行删掉,表面上重复项少了,实际却可能让后续业务找不到原记录。ERP 数据录入最容易被误解的地方就在这里:查重是筛出疑似记录,去重则是经过业务核验后,决定如何保留、合并、停用或修正。
开始整理数据前,我建议先把三个问题写清楚:这批数据是什么对象、用什么字段判断身份、发现重复后由谁确认。客户、供应商、物料、仓库和员工的身份识别方法并不相同,不能因为都在 Excel 里,就使用同一套“名称相同即重复”的规则。
例如,客户名称相同,可能是同一法人在不同地区的分支机构,也可能是两个独立主体使用了近似名称;物料名称相同,规格、材质、包装单位不同,也可能对应不同库存对象。去重规则应该从业务对象出发,而不是从表格操作出发。
我会把去重任务至少分成三个状态。第一类是“疑似重复”,系统或表格规则发现了相似记录;第二类是“确认重复”,业务人员根据稳定标识和业务信息完成核验;第三类是“已处理”,记录已经按审批流程合并、停用、更正或保留。
这三个状态不能混成一个“重复”标签。筛查工具擅长找候选项,却不一定知道公司内部的客户归属、历史合同和物料替代关系。把机器筛查结果直接当成删除清单,是高风险操作。
确认两条记录属于同一业务对象之后,仍要决定保留哪一条。可以从编码是否已在正式单据中使用、记录是否关联库存或往来、信息是否完整、是否存在审批历史等角度判断。“创建时间更早”不是天然的保留标准,“字段更多”也不一定意味着记录更可信。
具体处理方式取决于 ERP 的功能、数据权限和业务流程。系统可能支持合并,也可能只能停用旧记录并指定新记录;有些记录因关联业务单据而不能删除。不要预设所有系统都能一键合并,更不要在不了解关联影响时直接执行批量删除。
| 环节 | 要解决的问题 | 建议产物 | 常见风险 |
|---|---|---|---|
| 识别对象 | 这条记录代表谁或什么? | 数据对象清单、字段口径 | 把不同对象误当成同一对象 |
| 筛查候选 | 哪些记录值得复核? | 疑似重复清单 | 把相似记录直接判为重复 |
| 业务确认 | 记录是否指向同一业务身份? | 核验依据、确认人、判定结果 | 仅凭名称或地址作判断 |
| 安全处理 | 保留、合并、停用还是更正? | 处理记录、审批或变更日志 | 破坏历史单据关联 |
| 导入验收 | 数据是否准确进入目标系统? | 数量对账、错误清单、抽查结果 | 只看“导入成功”提示 |

企业准备 ERP 数据时,常见来源包括旧系统导出表、财务或采购台账、各部门自行维护的 Excel、历史邮件附件,以及临时登记表。同一对象可能被不同团队反复创建:采购使用简称,财务使用发票抬头,销售保存客户联系人常用名称,仓库则以内部物料描述为主。
这些记录即使指向同一个对象,字段也未必完全一致。名称可能有空格、标点、全半角差异,也可能因更名、简称、分支机构或历史编码而不同。反过来,两条名称完全相同的记录也可能对应不同的组织、账套、地区或业务关系。
因此,导入前的数据整理不能只做表格清洁。还要识别记录之间的业务身份关系,确认哪些字段可以作为主判断依据,哪些只能作为辅助线索。
重复记录不一定都来自录入人员手误。有时是系统没有设置唯一性约束,有时是多个部门各自维护档案,还有时是原始数据迁移时同一对象在不同文件中重复出现。也可能是旧记录不能被新流程直接使用,用户为了完成业务又新建了一条。
从操作上看,常见重复大致分为三类:完全重复、格式差异造成的疑似重复、业务上相似但实际上不同。完全重复在表格中比较容易发现;格式差异需要做规范化处理;业务相似记录则通常需要结合主体标识、组织关系、规格属性和历史单据判断。
客户、供应商、物料等通常属于企业反复使用的基础档案或主数据;订单、出入库记录、收付款和发票等属于业务交易数据。不同 ERP 的分类名称、字段归属可能不完全一样,但在导入计划中,至少要把“长期复用的对象档案”和“发生过的业务事实”区分开。
主数据重复往往影响后续新增、查询和统计;交易数据重复则可能造成数量、金额或业务状态不一致。两者不能用相同的删除策略处理。交易数据通常首先要核对业务事实和来源凭证,不能把它当作主数据档案那样简单合并。
数据录入不宜默认由某一个人独自负责到底。业务部门更了解客户、供应商和物料的实际含义,数据管理员更了解字段、编码和导入模板,系统管理员更了解权限、关联关系和系统限制。具体岗位如何分工,应由企业根据流程确定,但“整理、业务确认、导入、验收”最好有明确的责任人。
我更倾向于把每类数据的确认责任放在最了解业务的人手中,而不是把判断责任全部压给负责导入的人。后者可能能看出两条记录很像,却未必知道它们是否对应不同的法人、仓库或合同关系。

名称是人类容易理解的字段,但通常不是足够稳定的身份依据。客户名称可能相同但组织不同,物料名称可能一样但规格或版本不同,仓库名称也可能在不同法人或组织下重复使用。
名称可以用于筛查,但通常不应单独决定删除或合并。对客户和供应商,可以结合主体标识、地区、地址、联系人、合同及历史单据;对物料,则要核对物料编码、规格型号、计量单位、关键属性和使用场景。实际可用字段仍要以企业数据规范和 ERP 字段设置为准。
名称不同也不代表身份不同。公司名称可能经历变更,台账可能有简称和全称,录入人员可能添加了地区前缀、部门后缀或内部备注。物料也可能因命名习惯不同,被写成“垫片 20mm”“20 毫米垫片”或“垫片-20”。
这类记录的处理应分两步:先做规范化匹配,把空格、常见符号和格式差异尽可能整理一致;再用稳定标识或业务属性复核。名称规范化只能帮助召回候选项,不能替代身份确认。
整行字段完全一样,是值得优先检查的信号,但仍需确认数据来源、导入范围和业务含义。两行相同记录可能是同一个文件重复粘贴,也可能是两个业务批次的重复导出;如果记录包含时间、组织或来源批次字段,简单删除可能会抹去排查线索。
更稳妥的做法是保留原始文件副本,在处理版本中标记重复行、记录来源和操作时间,再确认哪些字段属于身份字段、哪些字段属于来源信息。需要保留的数据不一定多,但决策过程应该能追溯。
删除会让表格变短,却不一定让业务关系变正确。记录如果已经关联采购订单、库存、应收应付或历史交易,删除或改编码可能导致关联信息不可见、报表口径变化,或后续追溯困难。
实际操作时,应先查明记录是否已经被引用,再根据系统能力和企业流程选择保留一条、停用旧档案、调整新档案、合并关联或提交系统管理员处理。某些场景下,旧记录需要继续保留以支撑历史单据;此时“停用并限制新业务使用”可能比彻底删除更合适。
并不是每类数据都天然拥有一个可用的唯一标识。税务或主体字段可能缺失、格式不一致或并非所有数据对象都适用;物料编码可能在不同组织中采用不同规则;某些历史数据甚至没有可靠的外部标识。
当单一字段不足以判断时,可以使用组合字段形成候选匹配规则,例如“规范化名称+地址片段+电话”用于客户初筛,或“物料编码+规格+单位”用于物料核验。组合字段仍然是筛查依据,业务人员需要了解字段缺失率和例外场景,避免规则看似精确、实际误判。
导入成功通常只能说明文件通过了系统当前执行的格式或字段校验,并不自动证明业务身份正确,也不一定证明导入数量与预期相符。部分系统会跳过错误行、覆盖已有记录或只返回部分失败信息,具体行为受软件版本、配置和权限影响。
因此,验收至少要对比待导入量、成功量、失败量和目标系统中的实际记录数,再抽查关键字段与业务关联。不要把“界面显示成功”当作数据质量验收结论。

开始设计规则前,要明确一条记录代表什么。例如,客户档案表示法人主体、门店、收货地点,还是业务往来账户?供应商记录对应公司主体还是具体结算账户?物料档案是一种物料、一个规格,还是一个组织下的库存编码?这些边界不同,唯一性规则也会不同。
如果对象边界没有定义,单靠 Excel 公式很难得到稳定结果。即便公式每次都给出同样的标记,也可能只是稳定地执行了错误的业务假设。
我通常把字段分成三层:第一层是可用于身份核验的稳定字段;第二层是辅助判断字段;第三层是描述性或易变化字段。字段归属应由企业确认,以下只是常见思路,不是通用强制规范。
| 数据对象 | 可优先核验的字段示例 | 辅助判断字段示例 | 不宜单独判重的字段 |
|---|---|---|---|
| 客户或供应商 | 适用的主体标识、内部统一档案编码 | 名称、地区、地址、联系方式、合同关系 | 简称、联系人姓名、单独的名称相似度 |
| 物料 | 企业物料编码、经过定义的组合属性 | 规格、型号、材质、颜色、版本 | 口语化描述、单独的物料名称 |
| 仓库或组织 | 组织编码、仓库编码及其所属组织 | 仓库地址、用途、状态 | 单独的仓库显示名称 |
| 员工或联系人 | 企业内部员工编号或适用的唯一标识 | 部门、联系方式、任职状态 | 姓名或同名联系人字段 |
硬匹配适合稳定且定义清楚的标识,例如同一内部编码重复出现。它通常有较强的判定价值,但前提是编码唯一规则真实执行;若企业长期存在重复编码或跨组织复用,就不能把它当作绝对答案。
组合匹配适合单个字段不足以判断的情况。可以组合名称规范化结果、地址或规格等字段来缩小候选范围。组合规则应记录版本,说明字段选择、空值处理和例外情况,避免不同人员在不同时间使用不同标准。
模糊匹配可以帮助发现错别字、名称变体和录入差异,但更适合作为候选排序工具。相似度分数达到某个阈值,意味着值得复核,并不代表系统已经确认它们是同一对象。阈值应通过本企业的样本验证,而不是直接照抄别人的设置。
对每一组候选记录,建议至少留下原始行号或源文件标记、匹配规则、关键核验字段、业务确认人、最终结论和处理方式。这样做不是为了增加表格列,而是为了让后续人员知道为什么某条记录被保留、停用或合并。
对无法判断的记录,应明确标记“待业务确认”或“暂缓导入”。相比为了赶进度而做一个没有依据的结论,暂缓少量边界数据往往更可控。哪些记录可以暂缓,要由业务风险和上线范围共同决定。
导入前规则用于整理存量数据:查空值、格式、编码冲突、疑似重复及跨文件重复。上线后的规则用于减少新增问题:限制创建权限、设置编码申请流程、提示相似记录、定期复核停用档案等。只清理旧数据而不改变新增机制,通常会让重复问题再次出现。
如果 ERP 不支持相似记录提醒,也可以通过流程控制降低风险,例如新增前查询、设置业务审批、由数据管理员复核重点字段,或定期导出新增档案进行抽查。控制方式应与数据规模、错误成本和系统能力匹配。

以下为虚构的演示案例,不对应真实企业,也不代表某个行业的普遍情况。假设导入前整理出两条供应商记录:A 行名称为“华东精密有限公司”,统一标识字段为“9133XXXX”,地址为“滨江路 18 号”;B 行名称为“华东精密有限责任公司”,同一标识字段也显示“9133XXXX”,地址字段写作“滨江路18号”。
从名称和地址看,两条记录可能指向同一主体;但在做决定前,仍要确认标识字段是否完整可靠、是否存在复制错误、记录对应的结算主体是否相同,以及两条档案是否已经被历史单据引用。这里的占位标识仅用于示例,不能据此推断真实主体信息。
可先对名称、地址等字段做有限度的格式整理,例如去除首尾空格、统一全半角和明显的标点差异。标准化的目标是让同一内容的书写差异更容易被发现,不是改写原始业务事实。务必保留原始列,避免覆盖源数据后无法回查。
在表格中,可以建立辅助列存放规范化结果,并用条件计数标记完全重复或同键候选。下方公式仅展示一种基础思路;不同表格软件的函数名称和语法可能略有差异,且公式结果只用于筛查,不能直接作为删除依据。
规范化名称示例: =TRIM(CLEAN(SUBSTITUTE(A2,CHAR(160)," "))) 按规范化名称标记重复候选: =IF(COUNTIF($D:$D,D2)>1,"待复核","") 按组合键标记候选(示意): =IF(COUNTIFS($D:$D,D2,$E:$E,E2)>1,"组合字段待复核","")
公式的局限需要特别说明:它能处理一部分空格和字符问题,却不知道公司是否更名、地址是否变更,也不能识别同一名称下不同结算主体。自动化筛查越方便,越要避免把辅助列误当最终结论。
业务确认人需要查看适用的主体标识、合同或采购资料、付款账户信息以及历史往来记录。并不是每个数据对象都能使用相同字段,也不是所有企业都能从一份表中取得完整信息。核验字段应根据实际业务和数据授权确定。
如果关键标识一致,但历史单据分属不同业务组织,还要判断系统设计中“一个主体多业务档案”是否有实际需要。有些企业确实会因为账套、销售区域、结算方式或组织隔离保留多个业务档案;此时它们可能是同一外部主体,却不一定应该在 ERP 中压成一条记录。
假设确认 A、B 指向同一供应商主体,但 A 已经关联历史采购单,B 是新整理的档案,包含更新后的联系方式。不能因为 B 信息更完整就直接删除 A。应先查看目标 ERP 对历史单据、档案合并和编码变更的处理限制,再由业务和系统责任人决定是否保留 A、更新联系方式、停用 B,或按照系统支持的流程迁移关联。
若系统不支持合并,可能需要保留历史档案并限制后续新业务使用,同时明确新的正式档案;也可能因为历史单据引用要求继续保留两条记录,并在主数据治理台账中标注其关系。哪种方案适合,要根据系统能力、业务连续性和审计要求判断,不能给出脱离环境的固定答案。
在正式批量导入前,建议先用一小批覆盖典型情况的数据验证模板和处理规则。样本不应只挑字段齐全、格式整齐的记录,还应包括名称差异、空字段、特殊字符、跨组织档案和可能关联历史业务的数据。测试目标是尽早发现规则边界,而不是证明“系统能导入”。
试导入后检查字段映射、编码生成、重复提示、失败记录和关联行为。若发现一类数据被错误覆盖或拆分,应先修订规则,再扩大导入范围。不要在生产环境中用大量正式数据反复试错;是否能使用测试环境或回滚功能,要以企业实际系统安排为准。
| 观察点 | 案例中的核验问题 | 通过条件 | 未通过时的动作 |
|---|---|---|---|
| 主体身份 | 两条档案是否指向同一供应商主体? | 关键标识和业务资料相互支持 | 标记待确认,不自动合并 |
| 组织关系 | 是否因账套或业务组织需要保留多条档案? | 企业的数据模型允许且用途明确 | 请业务负责人确认对象边界 |
| 历史引用 | 是否关联采购、付款或其他历史单据? | 已核对关联影响和系统限制 | 暂停删除或编码调整 |
| 处理方案 | 系统是否支持合并、停用或更正? | 操作路径经过测试并获授权 | 保留现状,升级给系统责任人处理 |
| 导入验收 | 关键字段和记录数是否符合预期? | 导入前后数量对得上,抽查无关键错误 | 停止扩量,排查错误来源 |

先列出本次要导入的数据对象、来源文件、截止日期、目标组织或账套、责任部门及业务确认人。数据范围要具体到对象和时间边界,例如“当前有效供应商档案”与“所有历史供应商记录”不是同一范围。
同时确定本次哪些记录必须导入、哪些可以暂缓、哪些不应进入 ERP。范围不清会让团队不停追加文件,也会让导入完成数量失去判断标准。对于暂缓项,指定负责确认的人和下一次处理时间,避免其悄然流失。
原始数据应保持只读或另存备份,后续清洗在工作副本中进行。建议保留文件名、来源部门、获取时间、版本号和处理人;如果多份文件合并,应记录每条记录来自哪个文件、哪个工作表或哪一行。
保留原始版本并不是形式主义。发生字段误改、匹配规则过宽或导入结果异常时,原始数据可以帮助判断问题在源头、清洗过程还是系统映射。不要直接在唯一的源文件上进行批量删除和覆盖。
下载或取得当前系统对应的正式导入模板,逐列确认字段含义、数据类型、必填条件、长度限制、允许值和编码逻辑。历史项目的模板、网上下载的通用模板以及其他软件的字段表,都不能默认适用于当前系统。
对容易误解的字段,应找系统管理员或模块负责人确认。例如,“客户编码”究竟由业务人员预先分配,还是系统导入时生成;“默认仓库”是否必填;空值是代表未知、不适用,还是系统会自动赋默认值。字段映射错误可能比缺少一条数据更难发现。
先检查空白行、合并单元格、公式结果、日期格式、数字文本格式、隐藏空格、换行符、全半角字符及必填项缺失。若某字段允许空值,不要为了让导入通过而随意填入虚构内容;如果模板要求必填,应向业务责任人补充确认。
格式清理与业务修订要分开记录。格式清理通常是统一呈现方式,业务修订则可能改变数据含义。将两者混在一起,后续很难区分“修正格式”和“变更事实”。
根据数据对象执行对应规则,优先找出编码冲突、稳定标识重复、完全重复行和组合字段高度相似记录。把不同匹配规则产生的候选分组,不要将它们合并成一个不透明的“重复数据”列表。
复核清单中可以包含源记录编号、匹配原因、比较字段、关键差异、建议动作和确认状态。对疑似重复但业务证据不足的记录,明确标记待确认,并从批量导入范围中暂时隔离。
字段映射要从源字段逐项对应到目标字段,并说明转换规则。例如,源表中的“状态”是否需要映射到目标系统允许值;源表中的数量单位是否需要转换;名称字段是否需要截断;编码是否要保留前导零。
试导入样本要覆盖正常记录和边界记录。系统有失败日志时,应保存日志并将错误归类,例如必填缺失、值不合法、编码冲突、权限不足或关联对象不存在。根据错误类别修订数据或配置,不要通过随意改数据来掩盖系统规则不匹配。
正式导入时,把待导入数量、成功数量、失败数量、跳过数量和系统中实际可查询的记录数逐项对照。若系统会覆盖已有记录或自动跳过重复项,必须确认这种行为与本次预期一致,并保留操作日志。
不要只核对总数。总量相同并不代表内容正确:可能少了 10 条,同时多进了 10 条。必要时按编码、组织、来源批次等关键维度对账,并抽查高风险字段和处理过的重复组。
导入完成后保存最终文件版本、错误清单、变更记录和验收结论。确认新增档案的创建权限、后续修改流程及复核责任,避免刚完成一次集中清理,后续又回到部门各自建表、重复创建的状态。
验收并不意味着所有历史问题都要一次性清零。可以按风险分批处理:影响采购、库存、财务或客户交易的档案优先;低频、无业务引用、证据不足的记录可先冻结使用并排期复核。边界要透明,不能把未处理项伪装成已完成。

首次上线不要追求一轮把所有历史记录整理到绝对完美。先划清上线必需范围,再按业务风险分级:影响当前交易和期初余额的数据优先,历史低频或已停止使用的数据可以暂缓。对高风险对象设置业务确认和导入验收;对低风险对象可以采用批次导入、逐步补录。
优点是能控制上线范围和质量风险,代价是部分历史检索或报表功能可能需要分阶段补齐。上线范围、暂缓原因和后续计划应形成记录,并与使用部门沟通清楚。
不要简单地把旧编码全部替换成新编码,再丢弃映射关系。建立旧编码、新编码、数据来源、有效状态和生效时间之间的对应表,核对哪些编码可以一对一迁移,哪些属于合并、拆分或历史遗留。
保留映射关系会增加整理和维护工作,但有利于追溯历史单据、解释报表差异和支持业务查询。若只保留新编码,短期导入可能更快,却可能让旧系统记录难以关联。
先区分“缺失但不影响身份判定”和“缺失导致无法确认身份”。前一种可以依据已核验字段继续处理,并记录补齐计划;后一种应隔离或暂缓,不宜让模糊匹配替代事实依据。
如果上线时间紧,可以把部分记录限制为不可用于新业务,或只导入经过确认的核心档案,再安排后续补齐。是否能设置这种状态、权限和流程,需核对 ERP 实际功能,并经企业流程负责人批准。
这类记录应提高处理门槛。先确认系统能否查询引用关系,是否允许合并,历史单据显示的档案信息是否会变化,以及财务或库存报表口径会不会受影响。涉及核心业务链路时,操作前应在测试环境验证或取得系统责任人的明确意见。
优先考虑保留可追溯历史、限制错误档案继续使用,并通过新业务规则防止重复新增。彻底删除通常不是默认选项,尤其在操作可能影响已完成业务记录时。
不要只投入时间反复清理,而应检查新增档案流程。明确谁可以创建、创建前如何检索、哪些字段必须录入、哪些档案需复核、怎样处理更名和停用。若系统支持相似项提示或唯一性校验,可以评估启用;若不支持,可通过审批或定期稽核补足。
一次性清洗的价值在于恢复现状,新增控制的价值在于减少问题复发。对于长期维护型数据,后者往往更值得投入。具体控制强度要兼顾创建效率和错误成本,避免审批过重导致业务绕过流程。
可以把记录按风险和不确定性分层处理,而不是平均分配人工时间。稳定编码重复、关键主体字段冲突、已有业务引用的记录优先复核;名称相似但无业务影响的候选项,可以按规则分批处理或暂缓。
“自动筛查+人工复核”通常比纯人工逐条找重复更省力,但其效率取决于源数据质量、规则精度和系统能力。没有验证过的自动匹配不应直接执行不可逆操作。先用一批有业务结论的样本校准规则,再决定是否扩大应用范围。
| 场景 | 优先动作 | 主要收益 | 需要接受的代价 |
|---|---|---|---|
| 首次上线、来源多 | 划范围、分批次、按风险排优先级 | 降低一次性迁移风险 | 部分历史数据可能延期补齐 |
| 新旧编码不一致 | 保留编码映射和来源记录 | 便于回查和历史衔接 | 增加映射维护工作 |
| 关键字段缺失 | 补充业务确认或暂缓导入 | 避免错误合并或错录 | 导入范围可能缩小 |
| 已有交易引用 | 查关联、测试处理、保留历史 | 减少业务链路中断风险 | 清理速度较慢,需更多协调 |
| 长期重复新增 | 补上创建、审核和复核机制 | 减少问题持续复发 | 新增流程可能增加步骤 |

数量核对:对比源文件记录数、排除数、待确认数、成功导入数和失败数。排除或暂缓的每一类都应有原因,避免数量变化无法解释。
字段核对:抽查编码、名称、组织归属、状态、单位、地址等关键字段,重点覆盖曾经修正过、映射过或出现过错误的记录。抽查多少条没有适用于所有企业的固定比例,应依据风险、样本数量和错误成本制定。
关系核对:确认需要关联的组织、单位、客户、供应商或其他档案是否存在,业务引用是否指向预期记录。对于已处理的重复组,优先回查原记录和目标记录之间的关系。
日志核对:保存系统返回的成功、失败、跳过和覆盖信息。若系统提供错误明细,应将其与修正版本关联;若日志信息有限,可自行维护批次编号、文件版本和处理人,便于后续追踪。
流程不一定要复杂,但至少要说明谁能申请新增或修改、谁负责业务确认、编码由谁分配、哪些字段修改需要审批,以及旧档案如何停用。对客户、供应商、物料等不同对象,可设置不同的必填项和审核责任。
如果企业规模较小,可以先从共享台账和固定申请模板开始;如果业务规模和数据风险较高,再逐步增加系统校验、权限分层和定期稽核。关键不是表格数量,而是每次新增和修改都有可追溯的责任与依据。
可按月或按固定周期查看新增档案数量、疑似重复数、确认重复数、待业务确认数、导入失败数和处理时长。指标要服务于实际决策:疑似重复持续上升,可能说明新增校验不足;待确认积压长期不降,可能说明责任分配或审批流程不清。
这些指标不是为了制造一个看似精准的“数据质量分”。企业应统一统计口径,明确时间范围、对象范围和重复定义。否则,不同部门报出的数字无法比较,也可能诱发为了降低数字而少报问题。
去重规则应随着业务变化复核。例如,公司组织调整后,原本代表不同组织的编码可能统一;产品规格增加后,旧的物料名称匹配规则可能变得不适用;新系统上线后,字段可用性也可能发生变化。
建议保留规则版本、调整原因、批准人和生效时间。规则变化后,用已确认的历史样本回测:以前确认重复的记录能否再次识别,以前确认不是重复的记录会不会被误标。回测结果不理想时,先修规则,不要直接放宽批量处理范围。

不是。疑似重复只说明这些记录值得复核。先检查判断依据和业务关系,再确认是否属于同一对象。即使确认重复,也要判断是否已被业务单据引用,并根据 ERP 能力和企业流程选择保留、合并、停用或更正。
名称相同可能对应不同地区、组织、法人或结算关系,也可能是同名联系人或历史名称。客户档案究竟按外部主体、业务组织还是往来账户建立,需要结合企业数据模型确认。名称只能作为线索,不宜单独决定合并。
先看企业物料编码规则是否真正唯一,再结合规格型号、单位、材质、版本等关键属性。若编码跨组织复用或历史编码曾变更,编码本身也需要核验。名称适合检索候选,不能代替物料身份规则。
可以把模糊匹配用于生成候选项或排序,但不建议直接触发删除、合并等不可逆操作。应选择已由业务确认的样本测试规则,检查误报和漏报,再根据数据风险设置复核边界。关键字段缺失且无法核实的记录,应考虑暂缓处理。
先明确每类数据的业务确认人和最终导入责任人,使用统一模板、保留原始文件、建立简单的疑似重复清单,并要求重要档案新增前先查询。流程可以轻量,但不能没有责任归属和变更记录。随着数据量增加,再逐步增加权限控制和系统校验。
ERP 数据录入真正的难点,不是把文件导入系统,而是让每条记录代表清楚的业务对象,并能与正确的组织、单据和后续流程相连。查重工具可以帮忙发现候选项,但不能代替企业定义对象、判断身份和承担业务决策。
我建议把工作顺序记成一句话:先定对象边界,再选核验字段;先生成候选清单,再由业务确认;先查关联,再决定处理;先小批量验证,最后对账验收。这比追求“快速清空重复行”更稳,也更容易复盘。
如果你正准备导入 ERP,不必一开始就清理所有历史数据。先选一类近期会影响交易、库存或财务的对象,整理一份带来源信息的工作副本,定义匹配字段和复核责任人,再挑一小批数据完成查重、试导入和验收。
在完成第一批之后,记录哪些字段最有用、哪些情况最容易误判、哪些系统限制导致处理受阻,并据此修订规则。去重的最终目标不是让表格看起来没有重复,而是让企业知道哪些记录代表同一对象、哪些记录必须分别保留,以及每次处理都有可追溯的理由。
我正在整理一批准备导入 ERP 的 Excel,里面有客户、供应商、物料和库存数据,但不确定是不是每类都要用同一种方式查重。我担心只按名称筛选,会把不同主体误删;也怕漏掉名称写法不同、实际却是同一条记录的情况。
优先处理会被多部门重复引用的主数据,例如客户、供应商、物料和仓库。重复的主数据可能造成同一主体出现多个档案、物料被重复建码,或后续单据选错对象。期初库存、订单等业务数据也要核对重复,但它们通常还需要检查单据编号、日期、组织和业务状态,不能只套用主数据的查重规则。不同对象应选不同的识别字段。
客户或供应商可先核对统一社会信用代码等稳定主体标识,再参考名称、地址和联系方式;物料可核对物料编码、规格型号、计量单位及关键属性。适合的字段取决于企业实际业务和 ERP 字段设置,名称相同或相似只能用来发现疑似记录,不能单独作为删除依据。
例如,示例表里有“华新设备有限公司”和“华新设备有限责任公司”两行。若主体标识一致,且地址、业务资料也能相互印证,可列入待确认重复清单;若主体标识不同,就应先确认是否为不同法人或分支机构,不要因为名称相近就合并。
我手里的数据有空格、简称、全角半角混用,还有一些历史名称,直接按 Excel 的重复值筛选只能找到完全相同的内容。我想知道应该先清洗哪些字段、怎样组合条件,以及筛出来以后要核对什么,才不会把相似记录当成重复记录。
把查重拆成“规范格式,筛出疑似项,人工复核”三步,比直接删除重复行更稳妥。先复制并保留原始文件,再统一首尾空格、换行、全角半角和日期格式;规范化字段可用于辅助比对,但不要覆盖原始名称或原始编码,以免丢失来源信息。随后按数据类型组合条件筛查。例如客户可先按主体标识分组,再检查名称和地址;
物料可先按规格型号、单位和关键属性筛选,再对照已有物料编码。把结果标为“确认重复”“相似但不同”“暂无法判断”,并记录核验字段和判定理由。这样能把机器筛选的速度和业务人员的判断结合起来。一个实用检查方法是抽看每组疑似记录的原始来源、最近使用时间和关联业务,而不是只看整理后的名称。
若标识冲突、信息缺失或业务归属不清,先暂停处理并找对应业务负责人确认;不确定的记录应留待复核,不能为了追求表格整齐而强行合并。
我发现系统里有两条名称很接近的供应商档案,其中一条似乎已经被采购单引用。我担心直接删除会影响历史单据,也不清楚合并、停用和修改资料分别适合什么情况,想先判断安全的处理顺序。
先查记录是否已被订单、库存、财务或其他业务单据引用,再决定处理方式。系统支持什么操作、操作后历史单据如何显示,都取决于具体 ERP 的功能、权限和配置;不要默认每个系统都有安全的自动合并功能。如果只是资料字段填写错误,且系统允许按审批流程更正,可以修正并留存变更记录。
若两条记录确属同一主体且已有业务引用,应先确认系统是否支持合并或转移关联关系,并由数据负责人和相关业务人员核对影响;无法安全合并时,可按内部规则保留有效档案、停用不再使用的档案,同时明确旧档案的处理方式。处理前保留数据备份、记录原编码和关联单据,先用测试环境或少量样本验证操作结果。
处理后再检查历史单据能否正常查询、有效档案能否用于新业务。删除或停用不是目的,避免新业务继续选错档案、同时不破坏历史追溯,才是判断处理是否合适的标准。
我准备把多份 Excel 合并后导入 ERP,不确定是先全部清洗完再导入,还是边导边改。我也遇到过系统提示导入成功,但之后才发现有字段映射不对、部分记录没进系统的情况,想要一套能逐步核对的流程。
先确定数据范围、来源、负责人和审核人,再按 ERP 实际模板整理字段。逐项确认字段含义、必填项、编码规则、日期格式、计量单位和组织归属;不要直接套用其他系统的模板,因为字段定义和校验规则可能不同。原始文件应只读留存,另建整理版本并注明修改内容。
正式批量导入前,选一小批有代表性的记录试导入,既包括常规数据,也包括容易出错的边界情况,例如名称较长、特殊字符、缺少非必填字段或不同计量单位。检查字段映射、系统报错和记录关联;发现问题后先修正模板或数据规则,再决定是否扩大导入范围。
导入结束后,对照待导入数量、成功数量、失败数量和系统日志逐项核账,不要只看“导入成功”提示。再抽查关键字段、档案状态及必要的业务关联。一个简单的核对表可记录“源文件行数、排除行数、预期导入数、成功数、失败数、复核人”;若数字对不上,先查失败日志和重复拦截记录,再进行下一批。
后续防重要落到新增规则上:明确谁能申请、谁分配编码、谁审核,修改和停用如何留痕。这样查重就不只是一次性的表格清理,而是减少重复档案再次进入系统的日常控制。


读者评论
把“疑似重复”和“确认重复”分开处理很有必要,尤其是客户名称相同但主体不同的情况,直接删行确实容易误伤。
文章提到先查记录是否关联订单、库存或往来,再决定合并或停用,这比单纯按创建时间保留更符合实际操作。
按旧系统、部门台账等来源分析候选记录,有助于找到重复产生的原因;不过文中的数量是情景模拟,不能当作行业比例。
导入成功后再核对成功量、失败量和系统实际记录数,这个验收步骤容易被忽略,建议纳入固定流程。
职责划分的建议比较实用:导入人员未必了解业务身份,让熟悉客户或物料的人参与复核,能减少仅凭名称判断造成的误差。