去年,我接手了一个已经逾期 90 天以上的信贷资产包,规模大约 5000 万。传统催收策略是“一视同仁”地打电话,结果回收率不到 5%。接手后,我并没有要求催收员更努力,而是用了两周时间,基于历史数据搭建了一个简单的还款意愿模型。模型上线后,我们只对“高意愿”客户使用温和提醒,对“低意愿”客户直接升级法务函。三个月后,这个资产包的回收率从 5% 提升到了 18%。这件事让我深刻意识到:在催收领域,谁先用量化模型替代经验判断,谁就能在坏账回收中占据绝对优势。
这篇文章,我就从数据分析的角度,拆解一个完整的还款意愿模型是如何构建、验证和落地的。
在催收工作中,最稀缺的资源不是系统,不是工具,而是催收员的时间和精力。一个催收员一天最多打 80-120 通有效电话。如果把这 100 通电话全部打给“不可能还款”的客户,那天就是 0 产出。还款意愿模型的本质,不是预测谁一定会还钱,而是为催收员提供一份“优先动作清单”。
核心结论:还款意愿模型通过识别“主动还款概率”高于阈值的客户,优化催收资源的分配,从而在不增加人力成本的前提下,将整体回收率提升 10%-30%。 这不是一个学术概念,而是我在多个项目中验证过的、可量化的业务策略。

我见过太多风控团队,直接把“接听率”作为还款意愿的代理变量。他们的逻辑很简单:如果客户一直在接电话,说明他还在意这件事,愿意沟通,就有还款的可能。但真实场景远比这个复杂。
我曾经分析过一个逾期 30 天的客户 A。这位客户在 30 天内接了 28 通催收电话,接听率超过 90%。每次通话都承诺“明天一定还”,但从未兑现。按照传统的“接听率 = 意愿”逻辑,他应该被标记为“高意愿”,但事实上他从未还过一分钱。
这个案例让我意识到:接听率本身是一个“被污染”的特征。客户可能因为害怕、拖延或享受通话中的情绪宣泄而接电话,但并没有真实的还款意图。 我们需要引入更稳定的指标,比如“承诺兑现率”。
客户 B 逾期 45 天,只接了 5 通电话,接听率不到 30%。按照传统逻辑,他应该被标记为“低意愿”,催收员可能已经准备放弃他。但数据显示,他每次接电话后,都会在 24 小时内主动还款一部分。原来,他白天工作非常忙,只有晚上才有时间处理财务问题。催收员在白天频繁打电话,他确实接不到,但这并不代表他不愿意还。
这两个案例说明:单一特征(如接听率)很容易产生误判。还款意愿模型必须从多个维度综合评估,才能避免“以偏概全”。
在没有模型的情况下,催收经理常用的策略是“按逾期天数分档”:逾期 1-30 天用短信提醒,31-60 天用电话催收,61-90 天用律师函。但我在实际业务中发现,同一个逾期天数下的客户,还款意愿差异可以非常大。比如,一个逾期 30 天的客户,如果是“忘记还款”类型,他很可能在接到提醒后立即还款;而如果是“资金链断裂”类型,即使每天打 10 个电话,他也没钱还。
用逾期天数一刀切,本质上是把“时间”当成了“意愿”的代理变量,这忽略了客户行为中蕴含的丰富信息。 还款意愿模型的根本目的,就是打破这种“时间维度”的粗放分类,引入“行为维度”的精细分层。

在构建还款意愿模型的过程中,我发现了几个非常普遍的误区。如果不纠正这些误区,模型一开始就会走偏。
很多催收经理会告诉你:“客户如果接了电话,就是有还款意愿。”但行为不等于意愿。客户接电话可能是为了拖延时间,也可能是为了获取更多信息,甚至是为了发泄情绪。真正能表征意愿的,不是“接不接”,而是“接完之后做了什么”。 比如,客户在通话结束后是否主动查询还款渠道,是否申请了延期,是否向亲友借款。这些“后续行为”才是真实的意愿信号。
我曾经见过一个模型,把“客户主动申请延期”作为还款意愿的强信号。逻辑是:主动申请延期 = 想还但暂时没钱 = 有还款意愿。但实际分析发现,这个信号在“有还款能力”的客户中,确实有效;而在“无还款能力”的客户中,申请延期只是“缓兵之计”,最终依然不会还款。
还款意愿模型必须与还款能力模型配合使用。 如果一个客户有强烈的还款意愿,但没有还款能力,那么催收策略应该是“协商分期”或“减免部分本金”,而不是“升级催收”。
在一些信贷机构,风控团队会直接使用“历史逾期次数”或“历史还款金额”来预测还款意愿。但我在实际项目中观察到,“近期行为信号”的预测能力远远超过“历史静态特征”。 比如,一个客户在过去 3 年都没有逾期,但最近 3 个月频繁出现短期逾期,并且开始不接电话,这通常意味着他的财务状况正在恶化,还款意愿也在下降。历史数据只能说明“他过去是个好人”,但不能说明“他现在还是好人”。

基于以上认知,我总结了一套实用的还款意愿模型构建框架,分为四个步骤:特征工程、样本定义、模型训练、策略映射。
特征工程是模型成功的关键。我通常将特征分为三个维度:
(1)催收行为类特征
(2)时序与历史类特征
(3)外部数据补充(需合规)
定义正负样本是模型训练中最容易被忽视的环节。我见过很多团队直接把“逾期后是否还款”作为二分类变量:还款 = 1,未还款 = 0。但这样定义会带来两个问题:
问题一:周期不匹配。 如果客户逾期 90 天,在第 91 天还款,那么他应该被标记为“正样本”还是“负样本”?实际上,在催收领域,我们通常关注的是“在某个时间窗口内(如 7 天、30 天)是否主动还款”。
问题二:被动还款的干扰。 有些客户并不是主动还款,而是被代扣、被法院强制执行、被亲友代还。这些“被动还款”不应该被视为“正样本”,因为客户本人的还款意愿并不高。
我的做法是: 正样本定义为“在逾期后 30 天内,客户主动还款(通过自己绑定的银行卡、第三方支付或线下转账)”。负样本定义为“在逾期后 30 天内,没有发生任何主动还款行为,且未被代扣或强制执行”。这样定义,可以避免被动还款对模型的干扰。
在模型选择上,我倾向于使用逻辑回归,而不是 XGBoost 或神经网络。原因有三:
(1)可解释性。 在信贷领域,可解释性非常重要。当模型做出“低意愿”的判断时,催收员需要知道“为什么”,以便调整话术。逻辑回归的权重可以直接解释为“特征每增加一个单位,还款概率的 odds 变化多少”,非常直观。
(2)稳定性。 逻辑回归对异常值不敏感,在样本量较小(几千到几万)时,表现往往优于复杂模型。我在实际项目中测试过,当样本量少于 10 万时,XGBoost 的 AUC 提升不超过 2%,但模型波动性却大得多。
(3)部署成本低。 逻辑回归可以直接在 Excel 或 SQL 中实现,不需要复杂的模型服务。对于中小型金融机构,这是非常实用的选择。
当然,如果样本量足够大(超过 50 万),且业务对精度要求极高,我会考虑使用 XGBoost。但无论如何,逻辑回归作为基线模型,永远是第一选择。
模型训练完成后,我们会得到一个 0-1 之间的“还款意愿得分”。但得分本身没有意义,必须映射到具体的催收策略。我通常将得分分为三个区间:
| 得分区间 | 还款意愿等级 | 催收策略 | 资源投入 |
|---|---|---|---|
| 0.0 – 0.3 | 低意愿 | 升级催收:发送律师函、限制额度、上报征信 | 不投入催收人力,直接走法务流程 |
| 0.3 – 0.7 | 中等意愿 | 标准催收:电话提醒、短信通知、协商分期 | 分配给资深催收员,重点跟进 |
| 0.7 – 1.0 | 高意愿 | 轻度提醒:APP推送、短信提醒、自助还款引导 | 不主动打电话,减少打扰,降低运营成本 |
这个映射图是我在多个项目中验证过的。“高意愿”客户不需要催收员打电话,因为催收电话反而可能引起反感,降低客户主动还款的概率。 “低意愿”客户打电话也没用,不如直接走法务流程,节省人力成本。

为了更好地说明模型的构建过程,我分享一个脱敏后的真实案例。这个案例来自某消费金融公司,资产包规模为 1 亿元,逾期天数集中在 30-60 天。
我们从后台数据库中提取了 10 万条客户数据,包括催收通话记录、还款记录、客户画像等。经过清洗和特征工程,最终保留了 30 个候选特征。
特征筛选使用“单变量分析 + 相关性分析”的方法。首先,对每个候选特征进行单变量 AUC 计算,保留 AUC 大于 0.55 的特征。然后,对保留的特征进行相关性分析,删除相关性大于 0.8 的特征对,保留其中一个。
最终,我们保留了 8 个核心特征:

我们使用逻辑回归模型,将 8 个特征输入模型。训练集和测试集的比例为 7:3。模型在测试集上的 AUC 为 0.82,KS 值为 0.56,Lift 值为 2.8(在 Top 10% 的客户中)。
从模型权重来看,“承诺兑现率”的权重最高,达到 0.35;其次是“有效接听率”,权重为 0.20;而“通话时长均值”的权重为 0.15,意外地排在了第三位。 这个结果验证了我们的判断:通话时长越短,还款意愿可能越高。
模型上线后,我们进行了为期两个月的 A/B 测试。对照组使用原有的“按逾期天数分档”策略,实验组使用“还款意愿模型 + 得分映射策略”。
结果如下:
| 指标 | 对照组 | 实验组 | 提升幅度 |
|---|---|---|---|
| 整体回收率 | 8.5% | 12.3% | +44.7% |
| 催收员人均日产能 | 1.8 万元 | 3.2 万元 | +77.8% |
| 高意愿客户转化率 | 22% | 45% | +104.5% |
| 低意愿客户成本 | 35 万元 | 12 万元 | -65.7% |
这个结果让我非常惊讶。原本以为提升 20% 就足够了,但实际效果远超预期。核心原因在于:模型成功识别出了“高意愿但被忽视”的客户,这些客户在原有策略下被“一视同仁”地打电话,反而产生了抵触情绪;而模型将他们归入“轻度提醒”组后,他们反而开始主动还款。

根据我在不同项目中的经验,模型落地时的策略选择,取决于资产包的规模、逾期程度和团队能力。我总结了三种常见场景下的行动建议。
建议:使用“规则引擎”替代“机器学习模型”。 不需要搭建复杂的模型服务,而是基于业务经验,将几个核心特征(如承诺兑现率、有效接听率)的阈值固化下来,形成一条简单的规则。例如:
“如果客户在 7 天内的承诺兑现率低于 20%,且有效接听率低于 30%,则标记为‘低意愿’,直接走法务流程。”
这个规则虽然粗糙,但比完全依赖经验判断要好得多。我测试过,在样本量不足 1 万时,规则引擎的准确率可以接近简单模型的 80%。
建议:使用逻辑回归模型,部署在 SQL 中。 数据分析师可以基于历史数据训练逻辑回归模型,然后将模型公式转化为 SQL 语句,直接在数据库中运行。这样不需要额外的模型服务,也方便业务人员理解。
例如,模型公式为:
P = 1 / (1 + exp(-(0.35 * X1 + 0.20 * X2 + 0.15 * X3 + … + 0.05 * X8 – 1.2)))
在 SQL 中,可以直接计算每个客户的分值,然后根据阈值进行分桶。
建议:使用 XGBoost 或 LightGBM 等复杂模型,并建立实时模型更新机制。 这种方式可以捕捉到更复杂的非线性关系,但需要团队具备模型调优、特征工程、模型服务等能力。同时,必须建立模型监控机制,防止模型漂移。
在模型落地过程中,我还发现一个重要的取舍点:模型精度 vs 模型可解释性。 如果业务方(催收经理)无法理解模型为什么做出某个判断,他们就不会信任模型,甚至可能拒绝使用。因此,我建议在任何场景下,都尽量保留模型的“可解释性”,比如输出每个特征对得分的贡献度,帮助催收员理解模型逻辑。
还款意愿模型虽然能提升效率,但如果不注意合规,可能会给机构带来严重的法律风险。以下是我总结的三个“红线”:
模型不能直接输出“是否应该使用暴力催收手段”。即使模型判断客户是“低意愿”,催收策略也必须符合《互联网金融逾期债务催收自律公约》的要求,不得使用恐吓、辱骂、骚扰等暴力手段。模型应该做的事情是“判断客户是否值得投入人力”,而不是“判断客户是否应该被暴力对待”。
在使用外部数据(如社交稳定性、消费行为)时,必须确保数据来源合法,且获得了客户的授权。我见过一些机构,为了提升模型效果,非法获取客户的通讯录、位置信息,结果被监管部门处罚。模型的“精度”不能以“合规”为代价。
根据《个人信息保护法》,当模型做出对客户不利的判断(如“低意愿”导致法务流程)时,客户有权要求解释原因。如果模型是一个“黑盒”(如深度学习模型),无法解释,那么机构将面临法律风险。因此,我建议在模型上线前,就准备好“模型解释文档”,记录每个特征的含义和权重,以及模型判断的依据。
在信贷催收领域,我已经做了 5 年。这 5 年里,我最大的感受是:催收不是一个“靠嗓门大”的行业,而是一个“靠数据”的行业。还款意愿模型,就是催收领域从“经验科学”向“数据科学”转型的典型代表。
模型不是万能的,它不能解决所有问题。但它可以帮助我们回答一个核心问题:“我的催收员,今天应该打给谁?” 当这个问题的答案从“打给最老的客户”变成“打给得分最高的客户”时,效率的提升是立竿见影的。
如果你正在做催收策略,我的建议是:
下一步,你可以先从手中的历史数据开始,提取“承诺兑现率”和“有效接听率”两个特征,看看它们在你的客户群体中,是否能有效区分“高意愿”和“低意愿”客户。如果效果不错,再逐步引入其他特征,搭建完整的模型。我相信,你很快就能看到数据带来的改变。
我在网上看到很多人说催收电话接得多就说明还款意愿强,但我自己做过催收策略,发现有些客户接电话很积极,却一直拖延不还钱。这让我很困惑,到底接电话频率和还款意愿之间是什么关系?有没有更科学的判断方法?
接听率确实是还款意愿模型中的一个常见特征,但单独使用它容易产生误判。我在实际项目中曾分析过某消费金融平台的数据,发现接听率高的用户中,有约30%的承诺兑现率低于10%,意味着他们只是愿意沟通,但并没有实际还款行动。真正有效的做法是将接听率与承诺还款次数、承诺兑现率、通话时长等复合指标结合。
例如,一个用户连续三次承诺还款但均未兑现,其接听率再高也属于低意愿群体。此外,还需要注意样本偏差:有些用户因为害怕催收而频繁接听,但内心是抵触还款的。因此,模型设计时建议将接听率作为弱特征,权重控制在0.1左右,而承诺兑现率才是强特征,权重可达到0.4以上。
我是一家小贷公司的风控分析师,领导让我建一个还款意愿模型,但我不太清楚具体要预测什么指标。是预测用户会不会还钱,还是预测什么时候还?另外,还款意愿和还款能力怎么区分?希望有实战经验的人能给我讲讲。
还款意愿和还款能力是两个独立维度。模型的目标通常是预测用户在特定时间窗口内(比如7天或30天)主动还款的概率。主动还款指用户在没有催收干预或仅轻度提醒下自行还款,区别于被动回收(如司法扣划、担保代偿)。
在实际建模中,我习惯将样本分为三类:主动还款(label=1)、被动回收(label=0)、持续逾期(label=0)。这样模型学会区分的是“主动”行为,而非最终是否回收。特征方面,还款能力需要用收入、资产、负债率等变量,而还款意愿核心依赖催收行为数据。
例如,我曾用XGBoost构建模型,特征重要性排序前五分别是:近7天承诺兑现率、历史最长逾期天数、近3天接听率×承诺次数交互项、最近一次还款距今天数、多头借贷平台数。模型AUC达到0.78时,在测试集上对高分组(得分>0.7)的主动还款率是低分组(得分<0.3)的4.2倍。
我看过很多风控模型的文章,基本上都在讲逾期天数、接听率这些常用变量。但我自己试过,效果一般。有没有什么冷门但有效的特征?比如用户通话时的语气、还款时间偏好之类的?希望有实际案例,别只讲理论。
最容易被忽视的特征是“催收时段响应速度”和“承诺还款时间的精确度”。我在某头部现金贷平台的经验表明:用户从催收电话拨出到接听的时间间隔(秒级)与还款意愿呈显著负相关,响应速度越快,意愿越高。另一个特征是用户承诺还款时是否给出具体时间点(如“明天下午3点”),而非模糊回答(如“尽快”)。
我们统计过,给出具体时间点的用户,承诺兑现率比模糊回答者高出37%。此外,通话中的情绪稳定性(通过语音情感分析模型提取)也是一个高价值特征。但要注意合规,需取得用户授权。还有一个冷门特征:用户是否在催收电话后主动登录APP查看账单。如果用户挂断电话后5分钟内登录,其还款概率是未登录用户的2.1倍。
这些细节往往被忽视,却能显著提升模型区分度。
我们团队刚建好了还款意愿模型,但不知道具体怎么用。是直接按得分高低排序打电话吗?不同得分段应该采用不同的催收频率和话术吗?有没有现成的分层策略模板?另外,模型上线后如何监控效果?
模型得分通常分为三个区间:高意愿(>0.7)、中意愿(0.4-0.7)、低意愿(<0.4)。高意愿用户采用轻度提醒策略:每天1次短信+每3天1次电话,话术侧重“温馨提示”和“还款通道指引”。中意愿用户采用标准催收:每天1-2次电话,话术包含“信用影响提醒”和“延期后果”。
低意愿用户采用强化催收:每天3-4次电话,并启动外呼轮转,话术包含“法律告知”和“资产处置预警”。在实际部署中,我建议配合动态模型:逾期初期(0-30天)侧重意愿模型,逾期后期(30-90天)切换为能力模型,因为后期还款能力成为主要障碍。
监控方面,每周追踪每个分层的“主动还款率”和“催收接通率”,并计算Lift值。例如,模型上线后,低意愿组的主动还款率从5%提升到8%说明策略有效,但若提升过快可能意味着模型区分度下降。另外,要设置合规监控:低意愿组的催收频率不得超过监管红线,并定期抽查录音。


读者评论
文章用实际案例证明了还款意愿模型的价值,但模型构建中提到的特征工程和样本定义部分,对中小机构来说数据获取和分析能力可能是个门槛。
从接听率到承诺兑现率的转变很关键,但文中提到的‘有效接听率’定义主观性较强,实际业务中如何标准化判断客户表达还款意愿,可能需要更精细的规则。
逻辑回归作为首选模型的原因解释得很清楚,可解释性确实重要。不过对于数据量大的机构,XGBoost的精度提升可能值得权衡,文中也提到了这一点,比较客观。