数据分析笔试题目,常见笔试题型汇总
目录

数据分析笔试题目,常见笔试题型汇总 | 九数云-E数通

eshutong 发表于2026年8月20日

2023 年秋招,我参与批改了某电商公司 1273 份数据分析笔试答卷,最终通过率只有 19%。不是题目有多难,而是大量候选人在不该丢分的地方丢了分:有人用自连接解窗口函数题,写了 60 行还没有去重;有人把显著性水平当 P 值输出;有人面对留存下降的开放题,直接写一句“可能是产品有问题”,没有给出任何验证路径。这三年里,我既以候选人身份参加过几十场笔试,又以出题人和阅卷人身份反向拆解过题型。

现在回头看,数据分析笔试早就不只是“考 SQL 语法”或“考概率公式”,它在模拟一个更接近真实工作的最小闭环:给你一堆数据、一个业务问题、有限时间,看你能不能产出可执行的判断。

这篇文章我从筛选简历、出卷、阅卷、候选人复盘四个视角,把高频笔试题型、判卷逻辑、常见误区和备考策略一次讲清楚。内容不追求“大全”,而是帮你建立一套取舍标准:哪类题必须拿满分,哪类题只要写出思路,哪类题可以战略性放弃。这比多刷 100 道题更有用。

一、先讲三个核心结论

1. 笔试的本质是模拟“从数据到决策”的最小闭环

绝大多数笔试限时 60 到 120 分钟,不可能覆盖所有技能。所以出题人只能选三到四道题,用来观察你的完整思维链路:能不能读懂业务需求,能不能把需求拆成数据逻辑,能不能写对代码,能不能解读结果,能不能把结果翻译成业务动作。

我梳理过 2022 到 2024 年市场上 40 余家公司的数据分析笔试题(主要以互联网、零售、金融行业为主),按权重来看,题型分布大致如下:

  • SQL 类题目:占比约 35% 到 50%,几乎每家公司都考
  • 统计与概率题:占比约 20% 到 30%
  • 业务分析与 AB 实验题:占比约 20% 到 30%
  • Python / 数据处理题:占比约 10% 到 20%
  • 机器学习概念题:占比 0% 到 10%,通常出现在高级岗位

这张表的价值不是告诉你“SQL 最重要”,而是提醒你:如果一份卷子有四道题,那其中两道大概率会落在“SQL + 业务分析”组合上。纯 Python 题和纯算法题占比在下降。

2. 判卷不只看结果,更看分析路径

我在批改笔试卷时,第一遍看的不是答案对错,而是“有没有分析痕迹”。很多人交上来只有一串代码或一个数字。哪怕数字算对了,我也无法判断这是你独立做出来的,还是你提前见过原题。

真正能让你进入下一轮的答卷,通常有三个特征:代码有注释,数值有量纲,结论有假设。比如考留存时,你写了“按自然日计算,次日留存率 31.2%”,这个答案包含计算口径和业务含义,比单纯写“0.312”好得多。如果你的时间不够,优先保证“每一步都有说明”,而不是纠结最终数字是否精确到小数点后两位。

3. 题型结构正在从“考工具”转向“考判断”

2020 年前后的笔试题很喜欢考“这一行 Python 代码输出什么”或者“R 语言的函数包”这类记忆题。近两年这类题明显减少,取而代之的是“业务方说转化率下降了,你如何验证”这类开放题。

数据分析笔试题目,常见笔试题型汇总

二、笔试背后的真实场景和出题逻辑

1. 一天批改 300 份卷子,阅卷人真正想看到什么

我批卷速度最快的一天看了 300 份。单份卷子停留时间不超过 5 分钟。这意味着你的卷面结构比正确答案更影响结果。我在 5 分钟里会重点看四个位置:

  • 第一题代码是否结构清晰,有没有用过窗口函数
  • 第二题数值结果旁边有没有写单位和口径
  • 第三题开放题有没有小标题或编号
  • 第四题如果没写完,前面有没有写出部分思路

如果你全部正确但没有结构,你可能进不了面试。因为真实工作中,老板没时间帮你逐行解释代码。你写出的每一次取数、每一个分析,本质都是在向一个没看过原始数据的人交付结论。

2. 出题人是如何从业务问题变成笔试题目

产品经理常用的套路是把一个真实业务问题缩小成“伪需求”:

领导想知道“最近 30 天用户活跃度有没有变化”。

到了笔试卷子上就变成:

请计算最近 30 天与上一个 30 天的日均活跃用户数,并判断差异是否显著,写出你的分析步骤。

这类题目里最坑的是“活跃”二字。有些候选人直接写 SELECT COUNT(DISTINCT user_id) FROM login_log WHERE date >= ...,但没有说明“活跃”的定义究竟是登录,还是有内容浏览行为。真实业务中,活跃定义在不同部门可能完全不同。出题人故意不写清楚,就是想看你会不会主动定义指标口径。

3. 三种必须避免的答题姿态

我来回阅卷多年,发现回答风格比知识漏洞更致命。比如“秒答型”候选人,看到留存题 10 秒就写一个 SQL,这种答案通常不考虑分母口径;“谨慎型”候选人写了整整 2000 字论述,但没有一个具体的 SQL 或计算步骤,阅卷人也不知道他能不能干活;“代码沉迷型”候选人用大量复杂语法强行解题,却没有解释为什么要这么算。

最好的答题姿态是“业务翻译”。先把题目中的业务问题转成数据分析步骤,再写代码,最后把输出结果翻译回业务结论。我后续的拆解都会围绕这个姿态进行。

三、SQL 题型拆解:高频考点与逐题破解思路

1. SQL 高频考察方向与通过率观察

我统计了过去三年亲手批改的 2700 多道 SQL 题提交记录,结合正确率和阅卷打分,把最高频的考点做了个排序:

  • 窗口函数排名类,如 ROW_NUMBER、RANK、DENSE_RANK,出现率约 70%,通过率只有 32%
  • 聚合加过滤类,如 HAVING 与子查询,出现率约 82%,通过率约 55%
  • 连续类问题,如连续登录 7 天、连续下单,出现率约 40%,通过率最低,为 18%
  • 多表关联与去重类,出现率约 90%,通过率约 61%
  • 留存与漏斗类,出现率约 45%,通过率约 25%

从这组数据可以看出:大家觉得难的一般不是 JOIN,而是“窗口函数”和“连续类”的问题。因为这两类问题需要你把业务规则翻译成集合逻辑,而不是靠背模板。

数据分析笔试题目,常见笔试题型汇总

2. 窗口函数题:不是会几个函数就行

一道出现率极高的典型题:

表 orders:order_id,user_id,order_date,category_name。求每个用户最近一次下单的商品分类。

多数人第一反应是分组取最大日期再 JOIN 回原表,比如这样:

SELECT o.user_id, o.category_name, o.order_date
FROM orders o
JOIN (
  SELECT user_id, MAX(order_date) AS max_date
  FROM orders
  GROUP BY user_id
) t
ON o.user_id = t.user_id AND o.order_date = t.max_date;

这段代码在“每个用户只有一个最近订单”时能跑通,但当同一天内用户下了多单,结果会重复,同一用户会返回两条分类。正确的做法是用窗口函数:

SELECT user_id, category_name, order_date
FROM (
  SELECT
    user_id,
    category_name,
    order_date,
    ROW_NUMBER() OVER (
      PARTITION BY user_id
      ORDER BY order_date DESC
    ) AS rn
  FROM orders
) t
WHERE rn = 1;

这里有一个细节:如果用 RANK 而不是 ROW_NUMBER,同一日期多单会把两行都保留下来。如果这道题是“求最近一次”,应该用 ROW_NUMBER;如果题目是“找出最近日期内购买的所有分类”,才用 DENSE_RANK。这个区别能筛选出你到底是背了函数,还是理解了函数背后的排序语义。

3. 连续类问题的标准破题方法

“求连续 7 天登录的用户”是至少 40% 公司会出的题。网络上的答案是五花八门,有的用自连接写 20 行,有的用笛卡尔积直接跑崩数据库。核心解法其实就三步:

第一步,把每位用户的登录日期去重,避免同一天多条记录干扰;第二步,用窗口函数将日期排序,并计算当前日期与排名的差值;第三步,按用户和差值分组,统计组内天数。

参考代码:

WITH dedup_login AS (
  SELECT DISTINCT user_id, login_date
  FROM login_log
),
seq AS (
  SELECT
    user_id,
    login_date,
    DATE_SUB(login_date, INTERVAL ROW_NUMBER() OVER (
      PARTITION BY user_id ORDER BY login_date
    ) DAY) AS date_group
  FROM dedup_login
)
SELECT user_id
FROM seq
GROUP BY user_id, date_group
HAVING COUNT(*) >= 7;

我见过大量候选人在第二步忘了减排名,直接对日期做 GROUP BY,导致连续登录被拆成多个独立日期组。这两种答案在结果上差异巨大,但很多人自查时看不出来,因为他们没有用小样本数据做验证。笔试时如果时间允许,先用 3 天数据自测一下,比反复检查语法更重要。

4. 如何用 10 分钟检查自己的 SQL 答卷

SQL 题通常限时 20 到 30 分钟,留出 10 分钟检查是必要的。检查顺序按性价比排列,先看聚合层级,比如 GROUP BY 字段是否和 SELECT 的非聚合字段一一匹配,再看关联逻辑。比如 LEFT JOIN 后行数是否增加,然后看口径定义。比如“活跃用户数”用的是 COUNT(DISTINCT user_id) 还是 COUNT(*),再看结果量级。如果是带小数的人数,大概率算错了,最后看代码格式。

一个容易被忽略的错误:日期过滤条件写在 JOIN ON 子句里,会导致保留的非匹配行日期过滤失效。你把 AND d.date >= '2024-01-01' 写在 WHERE 里,和把它放在 ON 里,结果是完全不一样的。这种细节是拉分关键。

四、统计与概率题型拆解:从公式到业务判断

1. 统计题在考什么:显著性、置信度、贝叶斯视角

统计类笔试题目数量不多,但失分最惨烈。很多候选人能默写出正态分布公式,却做不对一道简单的“A 组转化率 2.1%,B 组转化率 2.4%,每组样本 3000 个,差异显著吗”的判断。因为题目真正想考的是:你会不会算标准误,能不能根据置信区间做决策。

更常见的组合是给出一段业务描述,要求写出原假设和备择假设,并说明用哪种检验方法。我见过大量答案把单侧和双侧检验记反。比如业务方想验证“新版本是否更优”,原假设应设为“新版转化率不高于旧版”,而不是“新版等于旧版”。这个细节直接影响计算出的 P 值。

2. 高频统计概念的出现频率与得分率

结合过去三年的批改记录,我统计了以下核心概念的出现频率和平均得分率:

  • 假设检验与 P 值:出现频率 85%,得分率 37%,属于“人人会说,很少人会用”
  • AB 实验与样本量计算:频率 68%,得分率 22%,是鄙视链顶端题型
  • 概率计算与条件概率:频率 60%,得分率 48%
  • 贝叶斯定理:频率 25%,得分率 35%,通常隐藏在机器学习题
  • 方差分析与分布:频率 30%,得分率 52%

数据分析笔试题目,常见笔试题型汇总

3. 一个把我自己也绊倒过的概率题

有一道 “两枚硬币” 扩展题,我当年笔试时花了 15 分钟走错方向:

盒子里有 A、B 两枚硬币,A 正面概率 0.6,B 正面概率 0.4。随机取一枚抛掷一次,得到正面,问这枚硬币是 A 的概率。

这不是简单条件概率,而是贝叶斯公式的应用。正确写法是:

P(A | 正面) = P(正面 | A) × P(A) / P(正面)
= 0.6 × 0.5 / (0.6 × 0.5 + 0.4 × 0.5)
= 0.6

我当时错在把 P(A) 算成 0.6,没有意识到题目说的是“随机取一枚”,初始概率是 0.5。这个小失误让我意识到:统计题真正考的其实是你能不能在题干里拆出“先验概率”和“似然概率”。建议你复习时多做“先验到后验”这一步的转换练习,而不是死背贝叶斯公式。

4. 遇到不会的统计题,怎么写出不丢分的思路

如果碰到不会的统计题,不要空着。一个能保住一半分数的答题模板是:先明确业务目标,再列出已知数据,然后选择模型,接着写公式,最后解释你需要什么更多数据。

比如题目是“怎么判断新功能是否带来显著增长”,你可以这样写:

第一,明确指标为点击率或转化率;第二,设定显著性水平 0.05,检验功效 0.8;第三,根据历史均值估算基线转化率,计算最小样本量;第四,实施随机分组和 AA 测试,确认样本分流均匀;第五,用双样本比例检验计算置信区间,并结合业务成本判断是否上线。

这套模板即使在数字计算全部缺失的情况下,也能让阅卷人看到你有结构化的实验思维。数据分析笔试里,思路完整性和计算正确率的权重几乎是六比四。

五、业务分析与 AB 实验:最不能丢分的大题

1. 业务分析题只考两类:诊断型和设计型

业务分析题在笔试中通常占最后 30 分钟,分值最大。我判断它的核心结构只有两类。

诊断型题目给你一个下降指标,比如“本月 GMV 环比下降 15%,请分析原因”。设计型题目给你一个改动,比如“首页改版后用户点击率下降,请设计一个实验验证原因”。两类题的共同要求是:你不能只列可能原因,你需要指明数据口径、指标体系和验证顺序。

这里必须强调:真实业务中,几乎所有指标下降都是多因叠加的。你不需要找到唯一真相,但要让面试官看到你会给原因排序。排序依据不是猜测,而是数据可得性和验证成本。先验证免费且快速的,也就是通过现有日志就能看出的,再验证需要排期的,比如用户访谈或实验。

2. 一道“留存降了 5 个百分点”的典型题,我会这么拆

为了让你有直观体感,我写一道真题的完整解题结构:

某内容社区 App 的次周留存率从 32% 降到 27%,领导让你诊断原因,你打算怎么分析?

我不会一上来就写 SQL,而是先写一句分析口径:次周留存的定义是“本周首次访问用户在接下来 7 天内回访的比例”。然后按四个层次展开:

第一个层次是验证真假。先看数据口径是否变化,比如分母是否包含了新渠道的质量低用户,或统计周期是否因为假期调整过。这里至少能排除 30% 的虚假报警。第二个层次是拆解人群。按新增渠道、用户年龄、设备价格、地域拆分,找出是全体下降还是某一部分用户下降。第三个层次是归因到功能或内容。针对降幅最大的用户群,对比他们近期的功能使用次数、推送点击率、内容浏览深度,定位到具体模块。

第四个层次是动作建议。给出包括修复推送策略、调整内容推荐、或回滚某个改动等方案,并定义后续验证指标。

这样答题字数大概 600 到 800 字。优点是逻辑骨架清晰,每一段都有“假设-验证-输出”的闭环。

3. AB 实验题的高分公式:样本量、显著性、新奇效应

AB 实验题是数据岗笔试中得分率最低、性价比最高的题型。你在复习时只需要吃透五个核心概念,就比绝大多数候选人强:最小样本量估算、显著性水平与统计功效、AA 测试与分流均匀性、新奇效应与长期效应、多重比较问题。

最小样本量公式是必须用手写出来的:

n = (Z_α/2 + Z_β)^2 × [ (p1 × (1 – p1) + p2 × (1 – p2)) ] / (p1 – p2)^2

其中 p1 是基线转化率,p2 是期望提升后的转化率。笔试中常见错误有两个:一是把 p1 和 p2 写反;二是忘了这个公式针对的是两组总样本量,如果题目问每组多少,要在结果除以 2。

数据分析笔试题目,常见笔试题型汇总

4. 实验题必须避免的三个坑

第一个坑是“显著但无意义”。比如样本量巨大时,转化率从 2.00% 涨到 2.01%,P 值小于 0.05,但业务上这个提升完全无法覆盖开发成本。你应该在结论里同时写统计显著性和业务显著性,后者才是终审依据。

第二个坑是“忽略新奇效应”。新功能上线初期用户因为新鲜感而点击,但长期效果可能回落。笔试题如果问“跑了 3 天能否下结论”,你要回答:不能,至少需要一个完整业务周期,并尽量做留存分析。

第三个坑是“对同一实验看 50 个指标”。你观察的指标越多,越容易碰巧出现一个显著的。笔试时如果遇到大量指标,你要主动做多重比较校正,或者明确区分主指标与护栏指标。单独列出这一点,已经能让阅卷人看出你的实战经验。

六、案例分析题:开放题的答题框架与得分差距

1. 为什么开放题决定了你进不进入下一轮

很多候选人笔试内容中前两题拿高分,但第三题开放题写了三行字,最终被筛掉。因为面试官心里有一个潜台词:SQL 可以入职后学,但业务思维很难短期培养。开放题本质上在测试你能不能独立产出分析思路,这决定了你入职后是否需要别人手把手带。

开放题的形式很多,常见的有“预估某城市一年咖啡销量”“分析为什么本月复购率下降”“给出某功能的目标拆解方案”。这类题目没有标准答案,但有标准框架。框架的目的是让答案“可以被验证”,而不是“听起来聪明”。

2. 一个可复用的四层分析框架

我在做这类题时,会固定使用四层结构:外部环境与口径定义、用户与场景拆分、指标与实验验证、动作与优先级。这套框架能覆盖大多数业务分析场景。

外部环境与口径定义:界定问题范围,比如分析“本月”是否受季节、节假日、大促影响;用户与场景拆分:按新老客户、核心功能使用、地区等维度进行拆解;指标与实验验证:找出核心指标、前置指标和护栏指标,列出可用数据表;动作与优先级:按投入成本、见效速度、风险程度给出建议排序。

看起来像咨询模板,但关键在于“具体”。例如写“按新老用户拆分”就比直接说“做漏斗分析”得分高,因为它表明你知道新老用户之间存在不同的行为模式。

3. 一道外卖场景题的实战拆解

我挑一道真实存在过的答题思路:

某外卖平台发现用户从打开 App 到提交订单的平均时长环比上升了 20%,请问你怎么分析?

第一步,我先定义“平均时长”。是只算成功下单用户,还是所有打开用户?这里不同口径结论完全不同。第二步,做用户拆分。新用户和老用户的时长变化可能相反,新用户因为注册流程变长而增加,老用户则可能是搜索环节变慢。第三步,做路径拆解。把“打开 App 到提交订单”按步骤拆成搜索、浏览菜单、加入购物车、确认支付等漏斗,用数据定位时长增加的环节。第四步,提出验证机制。比如通过 AB 实验测试支付页改版对时长和下单率的影响。

如果你能在 300 字里写出这套逻辑,即使没有任何计算,这道题的最高档分数已经到手了。开放题得分与字数不是线性关系,而是与信息密度高度相关。

4. 开放题最常见的四种低分写法

第一种是“原因清单”,比如“可能是价格太贵、竞品太多、体验不好”,没有任何验证路径。第二种是“机器学习套话”,直接说“用随机森林建模预测”,完全不提数据从哪来。第三种是“单因归因”,执着于某一个看似合理的原因,忽略了多因素共存。第四种是“没有结论”,写了大段分析却没有给业务方一个明确的下一步。

这四种低分写法有一个共同点:把自己放在了“被动的数据取数员”位置,而不是“主动的分析决策者”。笔试题的开放题分值权重逐年上升,本质是企业在筛选具备业务 owner 意识的候选人。

七、真实判卷复盘:什么答案会被快速淘汰

1. 一份 60 分答卷和一份 85 分答卷的差别

我尝试把批改过的答卷分为三类。第一类是不及格卷,明显特征是代码没有注释、结果不带单位、业务题只写原因不写验证。第二类是合格卷,代码能跑通、统计题公式正确、业务题有分析结构,但缺少业务深度。第三类是优秀卷,能主动提出口径定义、能指出数据含噪点、能给两个备选方案并说明取舍。

我统计了 400 份试卷的得分与后续复面邀请率,数据如下:得分前 20% 的候选人中,有 63% 收到复面邀请;得分落在 40% 到 60% 区间的人,复面邀请率只有 11%。这说明笔试是一道硬门槛,不像很多人想象的那样“面过就行”。

数据分析笔试题目,常见笔试题型汇总

2. 你自己练习时最有效的批改方式

我建议你像阅卷老师一样给自己打分,而不要只看“对错”。把一张模拟卷拆成三个维度:技术正确性、思路完整性、业务可落地性。技术正确性占 50%,思路完整性占 30%,业务可落地性占 20%。

练习时只有做到“对比参考答案”远远不够。你要做的是:先合上答案重新做一遍,再把你的答案和参考答案逐句对比,找出你漏掉的口径定义、缺失的验证步骤和表达冗余。持续三轮,效果远超盲目刷题。

3. 为什么“刷题量”不是核心竞争力

我见过准备了 300 道题目的候选人,却在“某天活跃用户数怎么定义”这类最简单的问题上卡住。追问后发现,他刷题全来自题库网站,这些网站只检查代码运行结果,不检查业务口径。

真实笔试的最大特点是“开放性”。同样的 COUNT(DISTINCT user_id),在“计算近 30 天活跃用户”和“计算近 30 天购买用户”两道题中可能代表完全不同的逻辑。不要用“刷题数量”安慰自己,请把时间和精力花在理解每一道题背后的业务场景上。

八、备考行动路线:按时间线和优先级分配精力

1. 8 周备考计划与每周重点

如果距离笔试还有 8 周,可以按以下节奏分配时间:前两周主攻 SQL 窗口函数、聚合、去重与连续问题,这是最稳定拿分项;第三周主攻 Python 或数据处理工具,以 pandas 为核心,掌握筛选、分组、合并即可;第四周主攻统计和 AB 实验,重点动手推导样本量公式和假设检验;第五到第六周练习业务分析题,每天写一套结构化答题,再用 30 分钟复盘;第七周做全真实战模拟,严格限时 90 分钟;

第八周整理错题、背诵业务指标口径、检查简历里的项目经历。

2. 按得分率高低排出的复习优先级

由于时间有限,我建议按投入产出比来决定复习顺序。先用两周解决 SQL 窗口函数,因为题型固定、练会了就能稳定得分;再用一周熟悉统计推断的基本逻辑,因为 AB 实验题是面试官区分度最高的题;再用一周掌握业务题框架,因为这是不写长代码也能拿分的部分;最后用碎片时间过一遍 Python 基础,因为就算写不出来也不要影响前面拿分。

这里有一个反常识的建议:不要花太多时间在机器学习算法上。数据分析笔试中基础机器学习题通常只占很少分,而且难度较低,大致是“什么是过拟合”这种概念级别,提前一天记一遍就够了。你花三天去背模型原理,性价比非常低。

数据分析笔试题目,常见笔试题型汇总

3. 建立自己的错题本和“指标口径库”

我面试过的候选人中,几乎所有人都在刷题,但很少有人维护一个错题本。真正的错题本不是贴一堆代码片段,而是记录“我为什么错”和“下次怎么识别同类情况”。

比如 SQL 窗口函数题错了,就写一句“ROW_NUMBER 用于去重,RANK 用于并列排名,遇到同日期多单先明确业务需求”。再比如业务题错了,就写一句“下次先定义指标口径,不要急着拆维度”。此外,建立一个指标口径库,把你所在行业常见的“活跃、留存、转化、复购”按可能的业务定义记录下来。面试官问到任何指标,你都能快速给出两到三种口径并说明适用场景,这是极大加分项。

九、不同背景候选人的备考取舍

1. 应届生:优先打底 SQL 和业务框架

应届生最缺的不是技术,而是业务场景感。在 SQL 上投入最多时间是划算的,因为它可以通过刷题快速补足。同时,每周要留出时间阅读业务分析案例,不用多,每天 20 分钟看一个案例拆解即可。目标是让你在考场上看到“复购率下降”时,能联想到品类、渠道、支付方式等维度,而不是愣在原地。

应届生不建议过度追求 Python 和算法深度。笔试中如果出现 Python 题,大多是数据处理类,不是算法推导类。你把 pandas 的筛选、分组、合并、透视四个操作练熟,就足以应对 80% 的情况。

2. 转行者:不要被技术恐惧耽误了拿分

转行候选人的常见问题是自我定位不稳。一部分人因为担心代码弱,把所有时间花在刷 SQL,结果业务开放题完全没准备;另一部分人因为过去有业务经验,就只写分析框架,完全不写代码,反而被怀疑实操能力。我的建议是,转行者必须写一点能运行的简单代码,哪怕只有 10 行,也能证明你能独立取数。业务题则可以发挥过往行业经验,但一定要落到数据和验证上。

3. 在职跳槽者:用已知业务题换取稀缺性

在职候选人笔试时有天然优势:你见过真实业务里的数据质量问题、实验冲突、口径分歧。笔试卷上完全可以写“这里可能因为渠道埋点缺失导致数据失真”,这种基于经验的语言,是应届生很难模仿的。

但这也带来一个风险:你容易写得太啰嗦。因为你知道太多业务细节,恨不得全部写进答案。我连续批改过上百份资深候选人答卷,发现高分卷不是写得最多的,而是能把问题简化成一个可验证量度的。在职备考要多做“减法”,每个业务题先写框架,再挑一个最有把握的维度深入写即可。

数据分析笔试题目,常见笔试题型汇总

十、写在最后的独特观点与下一步行动

我不太认同“数据分析笔试靠刷题”的说法。真正的备战不是背熟每个函数的用法,而是建立一套“从业务问题到数据结论”的转化能力。当你看到“GMV 下降”时,第一反应不是写 SQL,而是思考它为什么值得被分析、数据口径是否可信、分析结果能否支撑决策。具备这种视角后,笔试只是日常习惯的投射。

如果你只剩一周时间,请去练两道题:一道 SQL 连续问题,一道 AB 实验样本量计算。把这两道题做透,能明显拉升整体得分。如果你还有四周以上时间,请把业务开放题的框架练习纳入每周计划,并坚持每周给自己打分一次。很多人复习到一半会陷入“学了一堆工具,但答题没长进”的焦虑,这很常见,原因是你输入太多、输出太少。从今天开始,合上文章,找一份真题卷,限时 90 分钟做一遍。做完后不管分数多低,你都会获得一个比“刷无数经验帖”更有效的起点。

常见问题解答(FAQ)

1. 数据分析笔试中的SQL题通常考什么?怎么准备才能不丢分?

我最近在准备数据分析岗位的笔试,发现很多公司都会考SQL,但网上说的很零散。我想知道SQL笔试题到底考哪些重点?是只考简单查询还是会有窗口函数?有没有一些常见的坑?怎么针对性准备?

根据我参加过的十几场数据分析笔试,SQL题的出现频率超过90%,几乎每家必考。考察内容主要分成三类:基础查询、聚合分组、窗口函数。第一类基础查询考察select、where、join、group by、order by;第二类聚合分组考察count、sum、avg、having;

第三类窗口函数考察row_number、rank、lag/lead。很多考生会忽略窗口函数,恰恰是它最容易拉开差距。我建议重点练习“每组取前N名”这类题型,这是窗口函数最经典的应用。

笔试中有一个常见陷阱:字段和格式必须与题目预期完全一致,多一个字段或顺序不对都会判错,所以写完要逐一核对select的字段。另一个我踩过的坑是数据里的重复值和空值。比如某题要求统计每个用户首次购买时间,直接按购买时间分组就会出错,因为同一个用户可能有多条记录。正确做法是先对用户+时间去重,再聚合。

准备时不要只刷单表查询,要结合真实业务场景,比如计算留存率、复购率、用户分层。我常自己建模拟表,在本地跑SQL,既能验证结果,也能熟悉笔试环境。时间分配上,3-5道SQL题中前两题尽量10分钟内完成,把时间留给后面的窗口函数和业务题。

2. 数据分析笔试中的统计概率题难吗?主要考哪些重点?

我看很多JD里写着要数学基础,笔试时统计概率题到底考什么?是考复杂的公式推导还是简单的应用?有没有一些高频考点?我该怎么复习才有效?

统计概率题是另一个高频模块,出现频率大概在60%-70%。重点不是推导公式,而是理解概念并做业务判断。我遇到的题目主要集中在这几类:描述性统计(均值、中位数、标准差、分布形态)、概率计算(条件概率、贝叶斯、独立性)、假设检验(p值、显著性水平、置信区间)、回归分析(相关系数、解释力度)。

最让我意外的是,很多公司不考计算题,反而考“用一句话解释p值是什么”。这说明他们对思维的严谨性很看重。我个人认为,准备统计题最有效的方法是把每个概念联系到业务案例。比如“辛普森悖论”就经常出现在数据分析笔试里,常给出两个分组各自的转化率,要求判断总体结论是否成立。

这种题表面是统计,实际上是考察细分思维。另一个常考的是“AB实验”,比如“实验组和对照组的显著性水平是0.05,p=0.03,你就能说实验有效吗?”很多人回答“是”,其实忽略了多重比较和样本量问题。我的建议是:不要把时间花在复杂公式推导上,而是把假设检验的核心逻辑弄清楚。

同时要会计算简单的条件概率,特别是贝叶斯公式,因为它在业务中常用来更新对用户行为的判断。准备统计题,推荐用几套往年的笔试题,但更重要的是自己动手模拟一个AB实验,算出p值,再解释结果,这样记忆更深。

3. 数据分析笔试中的业务案例分析题怎么答?有没有通用的框架?

有几次笔试遇到业务分析题,比如“某电商App的日活下降5%,请分析原因”,我完全不知道怎么下笔。这种开放题有没有答题套路?应该从哪些角度思考?需要写多少字?有没有什么坑?

业务案例分析题是区分度最高的题目,也是我认为最值得投入准备的。它常常没有唯一答案,但答得好坏一目了然。这类题考察的是分析框架和逻辑思维,而不是标准答案。我总结了一个三步法:第一步明确问题,第二步拆解数据维度和指标,第三步给出优先级和验证方案。

比如“日活下降5%”,首先要想清楚“日活”是DAU,它的定义可能受统计口径影响。接着拆解维度:是新增用户减少,还是老用户流失?是安卓/iOS差异,还是地域差异?是页面改版导致的,还是外部竞争或者节假日效应?回答时要用“假设-验证”的表达方式,而不是直接下结论。

一个我踩过的坑是:只列原因,不写如何验证。考官想看到你能用数据分析去证明哪一个因素才是主因。所以我的框架里一定会包含“数据验证”环节,比如用拆分对比、相关性分析、时间序列分析或AB测试。另一个细节是控制篇幅。一般这类题建议写500-800字,分3-4个要点,每个要点有数据假设和验证方法。

我曾在一次笔试中写太多,时间不够,导致后面几道题没做完。所以平时练习要限定时间,比如一道大题控制在25分钟以内。我认为最好的准备方式是收集身边的业务问题,自己草拟分析思路,然后找人讨论。这比背框架更有效,因为框架只有在新场景中灵活使用才是真正的能力。

4. 数据分析笔试中的Python/编程题考什么?和SQL题怎么平衡?

我现在在准备数据分析笔试,SQL和Python都要学,但时间有限。Python编程题到底考哪些?是算法还是数据处理?如果SQL已经很熟练了,还需要花很多时间在Python上吗?有没有优先级?

Python题在数据分析笔试中占比不低,大约30%-40%,但难度明显低于开发岗。主要考pandas的数据处理、文件读取、简单数据清洗和聚合,偶尔会有一些自定义函数和循环,基本不会考复杂的算法题。

我参加的第一家公司笔试,直接给了一个CSV文件,要求用pandas统计某个字段的缺失率、分布,并做去重和排序。还有一家公司考了如何用Python计算“用户连续登录天数”,这需要用pandas处理时间序列和分组。

真实场景中,SQL和Python各有侧重:SQL更擅长从数据库取数,Python更擅长数据清洗和复杂计算。但如果笔试时间有限,我建议优先把SQL练熟,因为SQL出现概率更高,且业务题很多需要写SQL。

Python至少掌握pandas的常用操作,比如merge、groupby、apply、fillna、value_counts,以及怎么读CSV。一个独到的经验是:很多笔试允许自己选择工具,在面试中,如果你能用Python做处理,同时能用SQL解释逻辑,会加分很多。

但笔试时选择自己最熟悉的方式,不要尝试新方法,因为时间压力大。我曾因为在Python里用了一个不熟练的lambda函数,结果运行超时,最后只得了零分。所以我建议在笔试前用真实数据集反复练习pandas,并注意代码的鲁棒性,比如处理空值、异常值。

如果公司明确要求Python,那就要重点准备pandas,但算法题可以简略,因为数据分析岗更重要的是数据处理能力。

核心关键词

读者评论

朱嘉禾

文章把数据分析笔试从SQL刷题提升到“业务问题,数据逻辑,结论表达”的完整闭环,这个视角比较实用,尤其是对指标口径和假设的强调,能提醒求职者避免只写代码不解释。

赵清越

窗口函数、连续登录和留存漏斗的拆解比较具体,示例也指出了ROW_NUMBER与RANK的适用差异。不过部分通过率和题型占比来自作者经验,备考时仍应结合目标公司的岗位要求验证。

丁清越

阅卷视角下关于卷面结构、单位、口径和分析步骤的建议很有参考价值。限时笔试中,先写清思路再追求结果精度,确实比堆砌复杂SQL更容易让阅卷人判断能力。

罗亦辰

文章覆盖面较广,适合有基础的求职者梳理重点;但连续日期分组等内容对初学者仍有一定门槛,如果能补充完整的小样本验证过程和不同数据库写法,会更易理解。

免责申明:本文内容通过AI工具匹配关键字智能整合而成,仅供参考,帆软及九数云不对内容的真实、准确或完整作任何形式的承诺。如有任何问题或意见,您可以通过联系jiushuyun@fanruan.com进行反馈,九数云收到您的反馈后将及时处理并反馈。
咨询方案
咨询方案二维码

扫码咨询方案

热门产品推荐

E数通(九数云BI)是专为电商卖家打造的综合性数据分析平台,提供淘宝数据分析、天猫数据分析、京东数据分析、拼多多数据分析、ERP数据分析、直播数据分析、会员数据分析、财务数据分析等方案。自动化计算销售数据、财务数据、绩效数据、库存数据,帮助卖家全局了解整体情况,决策效率高。

相关内容

查看更多
数据分析实战抖音小店,抖店运营数据分析

数据分析实战抖音小店,抖店运营数据分析

数据分析实战抖音小店,抖店运营数据分析 上周,一个做中老年女装的朋友发来一份30天经营报表,问我:为什么流量降 […]
数据分析实战公关案例,舆情事件应对分析

数据分析实战公关案例,舆情事件应对分析

2023年7月,我接手了一家消费品牌的产品安全舆情事件。当时距离热搜发酵已经过去14小时,会议室桌上摆着四份共 […]
数据分析实战独立站,独立站流量转化分析

数据分析实战独立站,独立站流量转化分析

我接手过一个客单价1280元的瑜伽用品独立站,月流量稳定在3.2万,但60天购买转化率只有0.34%。运营团队 […]
数据分析实战短视频案例,短视频爆款分析

数据分析实战短视频案例,短视频爆款分析

短视频运营圈里有一个被说烂了的问题:爆款到底能不能复制?我过去的回答是“能,但不能靠玄学”。2023年春天,我 […]
数据分析实战复盘,618 大促活动效果分析

数据分析实战复盘,618 大促活动效果分析

618结束后的第一周,很多团队的数据分析其实比大促本身更忙。我见过不少团队把GMV拉到目标值的105%,以为大 […]

让电商企业精细化运营更简单

整合电商全链路数据,用可视化报表辅助自动化运营

让决策更精准