1. 写在前面:这套笔试题究竟在考什么
聊到小红书2020校招数据分析笔试,不少准备校招的同学第一反应是去刷LeetCode、啃《统计学习方法》,结果真正上了考场才发现,题目风格和自己准备的完全不是一回事。小红书的数据分析岗笔试,从来不是单纯考你会不会写代码、会不会背公式,而是看你能否用数据思维去理解一个内容社区的业务逻辑。卷四这套题,在当年几套卷子里算比较有代表性的,SQL、Python、统计学、业务分析都有涉及,而且业务场景非常贴近小红书的真实产品形态。
这套题适合谁来看?主要三类人:正在准备互联网公司数据分析校招的应届生,想转行做数据分析但缺乏实战场景的职场新人,以及已经入行但想系统梳理自己知识体系的数据从业者。如果你属于其中任何一类,这篇文章都值得你花点时间认真读完。我会从题目背后的考察逻辑切入,把每个考点拆开揉碎,再结合我自己的答题经验和踩坑经历,给你一份可以真正落地的备考思路。
先说一个很多人容易忽略的事实:小红书2020年的校招笔试,和当时市面上大部分互联网公司的数据分析笔试题相比,有一个很明显的差异——它极度重视业务场景的理解。同样是考SQL,别的公司可能给你一张订单表,问你销售额top10的城市,小红书的题目大概率会给你一套笔记互动数据,问你在不同内容垂类下,用户互动率的差异怎么分析。这种题目本身并不难,但它考察的不只是技术,而是你能否快速理解这个平台的内容生态。
我当时做完卷四最大的感受是:这套题其实是在模拟一个数据分析师入职后前三个月会遇到的工作内容。取数、清洗、描述性统计、假设检验、业务归因、给出建议,整套流程走下来,基本就是一个完整的数据分析项目闭环。所以与其说这是一场考试,不如说是一次入职前的实战演练。你能不能在有限时间内走完这个闭环,并且每一步都有理有据,这才是出题人真正想看到的。
2. 高频考点逐个拆解:到底考了哪些硬技能
2.1 SQL题:别只会写select,窗口函数是分水岭
小红书笔试里的SQL题,难度通常介于“入门”和“进阶”之间,但卷四有几道题是明显拉差距的。基础题无非是单表查询、分组聚合、多表join这些,但稍微往上走一点,就会考到窗口函数。比如让你计算每个用户连续登录的天数,或者统计每个垂类下笔记发布量的周环比变化,这类题目不用窗口函数硬写,代码会特别繁琐,而且在笔试环境里很容易出错。
我的建议是备考时至少熟练掌握ROW_NUMBER、RANK、DENSE_RANK、LAG、LEAD、SUM/AVG OVER这六个窗口函数。其中LAG和LEAD在计算环比、同比时特别好用,这一点在小红书这种内容平台的分析场景里尤其常见,因为运营经常需要看笔记发布量、用户活跃度在时间维度上的变化。另外,连续问题的解法也要提前准备好,经典的那个“用ROW_NUMBER减去日期序列判断连续性”的思路,最好能做到默写出来的程度。
还有一个容易被忽略的考点是数据质量处理。卷四里有一道题,给了一张用户行为日志表,里面有时间戳重复、用户ID为空、设备类型大小写不统一等各种脏数据,要求你写SQL把它清洗成可用于分析的表。这类题看似简单,但其实很考察你对实际问题边界的感知。很多人在刷题网站从没见过这种题,一到笔试就懵了,不知道该不该在SQL里做CASE WHEN,也不知道重复值该保留哪一条。我的经验是,拿到这种题先别急着写代码,第一步永远是明确业务口径——这个用户ID为空,是设备未登录导致的,还是埋点丢失导致的?不同原因对应的处理方式完全不同。
2.2 Python题:数据清洗与分析能力比算法更重要
小红书校招数据分析笔试的Python部分,几乎不会考LeetCode那种纯算法题。我印象里卷四涉及的Python内容主要是pandas、numpy的常规操作,加上一点数据可视化的思路。比如给一份笔记数据,里面有发布时间、点赞数、收藏数、评论数、浏览数这些字段,要求你用Python完成数据加载、缺失值处理、异常值过滤,然后计算不同内容垂类的平均互动率,并找出互动率最高的Top10笔记。
这种题目的难点不在代码本身,而在于你对数据清洗的理解深度。比如异常值过滤,你是简单粗暴地删掉点赞数大于浏览数的记录,还是会进一步思考,这种异常可能是数据回传延迟导致的,应该结合时间窗口来判断?再比如缺失值处理,某些字段缺失率高达30%,你是直接填充均值,还是会先分析缺失模式是有偏的还是随机的?这些决策才是出题人真正想考察的东西。
我个人的习惯是,在笔试里遇到数据处理题,先在草稿纸上写清楚处理流程,再动笔写代码。流程大概是:看数据概况(shape、dtypes、describe)—> 处理缺失值 —> 处理重复值 —> 过滤异常值 —> 构造衍生字段 —> 分组聚合 —> 输出结论。每一步做了什么处理、为什么这么做,都要在注释里写清楚。这样做有两个好处:一是代码逻辑清晰,不容易出bug;二是如果题目要求你解释处理思路,你也能条理分明地回答出来。
Python部分还有一个常见的考察方向是AB实验相关的模拟分析,比如用Python模拟一个实验组的点击率是否显著高于对照组。这类题会用到随机数生成、t检验或者卡方检验等统计方法。startsimple一点的做法是用scipy.stats里的ttest_ind或chi2_contingency,但你得知道什么场景该用哪个方法,参数该怎么传,结果怎么解读。
2.3 统计与概率:假设检验和AB实验是重头戏
小红书这种DAU过亿的内容平台,几乎所有的产品迭代都要靠AB实验来验证效果。所以校招笔试里考假设检验和AB实验,完全不是书本知识点的堆砌,而是真实工作场景的直接映射。卷四的统计题里,我记得有一道是关于实验组和对照组留存率差异是否显著的题目,给了样本量和转化率,让你计算z值并判断结论。
这类题目的关键在于你得把假设检验的完整流程记清楚:先写原假设和备择假设,再确定显著性水平,然后计算检验统计量,最后根据p值或临界值下结论。很多人容易漏掉的是,原假设必须是“没有差异”或“没有效果”,而不是“有差异”,这个方向搞反了,后面全错。另外,两组样本的方差是否相等,也会影响你用哪种t检验(Student t检验还是Welch t检验),这个细节在笔试里经常被拿来挖坑。
除了假设检验,概率题也是小红书笔试的常客。比如给你一个用户的行为数据,说某用户今天浏览了A类笔记,问他明天浏览B类笔记的概率是多少。这类题表面上是条件概率,实际上需要你结合贝叶斯公式去算。备考的时候,建议把条件概率、全概率公式、贝叶斯公式、期望和方差这几个基础概念彻底吃透,尤其要能理解它们的业务含义。
这里多说一句:笔试里的统计题,有时候并不会直接告诉你“请用假设检验”,而是把业务场景描述出来,让你自己判断该用什么方法。比如题目说“我们上线了一个新功能,想验证它是否真的提升了用户发布笔记的意愿,请设计一个分析方案”,这时候你的回答应该是完整的分析框架——明确指标、设定实验组对照组、确定样本量、选择检验方法、预估实验周期,而不是直接套一个公式。
2.4 业务分析题:小红书特色场景是核心区分点
卷四最有区分度的题目,其实是业务分析题。这些题目会给你一个很具体的小红书业务问题,让你从数据角度给出分析思路。比如:笔记的收藏量很高但点赞量很低,可能是什么原因?用户在某垂类下停留时长增加,但发布量下降,你会怎么分析?连续两次打开App的用户,和只打开一次的用户,在行为特征上有什么差异?
这类题没有标准答案,但出题人心里有一套比较好的答题框架。我的经验是,回答业务分析题要遵循“定义问题—>提出假设—>拆解指标—>设计分析方案—>给出落地建议”这个逻辑。不要一上来就急着给结论,而是把问题拆成可以验证的子问题,再逐个说明用什么数据、什么方法去验证。
比如“收藏量高但点赞量低”这个现象,你可以先假设几种可能:笔记内容属于攻略类、教程类,用户觉得有用先收藏,但内容本身不足以激发点赞冲动;或者推送机制导致流量集中在“泛收藏价值”的内容上,用户在碎片时间刷到后收藏,但不会深度互动;再或者某些垂类(比如装修、菜谱)天然存在收藏率高、点赞率低的属性。然后你要说明用什么数据验证这些假设,以及不同假设成立的情况下,运营策略分别应该怎么调整。
小红书特别爱考用户增长和留存相关的分析题,这跟它作为社区产品的基本盘有关。比如给你一组新用户的激活漏斗数据:注册—>浏览—>关注—>发布,让你分析哪一步流失最严重,应该优先优化哪一步。这种题其实是在考你对漏斗分析方法的掌握程度,以及你能否结合小红书的内容社区特性去思考问题。
3. 典型题目实操复盘:从读题到作答的完整推演
3.1 留存分析题:算出留存率只是开始,解读才是重点
卷四里有一道留存分析题,大致场景是:给出某月新增用户按日的回访数据,要求计算次日留存率、7日留存率,并分析新用户留存偏低的原因。这类题在笔试中非常经典,但很多人只做到了“算出留存率”这一步,后面的原因分析完全没有展开。
如果是我来答,会分三步走。第一步,先把留存率算清楚,注意分母是当日新增用户数,分子是这些新增用户在第N天回访的人数,时间窗口要对齐,这是最容易出错的地方。第二步,做分层分析——把新增用户按来源渠道拆分,看是否某些渠道带来的用户留存率明显偏低;再按用户首次访问的笔记垂类拆分,看是否内容偏好影响了留存。第三步才是落地方案,比如针对高流失渠道做流量质量控制,针对高留存内容垂类做个性化推荐加权。
这里我想强调一个笔试中的隐性加分点:不做多余的事情。有些同学喜欢展示自己会的东西,明明题目只要求计算次日和7日留存,非要把30日留存也算了,还画个留存曲线。多算本身没错,但如果计算过程耗时太长,导致后面的业务题没时间写,那就得不偿失了。筆試的时间永远是最稀缺的资源,把每道题控制在合理时间内,比追求每道题都完美更重要。
3.2 内容推荐题:指标的拆解逻辑要能自圆其说
小红书本质是一个内容推荐平台,所以笔试题里出现推荐相关的分析题几乎是可以预见的。卷四有一道题我记得很清楚,大意是:平台想要提升用户在信息流中的点击率,给了你一篇笔记从曝光到点击的漏斗数据,让你分析影响点击率的关键因素,并提出优化方向。
这种题的答题要点在于:先把点击率拆解为可解释的成分。点击率低,可能是内容封面吸引力不够,可能是标题不够抓眼球,可能是配图质量差,也可能是推荐匹配精度低导致流量分发给了不感兴趣的人群。每一个可能的原因背后,都需要一个对应的数据验证方式。
我当时答题时给了一个“分层归因”的思路:先看全局点击率是否在特定垂类、特定时段、特定用户群中差异显著,锁定异常层;再对异常层做内容特征分析,比如点击率低的笔记是否集中在某些封面类型或标题句式上;最后看推荐系统侧,是否存在某些位置、某些流量类型的点击率被稀释。这样做的好处是,你把一个模糊的“点击率低”的问题,逐步变成了可操作的结论,每一步都有数据支撑。
这道题还有一个隐含的考察点:你是否理解小红书的内容特点。其他平台可能更关注标题、封面这些基础因素,但小红书的内容形式是“封面+标题+正文摘要”的组合,有时候用户的点击动机不是内容本身,而是“这个封面看起来和我的生活场景有关”。所以在分析点击率时,用户与内容的匹配度比内容自身的质量更值得关注。
3.3 商业化场景题:数据指标要服务于商业目标
小红书2020年正处于商业化加速的阶段,所以卷四也有一道和商业变现相关的题目,我记得大概是问:品牌合作笔记的曝光量很高,但导流到电商页面的转化率很低,应该从哪些维度去分析这个问题。这类题的考察目标非常明确:你是否具备用数据驱动商业决策的思维。
我的分析框架是这样:先明确这条链路的关键节点——曝光—>点击—>阅读—>跳转电商—>下单,每一层都有对应的转化率。然后沿着链路逐层下钻,锁定转化率断崖式下跌的环节。比如曝光到点击的转化率正常,点击到阅读的转化率正常,但阅读到跳转电商的转化率极低,那问题大概率出在正文内容与商品关联度不够,或者引导文案和跳转路径设置得不合理。
接下来还要考虑外部分类和用户分层。不同类型的品牌笔记(美妆、穿搭、家居)本身的电商转化率基线就不同;不同用户群(新用户vs老用户、强购买意愿vs弱购买意愿)对广告的接受度也不同。所以单看整体数据没有意义,必须做维度下钻。
答题时如果能补充一个关键的经验值,会显得你的方案更落地——内容社区的商业化链路,用户的耐心极短,从阅读正文到跳转电商,中间每多一步操作,转化率都可能衰减一半以上。所以优化方向往往是减少跳转步骤、增加商品卡片嵌入、强化正文中的行动号召,而不是单纯加大曝光量。
4. 笔试实战技巧:直接影响分数的隐藏细节
4.1 时间分配:不要在一道SQL题上死磕
小红书笔试的总时长通常在90到120分钟之间,题量不算少。以我的经验来估算,卷四的整体题量大概在15到20道之间,包括选择题、SQL编程题、Python编程题和业务分析题。我见过太多人在一道窗口函数题上卡了20分钟,导致后面两道业务大题只能匆匆写两句。这是最典型的丢分方式。
我建议的时间分配策略是:选择题和填空题控制在15到20分钟内完成,因为这些题要么会要么不会,犹豫没有意义。SQL题每道控制在10到15分钟,如果超过20分钟还没有明确思路,先跳过,最后有时间再回头。Python题类似。业务分析题虽然分值高,但每题也不要超过15分钟,回答时按照“结论先行、论据分层、建议落地”的结构快速输出。
我自己做题有个习惯:拿到试卷先把所有题快速浏览一遍,在心里给每道题标一个难度等级,优先做“会做的”和“分值高的”。这样能保证基础分全拿,不至于因为一道难题耽误了后面一堆送分题。
4.2 答题排版:结构清晰比文采重要
笔试里的业务分析题,很多时候是简答题的形式,需要你写出分析思路。这时候最忌讳的是写成一篇流水账,想到哪写到哪。阅卷人一天要判几十份卷子,你写的内容如果不结构化,对方根本没耐心帮你提炼重点。
我的建议是,所有业务分析题的答案都按这个格式组织:先写一句“核心结论”,再分条目列出分析步骤,最后给出建议。如果中途需要补充说明,可以用括号加注。举个例子,如果题目问“次日留存率下降了5个百分点,你怎么排查”,我会答:核心结论是需优先排查版本更新和渠道投放变化;第一步查看版本分布,确认是否新版本存在体验问题;第二步查看渠道构成变化,是否新增了非精准渠道流量或遭遇了投放策略调整;第三步对比不同用户群的留存表现,定位是集中在某个群体还是全局性下降;第四步结合竞品动态和社区热点,判断是否存在外部因素影响;建议先回滚版本或暂停低质量渠道投放,同时建立留存监控看板,对关键指标设置异常告警。
这种结构一眼看去就知道你有清晰的思路,就算分析得不够全面,也比没有条理的答案拿分高。
4.3 环境准备:提前熟悉线上答题平台
2020年的笔试基本都在线上进行,现在更是如此。很多人忽略了一个看似不起眼但很致命的问题:不熟悉答题平台的环境。有些平台自带的代码编辑器没有自动补全,有些平台的缩进是用空格而不是Tab,有些平台运行Python代码时默认版本是2.7,这些细节都可能导致你在调试代码上浪费大量时间。
我建议在笔试前,先查清楚这家公司用的是哪个在线笔试系统,如果找不到往年真题来练,就找几个相似的平台体验一下。至少做到:知道代码怎么提交、控制台在哪里看报错、能不能本地运行、有没有样例测试。这些看起来都是小事,但在紧张的笔试环境下,每减少一个不确定因素,都是在给自己争取宝贵的答题时间。
5. 笔试之后的复盘与面试衔接
5.1 错题归因:比分数更重要的是暴露出的能力缺口
笔试结束后,不管考得好不好,我建议都花半小时做一个错题归因。把每道做错的题归类到具体的能力项——SQL语法不熟、窗口函数不会用、假设检验流程不清楚、业务分析没思路、时间不够用、平台操作不熟练,然后针对高频薄弱项做专项补强。
我见过太多同学笔试结束后就彻底松一口气,等收到面试通知才慌张准备。其实笔试中暴露出来的问题,大概率会在面试里被再次问到。比如你笔试里留存率计算错了,面试官很可能就会追问“如果让你重新算一遍,你会怎么算”。如果你笔试后做了复盘,这时候就能很自然地回答出来;如果没做,就只能在面试现场现想,效果天差地别。
5.2 从笔试到面试的能力迁移
最后说说笔试和面试的关系。小红书的面试风格,尤其是在数据分析岗上,非常偏好“场景题”——面试官会拿一个实际业务问题,让你现场讲分析思路。你会发现,这些场景题和笔试里的业务分析题几乎是同源的,只是换了一种提问方式。
所以,备考笔试时形成的分析框架,千万不要考完就丢掉。比如你总结的“定义问题—>提出假设—>拆解指标—>设计分析方案—>给出落地建议”这套方法论,面试时同样能用。你笔试里刷过的SQL场景题,面试时也可能会变成“现场写一段SQL处理某个具体取数需求”。能把这套能力迁移到面试场景里,你拿Offer的概率自然会大很多。
6. 一些实战心得:这些坑希望你不用再踩
文章最后,分享几个我在准备和参加这类笔试过程中积累的真实经验,不一定都是技术问题,但都很实际。
第一个坑是不重视选择题。很多人觉得选择题分值小,随便蒙蒙就行。但小红书的笔试是标准分制,整体通过率就卡在那里,选择题往往是最容易拿分也最容易丢分的部分。尤其是统计概率相关的选择题,概念清楚的人一眼就能选对,概念模糊的人再怎么猜也大概率是错的。所以备考时不要只刷SQL和Python,统计基础概念也要过一遍。
第二个坑是写SQL时不考虑数据量。有的同学写SQL只追求逻辑正确,完全不留意题目里给了一个千万级的大表。比如在where条件里对字段做函数运算,导致索引失效,这种写法在笔试环境里可能不会报错,但在真实场景中就是慢查询的根源。虽然笔试判题大概率只看结果,但如果你在注释里写了“考虑到数据量较大,此处先过滤再关联”,这种对性能的敏感性反而会成为加分项。
第三个坑是业务分析题回答得太虚。比如题目问“怎么提升用户的发布意愿”,有的同学写满一屏“加强内容引导”“优化推荐策略”“完善激励机制”,每一句都是正确的废话。高分的答案一定会落到具体的指标和动作上,比如“把新用户首月发布率从15%提升到20%,具体动作是通过新手任务引导用户在48小时内完成首次发布,并观察首月发布用户与次月留存的相关性”。有数字、有动作、有可检验的指标,才是一份合格的分析答案。
第四个坑,也是我自己亲身体会最深的一点:不要因为某一道题卡住了就心态崩掉。小红书2020年的笔试题量不低,中间遇到不会做的题太正常了。我当年考的时候,有一道概率题完全没思路,直接跳过,后来发现后面那道业务分析题才是整张卷子的压轴,分值是那道概率题的3倍。如果我在前面那道题上死磕,心态一旦崩了,后面的题大概率也写不好。校招笔试是一场取舍游戏,学会放弃某些分数,是为了把其他更重要的分数稳稳握在手里。
备考数据分析岗,刷题是必要的,但比刷题更重要的,是理解每道题背后的业务逻辑和思维方式。小红书2020校招数据分析笔试题卷四,本质上就是一场模拟真实工作场景的实战演练。把这道演练吃透,你收获的不仅仅是一张试卷的解题能力,更是一整套面对陌生问题时,如何用数据去拆解、分析、落地的思维框架。这套框架,才是数据分析师这份工作真正值钱的地方。