拿到 Anthropic 的面试邀请时,我其实有点意外。投递后快两周没动静,本来以为沉了,结果突然收到 OA 邮件。Anthropic 在国内论坛上的面经少得可怜,我备考期间几乎只能翻 Glassdoor 和 Blind 上的零散英文帖子,所以走完整个流程后,第一件事就是想把经历完整记下来,给后来人一点参考。
流程是:OA → Recruiter Screen → 4 轮 Virtual Onsite,我前后大约用了三周多。
Anthropic OA
平台是 CodeSignal,70 分钟 4 道题,难度逐步上升。CodeSignal 的打分方式和 HackerRank 不一样,它会给每道题一个 300 分制的分数,除了通过测试用例外,代码结构、边界覆盖、运行效率都会影响分数。所以就算逻辑写对了,代码很乱也会被扣分,这一点我一开始没注意,做到后面才反应过来。
真题回忆(题目已做脱敏改编):
Q1(Easy):日志字段解析
给一段半结构化的服务日志,要求解析出每个请求的 traceId、状态码和处理时长,并按固定格式输出。本质是字符串分割 + 条件判断,但要注意字段缺失、空行、状态码非数字等 edge case。Q2(Easy-Medium):滑动窗口变体
给一个整数数组和一个阈值,要求找出满足“窗口内最大值与最小值之差不超过阈值”的最长子数组长度。需要动态维护窗口内的有序结构,或者用双端队列优化。Q3(Medium):树路径查询
给一个员工层级树,每个节点有一个安全评分。有多个查询,每次问节点 A 到节点 B 的路径上评分大于某个值的节点有几个。需要预处理 LCA 和前缀计数,思路是 LCA + DFS 差分,实现细节比较多。Q4(Medium-Hard):优先级任务调度模拟
实现一个简化的任务调度器,每个任务有优先级、前置依赖、可执行时间窗口,按规则输出执行顺序。最后十分钟我还在赶,有些依赖冲突的用例没完全通过。
整体感受:时间压力很大,Q3/Q4 留的时间不够用。建议 Q1/Q2 控制在 15 分钟内完成,给后面留足空间。
Recruiter Screen(30 分钟)
OA 通过后约 5 天收到 recruiter 电话。内容比较轻松,主要聊了 Anthropic 的 mission、这个 team 的职责范围,然后问我为什么想来、对 AI safety 的理解,以及确认 timeline、薪资预期和签证情况。
有一个问题让我停顿了一下:“你如何看待 AI safety 与产品迭代速度之间的潜在冲突?” Anthropic 非常看重候选人是否真的认同他们的使命,不是把它当作一个 fancy 的 AI 公司跳板。建议这类问题提前想好自己的真实观点,而不是背官网介绍。
Virtual Onsite(4 轮,同一天)
四轮连排在同一天,中间各有 10 分钟休息,每轮 45~60 分钟。
Round 1:Coding
面试官来自 Platform 团队,人很温和。题目是实现一个带过期时间的请求计数器:支持record(event_id, timestamp)和count_past_seconds(seconds),要能返回过去 N 秒内记录的事件数量。先写一个基础版(用队列或有序字典),然后面试官追问怎么控制内存、如果事件量巨大怎么办、能不能改成概率性数据结构(比如 HyperLogLog)。这一轮主要看数据结构和工程权衡,我边写边讲,面试官会打断问“为什么这样选”。
Round 2:Coding
题目偏业务逻辑:实现一个简版的消息去重与优先级处理模块。给一个 token 预算,维护待处理消息,当新消息加入导致超出 token 上限时,按优先级和时效性裁剪旧消息。Follow-up 包括:保留最高优先级的消息不裁剪、加入 TTL 过期机制、以及单条消息本身超过预算怎么处理。这题明显和 Claude 的实际线上场景相关,写的时候有点像在给产品做底层组件。代码量不大,但边界情况要想透。
Round 3:Behavioral
Engineering Manager 来面,这轮我觉得准备最值。高频问题包括:
“讲一个你做了正确但团队不认同的技术决策,最后怎么解决的?”
“你做过最复杂的 trade-off 是什么?为什么那样权衡?”
“你有没有主动发现过一个没人跟进但很重要的问题,然后推动解决?”
“你如何判断一个技术方案是否 good enough to ship?”
Anthropic 的行为面特别看重主动性和判断力,不只是“完成了任务”,而是“为什么这样判断、你看到了什么别人没看到的东西”。STAR 可以用,但不要套模板,要讲出自己的 reasoning 过程。
Round 4:Values & Mission Fit
这轮很多人不重视,但其实很关键。面试官是 Senior Researcher,聊得相当深。核心问题包括:你怎么理解 AI safety?你认为 Anthropic 的方向是否靠谱?如果你在开发某个功能时发现它可能被滥用,你会怎么做?你怎么看待 helpful 和 harmless 之间的张力?
这轮没有标准答案,面试官想看你是不是真的独立思考过这些问题。我提到自己读过 Constitutional AI 的论文,还看了他们关于 RLHF 局限性的技术博客,面试官立刻来了兴趣,聊了很久。建议提前读一下 Anthropic 的 research blog 和 model card,形成自己的观点。
备考 checklist
刷题:LeetCode Medium 为主,重点练滑动窗口、树、LCA、模拟设计类
系统设计:了解限流、缓存、消息队列、计数器的常见做法和 trade-off
行为题:准备 5~6 个有深度的 STAR 故事,覆盖 conflict、trade-off、initiative
AI 认知:读 Anthropic 的公开文章,对 safety vs capability 有自己的看法
一点补充|关于备考效率
上面是我自己硬啃下来的过程。但说实话,Anthropic 的面经实在太少了,OA 的题目风格和 LeetCode 也不太一样——更偏实际工程场景,边界条件更隐蔽。到了 VO 阶段,面试官会非常深地追问你的思路、复杂度分析、甚至代码结构的一致性。为了求稳,我在最后一轮前预约了 VO 辅助 & OA 代做 的实时支持服务,相当于给自己上了一层保险。
如果你也面临类似情况:面经稀缺、不知道最近在考什么;OA 有思路但总在 hidden cases 上翻车;VO 担心现场卡壳、表达不清、跟不上面试官的追问——不妨给自己多准备一张底牌,上场时心态真的会稳很多。
👉 需要助攻的同学直接访问oavoservice.com,让真正懂 Anthropic 面试的北美专家陪你走完上岸前的每一步。