和见过 rubric 的 AI 面试官练习

真实题目,真实反馈,覆盖每家公司。专为留不起 onsite 的留学生打造。

30s
开始时间
5 轮
完整 loop
FAANG+
Rubric 覆盖
免费
第一次 mock

为什么大多数面试练习在开始之前就已经失败

你裸面进 onsite,是因为之前练的东西和你要走进的那场 loop 不是同一种东西。ChatGPT 你叫它扮演面试官它会演,但它不知道 Google L4 的系统设计 scoping 在前 10 分钟权重最高,也不知道 Amazon 的 Bar Raiser 跟其他几轮根本不是同一种问法。朋友 mock 会软化反馈——没人愿意告诉你第三轮的 STAR 整个崩了。市面上的面试书覆盖一切但针对没有。

结果是:你练了「面试」,但没练你将要面的那个面试。算法刷过了,但没在限时压力下被追问过复杂度。STAR 故事背过了,但没被一句追问打散过结构。系统设计想过了,但没被强制要求先 scoping 再画图。

一场好的 mock interview 应该精确复现你将要走进的那场 loop——出题风格、信号权重、追问 pattern、时间压力——并准确告诉你你会在哪里挂。

不是绕着 rubric 教,是把 rubric 装进去

AI 的训练基础是 Google、Meta、Amazon、Apple、Microsoft 实际使用的 rubric,加一批独角兽公司。不是「在这家面过的人写的 tips」——是结构化的 rubric 本身:L3 / L4 / L5 各自看重的信号权重、哪一类问题在测哪一条 Leadership Principle、什么 scoping 行为是过线和挂掉的分界。题库基于 Glassdoor、Reddit、一亩三分地、知乎面经上的公开记录,对应到题目来自的职级。

这就是为什么这里的 Google L4 mock 跟 Meta E4 mock 看起来不一样。同样的岗位 title,rubric 不同、题库不同、追问风格不同。loop 开始前 AI 加载对应的那个。

三步

完整一轮 mock 是怎么跑的

  1. 01

    选公司和职级

    Google L4 SWE。Meta E5。Amazon SDE2。AI 在 loop 开始前加载这个特定的 rubric——出题风格、信号权重、追问 pattern。你练的不是抽象的「面试」,是你将来真要走进的那个 loop。

  2. 02

    完整跑一轮,语音或文字

    Coding 轮、系统设计轮、行为面轮。AI 一次问一题,听你或读你的回答,像真招聘官那样追问没说清的部分。session 中途保存,能续。

  3. 03

    看逐轮 scorecard

    不是「整体表现不错,继续加油」。逐轮、逐信号:STAR 结构在哪里崩了、第 2 轮缺复杂度分析、系统设计 scoping 拖到第 18 分钟(满 45 分钟)。每个弱点都附一个更强答案的范例对比。

STAR 改写示例

诚实反馈长什么样——逐行看

你的答案(转录)

我在搜索团队。有一些性能问题,我参与优化了一下 query,后来变好了。大概花了两个月,部署了。

Situation 模糊、没数字、ownership 不清(「参与」)、Result 没量化。ATS 对行为面信号的解析:能匹配「search」字符串,但 ownership 和 impact 都缺失。

L4 实际期待

Search p95 是 820ms,SLO 要求 <300ms。我主导这个降延迟。Profile 后发现 autocomplete fanout 里的 N+1,换成 materialized join,加 flag 灰度两周。p95 降到 240ms;这个 pattern 被两个邻队采用。

Situation + Task + Action + Result。每一段都有数字。「我主导」让 ownership 没歧义。「两个邻队采用」是 L4+ rubric 看重的「scope 超出本队」信号。

诚实反馈,不是夸奖

你这轮挂了,scorecard 就说你挂了

大多数 AI 面试工具默认鼓励式反馈。问任何一个「我表现怎么样」,输出都是「整体不错,有几个地方可以打磨」。这种 output 没有用。mock 的全部意义就是找出你在哪里崩,不是让你感觉良好。

Applr 的 scorecard 直接点出具体弱点——「STAR 在 Action 这步崩了,你描述了做了什么,没说考虑过哪些 trade-off」——并展示更强的范例答案是怎么回的,针对这个具体 prompt。如果你这一轮在 rubric 里相当于挂了,report 就写挂了。校准的基准是这家公司实际用的 rubric,不是泛泛的曲线。

我们不评估口音。AI 评的是内容——结构、信号、深度、复杂度分析——不是发音。留学生拿到的是真正有用的反馈:什么会改变结果。

「真实 rubric」具体意味着什么

rubric 不是泛泛的清单。每家公司的信号权重是不通用的。Amazon 的 LP 贯穿所有轮次包括 coding——一个干净的算法答案,如果 Bar Raiser 的 LP 追问没暴露出 ownership,照样挂。Google 在 L4+ 系统设计权重很高,前十分钟的 scoping 行为决定大部分分数,没 clarify 完就跳到架构基本是直接降一档。Meta 跑两轮 coding,并且对生产代码质量(edge case、错误处理)的权重高于面试白板风格的算法代码。

AI 按公司逐轮追这些权重。Amazon 的行为面评估 LP 覆盖度和 STAR 完整性;Google 的行为面在不同的 cue 上评估 Googliness 和 team-fit 信号。L5+ 的系统设计期待多区域故障模式,L4 不需要展示这一层。所有公司的 coding 轮都明确评估复杂度分析——大多数候选人在压力下会跳过,rubric 把这视为信号缺失。

这种 mock 出来的 scorecard 像招聘人员的 debrief notes,不是参与奖。命名清楚的弱点、错过的信号、命中的信号。本来你是真 onsite 完三周后才能拿到的反馈,现在 5 分钟后就有,而且下一轮 mock 可以直接修。

对比

Applr 在选项里的位置

开始速度真实 rubric诚实反馈费用可用性
Applr AI 模拟面试Applr30 秒按公司 rubric(FAANG+)有——挂掉的信号会被点名第一次免费,之后 $9/月按需,随时
ChatGPT 角色扮演3-5 分钟(自己写 prompt)通用——没有 rubric 权重默认鼓励式,除非 prompt 强行要求约 $20/月按需
朋友 mock interview协调成本看朋友是否在该公司面过看朋友愿不愿意诚实人情债看双方什么时候有 60 分钟
付费面试 coach等 1-2 周看 coach 是否了解该公司$150-$300/小时看 coach 的排期

在你目标公司做过 hiring manager 的 coach 比任何工具都准。约束是时间和价格——同时管 10+ 家公司的 coding / 系统设计 / 行为面练习的留学生,每一轮 mock 都请 coach 显然不可行。Applr 填的是「角色扮演」和「专家」之间的空白:结构化的 rubric 知识,按每一轮应用,30 秒出反馈。

按你要面的公司练习:

FAQ

这是真正的模拟面试,还是普通聊天机器人?

是结构化面试循环。AI 一次出一道题,等你完整作答(语音或文字),像真实面试官一样追问,面试结束后给出按 rubric 分类的评分卡。不是自由聊天——是压缩版的 onsite 流程。

支持哪些公司的面试风格?

我们有 Google、Meta、Amazon、Apple、Microsoft 以及一批独角兽公司的详细 rubric。选好公司 + 职级,AI 会切换到该公司的出题风格、信号权重和追问逻辑,匹配对方已有记录的面试流程。

它真的会给出批评性反馈,还是什么都说你很好?

诚实反馈是核心价值。AI 会明确指出具体弱点——STAR 结构模糊、trade-off 表达不清晰、缺少复杂度分析——并告诉你更强的答案应该是什么样的。如果你这轮表现很差,它会直说。

跟直接用 ChatGPT 练有什么区别?

ChatGPT 可以扮演面试官,但它不强制执行结构,不追踪整场 loop 里哪些信号缺失,也不知道 Google L4 和 L3 的评分标准有什么区别。我们把 rubric 直接构建进了系统。

需要安装任何东西吗?

不需要。直接在浏览器里跑。支持语音和文字作答。会话自动保存,可以随时继续。

有免费版吗?

有。第一次模拟面试免费。之后付费计划从每月 9 美元起。

我是留学生,担心口音问题,AI 会扣分吗?

不会。AI 评分的是内容(结构、信号、深度),不是发音或口音。如果某个表达确实让人看不懂,会具体指出并给替代表达,但不会因为听起来「不够像母语者」扣分。我们就是为留学生设计的。

下次面试别再裸面

5 分钟跑一次完整的 mock,知道自己卡在哪。第一次免费。

免费开始第一次模拟面试 →