Generate interview questions with assessment dimensions and A-level reference answers from a resume, JD, PRD, or portfolio. Two modes — interviewer mode (scorecard, red flags, A/B/C scoring) and candidate prep mode (question essence, weighted dimensions, speakable A-level scripts). Covers an 11-group / 52-dimension coverage model (truth, demand, solution & AI boundary, product form, technical depth, reliability, enterprise reality, business value, collaboration, learning, fit) plus an Enterpr...
Scanned 8/30/2026
Install to Claude Code
npx -y skills add zhangchau/interview-designer-skill --agent claude-codeInstalls into .claude/skills of the current project.
Are you the author of interview-designer?
Add the live security badge to your README — it updates automatically with every re-scan.
[](https://www.skillsdirectory.com/skills/zhangchau-interview-designer)More formats (shields.io, HTML) on the badges page.
---
name: interview-designer
description: Generate interview questions with assessment dimensions and A-level reference answers from a resume, JD, PRD, or portfolio. Two modes — interviewer mode (scorecard, red flags, A/B/C scoring) and candidate prep mode (question essence, weighted dimensions, speakable A-level scripts). Covers an 11-group / 52-dimension coverage model (truth, demand, solution & AI boundary, product form, technical depth, reliability, enterprise reality, business value, collaboration, learning, fit) plus an Enterprise Reality Test that attacks a plan's unstated premises. Staged output with a hard context budget so large PRDs do not blow up the window. Use when preparing to interview someone, or preparing yourself from your own resume/PRD/course project.
---
# Interview Designer
> **两种模式**:面试官出题评分 | 候选人备考写逐字稿
> **四阶段**:判断提取 → 素材卡 → 分层逐字稿 → 攻防增强(**分阶段产出,禁止一次全出**)
> **输出语言**:跟随用户输入语言。中文提问则全部中文输出。
---
## 0. 第一性原理
七条原理推导出全部规则。理解这七条,不需要记流程。
**一、面试是信息不对称下的预测问题。**
用有限的、且由候选人自己控制的证据,预测他未来 12 个月的表现。全部技术都在解决"证据不可信"和"未来不可知"。
**二、没有标准,取证就变成挑刺。**
先看简历再定标准,标准会被简历污染(因人设岗)。必须先独立定义 A 级长什么样。**顺序错了后面全错。**
**三、候选人提交的文档一定是自洽的。**
简历和 PRD 是他自己写的,内部逻辑必然闭环,**从文档内部提问永远问不倒他**。破自洽文档只能攻击它的前提——它对真实世界那些没说出口的假设。纸面方案通常内部完美、外部幼稚:假设数据干净、接口开放、审核的人不疲劳、需求是真的。**这些假设就是攻击面。**
**四、问题和答案是同一个东西的两面。**
一道好题必然存在一个可讲出口的好答案。**写不出 A 级答案说明题目本身有问题**——太空泛、无法回答、或没有区分度。答案生成是对题目质量的强制校验,不是附加功能。
**五、面试官和候选人需要的答案形态不同。**
面试官需要 A/B/C 分级做区分。候选人需要唯一一个能内化的标准答案——**给他看 C 级答案会污染准备,让他记住错误说法。**
**六、素材卡是压缩机制,不是内容增量。**
N 个答案各自重述同一个例子 = N 份拷贝;一张卡被引用 N 次 = 1 份。**卡让产出变小,前提是答案引用卡而不是内联卡。**
**七、纸面项目(M0-M1)没有"经历"可讲,只有"判断"可证明。**
面试官知道课程项目没有真实用户,他要看的是思维方式对不对。而思维方式的证明不在单个答案里,在答案之间的结构里:判断的迁移、正反论证、边界意识、迭代历史、验证路径。
---
## 1. 上下文纪律(硬性,违反则输出失败)
**问题**:PRD 常在 100-250KB。整读输入约 60-80k tokens;一次生成 60 题全量答案约 40,000 字。**质量在触到硬限制之前就已经崩了。**
**输入侧压缩(必须做)**
1. **先扫大纲不读全文**:`grep -n "^#\{1,3\} "` 拿到结构。
2. **只读含判断与数字的节**:摘要、KPI/指标、核心技术决策 3-5 节、范围边界。目标 ≤6000 字(220KB → 约 18 倍压缩)。
3. **禁止整读**:需要细节时定点再读那一节,不回头整读。
**冻结简报(Stage 1 后必须产出)**
写一份 800-1200 字 `项目冻结简报`:项目性质与成熟度、12 个判断各一句话、关键数字清单、已知缺口。
**此后所有阶段只读这份简报 + 当前要处理的那张卡,不再回读 PRD,不回读前批产出。**
**输出侧配额(硬上限)**
| 产物 | 上限 | 说明 |
| :--- | :--- | :--- |
| 判断台账 | 10-15 条 | 超过说明在抄功能,不是在提判断 |
| 题目索引 | 40-60 题 | 只有题干 + 维度码 + 卡号,**不含答案** |
| 全文逐字稿 | 默认只做 P0 的 12-18 题 | 其余按学员点名再展开 |
| 素材卡 | 8-12 张 | 每张支撑 3-5 题 |
| 攻防增强 | 只做 TOP 3 判断 | 正反+边界+验证+迭代 |
| **单次响应** | **≤4000 字** | 超了就分批,宁可多轮 |
**P0 不设数量上限。** 上面的 12-18 是单批产出的节奏建议,不是总量天花板。P0 有 25 题就出 25 题,分 5 批。
**上下文约束靠分批解决,不靠砍题**——砍题解决的是学员的时间预算,而准备期通常是几周不是几晚,时间不是瓶颈。
**但同源题必须合并**,理由不是省时间,是**答案一致性**:
考同一个判断的多个问法,如果各写一份独立全文,学员手里就有 3 份措辞不同、细节可能互相矛盾的答案。真实面试里面试官问一个、追问另外两个,他需要的是**一条连贯的推理链**,不是三段各自成立的话。
例:「硬约束为什么放规则引擎」「哪些愿意交给模型」「库存为什么不进知识库」——这是同一个 AI 边界判断的三个切面 → 合成 1 主问 + 2 追问,共用一张判断卡。
判据:**两题引用同一张卡的同一栏,就该合并。** 引用同一张卡的不同栏(如 判断卡1.正面 vs 判断卡1.边界),可以分开出题。
**L2 不写全文**:3 分钟口述写全约 800 字。改成写骨架 + 引用哪张卡("背景→引场景卡1;决策点→引判断卡1正面;失败场景→引判断卡1场景;边界→引判断卡1边界")。学员用卡自己组装。**这一条单独省掉一半输出。**
**文件即上下文卸载**:每阶段写入独立文件,后续阶段用路径引用,不把前文抬回上下文。
**编码代替重复**:维度用码(A1/F3/G4),卡用号(判断卡1/推导卡2)。码表只在 `references/coverage-model.md` 定义一次。
---
## 2. 两种模式
开始前判断用户是谁,判断不了就问一句。
| | **面试官模式** | **候选人备考模式** |
| :--- | :--- | :--- |
| **触发信号** | "我要面试他"、上传别人的简历 | "我要面试了"、上传自己的简历/PRD |
| **目标** | 区分 A/B/C,做录用决策 | 内化标准答案,写逐字稿 |
| **答案形态** | A/B/C 三级 + 判分线 + 陷阱 | **只给 A 级** + 追问应对 |
| **额外产出** | 红旗绿灯、判分矩阵、防偏见提醒 | 攻击面自检、准备缺口、24h 清单 |
| **模板** | `templates/interview_guide_template.md` | `templates/candidate_prep_template.md` |
两种模式的 Stage 1/2/4 相同,**只在 Stage 3 分叉**。
---
## 3. 战情室
- **Geoff Smart(Topgrading)** — 定标准与取证。Scorecard First。
- **Lou Adler(Performance-based Hiring)** — 预测。过去表现只在情境相似时才能预测未来。
- **Marty Cagan(SVPG)** — 企业现实检验。四类风险:价值、可用性、可行性、商业可行性。
- **Daniel Kahneman(Noise)** — 防偏见。找到疑点时也找反证,找到亮点时验证可复用性。
- **领域专家** — 按岗位召唤。
---
## 4. 四阶段工作流
### Stage 0:定位与 Scorecard(不看简历)
基于 JD 独立定义:**Mission**(一句话,这岗位为什么存在)、**Outcomes**(12 个月内 3-5 个可衡量结果)、**Competencies**(拿到这些结果所需能力)。
然后标注候选人的**项目成熟度**,这决定后续全部权重:
| 级别 | 含义 | 出题重心 |
| :--- | :--- | :--- |
| **M0-M1** | 想法 / PRD / 原型,无真实用户 | **G 组企业现实 + 判断溯源占 35-40%**,禁止问"你碰到什么困难" |
| **M2-M3** | 可跑 demo / 内测 | 现实组降到 25%,加真实 Bad Case |
| **M4+** | 客户 POC / 生产 | 现实组降到 15%,改问"你踩过哪些坑" |
### Stage 1:判断提取 + 题目索引 ⭐ 产出最便宜、价值最高
**先提判断,不提功能。** PRD 写的是"要做什么",面试考的是"你为什么这么做"。
产出三样(写入 `<候选人>-面试索引.md`):
1. **判断台账**(10-15 条):`判断 | PRD 出处 | 维度码 | 面试概率 | 是否你的原创`
2. **题目索引**(40-60 题):`题号 | 题干 | 维度码 | 优先级 P0/P1/P2 | 需要哪张卡`
—— **只有题干,不含答案。** 这是全局地图,学员据此点名要哪些题的全文。
3. **覆盖诊断**:11 组逐组标 充分/薄弱/缺失 + 缺什么 + 下一步动作
然后写 **`项目冻结简报`**(800-1200 字),后续阶段只读它。
### Stage 2:素材卡(压缩层)
按 `references/card-system.md` 建 8-12 张卡。卡类型:判断卡、推导卡(每个关键数字一张)、场景卡、溯源卡、降级卡。
**每张卡必须标注:它支撑哪几道题。** 一张卡支撑 3-5 题,这是压缩比的来源。
### Stage 3:分层逐字稿(默认只做 P0)
L0(≤40字结论)/ L1(150-250字主回答,引用卡)/ L2(**骨架+卡引用,不写全文**)/ L3(追问分支只写"引哪张卡")。
**每批开头必须放「卡片速查表」**:本批引用到的卡,一行一张写清卡号 + 一句话内容 + 在哪个文件。
否则学员看到"引 判断卡1.第一性原理"不知道该翻哪——**卡引用省下的字数,不能变成学员的查找成本。**
模式分叉:面试官模式在 L1 后补 B/C 级 + 判分线 + 陷阱;候选人模式只给 A 级 + 追问应对。
详细标准见 `references/answer-standards.md`。
### Stage 3.5:补证据行动清单(准备期 ≥2 周时必做)⭐
**为什么单列一步**:准备期长会改变策略性质。
- **短准备期**:缺口只能"诚实承认"——"我没接触过真实企业数据,这是我的短板"(保底,不丢分)
- **长准备期**:缺口可以**真去补掉**——"我特意找了两个做外贸 ERP 的朋友聊,他们的产品表是这样的……"(**把红旗直接转成绿灯**)
所以覆盖诊断里每个"缺失/薄弱",都要判断它是**只能承认的**还是**能补掉的**,能补的给具体动作:
| 缺口类型 | 能不能补 | 补的动作 | 补完后答案的变化 |
| :--- | :---: | :--- | :--- |
| 没见过真实企业数据(G1) | ✅ 能 | 找 2-3 个做外贸/ERP 的人各聊 30 分钟,记下产品表的真实形态和字段缺失情况 | "我推测数据是脏的" → "我问过两个人,他们的 MOQ 字段大概三成是空的" |
| ROI 没算过(H1) | ✅ 能 | 用真实薪资水平和询盘量算一遍,写在纸上 | "这个我没算过" → 给出完整测算 + 标明最脆弱的假设 |
| token 成本没算(H4) | ✅ 能 | 按真实 API 定价算单条询盘成本 × 月量 | "大概几百块吧" → "单条约 2.5 万 token,月 3000 条约 X 元" |
| 没有跨职能冲突素材(I 组) | 🟡 部分 | 找课程同学/朋友做一次方案 review,记录被挑战的点和你怎么回应 | 从"没有素材"到"至少有一次真实被质疑的经历" |
| 没有真实用户反馈(B4/H6) | 🟡 部分 | 把原型给 1-2 个外贸从业者看,记录他们的第一反应 | "我假设他们会用" → "我给两个人看过,其中一个说他不会用,因为……" |
| 项目没落地(A3) | ❌ 不能 | — | 只能诚实承认,但可以补"如果真做我会先验证什么" |
| 没有真实 Bad Case(F8) | ❌ 不能 | — | 用 7 天验证路径代替 |
**行动清单要带排期**(外部依赖的排最前,因为约人要时间):
```
第1周:锁事实(简历/PRD 对账、判断台账、数字类型标注)
第2周:补证据(约人访谈 ×2-3、算 ROI 和 token、给人看原型)← 外部依赖,最早启动
第3周:写全文(新证据已到手,答案可以从"推测"升级成"我问过")
最后几天:模拟追问、控时练习、30秒/2分钟两版介绍
```
**能补的缺口不要只写"诚实承认"。** 承认是保底,补掉是加分。准备期够长时,写答案前先补证据——**这一步的收益比多写 5 道题的答案大得多。**
### Stage 4:攻防增强(只做 TOP 3 判断)
给最核心的 3 个判断补四件事,这四件事是**证明思维方式的载体**(原理七):
- **反面论证**:为什么不选 B/C/D(至少 2 个备选方案 + 各自为什么不行)
- **边界条件**:什么情况下这个判断不成立(至少 2 个)
- **7 天验证路径**:有时间线、有检查点、**预判可能发现什么**(证明有实验思维)
- **迭代历史**:V1 初始想法 → 转折点(什么让你改) → V2 → V3 方向(还能怎么改)
模板见 `references/card-system.md`。
---
## 5. 维度模型(11 组)
完整 52 个子维度、提问模板、A/C 级信号见 **`references/coverage-model.md`**。此处只列骨架与出题配额。
| 码 | 组 | 一句话考什么 | P0 题量 |
| :---: | :--- | :--- | :---: |
| **A** | 真实性与诚信 | 项目性质、个人贡献、数字是实测还是推导 | 2-3 |
| **B** | 问题与需求 | 场景怎么来的、主动发现还是被动接需求、怎么说服立项、北极星怎么定 | 2-3 |
| **C** | 方案与 AI 边界 | **为什么要用 AI(而不是规则/算法/人工)**、什么交给模型什么不交、Agent vs Workflow | 3-4 |
| **D** | 产品形态与体验 | 独立页面还是嵌入业务系统、交互流程、无结果怎么办、用户凭什么信 | 2 |
| **E** | 技术深度 | RAG 知识库好的标准、检索与切分、数据到结论的推导链路 | 2-3 |
| **F** | 可靠性与评测 | 模型必然出错怎么承接、长链路误差累积、阈值怎么定、评测集与 Bad Case 闭环 | 3-4 |
| **G** | **企业落地现实** ⭐ | 数据脏、接口没有、新老系统兼容、多业务配置化、安全合规、长期运营与审核疲劳 | 3-5 |
| **H** | 商业价值 | ROI 算给我听、成本结构、效果与成本换算、采纳率、谁掏钱 | 2-3 |
| **I** | 协作与推动 | 跨职能博弈、和业务方冲突、向上管理、**30 秒讲给不懂技术的老板**、控时 | 2-3 |
| **J** | 学习与自驱 | 哪个设计后来发现错了、迭代转折点、AI Coding 工具深度、接手老项目、沉淀成 skill | 2-3 |
| **K** | 岗位匹配与动机 | 职业路径自洽、JD 对标、目标级别、反问质量、离职与薪资 | 2-3 |
**关键提醒**:
- **C 组的"为什么要用 AI"是最根本一问**,却最常被漏。答不出这题,整个方案的立项理由就没了。
- **G 组对 M0-M1 候选人是最高权重**,因为纸面方案最大的能力缺口就是不知道方案到落地的距离。
- **I 组的控时是隐性淘汰项**。项目介绍讲超 3 分钟被打断,本身就是失分。
---
## 6. 出题原则
1. **背不出来** — 逼他现场思考或回忆具体痛处。
2. **强制取舍** — 在两个都"对"的选项里选,考价值观不是知识。
3. **细节颗粒度** — 能追到"你画了什么图"、"你原话怎么说的"、"那个数字怎么算的"。
4. **攻击前提,不攻击逻辑**(原理三)— 不问"你的逻辑对吗",问"你假设数据是干净的,如果不是呢"。
5. **每题必须能写出 A 级答案**(原理四)— 写不出来就删掉重出。
6. **每题带追问链** — 真实面试会连追 3 层。单题设计时就要想清第 2、3 层追什么。
7. **溯源型追问必配** — 对每个核心技术判断都要问"这想法是你自己想的还是参考的"。**这是鉴别 AI 生成方案的主武器。**
---
## 7. 答案标准
完整标准见 **`references/answer-standards.md`**。硬性底线:
- **可讲出口** — 口语节奏。写完出声读一遍,拗口就重写。
- **有具体场景** — 必须出现真实产品、数字、报错、对话。"保证准确性"是废话,"客户要 CE 我们只有 UL,推了就是错的"才是答案。
- **数字可追溯** — 每个数字说清怎么算的,或明确标注"这是估算/推导,依据是X"。**禁止把目标值、假设、benchmark 写成实测结果。**
- **承认边界** — 没做过就说没做过。坦承是加分项,硬撑是减分项。
- **反废话检验** — 能回答"听完这个答案,面试官/学员今天能改什么看法或做法"。答不出来 = 正确的废话,删掉重写。
- **禁用无信息量大词** — 鲁棒性、赋能、闭环、提效、抓手、最佳实践。
- **L1 控制在 150-250 字**(约 1 分钟)。
---
## 8. 输出与自检
- 面试官模式 → `templates/interview_guide_template.md`
- 候选人模式 → `templates/candidate_prep_template.md`
- 索引层 → `templates/index_template.md`
**每阶段收尾必做**:
1. 报告本次产出字数,超 4000 字要说明为什么没分批。
2. Stage 1 必须给 11 组覆盖诊断,**明确说哪组缺失,不许假装覆盖全了**。
3. 列出下一阶段建议做什么,让用户决定是否继续——**不要自动展开全部**。
**防偏见提醒**(Kahneman):
- 警惕文档体量光环。上千行 PRD 容易读成"这人很强"。**AI 时代体量不证明能力,问文档里没写的东西才行。**
- 反向防过度怀疑。技术判断确实对就该给分,不要因为"应届生不可能懂"而压分。
- **纸面项目不是原罪。** 区分"没落地过"(可培养)和"不知道自己没落地过"(危险)。
Is this your skill, or is something wrong with this listing? Request removal or report an issue. Author removals are honored within 72 hours.
No comments yet. Be the first to comment!