A06 可观测性与稳定性工程 — 面试题
目标:模拟真实面试场景,考察候选人的可观测性思维、监控体系设计、稳定性保障和故障响应能力。按难度分为基础、进阶、高级三个层级。
一、基础题
1. 什么是可观测性?它和监控有什么区别?基础
2. Core Web Vitals 包含哪些指标?如何优化?基础
3. 前端错误监控应该怎么做?基础
4. 什么是 SLO、SLA、Error Budget?基础
二、进阶题
5. 设计一个前端监控体系。进阶
6. 如何设计一个高可用的前端发布流程?进阶
7. 遇到线上故障,你的处理流程是什么?进阶
8. 什么是混沌工程?前端可以做吗?进阶
三、高级题
9. 如何设计前端全链路追踪方案?深入
10. 如何设计前端性能预算和告警体系?深入
11. 如何构建前端稳定性保障体系?深入
12. 描述一次你处理重大线上故障的经历。深入
参考答案(模板,需结合自身经历):
背景:某次大促期间,部分用户反馈商品详情页白屏。
处理过程:
- 通过 Sentry 发现大量
Cannot read property of undefined错误。 - 通过 traceId 定位到是新品类数据缺少某个字段,新代码未做兼容。
- 立即关闭相关新功能开关,快速止损。
- 补充空值判断,增加数据 schema 校验。
- 在灰度环境验证后重新发布。
- 复盘并增加数据契约测试和上线 checklist。
收获:
- 关键路径必须有空值兜底。
- 功能开关是快速止损的有效手段。
- 数据契约变更需要前后端同步校验。
评分维度:
- 过程完整(25%)
- 有快速止损意识(25%)
- 有复盘和预防(30%)
- 有可复用的方法论(20%)
面试准备建议
- 理解可观测性三大支柱:Logs、Metrics、Traces,能说明各自适用场景。
- 掌握 Core Web Vitals 定义、测量方法和优化手段。
- 能手写前端错误监控 SDK 的核心代码。
- 理解 SLO/SLA/Error Budget,能结合业务设定合理目标。
- 准备至少一次线上故障处理案例,重点说明止损、定位和复盘。
领域编号:A06 可观测性与稳定性工程
最后更新:2026-06-18