Skip to content

A06 可观测性与稳定性工程 — 面试题 ​

目标:模拟真实面试场景,考察候选人的可观测性思维、监控体系设计、稳定性保障和故障响应能力。按难度分为基础、进阶、高级三个层级。


一、基础题 ​

1. 什么是可观测性?它和监控有什么区别?基础
2. Core Web Vitals 包含哪些指标?如何优化?基础
3. 前端错误监控应该怎么做?基础
4. 什么是 SLO、SLA、Error Budget?基础

二、进阶题 ​

5. 设计一个前端监控体系。进阶
6. 如何设计一个高可用的前端发布流程?进阶
7. 遇到线上故障,你的处理流程是什么?进阶
8. 什么是混沌工程?前端可以做吗?进阶

三、高级题 ​

9. 如何设计前端全链路追踪方案?深入
10. 如何设计前端性能预算和告警体系?深入
11. 如何构建前端稳定性保障体系?深入
12. 描述一次你处理重大线上故障的经历。深入

参考答案(模板,需结合自身经历):

背景:某次大促期间,部分用户反馈商品详情页白屏。

处理过程:

  1. 通过 Sentry 发现大量 Cannot read property of undefined 错误。
  2. 通过 traceId 定位到是新品类数据缺少某个字段,新代码未做兼容。
  3. 立即关闭相关新功能开关,快速止损。
  4. 补充空值判断,增加数据 schema 校验。
  5. 在灰度环境验证后重新发布。
  6. 复盘并增加数据契约测试和上线 checklist。

收获:

  • 关键路径必须有空值兜底。
  • 功能开关是快速止损的有效手段。
  • 数据契约变更需要前后端同步校验。

评分维度:

  • 过程完整(25%)
  • 有快速止损意识(25%)
  • 有复盘和预防(30%)
  • 有可复用的方法论(20%)

面试准备建议 ​

  1. 理解可观测性三大支柱:Logs、Metrics、Traces,能说明各自适用场景。
  2. 掌握 Core Web Vitals 定义、测量方法和优化手段。
  3. 能手写前端错误监控 SDK 的核心代码。
  4. 理解 SLO/SLA/Error Budget,能结合业务设定合理目标。
  5. 准备至少一次线上故障处理案例,重点说明止损、定位和复盘。

领域编号:A06 可观测性与稳定性工程
最后更新:2026-06-18

基于 MIT 协议发布