评审现有告警时,可行动性、严重度和运行手册缺失应如何决定降级或删除?
围绕“评审现有告警时,可行动性、严重度和运行手册缺失应如何决定降级或删除”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出保留/降级/删除准则,不设计通知排班。
指标日志追踪专题面试题第 1 页,显示第 1–46 题,共找到 46 道完整解析,可继续按分类、标签与关键词缩小范围。
按稳定语义路径排序
围绕“评审现有告警时,可行动性、严重度和运行手册缺失应如何决定降级或删除”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出保留/降级/删除准则,不设计通知排班。
围绕“Alertmanager 中 silence、inhibition 与 routing tree 的职责边界是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确谁屏蔽通知、谁依赖关系去重、谁决定接收人。
围绕“告警应按症状还是原因触发,为什么磁盘空间根因告警不适合直接打扰值班”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明用户可感知症状优先原则。
围绕“阈值告警频繁抖动时,持续时间 for、迟滞区间和抑制规则各解决什么问题”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须区分防抖、回差与父子告警抑制。
围绕“OpenTelemetry Baggage 与 Span Attributes 都能携带上下文,为什么不能混用”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确传播范围、敏感性与基数风险。
围绕“黑盒探测与白盒指标在判断“用户真坏”与“我知道坏”上如何互补”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须区分外部可用性视角与内部归因能力。
围绕“SLO 燃烧率告警为什么比单纯错误率阈值更适合少报漏报”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明快慢燃烧窗口的意图。
围绕“浏览器端用户操作如何加入后端分布式 Trace,跨域 fetch 的 context 传播受什么限制”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明客户端起点 span 与跨域 header 限制。
围绕“异步消息队列场景如何注入和提取 Trace Context,消费者晚到数小时会怎样”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须处理生产消费断链与延迟可见性。
围绕“只给一个慢请求 ID,如何确定它进入系统、穿过队列、访问数据库并返回的耗时断点”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出从入口 span 到 DB/queue span 的断点定位路径,不解释所有组件原理。
围绕“如何把发布版本、feature flag 与指标突变更改关联,区分容量问题和回归”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确变更事件作为因果切面的用法。
围绕“Head-based sampling 与 tail-based sampling 在错误保留和成本上如何取舍”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明随机早期丢弃与完整 trace 后验决策差异。
围绕“必须按租户观测时,指标高基数应改用哪些聚合、日志或追踪方案”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须比较预聚合、日志明细、Trace exemplar 的取舍,不定义租户隔离安全。
围绕“Prometheus Histogram 与 Summary 的分位数在聚合能力上有什么关键差异”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确跨实例可分位数聚合为何倾向 Histogram,不比较存储格式。
围绕“一次用户报障如何从指标异常跳到具体 Trace,再落到同 span 的日志”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须串联 exemplar/trace_id/日志关联键。
围绕“结构化日志应固定哪些字段才能与指标和 Trace 关联,而不是只把 message 改成 JSON”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须指出关联键、级别语义与字段契约。
围绕“P99 延迟恶化但样本 Trace 正常时,如何用直方图桶与 exemplar 判断是不是采样遮蔽”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明聚合指标与个体轨迹的证据强弱,不定义 SLO。
围绕“多租户平台观测后端应如何用租户标签、独立项目或独立实例控制串扰”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须比较查询隔离与成本归因方案。
围绕“观测数据成本爆炸时,指标降基数、日志降噪、Trace 采样三者牺牲的信息各是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须比较三类信号裁剪后的不可逆损失,不给出厂商报价。
围绕“OpenTelemetry Collector 中 processors 做采样、属性富化与批处理的顺序为什么重要”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明先富化后采样与先采样后富化的结果差异。
围绕“OpenTelemetry Resource 中 service.name、service.namespace、de”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须区分进程身份与部署环境路由。
围绕“OpenTelemetry HTTP semantic conventions 固定 http.request.me”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明命名稳定利于跨语言查询。
围绕“OpenTelemetry parent-based sampler 如何保证同一 trace 内采样决策一致”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确父 Span 标记继承与根服务兜底,不比较各后端 UI。
围绕“Prometheus exemplars 如何把 Histogram 桶里的极端样本链接到 OpenTelemetr”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明 exemplar 元数据与采样前提。
围绕“两套 Prometheus 抓取同一目标时,告警去重应靠外部标签还是 Alertmanager 集群”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须识别副本标签一致性与通知去重边界。
围绕“Prometheus 标签基数为什么会把用户 ID 放进 label 变成事故”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明时间序列乘积爆炸与内存代价。
围绕“Prometheus Counter、Gauge、Histogram、Summary 各自不能表达什么数据”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须指出类型误用导致的错误结论。
围绕“什么场景应把 PromQL 下沉为 recording rule,什么时候反而增加运维复杂度”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明预计算收益与规则漂移成本,不讲解每条 PromQL 函数。
围绕“Prometheus 本地 TSDB 保留周期与远端长期存储分工如何影响高分辨率查询”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须权衡本地热数据与长期降精度。
围绕“为什么对 Prometheus Counter 直接看图会误导,rate/increase 的时间窗口如何选择”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明计数器重置与窗口平滑权衡。
围绕“跨网关、CDN 或第三方回调时 Trace Context 丢失,应把断点归因到哪一层”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须定位 header 被剥离或新建 trace 的边界。
围绕“RED 方法适合监控哪类服务,Rate、Errors、Duration 三个指标分别回答什么运维问题”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明 RED 面向请求驱动服务的适用边界。
围绕“同一台 API 服务同时出现高延迟和高 CPU 时,如何决定先用 RED 还是 USE 定位”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出从用户体验到资源因果的取舍逻辑。
围绕“低比例采样为什么可能系统性漏掉稀有错误 Trace,怎样避免幸存者偏差”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明按错误/延迟倾向保留的策略。
围绕“Prometheus scrape_interval 与 rules evaluation_interval 不匹配”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须计算发现延迟上下界。
围绕“trace/span 属性误带 Authorization 或手机号时,采集端与导出端各应如何做脱敏”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须划分 SDK 最小化与 Collector 删除改写责任。
围绕“为 HTTP API 定义可用性 SLI 时,5xx、超时和业务失败应如何计入分子分母”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须区分传输失败、超时与领域失败。
围绕“核心接口依赖三个下游服务时,端到端 SLO 能否简单乘各下游成功率”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明独立假设失效与关键路径口径。
围绕“SLI、SLO 与错误预算的关系是什么,如何用错误预算决定发布冻结”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确预算消耗与变更风险门控。
围绕“滚动窗口 SLO 与日历月 SLO 在错误预算清零和追责上有何差别”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须比较窗口策略对预算重置的影响,不解释 PromQL 全部语法。
围绕“OpenTelemetry SpanKind 的 server/client/internal/producer/c”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明边界识别与指标归因。
围绕“Prometheus target 消失后 stale marker 如何影响 vector 查询与告警残留”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要解释瞬时序列失效与旧值误报。
围绕“指标名、label 值和 span 属性演进时,怎样避免破坏既有看板与告警”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须提出兼容窗口、双发与弃用策略。
围绕“W3C Trace Context 的 traceparent 与 tracestate 分别允许谁修改”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须区分核心追踪标识与供应商扩展状态。
围绕“分布式 Trace 中 trace_id、span_id 与 parent span 如何重建调用因果”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要解释树形因果而非日志时间排序。
围绕“USE 方法中的 Utilization、Saturation、Errors 如何用于定位主机资源瓶颈”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明三类资源信号与排队饱和的关系。