Pod 出现 CrashLoopBackOff 时应该按什么思路排查?
围绕“Pod 出现 CrashLoopBackOff 时应该按什么思路排查”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖给出从事件、日志、探针到资源限制的诊断顺序。
工作负载与发布专题面试题第 1 页,显示第 1–45 题,共找到 45 道完整解析,可继续按分类、标签与关键词缩小范围。
按稳定语义路径排序
围绕“Pod 出现 CrashLoopBackOff 时应该按什么思路排查”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖给出从事件、日志、探针到资源限制的诊断顺序。
围绕“Kubernetes 的 restartPolicy 有哪些取值,Always、OnFailure、Never 分别”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明三种策略语义及 Pod/Deployment/Job 默认值的差异。
围绕“CronJob 错过调度时 startingDeadlineSeconds 如何决定是否补跑”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要讲清清错过窗口的计数与判定逻辑及避免大量补跑的配置。
围绕“CronJob 的调度表达式、时区与并发策略 concurrencyPolicy 如何配置”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明 Allow/Forbid/Replace 三种并发策略及 timeZone 字段的版本要求。
围绕“为什么批量修改 Deployment 前要用 kubectl rollout pause”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明暂停期间多次变更合并为一次滚动的价值及 pause 不影响已有滚动完成的边界。
围绕“Deployment 的 progressDeadlineSeconds 在更新卡顿时如何触发失败判定”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明 Progressing 条件超时判定及超时后不会自动回滚的事实。
围绕“什么场景下 Deployment 应使用 Recreate 策略而不是 RollingUpdate”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖给出单实例存储、版本不兼容等判断标准。
围绕“Kubernetes Deployment 如何回滚到指定历史版本,revisionHistoryLimit 起什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明修订记录、undo 命令及历史版本保留数量的关系。
围绕“Deployment 滚动更新中 maxSurge 和 maxUnavailable 如何共同决定更新速度与可用性”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕用具体副本数演算两个参数的行为及百分比取整规则。
围绕“Deployment 在滚动更新过程中同时扩容时,新副本如何在新旧版本间分配”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要讲清清按比例扩缩分配机制(proportional scaling)及可能的版本倾斜。
围绕“Deployment 与 ReplicaSet 是什么关系,为什么不推荐直接管理 ReplicaSet”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明 Deployment 通过 ReplicaSet 实现版本化管理的分工。
围绕“Kubernetes 临时容器(Ephemeral Container)适合什么排障场景,有哪些限制”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明其用于无 shell 镜像排障的定位及不能加端口、不能改资源的限制。
围绕“Kubernetes Init 容器的执行顺序、失败处理和与普通容器的区别是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明串行执行、阻塞语义与镜像可不同的特点。
围绕“Job 的 backoffLimit 与 Pod 失败重试如何工作,达到上限后 Job 处于什么状态”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要讲清清重试计数与 Job Failed 条件的触发。
围绕“Kubernetes Job 的 completions 与 parallelism 如何组合,NonIndexed”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明完成计数语义及索引模式下发配任务分片的用途。
围绕“Kubernetes 1.31+ Job 的 podFailurePolicy 如何按容器退出码决定重试还是终止”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明规则匹配 Ignore/FailJob/Count 动作的语义及与 backoffLimit 的关系。
围绕“Job 的 suspend 与 activeDeadlineSeconds 分别在什么运维场景下使用”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖区分手动暂停与运行超时的触发者和效果。
围绕“如何自动清理已完成的 Job 及其 Pod,ttlSecondsAfterFinished 的语义是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明 TTL 控制器级联删除行为及与手动清理的取舍。
围绕“节点内存或磁盘压力时 kubelet 如何驱逐 Pod,驱逐信号与硬软阈值是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明 eviction-hard/soft 阈值、排序依据及与 API 驱逐的区别。
围绕“Pod 亲和与反亲和如何通过 topologyKey 实现同机部署或跨可用区打散”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖用拓扑域标签解释调度约束的计算方式及性能代价。
本题讲解 Pod Ready 条件的计算逻辑,包括容器就绪与 readinessGates 的合成关系,以及 Ready 状态如何影响 Service 端点与滚动更新。通过具体场景说明自定义就绪门控的用法,并指出常见误判和运维边界。
围绕“PodDisruptionBudget 如何限制主动驱逐,minAvailable 与 maxUnavailable”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要讲清清 PDB 只约束自愿驱逐及两种阈值的互斥语义。
围绕“Kubernetes Pod 的生命周期有哪些阶段,Pending 和 Failed 各自在什么情况下出现”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明 Pod 各 phase 的判定条件与容器退出码的区别。
围绕“Kubernetes 如何根据 requests/limits 把 Pod 分为 Guaranteed、Bursta”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明三档 QoS 的判定规则及其在节点资源紧张时的驱逐优先级。
围绕“Pod 删除时 terminationGracePeriodSeconds 与 PreStop 钩子的执行顺序是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕梳理 SIGTERM、preStop、宽限期、SIGKILL 的时序及端点摘除的并行性。
围绕“Pod Priority 与抢占机制如何工作,高优先级 Pod 如何挤走低优先级 Pod”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明 PriorityClass、Pending 触发抢占与受害者选择逻辑。
围绕“HTTP、TCP、exec、gRPC 四种探针探测方式各适合什么场景”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖按协议与侵入性比较选型及 gRPC 探针的版本要求。
围绕“探针的 initialDelaySeconds、periodSeconds、failureThreshold、tim”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖给出从异常发生到标记失败的最坏时间推导及各参数常见误配。
围绕“liveness、readiness、startup 三种探针各自的失败后果是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要对比重启容器、摘端点、延迟另两种探针生效三种行为。
围绕“CPU 和内存的 requests/limits 分别如何影响调度决策与运行时行为”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖区分调度只看 requests、OOM 与 CPU throttle 的不同后果。
介绍kubelet容器重启退避的具体档位、上限和重置条件,纠正关于固定间隔的常见误解,并给出可配置上限的边界。
围绕“nodeSelector 与 nodeAffinity 的能力差异是什么,required 和 preferred ”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要对比表达力与软硬约束的调度行为。
围绕“Kubernetes 调度器的 Filter(PreFilter/Filter)与 Score 阶段各自做什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖梳理从队列到绑定的主流程及插件扩展点。
本文解释 1.29+ 原生 Sidecar 的实现机制:作为 restartPolicy: Always 的 init 容器,讨论其启动顺序、生命周期、readiness 探针与普通容器的区别,以及探针失败时的行为和 Job 兼容性。
围绕“启动慢的应用为什么应该配 startupProbe 而不是单纯调大 livenessProbe 的延迟参数”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖论证 startup 探针把启动时长与稳态检测解耦的优势。
围绕“删除 StatefulSet 或其 Pod 后,PVC 会怎样,如何实现缩容后保留存储”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明默认 PVC 不随 Pod 删除及 persistentVolumeClaimRetentionPolicy 的控制。
围绕“StatefulSet 滚动更新卡在某个 Pod 失败时如何处置,为什么不能直接回滚”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明卡住阻塞后续序号的机制与修复 Pod 后自动继续的行为。
围绕“StatefulSet 的稳定网络标识和存储标识分别通过什么机制保证”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明 Pod 序号命名、Headless Service DNS 与 volumeClaimTemplates 的绑定关系。
围绕“StatefulSet 的 podManagementPolicy 取 OrderedReady 和 Paralle”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要对比串行与并行启动的取舍及无主从依赖集群的选择依据。
围绕“StatefulSet 扩容和缩容时 Pod 创建删除的顺序规则是什么,为什么这样设计”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明按序号升序创建、降序删除及前一实例 Ready 才继续的语义。
围绕“StatefulSet 的 RollingUpdate 与 OnDelete 更新策略及 partition 分区滚”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明三种机制差异及用 partition 实现分批灰度的方式。
围绕“设计一个 Kafka 或数据库类应用时,如何论证应选 StatefulSet 而不是 Deployment”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖从身份、存储、启动顺序三个维度给出选型判断。
说明静态 Pod 由 kubelet 直接管理、绕过 API Server 的机制,以及镜像 Pod 概念;解释控制平面组件为何以静态 Pod 运行,包括自举与高可用部署的考量。
围绕“Taint 与 Toleration 的三种 effect 分别如何影响调度与运行中的 Pod”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖区分 NoSchedule、PreferNoSchedule、NoExecute 的驱逐语义。
围绕“topologySpreadConstraints 与 podAntiAffinity 在做副本打散时有什么本质区别”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明基于倾斜度 skew 的均衡计算与逐对反亲和的扩展性差异。