Kubernetes监控手册08-监控scheduler
Kubernetes scheduler 监控实操:验证 /metrics 认证、用 Prometheus agent 抓取 kube-scheduler,并理解调度队列、调度耗时、抢占和 leader election 等关键指标。
汇总 Flashcat 博客中归属于 产品技术 分类的文章,方便按内容类型连续阅读产品实践、客户案例和可观测性方法。
Kubernetes scheduler 监控实操:验证 /metrics 认证、用 Prometheus agent 抓取 kube-scheduler,并理解调度队列、调度耗时、抢占和 leader election 等关键指标。
Kubernetes controller-manager 监控实操:如何验证 /metrics、配置 Prometheus agent 抓取、导入夜莺大盘,并理解 workqueue、leader election、PV/PVC 等关键指标。
Kubernetes 监控手册第 6 篇,讲解 APIServer 监控:6443 HTTPS 指标接口、Token/RBAC 认证、Prometheus agent mode 服务发现、Remote Write 上报和关键指标含义。
Kubernetes 监控手册第 5 篇,讲解 Kubelet 监控:10248 健康检查、10250 HTTPS 指标接口、ServiceAccount/RBAC 认证、Categraf DaemonSet 配置以及 Kubelet 与 cAdvisor 指标。
Kubernetes 监控手册第 4 篇,讲解 Kube-Proxy 监控:10249 指标端口、10256 健康检查、Categraf Prometheus 插件配置、DaemonSet 部署和关键指标含义。
Kubernetes 监控手册第 3 篇,演示如何用 Categraf 采集 Linux 宿主机 CPU、内存、IO、进程等指标,并通过 Remote Write 推送到 Nightingale 或其他兼容后端。
Kubernetes 监控手册第 2 篇,讲解宿主机监控的范围和采集器选型:带内 Agent、带外 IPMI/SNMP,以及 Telegraf、Grafana Agent、Datadog Agent、Node Exporter、Categraf 的适用场景。
Kubernetes 监控手册第 1 篇,从整体架构梳理 Kubernetes 监控对象:控制面组件、工作负载节点、容器运行时、Pod 应用和底层宿主环境。
服务稳定性保障中,服务可用性、故障、根本原因、故障定位和业务监控经常被混用。本文从用户视角解释这些概念的边界、统计口径和实践影响。
从 Open-Falcon 与 Prometheus 的数据模型差异出发,梳理云原生监控在采集、数据模型、查询、关联分析、OaC/API-Driven 和系统云原生化上的十大趋势。