集群是一组由 节点(物理机或虚拟机)组成的集合,运行 Kubernetes 代理,并由 控制平面管理。Kubernetes v1.36 支持最多 5,000 个节点的集群。更具体地说,Kubernetes 的设计旨在适配满足以下所有标准的配置:
你可以通过添加或移除节点来扩展集群。具体操作方式取决于集群的部署方式。
为了避免遇到云提供商的配额问题,在创建包含大量节点的集群时,请考虑:
对于大型集群,你需要一个具备充足计算能力和其他资源的控制平面。
通常,你会在每个故障域运行一个或两个控制平面实例,先进行垂直扩展这些实例,在达到收益递减点后再进行水平扩展。
你应该在每个故障域至少运行一个实例以提供容错能力。Kubernetes 节点不会自动将流量导向同一故障域中的控制平面端点;然而,你的云提供商可能有自己的机制来执行此操作。
例如,使用托管负载均衡器时,你可以配置负载均衡器以发送源自故障域 A 中的 kubelet 和 Pod 的流量,并仅将其引导至同样位于域 A 中的控制平面主机。如果单个控制平面主机或故障域 A 的端点离线,这意味着节点在域 A 中的所有控制平面流量现在将在不同区域之间传输。在每个区域运行多个控制平面主机可降低这种情况发生的可能性。
为了提高大型集群的性能,你可以将 Event(事件)对象存储在单独的专用 etcd 实例中。
创建集群时,你可以(使用自定义工具):
有关为大型集群配置和管理 etcd 的详细信息,请参阅操作 Kubernetes 的 etcd 集群和使用 kubeadm 设置高可用 etcd 集群。
Kubernetes 资源限制有助于最大限度地减少内存泄漏及 Pod 和容器可能影响其他组件的其他方式带来的影响。这些资源限制不仅适用于应用程序工作负载,同样也适用于 插件资源。
例如,你可以为日志组件设置 CPU 和内存限制。
...
containers:
- name: fluentd-cloud-logging
image: fluent/fluentd-kubernetes-daemonset:v1
resources:
limits:
cpu: 100m
memory: 200Mi
插件的默认限制通常基于在小型或中型 Kubernetes 集群上运行每个插件的经验数据。在大型集群上运行时,插件通常会消耗比其默认限制更多的资源。如果在大规模集群部署中不调整这些值,插件可能会因为不断触及内存限制而被持续杀死。或者,插件可能虽然可以运行,但由于 CPU 时间片限制导致性能不佳。
为了避免遇到集群插件资源问题,在创建包含大量节点的集群时,请考虑以下建议:
为确保集群必需组件(如 CoreDNS、metrics-server 和其他关键插件)在其他工作负载之前调度,且不会被优先级较低的 Pod 抢占,请使用系统 PriorityClass(例如 system-cluster-critical 或 system-node-critical)来运行它们。
VerticalPodAutoscaler 是一种自定义资源,你可以将其部署到集群中,以帮助管理 Pod 的资源请求和限制。
了解有关 Vertical Pod Autoscaler 的更多信息,以及如何使用它来扩展集群组件,包括集群关键插件。
阅读关于 节点自动缩放 (Node autoscaling) 的内容。
插件调整器 (addon resizer) 有助于在集群规模发生变化时自动调整插件大小。