
SHOPLINE
Cloud Engineer
Shiun 現於 SHOPLINE 任職 Cloud Engineer,主要工作專注在 Networking、Cloud Infra 與 EKS,解決大流量電商平台各式各樣的問題,同時也是 Cilium Contributor、2025 iThome 鐵人賽 - Cloud Native 組冠軍、 AWS Community Builder 與 AWS Educate Cloud Ambassador,業餘時間致力於 AWS 社群貢獻與雲端技術教育。
個人部落格:https://shiun.me
Pod 擴容速度過慢,不僅可能導致系統無法承受突發流量,也會造成 Node 已完成 Provisioning 但 Pod 遲遲無法啟動的閒置資源浪費,甚至拉長 Incident Recovery 時間。
在大流量壓力測試中,我們發現 Kubernetes Cluster 雖然具備足夠的運算資源,但許多 Pods 從建立到進入 Running 狀態竟然需要 26 分鐘。
本議程將分享 SHOPLINE 優化 Pod 水平擴容速度的完整過程,包含如何定位出 Root Cause、理解 Cilium IPAM 的運作機制,以及 Cilium 各元件的交互是如何影響 Pod 擴容速度。我們最終將 Pod 擴容時間縮短 80~88%,並將相關優化貢獻至 Cilium Upstream。
此外,在優化過程中曾因錯誤判斷調整 Cilium 設定以及錯誤的操作,導致 Production 發生服務中斷。本次分享也將深入解析 Incident 背後的 Cilium Endpoint Restore、Endpoint State 與 IP Allocation 等機制,以及我們從中獲得的經驗與教訓。
由於內容將深入探討 Cilium 背後運作機制、AWS ENI IPAM 與 Prefix Delegation 的實作細節,建議聽眾具備 Kubernetes、Cilium 與 AWS 基礎知識。
聽眾收穫: