9 กันยายน 2569
ที่มา: Help Net Security
หมวด: คลาวด์
AWS เปิดเผยว่าใช้เวลาหลายปีเปลี่ยนระบบควบคุมเส้นทางของเครือข่ายขอบใหม่ทั้งหมด ซึ่งเป็นระบบที่กำหนดเส้นทางของทุกการเรียก API ทุกสตรีมของ CloudFront และการค้นหาชื่อผ่าน Route 53 ของเดิมเป็นระบบควบคุมหลายชุดที่แยกกันและซิงก์กันไม่ทัน ทำให้เกิดเส้นทางวนและแพ็กเก็ตหาย ระบบใหม่รวมเป็นแหล่งความจริงเดียวและทยอยเปลี่ยนบนอุปกรณ์นับพันเครื่องโดยไม่มีช่วงหยุดบริการ ผลคือเวลาปรับเส้นทางบางส่วนของเครือข่ายดีขึ้นถึง 96 เปอร์เซ็นต์
ระบบควบคุมเส้นทางคือส่วนที่ตัดสินว่าทราฟฟิกจะเดินทางผ่านเส้นทางใดในเครือข่าย เมื่อเส้นทางหนึ่งล่ม ระบบต้องกระจายข้อมูลเส้นทางใหม่ให้อุปกรณ์ทุกตัวรับรู้ตรงกัน ช่วงเวลาที่อุปกรณ์แต่ละตัวยังรู้ไม่ตรงกันเรียกว่าช่วง convergence และเป็นช่วงที่ปัญหาเกิดขึ้นได้มากที่สุด
ปัญหาของสถาปัตยกรรมเดิมคือความกระจัดกระจาย เครือข่ายแต่ละส่วนมีระบบควบคุมของตัวเองที่สะสมมาจากการอัปเกรดฮาร์ดแวร์และซอฟต์แวร์หลายรุ่น และซิงก์กันได้ไม่ดีพอ ผลคือเครือข่ายส่วนหนึ่งอาจยังส่งทราฟฟิกไปตามเส้นทางที่อีกส่วนหนึ่งตัดออกไปแล้ว ทำให้เกิดเส้นทางวน แพ็กเก็ตหาย และเวลาแฝงกระโดด ซึ่งกระทบงานที่ทนความหน่วงไม่ได้อย่างการซื้อขายทางการเงิน การแพทย์ทางไกล และการถ่ายทอดสด
ระบบใหม่เปลี่ยนหลักการสำคัญสามอย่าง อย่างแรกคือการแบ่งปันเส้นทางแบบทางเดียว โหนดเก็บเส้นทางจะรวบรวมเส้นทางในพื้นที่ของตัวเองแล้วกระจายออกไป ส่วนโหนดกระจายจะรับเส้นทางจากที่อื่นโดยไม่ประกาศต่อ ทำให้อุปกรณ์ทุกตัวได้รับเส้นทางแต่ละเส้นจากต้นทางโดยตรง อย่างที่สองคือการห่อแพ็กเก็ต โดยแพ็กเก็ตเดิมถูกห่อไว้ในแพ็กเก็ตชั้นนอกที่พกคำสั่งเส้นทางไปด้วย ทำให้ทราฟฟิกไม่ได้รับผลจากอุปกรณ์ที่ยังถือข้อมูลเก่า และอย่างที่สามคือการยุบระบบควบคุมที่แยกกันให้เหลือแหล่งความจริงเดียว
ขนาดของการเปลี่ยนผ่านคือสิ่งที่ทำให้กรณีนี้น่าสนใจ AWS ทยอยเปลี่ยนบนอุปกรณ์นับพันเครื่องตลอดหลายปีโดยไม่มีช่วงหยุดบริการ ครอบคลุมเราเตอร์ที่หันออกอินเทอร์เน็ต โครงข่ายหลัก บริการ Direct Connect โหนดในโซนความพร้อมใช้งาน และบริการที่ขอบเครือข่าย ปัจจุบันระบบนี้ทำงานอยู่ใน 39 ภูมิภาค 123 โซนความพร้อมใช้งาน และจุดเชื่อมต่อกว่า 750 แห่งใน 6 ทวีป เชื่อมต่อกับเครือข่ายภายนอกมากกว่า 5,000 ราย และรองรับทราฟฟิกระดับหลายร้อยเทระบิตต่อวินาที
ผลลัพธ์ที่ AWS รายงานคือเวลา convergence บนโครงข่ายบางส่วนดีขึ้นถึง 96 เปอร์เซ็นต์ จำนวนการลองใหม่ลดลง และเวลาแฝงที่ลูกค้าเจอคาดเดาได้มากขึ้น โดยระบบรวมศูนย์รับภาระการคำนวณเส้นทางมากกว่าเดิมอย่างมีนัยสำคัญ
บทเรียนที่ทีมไทยนำไปใช้ได้ไม่ได้อยู่ที่ขนาด แต่อยู่ที่วิธีเปลี่ยนระบบหัวใจโดยไม่ดับบริการ นั่นคือทยอยเปลี่ยนทีละส่วน ให้ระบบเก่ากับใหม่อยู่ร่วมกันได้ระหว่างทาง และออกแบบให้ข้อมูลไหลทางเดียวเพื่อลดโอกาสที่สองฝั่งจะรู้ไม่ตรงกัน หลักการเดียวกันใช้ได้กับการย้ายฐานข้อมูลหรือเปลี่ยนสถาปัตยกรรมบริการภายในองค์กร ทีมงาน Smart Cyber Tech รับย้ายระบบขึ้นคลาวด์และวางสถาปัตยกรรม โดยวางแผนการเปลี่ยนผ่านแบบไม่ต้องหยุดให้บริการ ปรึกษาได้ที่ แบบฟอร์มติดต่อ
แหล่งข่าว เรียบเรียงจาก Help Net Security —
อ่านต้นฉบับ ภาพปก: Help Net Security · ลิขสิทธิ์ภาพเป็นของเจ้าของต้นฉบับ ใช้ประกอบการรายงานพร้อมอ้างอิงแหล่งที่มา
เนื้อหาบนหน้านี้เป็นการสรุปและเรียบเรียงเพื่อผู้อ่านชาวไทย หากพบข้อผิดพลาดโปรดแจ้งที่
info@smart-cyber-tech.com
บริการที่เกี่ยวข้องจากทีมงาน Smart Cyber Tech
แบ่งปันข่าวนี้:
LINE
Facebook
X
คัดลอกลิงก์
ปรึกษาทีมของเรา