خلل آلي خلال صيانة روتينية يتسبب في انقطاع Azure وMicrosoft 365

التبليغ والسبب الرئيسي

أعلنت مايكروسوفت أن الانقطاع الذي شهدته منصات Azure وMicrosoft 365 يعود إلى عيب تشغيلي آلي أثناء إجراء صيانة شبكية روتينية. وتبيّن أن الخلل بدأ في ساعة محددة وتسبب في اضطراب الاتصالات في جزء من الشبكة الخاصة بمايكروسوفت، خاصة فيما يتعلق بالبنية المرتبطة بمنطقة West US.
وقد تم رصد الحادث كإشارة MO1437424 ضمن سياق Microsoft 365. وأشارت الشركة إلى أن عيباً آلياً أزاح مسارات شبكية حيوية، ما أدى إلى تعطيل مسارات الاتصال بين مركز بيانات West US وبقية الشبكة.

كيف بدأ الخلل وما سببه
بدأ الانقطاع عندما قدَّم مهندسو الشركةطلب صيانة جهاز شبكي كجزء من الإجراءات الاعتيادية. ثم تحوّل الطلب إلى تعليمات غير صحيحة من خلال نظام آلي، إضافة إلى أن عيباً برمجياً وسّع نطاق عملية الصيانة ليشمل أجهزة شبكية أكثر من المخطط. النتيجة كانت تعديلاً في تكوين الشبكة أدى إلى إزالة مسارات IP من عدة أجهزة تربط مركز البيانات بمنظومة مايكروسوفت الأوسع.
التأثير والتعافي
في البداية، ورد أن المشكلة ظهرت كاضطرابات توجيه واسعة النطاق عبر البنية التحتية. حركة المرور المتجهة إلى West US تضررت، بينما المسارات التي بقيت داخل المنطقة نفسها استمرت في العمل بشكلطبيعي. أبلغ العملاء عن فشل في الاتصال، وزيادة في زمن الاستجابة، وتباطؤ في التطبيقات، ومشاكل في الوصول إلى الخدمات.
الخدمات المتأثرة وفق المعطيات شملت: Microsoft Graph، Windows 365، وMicrosoft Defender.
خط الزمن وطريقة التعافي
أعادت مايكروسوفت توجيه المرور عبر مسارات بديلة، وبدأت عملية التراجع عن التغيير الخاطئ عند الساعة 1:45 PM ET. اكتمل التراجع في 2:26 PM ET، وتأكدت عودة الخدمات المتأثرة إلى الوضع الطبيعي بحلول 3:41 PM ET. كما أشارت الشركة إلى أنها ستجري مراجعة مابعد الحادث ضمن تحقيق داخلي، مع نشر تقرير نهائي خلال نحو 14 يوماً عادةً.
ملاحظات إضافية حول التأثير والشفافية
تشير التطورات إلى أن الانقطاع أثر على نطاق واسع من المنتجات السحابية بما في ذلك خدمات Azure وMicrosoft 365، مع وجود تأثيرات متفاوتة على عدة خدمات وأدوات مرتبطة بالشبكة. تواصل مايكروسوفت متابعة الإجراءات الآلية وتقييم آليات التحقق والحد من المخاطر لتجنب تكرار مثل هذه الأحداث في المستقبل.





