در این قسمت از رادیو آوید، روایت یک عملیات واقعی برای نجات اطلاعات در بحران را میشنوید؛ عملیاتی که پس از آسیب جدی به زیرساخت IT آغاز شد و تیم فنی را در برابر تصمیمهایی حساس قرار داد.
در چنین شرایطی، بکاپ، بازیابی اطلاعات و Disaster Recovery دیگر چند اصطلاح فنی نیستند. هر تصمیم میتواند بر سلامت دادهها، زمان بازگشت سرویسها و ادامه فعالیت سازمان اثر بگذارد.
پیشنهاد میکنیم ابتدا فایل صوتی این قسمت را بشنوید. اگر فرصت شنیدن نسخه کامل را ندارید، متن زیر مهمترین موضوعات مطرحشده در این اپیزود را مرور میکند.
نجات اطلاعات در بحران از کجا آغاز میشود؟
در یک بحران زیرساختی، اولین نشانه معمولاً قطع شدن سرویسها یا خارج شدن بخشی از تجهیزات از مدار است. بااینحال، روشن کردن دوباره سرورها همیشه اولین اقدام درست نیست. پیش از هر کاری باید مشخص شود که دادهها در چه وضعیتی قرار دارند و راهاندازی مجدد چه ریسکهایی ایجاد میکند.
در تجربهای که این قسمت از رادیو آوید روایت میکند، آسیب ایجادشده فقط عملکرد چند سرویس را مختل نکرده بود. وضعیت تجهیزات، دسترسی به دادهها و امکان ادامه فعالیت سازمان نیز در ابهام قرار داشت. به همین دلیل، عملیات بازیابی با بررسی شرایط و تعیین اولویتها آغاز شد.
در زمان بحران، سرعت مهم است؛ اما تصمیم عجولانه میتواند داده سالم را نیز در معرض آسیب قرار دهد.
تیم فنی باید میان بازگرداندن سریع سرویسها و حفاظت از اطلاعات تعادل برقرار کند. این تصمیم بدون شناخت وابستگی سرویسها، وضعیت بکاپها و معماری زیرساخت امکانپذیر نیست.
ارزیابی زیرساخت آسیبدیده پیش از بازیابی
بازیابی اطلاعات باید با یک ارزیابی فنی آغاز شود. هدف این مرحله، مشخصکردن دامنه آسیب و جلوگیری از گسترش خسارت است. اتصال بدون بررسی تجهیزات یا بازگرداندن شتابزده سرویسها ممکن است وضعیت را پیچیدهتر کند.
در ارزیابی اولیه، موارد زیر بررسی میشوند:
- میزان آسیب فیزیکی و منطقی واردشده به تجهیزات
- سلامت سرورها، تجهیزات ذخیرهسازی و شبکه
- وضعیت دادههای اصلی و نسخههای پشتیبان
- وابستگی میان سرویسها و سامانههای سازمان
- احتمال آلودگی، خرابی یا ناقص بودن دادهها
- امکان انتقال سرویسهای ضروری به یک بستر سالم
خروجی این ارزیابی، مبنای برنامه بازیابی است. بدون این مرحله نمیتوان تشخیص داد کدام سرویس باید زودتر بازگردد و کدام بخش به بررسی بیشتری نیاز دارد.
بازیابی اطلاعات پس از بحران یک عملیات مرحلهای است
بازیابی اطلاعات پس از بحران معمولاً با یک اقدام واحد انجام نمیشود. تیم فنی باید چند مرحله وابسته را بهترتیب اجرا کند و پس از هر مرحله، سلامت دادهها و سرویسها را دوباره بسنجد.
- مهار خسارت: تجهیزات و سرویسهای آسیبدیده از بخشهای سالم جدا میشوند.
- شناسایی سرویسهای حیاتی: سامانههایی که توقف آنها بیشترین اثر عملیاتی را دارد، در اولویت قرار میگیرند.
- بررسی نسخههای پشتیبان: سلامت، تاریخ و قابلیت بازیابی بکاپها آزمایش میشود.
- آمادهسازی بستر بازیابی: یک محیط سالم برای بازگرداندن دادهها و سرویسها در نظر گرفته میشود.
- بازیابی کنترلشده: دادهها و ماشینها بهترتیب وابستگی بازگردانده میشوند.
- آزمایش نهایی: عملکرد سرویسها، دسترسی کاربران و یکپارچگی اطلاعات بررسی میشود.
این ترتیب برای تمام سازمانها یکسان نیست. اولویتها باید بر اساس نوع کسبوکار، حساسیت دادهها، زمان قابلتحمل توقف و معماری زیرساخت تعیین شوند.
نقش بکاپ و Disaster Recovery در ادامه فعالیت سازمان
وجود فایل بکاپ بهتنهایی تضمینکننده بازیابی موفق نیست. نسخه پشتیبان باید سالم، در دسترس، بهروز و آزمایششده باشد. بکاپی که هیچگاه بازیابی آزمایشی نشده است، در زمان بحران یک نقطه اطمینان محسوب نمیشود.
یک سیاست بکاپ و استراتژی پشتیبانگیری باید مشخص کند چه دادههایی، با چه فاصله زمانی و در چند محل نگهداری میشوند. همچنین مسئولیت بررسی بکاپها و اجرای آزمون بازیابی باید از قبل تعیین شده باشد.
Disaster Recovery یا بازیابی پس از بحران دامنه گستردهتری دارد. این برنامه فقط به بازگرداندن فایلها محدود نیست و روش بازگشت زیرساخت، سرویسها، ارتباطات و عملیات سازمان را نیز پوشش میدهد.
دو شاخص RPO و RTO در این برنامه اهمیت زیادی دارند:
- RPO: حداکثر میزان دادهای که سازمان میتواند از دست بدهد.
- RTO: حداکثر زمانی که بازگشت یک سرویس میتواند طول بکشد.
تعیین این دو شاخص کمک میکند روش بکاپگیری، ظرفیت زیرساخت جایگزین و ترتیب بازیابی سرویسها بر مبنای نیاز واقعی سازمان انتخاب شود.
اثر مجازیسازی بر تداوم سرویسها
مجازیسازی میتواند جابهجایی و بازیابی سرویسها را سریعتر کند، بهویژه زمانی که زیرساخت اصلی آسیب دیده است. ماشینهای مجازی را میتوان روی میزبان سالم یا زیرساخت جایگزین بازیابی کرد؛ البته به شرط آنکه فایلهای پشتیبان معتبر و سازگاریهای فنی از قبل بررسی شده باشند.
یک زیرساخت یکپارچه و قابلمدیریت، وابستگی به تجهیزات پراکنده را کاهش میدهد و کنترل عملیات بازیابی را آسانتر میکند. پلتفرم Persian VM نیز برای مدیریت زیرساخت مجازی و متمرکزکردن عملیات ماشینهای مجازی طراحی شده است.
بااینحال، استفاده از مجازیسازی جایگزین برنامه بازیابی بحران نیست. معماری مناسب، بکاپ خارج از محیط اصلی، مستندسازی و آزمون دورهای همچنان ضروریاند.
درسهای این تجربه برای مدیران و تیمهای IT
در مستندات فنی، فرآیند بازیابی معمولاً منظم و قابل پیشبینی به نظر میرسد. در حادثه واقعی، تیم IT با محدودیت زمان، فشار عملیاتی، دسترسی ناقص به تجهیزات و نگرانی درباره سلامت دادهها روبهرو است.
این تجربه چند نکته روشن برای سازمانها دارد:
- نسخههای پشتیبان باید بهطور منظم آزمایش شوند.
- وابستگی سرویسها باید پیش از وقوع بحران مستند شده باشد.
- مسئولیت اعضای تیم بازیابی باید از قبل مشخص باشد.
- اطلاعات حیاتی نباید فقط در محل زیرساخت اصلی نگهداری شوند.
- برنامه بازیابی باید با تغییرات زیرساخت بهروزرسانی شود.
- مدیران سازمان باید زمان و بودجه لازم برای مانور بازیابی را در نظر بگیرند.
وبینار بکاپ و بازیابی اطلاعات نیز میتواند برای آشنایی بیشتر تیمهای فنی با اصول پشتیبانگیری و آمادگی در برابر خرابی زیرساخت مفید باشد.
جمعبندی اپیزود
نجات اطلاعات در بحران به تصمیمهایی وابسته است که بخشی از آنها باید پیش از حادثه گرفته شوند. معماری مناسب، بکاپ قابلاعتماد، مستندسازی و برنامه آزمایششده بازیابی، شانس بازگشت سرویسها را افزایش میدهند.
در این قسمت از رادیو آوید، جزئیات یک تجربه عملی از بازیابی زیرساخت و حفظ دادههای سازمانی را میشنوید. شنیدن روایت کامل کمک میکند فاصله میان برنامههای نوشتهشده و شرایط واقعی یک حادثه زیرساختی را بهتر بشناسید.
نسخه صوتی این قسمت را بشنوید و وضعیت بکاپ و برنامه بازیابی زیرساخت سازمان خود را دوباره بررسی کنید.
پرسشهای متداول درباره نجات اطلاعات در بحران
اولین اقدام پس از آسیبدیدن زیرساخت IT چیست؟
ابتدا باید دامنه آسیب مشخص و بخشهای معیوب از زیرساخت سالم جدا شوند. راهاندازی مجدد تجهیزات پیش از بررسی وضعیت دادهها ممکن است خسارت بیشتری ایجاد کند.
آیا داشتن بکاپ برای بازیابی اطلاعات کافی است؟
خیر. نسخه پشتیبان باید سالم، بهروز، در دسترس و بازیابی آن قبلاً آزمایش شده باشد. داشتن فایل بکاپ بدون آزمون بازیابی، تضمینی برای بازگشت اطلاعات نیست.
مجازیسازی چگونه به بازیابی زیرساخت کمک میکند؟
مجازیسازی امکان انتقال یا بازیابی ماشینها روی یک میزبان سالم را فراهم میکند و میتواند زمان بازگشت سرویسها را کاهش دهد. موفقیت این فرآیند به سلامت بکاپها و طراحی درست زیرساخت وابسته است.
برنامه Disaster Recovery شامل چه بخشهایی است؟
این برنامه روش مهار حادثه، اولویتبندی سرویسها، بازیابی دادهها، آمادهسازی زیرساخت جایگزین، تعیین مسئولیتها و آزمایش بازگشت سرویسها را مشخص میکند.