معرفی و تعریف
پشتیبانگیری و بازیابی پس از بحران، توانایی طراحی، اجرا و آزمودن فرایندی است که دادهها، تنظیمات و سرویسهای سازمان را پس از حذف ناخواسته، خرابی سختافزار، حمله باجافزاری، خطای انسانی یا اختلال گسترده دوباره در دسترس قرار میدهد.
این مهارت فقط ساختن فایل بکاپ نیست. فرد باید مشخص کند چه دادهای ارزش حفاظت دارد، هر چند وقت یکبار نسخه تهیه شود، نسخهها کجا نگهداری شوند، چه مدت باقی بمانند و هر سرویس در چه زمان قابلقبولی باید بازیابی شود. هدف «زمان بازیابی» (Recovery Time Objective | RTO) و «هدف نقطه بازیابی» (Recovery Point Objective | RPO) در همین تصمیمها نقش دارند.
مدیران سیستم، مدیران پایگاه داده، مهندسان کلود و دواپس از این مهارت برای تداوم خدمت استفاده میکنند. معیار واقعی موفقیت وجود فایل پشتیبان نیست، بلکه توانایی بازیابی موفق، قابلتکرار و مستند در شرایط واقعی است.
این مهارت را با نامهای دیگری نیز میشناسند:
- بکاپ و بازیابی
- مدیریت پشتیبانگیری
- بازیابی از نسخه پشتیبان
- Backup and Recovery
- Backup and Restore
- Disaster Recovery
اهمیت و کاربردها
چرا این مهارت مهم است؟
در نقشهای زیرساختی، پایداری سرویس فقط با مانیتورینگ و رفع خطا تامین نمیشود. وقتی دیسک، ماشین مجازی، فایلهای اشتراکی یا تنظیمات سرویسی از دست میرود، تیم باید بتواند با زمان و ترتیب مشخص آن را برگرداند. مسئولیت طراحی و اجرای این فرایند بسته به اندازه سازمان، تفکیک تیم زیرساخت و پایگاه داده، و مدل استقرار سرویس میان مدیر سیستم، مدیر پایگاه داده، تیم دواپس یا ارائهدهنده زیرساخت تقسیم میشود.
این مهارت برای سرویسهایی که داده مشتری، سامانه مالی، فروشگاه اینترنتی، سرویس داخلی یا زیرساخت ابری دارند اهمیت بیشتری پیدا میکند. در استخدامهای ایران، عنوان شغلی بهتنهایی برای تشخیص مسئولیت کافی نیست. شرح وظایف آگهی و محیط فنی سازمان را بررسی کنید تا مشخص شود تمرکز نقش بر سرورهای محلی، مجازیسازی، پایگاه داده یا زیرساخت ابری است.
پشتیبانگیری بدون آزمون احساس امنیت کاذب ایجاد میکند. نسخهای که رمز آن در دسترس نیست، ناقص است یا زمان بازیابی آن با نیاز کسبوکار سازگار نیست، در رخداد واقعی کمکی نمیکند. توانایی مستندسازی سناریوها و اجرای تمرین بازیابی، این مهارت را از کار روزمره بکاپگیری متمایز میکند.
کاربردها
-
بازیابی فایلها و اشتراکهای سازمانی
بازگرداندن فایل یا پوشه حذف شده از نسخه مناسب، بدون جایگزین کردن ناخواسته نسخههای جدیدتر کاربران
-
بازیابی ماشینهای مجازی
برگرداندن ماشین مجازی آسیبدیده یا انتقال سرویس به نسخه قابلاجرا پس از خرابی میزبان یا فضای ذخیرهسازی
-
محافظت از پایگاه دادههای عملیاتی
هماهنگکردن بکاپ کامل، افزایشی یا لاگ تراکنش با نیاز بازیابی پایگاه داده و آزمودن بازگردانی در محیط جداگانه
-
مقابله با باجافزار
استفاده از نسخههای جدا، محافظت شده و خارج از دسترس مهاجم برای بازسازی سرویس پس از آلودگی
-
بازیابی تنظیمات زیرساخت
نگهداری و بازگردانی تنظیمات سرورها، ماشینهای مجازی، سرویسهای دایرکتوری و اجزای حیاتی شبکه
-
تمرین سناریوی قطعی سرویس
اجرای دورهای سناریوی خرابی، ثبت زمان و خطاهای Restore و اصلاح مستندات و سیاست بازیابی
ابزارهای مرتبط
پیشنیازها
موارد زیر پایههای لازم برای شروع را نشان میدهند.
- آشنایی عملی با دستکم یک محیط سروری لینوکس یا ویندوز سرور
- دسترسی به محیط آزمایشگاهی شامل ماشین مجازی و فضای ذخیرهسازی
- درک پایه از فایلسیستم، دیسک و مجوزهای دسترسی
مسیر یادگیری پشتیبانگیری و بازیابی پس از بحران
-
۱۵ ساعت
مفاهیم حفاظت و بازیابی را تشخیص دهید.
تفاوت میان بکاپ، آرشیو، «Snapshot» و «Replication» و دسترسپذیری بالا را بیاموزید. سناریوهای حذف فایل، خرابی دیسک، خرابی ماشین مجازی، باجافزار و از دسترفتن سایت را مقایسه کنید تا برای هرکدام راهحل نامرتبط انتخاب نکنید.
مفاهیم «RPO» و «RTO» را با مثال سرویسهای واقعی تمرین کنید. برای یک فایلسرور فرضی مشخص سازید چه مقدار داده قابلقبول است از دست برود و سرویس حداکثر چه مدت میتواند قطع بماند.
برای رسیدن به سطح کاربردی در آزمایشگاه ساده، حدود ۸۰ تا ۱۴۰ ساعت مطالعه و تمرین نیاز دارید. کار با «VMware vSphere» و «Microsoft Hyper-V» یا زیرساختهای ابری به زمان بیشتری برای شناخت محیط و سناریوهای بازیابی نیاز دارد.
-
۲۰ ساعت
سیاست پشتیبانگیری قابلاجرا طراحی کنید.
داراییهای قابلپشتیبانگیری را فهرست کنید:
داده کاربران
پایگاه داده
ماشین مجازی
تنظیمات
کلیدهای دسترسی
و غیره
برای هر مورد، تناوب بکاپ، مدت نگهداری، مسئول اجرا و محل ذخیرهسازی تعیین کنید.
الگوی نگهداری چندنسخهای و جداسازی نسخهها را تمرین کنید. سیاست باید مشخص کند کدام نسخه برای بازیابی سریع، کدام نسخه برای نگهداری بلندمدت و کدام نسخه در محل یا حساب جدا نگهداری میشود.
-
۲۵ ساعت
راهبرد بازیابی پس از بحران را انتخاب کنید.
در نظر داشته باشید که بازیابی از بکاپ، بهتنهایی برنامه کامل بازیابی پس از بحران نیست. برنامه بازیابی باید این موارد را نیز مشخص کند.
اثر اختلال بر کسبوکار
اولویت سرویسها
وابستگیها
راههای ارتباطی
مسئول هر اقدام
روش ادامه ارائه به کار سرویس
برای هر سرویس، اثرات ناشی از قطعی را بررسی و اولویت بازیابی آن را تعیین کنید. سپس با توجه به RTO و RPO، حجم و نرخ تغییر دادهها، وابستگیهای فنی و هزینه، راهبرد مناسب را انتخاب کنید. این راهبردها میتوانند شامل بازیابی از بکاپ، Replication، استفاده از سایت جایگزین یا بازیابی در زیرساخت ابری باشند.
یک سناریوی Failover طراحی کنید.
در این سناریو مشخص کنید چه کسی وقوع رخداد را اعلام میکند.
چه کسی درباره جابهجایی سرویس تصمیم میگیرد.
اطلاعرسانی به کاربران چگونه انجام میشود.
و چه معیارهایی نشان میدهند سرویس جایگزین برای ارائه خدمت آماده است.
-
۲۵ ساعت
بکاپ سرویسها و ماشینهای مجازی را اجرا کنید.
در آزمایشگاه، از ماشین Linux یا Microsoft Windows Server بکاپ زمانبندی شده بگیرید. بکاپ فایل، ایمیج ماشین و تنظیمات را از نظر حجم، زمان اجرا و امکان بازیابی مقایسه کنید.
با Veeam Backup & Replication یا ابزار متناسب با محیط خود، یک Job بسازید، مقصد ذخیرهسازی و سیاست نگهداری را تعیین کنید و گزارش اجرای موفق یا ناموفق را بررسی کنید. رمزگذاری و محدودکردن دسترسی به مخزن بکاپ را نیز در نظر بگیرید.
برای خودکارسازی، اسکریپت Bash در Linux یا PowerShell در Windows Server بنویسید که وضعیت آخرین بکاپ، فضای آزاد مخزن یا نتیجه اجرای Job را بررسی و خروجی آن را ثبت کند.
-
۳۰ ساعت
بازیابی و Failover را در محیط جداگانه آزمون کنید.
فایل حذف شده، ماشین مجازی ازکارافتاده و سرویس با تنظیمات ناقص را به صورت تعمدی شبیهسازی کنید. هر مورد را از بکاپ بازیابی کنید و فقط به پایان بدون خطای Job اکتفا نکنید.
پس از Restore، صحت فایلها، دسترسی کاربران، اجرای سرویس و اتصالهای وابسته را بررسی کنید. زمان واقعی بازیابی و فاصله داده بازیابی شده تا آخرین تغییر را ثبت کنید تا RTO و RPO طراحی شده را ارزیابی کنید.
در تمرین جداگانهای، سرویس را به ماشین یا محیط جایگزین منتقل کنید و مراحل Failover و بازگشت به محیط اصلی را ثبت کنید. در صورت استفاده از AWS یا Microsoft Azure، دسترسی شبکه، هویت، ذخیرهسازی و هزینه نگهداری محیط جایگزین را نیز در آزمون بررسی کنید.
-
۲۰ ساعت
سناریوی بحران و ترتیب بازگردانی سرویسها را مستند کنید.
وابستگی سرویسها را مشخص کنید. برای نمونه، سرویس هویت، پایگاه داده و فضای ذخیرهسازی باید پیش از برنامه کاربردی بازیابی شوند. برای هر سناریو، ترتیب بازیابی، مسئول هر اقدام، اطلاعات دسترسی و معیار پایان کار را بنویسید.
مستندات را خارج از سامانهای نگهداری کنید که ممکن است در بحران از دسترس خارج شود. مستندات را به گونهای بنویسید که هر همکار بتواند با اتکا به آنها بازیابی آزمایشگاهی را تکرار کند.
-
۱۵ ساعت
فرایند را پایش و بهبود دهید.
هشدارهای مربوط به شکست Job، کمبود ظرفیت مخزن، پایان دوره نگهداری و تاخیر در بکاپ را بررسی کنید. گزارشهای دورهای بسازید که وضعیت سرویسهای مهم و آخرین آزمون Restore را نشان دهد.
پس از هر تمرین یا رخداد، دلیل کندی، نقص مستندات یا شکست بازیابی را تحلیل کنید و سیاست مربوطه را اصلاح کنید. فرایند را به شکلی قابلتکرار طراحی کنید تا وابسته به حافظه یک نفر نباشد.
زمان تقریبی یادگیری
برآورد مجموع زمان آموزش، مطالعه و تمرین تا رسیدن به سطح کاربردی؛ بسته به پیشزمینه شما میتواند کمتر یا بیشتر باشد.
پروژههای تمرینی
برای آشنایی بهتر با این مهارت، توجه به موارد زیر میتواند مفید باشد.
-
بکاپ و بازیابی فایلسرور آزمایشگاهی
توضیح پروژه: ماشین مجازی فایلسرور بسازید، از چند پوشه با سطح دسترسی متفاوت بکاپ بگیرید و حذف تصادفی فایل و پوشه را با Restore آزمایش کنید. نتیجه و زمان بازیابی را ثبت کنید.
-
سیاست بکاپ برای یک شرکت فرضی
توضیح پروژه: برای شرکت فرضی دارای فایلسرور، پایگاه داده و وبسایت، فهرست داراییها، RPO و RTO، زمانبندی بکاپ، مدت نگهداری و محل ذخیره نسخهها را در یک سند عملیاتی بنویسید.
-
تمرین بازیابی ماشین مجازی
توضیح پروژه: از ماشین مجازی دارای سرویس وب بکاپ بگیرید، آن را از دسترس خارج کنید و در محیط جداگانه بازیابی کنید. پس از بازگردانی، عملکرد سرویس و دسترسی به داده را بررسی کنید.
-
سناریوی بازیابی پس از باجافزار
توضیح پروژه: فرض کنید فایلهای سرور رمزگذاری شدهاند. مراحل ایزولهسازی، انتخاب نسخه سالم، بازیابی، بررسی صحت و ثبت درسآموختهها را به صورت Runbook مستند کنید.
پرسشهای رایج درباره پشتیبانگیری و بازیابی پس از بحران
در این بخش، به تعدادی از پرسشهای رایج درباره این مهارت پاسخ داده شده است.
تفاوت بکاپ با Snapshot چیست؟
Snapshot تصویری سریع از وضعیت دیسک یا ماشین در همان زیرساخت است و میتواند به همان خرابی یا حمله آسیبپذیر باشد. بکاپ باید نسخهای مستقل با سیاست نگهداری مشخص داشته باشد و برای بازیابی بلندمدت و سناریوهای جدی قابلاتکا باشد.
آیا بکاپ موفق یعنی بازیابی حتماً موفق است؟
خیر. موفقبودن Job فقط نشان میدهد فرایند تهیه نسخه بدون خطای آشکار تمام شده است. باید Restore را در محیط جداگانه انجام دهید و صحت داده، اجرای سرویس و دسترسی کاربران را بررسی کنید.
RPO و RTO چه تفاوتی دارند؟
RPO بیشترین مقدار دادهای است که سازمان میپذیرد از دست برود. برای مثال داده تا آخرین بکاپ. RTO بیشترین زمان قابلقبول برای بازگرداندن سرویس است. این دو هدف، تناوب بکاپ و روش بازیابی را تعیین میکنند.
برای شروع این مهارت، Veeam یاد بگیرم یا ابزارهای ابری؟
ابتدا مفاهیم سیاست بکاپ، نگهداری نسخه و آزمون Restore را یاد بگیرید. سپس ابزار را بر اساس محل استقرار سرویس، Hypervisor یا پایگاه داده هدف، حجم و نرخ تغییر داده، RPO و RTO، هزینه مجوز و فضای ذخیرهسازی و مهارت تیم انتخاب کنید. Veeam میتواند برای برخی محیطهای مجازیسازی مناسب باشد، اما سرویسهای بومی AWS یا Azure، ابزارهای پایگاه داده و گزینههای متنباز نیز بسته به محیط، انتخابهای معتبری هستند.
چند نسخه پشتیبان باید نگه داریم؟
تعداد نسخهها به ارزش داده، RPO، الزامات نگهداری و ظرفیت ذخیرهسازی وابسته است. بهجای انتخاب عدد ثابت، نسخههای کوتاهمدت برای بازیابی سریع و نسخههای جداگانه برای رخدادهای دیرکشف شده در نظر بگیرید.
آیا مدیر سیستم باید بکاپ پایگاه داده را هم انجام دهد؟
در بسیاری از تیمها مسئولیت زیرساخت بکاپ با مدیر سیستم است، اما روش سازگار پشتیبانگیری و بازیابی پایگاه داده باید با مدیر پایگاه داده یا تیم توسعه هماهنگ شود. بکاپ فایلهای داده بهتنهایی همیشه برای بازیابی سازگار کافی نیست.