مهارت پشتیبان‌گیری و بازیابی پس از بحران برای مدیران سیستم

معرفی و تعریف

پشتیبان‌گیری و بازیابی پس از بحران، توانایی طراحی، اجرا و آزمودن فرایندی است که داده‌ها، تنظیمات و سرویس‌های سازمان را پس از حذف ناخواسته، خرابی سخت‌افزار، حمله باج‌افزاری، خطای انسانی یا اختلال گسترده دوباره در دسترس قرار می‌دهد.

این مهارت فقط ساختن فایل بکاپ نیست. فرد باید مشخص کند چه داده‌ای ارزش حفاظت دارد، هر چند وقت یک‌بار نسخه تهیه شود، نسخه‌ها کجا نگهداری شوند، چه مدت باقی بمانند و هر سرویس در چه زمان قابل‌قبولی باید بازیابی شود. هدف «زمان بازیابی» (Recovery Time Objective | RTO) و «هدف نقطه بازیابی» (Recovery Point Objective | RPO) در همین تصمیم‌ها نقش دارند.

مدیران سیستم، مدیران پایگاه داده، مهندسان کلود و دواپس از این مهارت برای تداوم خدمت استفاده می‌کنند. معیار واقعی موفقیت وجود فایل پشتیبان نیست، بلکه توانایی بازیابی موفق، قابل‌تکرار و مستند در شرایط واقعی است.

این مهارت را با نام‌های دیگری نیز می‌شناسند:

  • بکاپ و بازیابی
  • مدیریت پشتیبان‌گیری
  • بازیابی از نسخه پشتیبان
  • Backup and Recovery
  • Backup and Restore
  • Disaster Recovery

اهمیت و کاربردها

چرا این مهارت مهم است؟

در نقش‌های زیرساختی، پایداری سرویس فقط با مانیتورینگ و رفع خطا تامین نمی‌شود. وقتی دیسک، ماشین مجازی، فایل‌های اشتراکی یا تنظیمات سرویسی از دست می‌رود، تیم باید بتواند با زمان و ترتیب مشخص آن را برگرداند. مسئولیت طراحی و اجرای این فرایند بسته به اندازه سازمان، تفکیک تیم زیرساخت و پایگاه داده، و مدل استقرار سرویس میان مدیر سیستم، مدیر پایگاه داده، تیم دواپس یا ارائه‌دهنده زیرساخت تقسیم می‌شود.

این مهارت برای سرویس‌هایی که داده مشتری، سامانه مالی، فروشگاه اینترنتی، سرویس داخلی یا زیرساخت ابری دارند اهمیت بیشتری پیدا می‌کند. در استخدام‌های ایران، عنوان شغلی به‌تنهایی برای تشخیص مسئولیت کافی نیست. شرح وظایف آگهی و محیط فنی سازمان را بررسی کنید تا مشخص شود تمرکز نقش بر سرورهای محلی، مجازی‌سازی، پایگاه داده یا زیرساخت ابری است.

پشتیبان‌گیری بدون آزمون احساس امنیت کاذب ایجاد می‌کند. نسخه‌ای که رمز آن در دسترس نیست، ناقص است یا زمان بازیابی آن با نیاز کسب‌وکار سازگار نیست، در رخداد واقعی کمکی نمی‌کند. توانایی مستندسازی سناریوها و اجرای تمرین بازیابی، این مهارت را از کار روزمره بکاپ‌گیری متمایز می‌کند.

کاربردها

  • بازیابی فایل‌ها و اشتراک‌های سازمانی

    بازگرداندن فایل یا پوشه حذف شده از نسخه مناسب، بدون جایگزین کردن ناخواسته نسخه‌های جدیدتر کاربران

  • بازیابی ماشین‌های مجازی

    برگرداندن ماشین مجازی آسیب‌دیده یا انتقال سرویس به نسخه قابل‌اجرا پس از خرابی میزبان یا فضای ذخیره‌سازی

  • محافظت از پایگاه داده‌های عملیاتی

    هماهنگ‌کردن بکاپ کامل، افزایشی یا لاگ تراکنش با نیاز بازیابی پایگاه داده و آزمودن بازگردانی در محیط جداگانه

  • مقابله با باج‌افزار

    استفاده از نسخه‌های جدا، محافظت شده و خارج از دسترس مهاجم برای بازسازی سرویس پس از آلودگی

  • بازیابی تنظیمات زیرساخت

    نگهداری و بازگردانی تنظیمات سرورها، ماشین‌های مجازی، سرویس‌های دایرکتوری و اجزای حیاتی شبکه

  • تمرین سناریوی قطعی سرویس

    اجرای دوره‌ای سناریوی خرابی، ثبت زمان و خطاهای Restore و اصلاح مستندات و سیاست بازیابی

پیش‌نیازها

موارد زیر پایه‌های لازم برای شروع را نشان می‌دهند.

  • آشنایی عملی با دست‌کم یک محیط سروری لینوکس یا ویندوز سرور
  • دسترسی به محیط آزمایشگاهی شامل ماشین مجازی و فضای ذخیره‌سازی
  • درک پایه از فایل‌سیستم، دیسک و مجوزهای دسترسی

مسیر یادگیری پشتیبان‌گیری و بازیابی پس از بحران

  1. مفاهیم حفاظت و بازیابی را تشخیص دهید.

    ۱۵ ساعت

    تفاوت میان بکاپ، آرشیو، «Snapshot» و «Replication» و دسترس‌پذیری بالا را بیاموزید. سناریوهای حذف فایل، خرابی دیسک، خرابی ماشین مجازی، باج‌افزار و از دست‌رفتن سایت را مقایسه کنید تا برای هرکدام راه‌حل نامرتبط انتخاب نکنید.

    مفاهیم «RPO» و «RTO» را با مثال سرویس‌های واقعی تمرین کنید. برای یک فایل‌سرور فرضی مشخص سازید چه مقدار داده قابل‌قبول است از دست برود و سرویس حداکثر چه مدت می‌تواند قطع بماند.

    برای رسیدن به سطح کاربردی در آزمایشگاه ساده، حدود ۸۰ تا ۱۴۰ ساعت مطالعه و تمرین نیاز دارید. کار با «VMware vSphere» و «Microsoft Hyper-V» یا زیرساخت‌های ابری به زمان بیشتری برای شناخت محیط و سناریوهای بازیابی نیاز دارد.

  2. سیاست پشتیبان‌گیری قابل‌اجرا طراحی کنید.

    ۲۰ ساعت

    دارایی‌های قابل‌پشتیبان‌گیری را فهرست کنید:

    • داده کاربران

    • پایگاه داده

    • ماشین مجازی

    • تنظیمات

    • کلیدهای دسترسی

    • و غیره

    برای هر مورد، تناوب بکاپ، مدت نگهداری، مسئول اجرا و محل ذخیره‌سازی تعیین کنید.

    الگوی نگهداری چندنسخه‌ای و جداسازی نسخه‌ها را تمرین کنید. سیاست باید مشخص کند کدام نسخه برای بازیابی سریع، کدام نسخه برای نگهداری بلندمدت و کدام نسخه در محل یا حساب جدا نگهداری می‌شود.

  3. راهبرد بازیابی پس از بحران را انتخاب کنید.

    ۲۵ ساعت

    در نظر داشته باشید که بازیابی از بکاپ، به‌تنهایی برنامه کامل بازیابی پس از بحران نیست. برنامه بازیابی باید این موارد را نیز مشخص کند.

    • اثر اختلال بر کسب‌وکار

    • اولویت سرویس‌ها

    • وابستگی‌ها

    • راه‌های ارتباطی

    • مسئول هر اقدام

    • روش ادامه ارائه به کار سرویس

    برای هر سرویس، اثرات ناشی از قطعی را بررسی و اولویت بازیابی آن را تعیین کنید. سپس با توجه به RTO و RPO، حجم و نرخ تغییر داده‌ها، وابستگی‌های فنی و هزینه، راهبرد مناسب را انتخاب کنید. این راهبردها می‌توانند شامل بازیابی از بکاپ، Replication، استفاده از سایت جایگزین یا بازیابی در زیرساخت ابری باشند.

    یک سناریوی Failover طراحی کنید.

    1. در این سناریو مشخص کنید چه کسی وقوع رخداد را اعلام می‌کند.

    2. چه کسی درباره جابه‌جایی سرویس تصمیم می‌گیرد.

    3. اطلاع‌رسانی به کاربران چگونه انجام می‌شود.

    4. و چه معیارهایی نشان می‌دهند سرویس جایگزین برای ارائه خدمت آماده است.

  4. بکاپ سرویس‌ها و ماشین‌های مجازی را اجرا کنید.

    ۲۵ ساعت

    در آزمایشگاه، از ماشین Linux یا Microsoft Windows Server بکاپ زمان‌بندی شده بگیرید. بکاپ فایل، ایمیج ماشین و تنظیمات را از نظر حجم، زمان اجرا و امکان بازیابی مقایسه کنید.

    با Veeam Backup & Replication یا ابزار متناسب با محیط خود، یک Job بسازید، مقصد ذخیره‌سازی و سیاست نگهداری را تعیین کنید و گزارش اجرای موفق یا ناموفق را بررسی کنید. رمزگذاری و محدودکردن دسترسی به مخزن بکاپ را نیز در نظر بگیرید.

    برای خودکارسازی، اسکریپت Bash در Linux یا PowerShell در Windows Server بنویسید که وضعیت آخرین بکاپ، فضای آزاد مخزن یا نتیجه اجرای Job را بررسی و خروجی آن را ثبت کند.

  5. بازیابی و Failover را در محیط جداگانه آزمون کنید.

    ۳۰ ساعت

    فایل حذف شده، ماشین مجازی ازکارافتاده و سرویس با تنظیمات ناقص را به صورت تعمدی شبیه‌سازی کنید. هر مورد را از بکاپ بازیابی کنید و فقط به پایان بدون خطای Job اکتفا نکنید.

    پس از Restore، صحت فایل‌ها، دسترسی کاربران، اجرای سرویس و اتصال‌های وابسته را بررسی کنید. زمان واقعی بازیابی و فاصله داده بازیابی شده تا آخرین تغییر را ثبت کنید تا RTO و RPO طراحی شده را ارزیابی کنید.

    در تمرین جداگانه‌ای، سرویس را به ماشین یا محیط جایگزین منتقل کنید و مراحل Failover و بازگشت به محیط اصلی را ثبت کنید. در صورت استفاده از AWS یا Microsoft Azure، دسترسی شبکه، هویت، ذخیره‌سازی و هزینه نگهداری محیط جایگزین را نیز در آزمون بررسی کنید.

  6. سناریوی بحران و ترتیب بازگردانی سرویس‌ها را مستند کنید.

    ۲۰ ساعت

    وابستگی سرویس‌ها را مشخص کنید. برای نمونه، سرویس هویت، پایگاه داده و فضای ذخیره‌سازی باید پیش از برنامه کاربردی بازیابی شوند. برای هر سناریو، ترتیب بازیابی، مسئول هر اقدام، اطلاعات دسترسی و معیار پایان کار را بنویسید.

    مستندات را خارج از سامانه‌ای نگهداری کنید که ممکن است در بحران از دسترس خارج شود. مستندات را به گونه‌ای بنویسید که هر همکار بتواند با اتکا به آن‌ها بازیابی آزمایشگاهی را تکرار کند.

  7. فرایند را پایش و بهبود دهید.

    ۱۵ ساعت

    هشدارهای مربوط به شکست Job، کمبود ظرفیت مخزن، پایان دوره نگهداری و تاخیر در بکاپ را بررسی کنید. گزارش‌های دوره‌ای بسازید که وضعیت سرویس‌های مهم و آخرین آزمون Restore را نشان دهد.

    پس از هر تمرین یا رخداد، دلیل کندی، نقص مستندات یا شکست بازیابی را تحلیل کنید و سیاست مربوطه را اصلاح کنید. فرایند را به شکلی قابل‌تکرار طراحی کنید تا وابسته به حافظه یک نفر نباشد.

زمان تقریبی یادگیری

حدود ۱۵۰ ساعت

برآورد مجموع زمان آموزش، مطالعه و تمرین تا رسیدن به سطح کاربردی؛ بسته به پیش‌زمینه شما می‌تواند کمتر یا بیشتر باشد.

پروژه‌های تمرینی

برای آشنایی بهتر با این مهارت، توجه به موارد زیر می‌تواند مفید باشد.

  • بکاپ و بازیابی فایل‌سرور آزمایشگاهی

    توضیح پروژه: ماشین مجازی فایل‌سرور بسازید، از چند پوشه با سطح دسترسی متفاوت بکاپ بگیرید و حذف تصادفی فایل و پوشه را با Restore آزمایش کنید. نتیجه و زمان بازیابی را ثبت کنید.

  • سیاست بکاپ برای یک شرکت فرضی

    توضیح پروژه: برای شرکت فرضی دارای فایل‌سرور، پایگاه داده و وب‌سایت، فهرست دارایی‌ها، RPO و RTO، زمان‌بندی بکاپ، مدت نگهداری و محل ذخیره نسخه‌ها را در یک سند عملیاتی بنویسید.

  • تمرین بازیابی ماشین مجازی

    توضیح پروژه: از ماشین مجازی دارای سرویس وب بکاپ بگیرید، آن را از دسترس خارج کنید و در محیط جداگانه بازیابی کنید. پس از بازگردانی، عملکرد سرویس و دسترسی به داده را بررسی کنید.

  • سناریوی بازیابی پس از باج‌افزار

    توضیح پروژه: فرض کنید فایل‌های سرور رمزگذاری شده‌اند. مراحل ایزوله‌سازی، انتخاب نسخه سالم، بازیابی، بررسی صحت و ثبت درس‌آموخته‌ها را به صورت Runbook مستند کنید.

پرسش‌های رایج درباره پشتیبان‌گیری و بازیابی پس از بحران

در این بخش، به تعدادی از پرسش‌های رایج درباره این مهارت پاسخ داده شده است.

تفاوت بکاپ با Snapshot چیست؟

Snapshot تصویری سریع از وضعیت دیسک یا ماشین در همان زیرساخت است و می‌تواند به همان خرابی یا حمله آسیب‌پذیر باشد. بکاپ باید نسخه‌ای مستقل با سیاست نگهداری مشخص داشته باشد و برای بازیابی بلندمدت و سناریوهای جدی قابل‌اتکا باشد.

آیا بکاپ موفق یعنی بازیابی حتماً موفق است؟

خیر. موفق‌بودن Job فقط نشان می‌دهد فرایند تهیه نسخه بدون خطای آشکار تمام شده است. باید Restore را در محیط جداگانه انجام دهید و صحت داده، اجرای سرویس و دسترسی کاربران را بررسی کنید.

RPO و RTO چه تفاوتی دارند؟

RPO بیشترین مقدار داده‌ای است که سازمان می‌پذیرد از دست برود. برای مثال داده تا آخرین بکاپ. RTO بیشترین زمان قابل‌قبول برای بازگرداندن سرویس است. این دو هدف، تناوب بکاپ و روش بازیابی را تعیین می‌کنند.

برای شروع این مهارت، Veeam یاد بگیرم یا ابزارهای ابری؟

ابتدا مفاهیم سیاست بکاپ، نگهداری نسخه و آزمون Restore را یاد بگیرید. سپس ابزار را بر اساس محل استقرار سرویس، Hypervisor یا پایگاه داده هدف، حجم و نرخ تغییر داده، RPO و RTO، هزینه مجوز و فضای ذخیره‌سازی و مهارت تیم انتخاب کنید. Veeam می‌تواند برای برخی محیط‌های مجازی‌سازی مناسب باشد، اما سرویس‌های بومی AWS یا Azure، ابزارهای پایگاه داده و گزینه‌های متن‌باز نیز بسته به محیط، انتخاب‌های معتبری هستند.

چند نسخه پشتیبان باید نگه داریم؟

تعداد نسخه‌ها به ارزش داده، RPO، الزامات نگهداری و ظرفیت ذخیره‌سازی وابسته است. به‌جای انتخاب عدد ثابت، نسخه‌های کوتاه‌مدت برای بازیابی سریع و نسخه‌های جداگانه برای رخدادهای دیرکشف شده در نظر بگیرید.

آیا مدیر سیستم باید بکاپ پایگاه داده را هم انجام دهد؟

در بسیاری از تیم‌ها مسئولیت زیرساخت بکاپ با مدیر سیستم است، اما روش سازگار پشتیبان‌گیری و بازیابی پایگاه داده باید با مدیر پایگاه داده یا تیم توسعه هماهنگ شود. بکاپ فایل‌های داده به‌تنهایی همیشه برای بازیابی سازگار کافی نیست.

آموزش‌های مرتبط در فرادرس

منابع پیشنهادی

برچسب‌ها و کلیدواژه‌ها