نقشه راه شغلی دانشمند داده؛ مسیر یادگیری Data Scientist علم داده از صفر تا استخدام

معرفی

مسیر تبدیل شدن به دانشمند داده از یادگیری ابزارهای مختلف شروع نمی‌شود. ابتدا باید بتوانید یک پرسش مبهم را به مسئله‌ای مشخص و قابل‌اندازه‌گیری تبدیل کنید. سپس برنامه‌نویسی Python، کار با پایگاه داده، آمار، پاک‌سازی و تحلیل داده را یاد می‌گیرید. پس از ساخت این پایه‌ها، نوبت به مدل‌سازی با یادگیری ماشین می‌رسد؛ زیرا یک مدل مناسب نیز بدون داده معتبر و تعریف درست مسئله، نتیجه قابل‌اعتمادی ایجاد نمی‌کند.

بسته به پیش‌زمینه و زمانی که هر هفته برای یادگیری و تمرین اختصاص می‌دهید، این مسیر می‌تواند حدود ۳۵۰ تا ۵۰۰ ساعت تمرین هدفمند نیاز داشته باشد. برای فردی که هفته‌ای ۱۰ ساعت زمان ثابت دارد، این مقدار تقریبا معادل ۸ تا ۱۲ ماه تمرین است. اگر از قبل با Python یا آمار آشنا باشید، ممکن است بخش‌های پایه را سریع‌تر پشت سر بگذارید، اما بهتر است پروژه‌های عملی مسیر را حذف نکنید.

این نقشه راه در ۸ گام طراحی شده است. مسیر از صورت‌بندی مسئله و مبانی Python شروع می‌شود، به SQL و آمار می‌رسد، سپس پاک‌سازی و تحلیل داده، مصورسازی، مدل‌سازی یادگیری ماشین و مهندسی ویژگی را پوشش می‌دهد و در پایان به اجرای یک پروژه سرتاسری می‌رسد.

پس از یادگیری هسته مشترک، می‌توانید با توجه به نوع مسئله و هدف شغلی خود به حوزه‌هایی مانند تحلیل محصول و آزمایش، پردازش زبان طبیعی یا بینایی ماشین وارد شوید. مسیر مهندس یادگیری ماشین نیز برای افرادی که به استقرار، پایش و نگهداری مدل‌ها علاقه دارند، یک مسیر شغلی مرتبط و مکمل محسوب می‌شود.

برای آشنایی بیشتر با وظایف و مهارت‌های مورد نیاز این شغل، صفحه «دانشمند داده» را نیز مطالعه کنید.

مخاطبان نقشه راه

این نقشه راه برای افرادی مناسب است که می‌خواهند مهارت‌های لازم برای ورود به حوزه علم داده را به‌صورت مرحله‌ای یاد بگیرند و در پایان، نمونه‌کاری قابل‌ارائه داشته باشند. دانشجویان، فارغ‌التحصیلان رشته‌های فنی و تحلیلی و افرادی که قصد تغییر مسیر شغلی به سمت علم داده را دارند، می‌توانند از این مسیر استفاده کنند.

دستاورد پایانی

در پایان مسیر می‌توانید یک مسئله داده‌ای را تعریف کنید، داده‌های مورد نیاز را با SQL استخراج کنید، داده را با Python و ابزارهای تحلیلی آماده و بررسی کنید، نتایج را به شکل مناسب ارائه دهید و برای مسائل رگرسیون یا طبقه‌بندی، مدل‌های پایه یادگیری ماشین بسازید و ارزیابی کنید. همچنین می‌توانید یک پروژه سرتاسری را مستندسازی کنید و محدودیت‌های داده و نتایج مدل را به شکل شفاف توضیح دهید.

پیش‌نیازها

شروع این مسیر با دانستن پیش‌نیازهای زیر هموارتر می‌شود.

  • توانایی کار روزمره با فایل‌ها و مرورگر
  • آشنایی مقدماتی با مفاهیم جدول، سطر و ستون
  • انگلیسی فنی در حد خواندن مستندات ساده

مسیر یادگیری شغل دانشمند داده

  1. صورت‌بندی مسئله و مبانی برنامه‌نویسی Python

    ۵۰ ساعت

    هدف گام: یاد بگیرید پرسش کسب‌وکار را به مسئله داده‌ای تبدیل کنید و با Python داده‌های ساده را پردازش کنید.

    پیش از ورود به کتابخانه‌های علم داده، باید بتوانید یک سؤال کلی را به مسئله‌ای مشخص تبدیل کنید. برای هر مسئله، تصمیم‌گیرنده، متغیر هدف، واحد تحلیل، بازه زمانی، داده‌های در دسترس و معیار موفقیت را مشخص کنید. برای مثال، «چرا فروش کم شده است؟» هنوز یک مسئله داده‌ای مشخص نیست. باید معلوم شود فروش کدام محصول، در چه بازه‌ای و در مقایسه با چه دوره یا گروهی بررسی می‌شود.

    سپس مبانی Python را تا سطحی یاد بگیرید که بتوانید فایل بخوانید، متغیر و تابع تعریف کنید، با فهرست‌ها و دیکشنری‌ها کار کنید و خطاهای ساده را پیدا و بررسی کنید. مستندات رسمی Python نیز مباحثی مانند ساختارهای داده، توابع، خواندن و نوشتن فایل و مدیریت خطاها را در مبانی این زبان پوشش می‌دهد.

    هدف این گام تبدیل شدن به برنامه‌نویس حرفه‌ای نیست. بلکه ایجاد پایه‌ای است که بتوانید تحلیل داده را روی آن انجام دهید.

    مهارت‌ها

    ابزارها

    مفاهیم تکمیلی

    • تبدیل پرسش کسب‌وکار به پرسش قابل‌اندازه‌گیری
    • تعریف متغیر هدف و واحد تحلیل
    • نوع داده و ساختارهای داده در Python
    • شرط، حلقه و تابع
    • خواندن و نوشتن فایل‌های متنی و CSV
    • مدیریت خطاهای ساده

    پروژه پیشنهادی: یک مسئله ساده کسب‌وکار را تعریف کنید و یک برنامه Python بنویسید که داده اولیه آن را از فایل CSV بخواند، چند شاخص ساده محاسبه کند و نتیجه را در قالبی قابل‌فهم نمایش دهد.

    معیار پایان گام: می‌توانید یک مسئله ساده را به چند پرسش قابل‌اندازه‌گیری تبدیل کنید و با Python فایل داده را بخوانید، داده‌ها را پردازش کنید و یک تابع ساده برای انجام تحلیل بنویسید.

  2. استخراج داده با SQL

    ۴۵ ساعت

    هدف گام: یادگیری استخراج، ترکیب و بررسی داده‌های مورد نیاز از پایگاه داده با SQL.

    دانشمند داده معمولا داده را به شکل آماده دریافت نمی‌کند. باید بتوانید ساختار جدول‌ها را بخوانید، ارتباط میان آن‌ها را بفهمید و داده مناسب مسئله را استخراج کنید.

    ابتدا SELECT، فیلتر، مرتب‌سازی، تجمیع و GROUP BY را تمرین کنید و سپس به JOIN، زیرپرس‌وجو و توابع پنجره‌ای برسید. هنگام اتصال جدول‌ها نیز بررسی کنید هر JOIN چه تعداد رکورد ایجاد می‌کند و آیا باعث تکثیر ناخواسته داده شده است یا خیر. این بررسی برای جلوگیری از تحلیل نادرست اهمیت زیادی دارد.

    مهارت‌ها

    ابزارها

    مفاهیم تکمیلی

    انتخاب، فیلتر و مرتب‌سازی دادهتجمیع و گروه‌بندیاتصال جدول‌ها و کنترل تکثیر رکوردزیرپرس‌وجو و عبارت‌های جدولی مشترکتوابع پنجره‌ایبررسی بازه زمانی و دانه‌بندی داده

    پروژه پیشنهادی: یک پایگاه داده چندجدولی انتخاب کنید و با SQL داده مورد نیاز برای یک مسئله تحلیلی را استخراج کنید. در گزارش پروژه، منطق اتصال جدول‌ها و کنترل تعداد رکوردهای خروجی را نیز توضیح دهید.

    معیار پایان گام: می‌توانید از چند جدول مرتبط، داده مورد نیاز یک مسئله را استخراج کنید، JOIN مناسب را انتخاب کنید و درستی تعداد و دانه‌بندی رکوردهای خروجی را بررسی کنید.

  3. آمار کاربردی و تفکر آزمایشی

    ۵۵ ساعت

    هدف گام: یادگیری استفاده از آمار برای توصیف داده، سنجش عدم‌قطعیت و طراحی مقایسه‌های آزمایشی.

    آمار در علم داده فقط مجموعه‌ای از فرمول‌ها نیست؛ ابزاری برای توصیف داده و سنجش عدم‌قطعیت است. آمار توصیفی، شکل توزیع، میانگین، میانه، واریانس، صدک و همبستگی را با داده واقعی تمرین کنید.

    همچنین باید بدانید که همبستگی به‌تنهایی رابطه علّی را اثبات نمی‌کند و یک میانگین کلی ممکن است تفاوت میان گروه‌های مختلف را پنهان کند.

    در ادامه، نمونه‌گیری، فاصله اطمینان، فرض صفر، مقدار p و خطاهای نوع اول و دوم را در مسئله‌های ساده بررسی کنید. برای تحلیل محصول یا کمپین نیز منطق مقایسه گروه کنترل و گروه آزمایش را یاد بگیرید. انتخاب روش آماری باید به نوع متغیر، داده و پرسش مورد بررسی وابسته باشد.

    مهارت‌ها

    ابزارها

    مفاهیم تکمیلی

    آمار توصیفی و شکل توزیعنمونه‌گیری و سوگیری نمونههمبستگی و محدودیت تفسیر آنفاصله اطمینانآزمون فرض و مقدار pخطاهای نوع اول و دومگروه کنترل و گروه آزمایش

    پروژه پیشنهادی: یک مجموعه‌داده واقعی را بررسی کنید، آمار توصیفی آن را محاسبه کنید و یک پرسش آماری مشخص برای مقایسه دو گروه تعریف و تحلیل کنید.

    معیار پایان گام: می‌توانید شاخص‌های آماری مناسب را انتخاب کنید، نتایج آزمون آماری را تفسیر کنید و میان همبستگی، تفاوت آماری و رابطه علّی تمایز بگذارید.

  4. پاک‌سازی، آماده‌سازی و تحلیل اکتشافی داده

    ۶۰ ساعت

    هدف گام: یادگیری آماده‌سازی داده‌های خام و کشف الگوها، خطاها و محدودیت‌های داده پیش از مدل‌سازی.

    بخش مهمی از کار واقعی علم داده به آماده‌سازی و بررسی داده اختصاص دارد. با pandas داده را بارگذاری کنید، نوع ستون‌ها و دامنه مقادیر را بررسی کنید و برای داده‌های گمشده، تکراری، ناسازگار و پرت تصمیمی مستند بگیرید. pandas ابزارهایی برای تشخیص و مدیریت داده‌های گمشده و همچنین عملیات گروه‌بندی و ترکیب داده فراهم می‌کند.

    در تحلیل اکتشافی داده (Exploratory Data Analysis یا EDA)، از جدول‌های خلاصه و نمودارها برای یافتن الگو، خطای داده و تغییرات مهم استفاده کنید. پیش از ساخت مدل، توزیع متغیر هدف، تغییرات زمانی و احتمال وجود نشتی داده را بررسی کنید.

    مهارت‌ها

    ابزارها

    مفاهیم تکمیلی

    بررسی نوع و دامنه متغیرهامدیریت مقادیر گمشدهشناسایی رکوردهای تکراری و ناسازگارتشخیص و تفسیر داده‌های پرتتحلیل تک‌متغیره و چندمتغیرهبررسی تغییرات زمانیشناسایی نشتی داده

    پروژه پیشنهادی: یک مجموعه‌داده خام را دریافت و پاک‌سازی کنید، کیفیت ستون‌ها را بررسی کنید و با چند تحلیل و نمودار، مهم‌ترین الگوها و محدودیت‌های داده را گزارش دهید.

    معیار پایان گام: می‌توانید کیفیت داده را بررسی کنید، روش برخورد با داده‌های گمشده و پرت را توضیح دهید و یک تحلیل اکتشافی منظم و قابل‌تکرار ارائه کنید.

  5. مصورسازی و انتقال بینش به تصمیم‌گیرنده

    ۳۵ ساعت

    هدف گام: یادگیری انتخاب نمودار مناسب و تبدیل نتایج تحلیل داده به بینش قابل‌فهم برای تصمیم‌گیرنده.

    نمودار باید به یک پرسش مشخص پاسخ دهد. نوع نمودار را بر اساس هدف تحلیل، مانند مقایسه، روند، توزیع یا بررسی رابطه میان متغیرها انتخاب کنید. عنوان، مقیاس، برچسب‌ها و بازه زمانی نیز باید به خواننده کمک کنند نتیجه را درست تفسیر کند.

    در ارائه نتایج، میان مشاهده، تفسیر و پیشنهاد تفاوت بگذارید. برای مثال، کاهش نرخ خرید یک مشاهده است؛ علت آن یک فرضیه است و پیشنهاد آزمایش یک اقدام احتمالی. این تفکیک هنگام ارائه نتایج به تیم محصول، بازاریابی یا عملیات اهمیت دارد.

    برای ساخت داشبورد نیز می‌توانید با توجه به محیط کاری از Microsoft Power BI یا ابزارهای مشابه استفاده کنید. داشبوردسازی پیش‌نیاز یادگیری مدل‌سازی نیست.

    مهارت‌ها

    ابزارها

    مفاهیم تکمیلی

    انتخاب نمودار متناسب با پرسشطراحی مقیاس و برچسب قابل‌خواندنروایت داده و ترتیب ارائه یافته‌هاتفکیک مشاهده، تفسیر و پیشنهادبیان عدم‌قطعیت و محدودیت تحلیلطراحی گزارش مدیریتی

    پروژه پیشنهادی: نتایج تحلیل گام قبل را در قالب یک گزارش تصویری یا داشبورد ارائه کنید و برای هر نمودار، پرسش، مشاهده و برداشت اصلی را مشخص کنید.

    معیار پایان گام: می‌توانید نمودار مناسب را برای یک پرسش مشخص انتخاب کنید و نتایج تحلیل را در قالب گزارشی قابل‌فهم برای مخاطب فنی و غیرفنی ارائه دهید.

  6. مدل‌سازی پایه یادگیری ماشین

    ۶۵ ساعت

    هدف گام: یادگیری ساخت، مقایسه و ارزیابی مدل‌های پایه برای مسائل رگرسیون و طبقه‌بندی.

    یادگیری ماشین را با تعریف مسئله و ساخت یک خط مبنا شروع کنید، نه با مدل‌های پیچیده. ابتدا مشخص کنید پیش‌بینی چه چیزی قرار است به تصمیم‌گیری کمک کند. سپس داده را به بخش‌های آموزش و ارزیابی تقسیم کنید و روش اعتبارسنجی مناسب را انتخاب کنید.

    یک مدل ساده مانند رگرسیون خطی یا لجستیک را به‌عنوان خط مبنا بسازید و مدل‌های دیگر را با استفاده از داده و معیارهای یکسان مقایسه کنید.

    معیار ارزیابی باید با نوع مسئله و هزینه خطا هماهنگ باشد. در داده‌های نامتوازن، دقت کلی می‌تواند تصویر ناقصی از عملکرد مدل ارائه دهد. در چنین شرایطی، معیارهایی مانند دقت (Precision)، بازخوانی (Recall) و امتیاز F1 را نیز بررسی کنید. ماتریس درهم‌ریختگی (Confusion Matrix) نیز برای بررسی خطاهای مدل‌های طبقه‌بندی کاربرد دارد.

    مهارت‌ها

    ابزارها

    مفاهیم تکمیلی

    تعریف مسئله رگرسیون و طبقه‌بندیتقسیم داده آموزش و ارزیابیاعتبارسنجی متقابلمدل خط مبنابیش‌برازش و کم‌برازشانتخاب سنجه ارزیابیداده نامتوازنماتریس درهم‌ریختگی

    پروژه پیشنهادی: برای یک مسئله رگرسیون یا طبقه‌بندی، ابتدا یک مدل خط مبنا بسازید و سپس حداقل یک مدل دیگر را با معیار مناسب ارزیابی و مقایسه کنید. دلیل انتخاب معیار ارزیابی را نیز توضیح دهید.

    معیار پایان گام: می‌توانید یک مسئله یادگیری ماشین را تعریف کنید، مدل خط مبنا بسازید، روش ارزیابی مناسب انتخاب کنید و محدودیت‌های نتیجه را توضیح دهید.

  7. مهندسی ویژگی و بازتولیدپذیری تحلیل

    ۴۰ ساعت

    هدف گام: یادگیری ساخت ویژگی‌های مناسب، جلوگیری از نشتی داده و ایجاد پروژه‌های قابل‌بازبینی و بازتولیدپذیر.

    ویژگی مناسب از شناخت مسئله و زمان تولید داده به دست می‌آید، نه فقط از افزایش تعداد ستون‌ها. هنگام ساخت ویژگی‌های جدید بررسی کنید که آیا این اطلاعات در زمان پیش‌بینی واقعا در دسترس هستند یا خیر. ویژگی‌هایی که به آینده یا برچسب هدف وابسته‌اند، می‌توانند باعث نشتی داده شوند و عملکرد مدل را بهتر از واقعیت نشان دهند.

    هم‌زمان، پروژه را بازتولیدپذیر کنید. کد، داده‌های عمومی یا روش دریافت داده، فرض‌ها، نسخه کتابخانه‌ها و نتایج اجرا را در مخزن Git ثبت کنید. دفترچه ژوپیتر باید خوانا باشد، اما بخش‌های تکراری را تا حد امکان به توابع یا فایل‌های جدا منتقل کنید.

    در این مرحله لازم نیست استقرار صنعتی مدل را به‌صورت عمیق یاد بگیرید؛ این موضوع در مسیر مهندس یادگیری ماشین با جزئیات بیشتری دنبال می‌شود.

    مهارت‌ها

    ابزارها

    مفاهیم تکمیلی

    ساخت ویژگی از داده خامدسترس‌پذیری ویژگی در زمان پیش‌بینیکنترل نشتی دادهتبدیل و مقیاس‌بندی متغیرهاانتخاب ویژگی و تفسیر اثر آنثبت فرض‌ها و نسخه دادهساختاردهی مخزن تحلیل

    پروژه پیشنهادی: پروژه یادگیری ماشین گام قبل را توسعه دهید، چند ویژگی معنادار بسازید و اثر آن‌ها را ارزیابی کنید. سپس کل پروژه را در یک مخزن Git با ساختار مشخص، README و دستورالعمل اجرای آن قرار دهید.

    معیار پایان گام: می‌توانید ویژگی‌های جدید را بدون ایجاد نشتی داده تولید کنید و پروژه‌ای بسازید که فرد دیگری بتواند با دنبال کردن مستندات، آن را دوباره اجرا و بررسی کند.

  8. پروژه سرتاسری و انتخاب مسیر تخصصی

    ۸۰ ساعت

    هدف گام: تجمیع مهارت‌های مسیر در یک پروژه واقعی و انتخاب حوزه تخصصی متناسب با هدف شغلی.

    یک پروژه سرتاسری انتخاب کنید که مسئله، داده و معیار موفقیت آن مشخص باشد. پروژه باید دریافت داده از SQL یا یک منبع عمومی، پاک‌سازی، تحلیل اکتشافی، تعریف فرضیه یا مسئله پیش‌بینی، ساخت مدل خط مبنا، ارزیابی و گزارش نهایی را دربرگیرد.

    ارزش پروژه فقط به عملکرد مدل وابسته نیست. باید نشان دهید چرا مسئله اهمیت دارد، داده چه محدودیت‌هایی دارد و نتیجه تحلیل یا مدل چه تصمیمی را می‌تواند پشتیبانی کند.

    پس از تکمیل هسته مسیر، حوزه تخصصی خود را با توجه به نوع داده و هدف شغلی انتخاب کنید. برای تحلیل محصول و آزمایش، روی داده‌های رویداد محصول و طراحی آزمایش تمرکز کنید. برای پردازش زبان طبیعی، آماده‌سازی متن و مدل‌های زبانی را ادامه دهید. برای بینایی ماشین، آماده‌سازی تصویر و مدل‌های بینایی را یاد بگیرید. اگر هدف شما استقرار، پایش و نگهداری مدل‌ها در مقیاس است، مسیر مهندس یادگیری ماشین می‌تواند مسیر مکمل مناسبی باشد.

    لازم نیست همه این شاخه‌ها را هم‌زمان یاد بگیرید.

    مهارت‌ها

    ابزارها

    مفاهیم تکمیلی

    تعریف دامنه و معیار موفقیت پروژهخط لوله تحلیل از داده خام تا گزارشمقایسه مدل با خط مبنامستندسازی محدودیت و فرض‌هاتبدیل یافته به پیشنهاد قابل‌آزمونانتخاب تخصص بر اساس نوع داده و مسئلهبازبینی‌پذیری و بازتولید نتیجه

    پروژه پیشنهادی: یک پروژه کامل علم داده انجام دهید که از دریافت داده تا ارائه نتیجه را پوشش دهد. پروژه باید شامل کد، داده یا روش دریافت داده، تحلیل اکتشافی، مدل خط مبنا، ارزیابی، README و توضیح محدودیت‌ها باشد.

    معیار پایان گام: می‌توانید یک پروژه سرتاسری را از تعریف مسئله تا ارائه نتیجه اجرا کنید و تصمیم‌های تحلیلی، روش ارزیابی، محدودیت داده و نتیجه نهایی را مستند کنید.

زمان تقریبی یادگیری

حدود ۴۳۰ ساعت

برآورد مجموع زمان آموزش، مطالعه و تمرین تا رسیدن به سطح کاربردی؛ بسته به پیش‌زمینه شما می‌تواند کمتر یا بیشتر باشد.

ابزارهای مسیر

موارد زیر تصویری کلی از این بخش برای این مسیر ارائه می‌کنند.

خطاهای رایج مسیر

در ادامه، مهم‌ترین موارد این بخش به تفکیک معرفی شده‌اند.

  • شروع با مدل‌های پیچیده پیش از فهم مسئله

    پیش از انتخاب مدل، مسئله، متغیر هدف و معیار موفقیت را مشخص کنید. ابتدا یک خط مبنا بسازید و سپس سراغ مدل‌های پیچیده‌تر بروید.

  • تمرکز بر دقت مدل بدون انتخاب سنجه مناسب

    هزینه خطا را از مسئله استخراج کنید. در طبقه‌بندی نامتوازن، علاوه بر دقت کلی (accuracy)، معیارهایی مانند دقت پیش‌بینی مثبت (precision)، پوشش موارد مثبت (recall)، میانگین موزون آن‌ها (F1) و ماتریس درهم‌ریختگی را بررسی کنید.

  • نادیده گرفتن کیفیت داده

    پیش از مدل‌سازی، نوع داده، مقادیر گمشده، رکوردهای تکراری، داده‌های پرت و ناسازگاری‌های احتمالی را بررسی کنید.

  • ایجاد نشتی داده در ویژگی‌ها یا تقسیم داده

    اطمینان پیدا کنید اطلاعاتی که فقط پس از زمان پیش‌بینی در دسترس هستند وارد ویژگی‌ها یا فرایند آموزش مدل نشده باشند.

  • ساخت نمونه‌کارهای پراکنده و بدون مسئله روشن

    به‌جای چند Notebook کوتاه، دست‌کم یک پروژه سرتاسری بسازید که مسئله، منبع داده، SQL، پاک‌سازی، تحلیل، مدل پایه، ارزیابی و محدودیت‌ها را نشان دهد.

  • نتیجه‌گیری علّی از همبستگی

    همبستگی را مشاهده اولیه بدانید، نه اثبات علت. متغیرهای مخدوش‌کننده، سوگیری انتخاب و نیاز به آزمایش یا داده بیشتر را در گزارش ذکر کنید.

  • پنهان کردن محدودیت‌ها برای بهتر دیده شدن نتیجه

    محدودیت داده، فرض‌های تحلیل و خطاهای مدل را شفاف بیان کنید. گزارش خوب فقط نتیجه مطلوب را نشان نمی‌دهد.

  • انتخاب تخصص پیش از ساخت هسته مشترک

    ابتدا Python، SQL، آمار، تحلیل داده و یادگیری ماشین را در حد مورد نیاز یاد بگیرید و سپس بر اساس علاقه و هدف شغلی وارد حوزه تخصصی شوید.

چک‌لیست آمادگی شغلی

پیش از ادامه، فهرست زیر را مرور کنید و مطمئن شوید همه موارد را پوشش داده‌اید:

  • می‌توانم یک مسئله کسب‌وکار را به پرسش داده‌ای، متغیر هدف و معیار موفقیت تبدیل کنم.
  • می‌توانم با SQL داده را از چند جدول مرتبط استخراج و درستی خروجی را کنترل کنم.
  • می‌توانم با Python و pandas داده‌های گمشده، تکراری و ناسازگار را بررسی و پاک‌سازی کنم.
  • می‌توانم با آمار توصیفی و نمودار، الگوها و محدودیت‌های داده را توضیح دهم.
  • می‌توانم یک فرضیه آماری مناسب بنویسم و نتیجه آن را بدون ادعای علّی تفسیر کنم.
  • می‌توانم برای یک مسئله طبقه‌بندی یا رگرسیون، مدل خط مبنا بسازم و مدل‌ها را با سنجه مناسب مقایسه کنم.
  • می‌توانم نشتی داده، بیش‌برازش و نامتوازن بودن داده را در ارزیابی مدل بررسی کنم.
  • می‌توانم یافته‌ها، محدودیت‌ها و پیشنهادهای عملی را در گزارش قابل‌فهم برای مخاطب غیرفنی ارائه کنم.
  • یک پروژه سرتاسری را با کد، داده یا روش دریافت داده، README و مستندات لازم بازتولید کنم.

پرسش‌های پرتکرار

پرسش‌ها و پاسخ‌های زیر، برخی از موضوعات مهم درباره نقشه راه شغلی دانشمند داده را روشن می‌کنند.

برای دانشمند داده شدن از Python شروع کنم یا SQL؟

در این مسیر ابتدا Python و مبانی صورت‌بندی مسئله آموزش داده می‌شود و سپس SQL قرار می‌گیرد. این ترتیب کمک می‌کند ابتدا توانایی پایه برای کار با داده را به دست آورید و بعد استخراج داده از پایگاه داده را یاد بگیرید.

آیا برای شروع علم داده باید ریاضیات دانشگاهی قوی داشته باشم؟

برای شروع این مسیر به ریاضیات پیشرفته نیاز ندارید. آمار توصیفی، احتمال و مفاهیم آماری مورد نیاز به‌تدریج و در ارتباط با مسئله‌های واقعی آموزش داده می‌شوند.

یادگیری عمیق را از چه زمانی شروع کنم؟

ابتدا هسته مشترک علم داده شامل Python، SQL، آمار، تحلیل داده و یادگیری ماشین را یاد بگیرید. پس از آن، اگر هدف شما پردازش زبان طبیعی، بینایی ماشین یا حوزه‌های مشابه است، می‌توانید یادگیری عمیق را به مسیر خود اضافه کنید.

برای نمونه‌کار دانشمند داده چند پروژه لازم است؟

تعداد پروژه به‌تنهایی معیار مناسبی برای سنجش آمادگی نیست. بهتر است حداقل یک پروژه سرتاسری داشته باشید که مسئله، داده، پاک‌سازی، تحلیل، مدل‌سازی، ارزیابی و مستندسازی را پوشش دهد.

آیا باید همه ابزارهای علم داده را یاد بگیرم؟

خیر. ابتدا ابزارهای اصلی مورد نیاز مسیر مانند Python، SQL، pandas، NumPy و scikit-learn را یاد بگیرید. ابزارهای دیگر را بر اساس نوع پروژه و نیاز شغلی خود اضافه کنید.

آیا داشبوردسازی برای دانشمند داده ضروری است؟

داشبوردسازی برای همه موقعیت‌های شغلی دانشمند داده یک پیش‌نیاز نیست. با این حال، توانایی ارائه نتایج و انتقال بینش به مخاطبان مختلف برای بسیاری از موقعیت‌های این حوزه اهمیت دارد.

پس از این مسیر، کدام تخصص را انتخاب کنم؟

انتخاب تخصص به نوع داده، مسئله و هدف شغلی شما بستگی دارد. تحلیل محصول و آزمایش، پردازش زبان طبیعی و بینایی ماشین از مسیرهای ممکن هستند. برای علاقه‌مندان به استقرار و نگهداری مدل در مقیاس نیز مهندسی یادگیری ماشین یک مسیر مرتبط است.

آموزش‌های مرتبط در فرادرس

منابع پیشنهادی

برچسب‌ها و کلیدواژه‌ها