معرفی
مسیر تبدیل شدن به دانشمند داده از یادگیری ابزارهای مختلف شروع نمیشود. ابتدا باید بتوانید یک پرسش مبهم را به مسئلهای مشخص و قابلاندازهگیری تبدیل کنید. سپس برنامهنویسی Python، کار با پایگاه داده، آمار، پاکسازی و تحلیل داده را یاد میگیرید. پس از ساخت این پایهها، نوبت به مدلسازی با یادگیری ماشین میرسد؛ زیرا یک مدل مناسب نیز بدون داده معتبر و تعریف درست مسئله، نتیجه قابلاعتمادی ایجاد نمیکند.
بسته به پیشزمینه و زمانی که هر هفته برای یادگیری و تمرین اختصاص میدهید، این مسیر میتواند حدود ۳۵۰ تا ۵۰۰ ساعت تمرین هدفمند نیاز داشته باشد. برای فردی که هفتهای ۱۰ ساعت زمان ثابت دارد، این مقدار تقریبا معادل ۸ تا ۱۲ ماه تمرین است. اگر از قبل با Python یا آمار آشنا باشید، ممکن است بخشهای پایه را سریعتر پشت سر بگذارید، اما بهتر است پروژههای عملی مسیر را حذف نکنید.
این نقشه راه در ۸ گام طراحی شده است. مسیر از صورتبندی مسئله و مبانی Python شروع میشود، به SQL و آمار میرسد، سپس پاکسازی و تحلیل داده، مصورسازی، مدلسازی یادگیری ماشین و مهندسی ویژگی را پوشش میدهد و در پایان به اجرای یک پروژه سرتاسری میرسد.
پس از یادگیری هسته مشترک، میتوانید با توجه به نوع مسئله و هدف شغلی خود به حوزههایی مانند تحلیل محصول و آزمایش، پردازش زبان طبیعی یا بینایی ماشین وارد شوید. مسیر مهندس یادگیری ماشین نیز برای افرادی که به استقرار، پایش و نگهداری مدلها علاقه دارند، یک مسیر شغلی مرتبط و مکمل محسوب میشود.
برای آشنایی بیشتر با وظایف و مهارتهای مورد نیاز این شغل، صفحه «دانشمند داده» را نیز مطالعه کنید.
مخاطبان نقشه راه
این نقشه راه برای افرادی مناسب است که میخواهند مهارتهای لازم برای ورود به حوزه علم داده را بهصورت مرحلهای یاد بگیرند و در پایان، نمونهکاری قابلارائه داشته باشند. دانشجویان، فارغالتحصیلان رشتههای فنی و تحلیلی و افرادی که قصد تغییر مسیر شغلی به سمت علم داده را دارند، میتوانند از این مسیر استفاده کنند.
دستاورد پایانی
در پایان مسیر میتوانید یک مسئله دادهای را تعریف کنید، دادههای مورد نیاز را با SQL استخراج کنید، داده را با Python و ابزارهای تحلیلی آماده و بررسی کنید، نتایج را به شکل مناسب ارائه دهید و برای مسائل رگرسیون یا طبقهبندی، مدلهای پایه یادگیری ماشین بسازید و ارزیابی کنید. همچنین میتوانید یک پروژه سرتاسری را مستندسازی کنید و محدودیتهای داده و نتایج مدل را به شکل شفاف توضیح دهید.
پیشنیازها
شروع این مسیر با دانستن پیشنیازهای زیر هموارتر میشود.
- توانایی کار روزمره با فایلها و مرورگر
- آشنایی مقدماتی با مفاهیم جدول، سطر و ستون
- انگلیسی فنی در حد خواندن مستندات ساده
مسیر یادگیری شغل دانشمند داده
-
۵۰ ساعت
صورتبندی مسئله و مبانی برنامهنویسی Python
هدف گام: یاد بگیرید پرسش کسبوکار را به مسئله دادهای تبدیل کنید و با Python دادههای ساده را پردازش کنید.
پیش از ورود به کتابخانههای علم داده، باید بتوانید یک سؤال کلی را به مسئلهای مشخص تبدیل کنید. برای هر مسئله، تصمیمگیرنده، متغیر هدف، واحد تحلیل، بازه زمانی، دادههای در دسترس و معیار موفقیت را مشخص کنید. برای مثال، «چرا فروش کم شده است؟» هنوز یک مسئله دادهای مشخص نیست. باید معلوم شود فروش کدام محصول، در چه بازهای و در مقایسه با چه دوره یا گروهی بررسی میشود.
سپس مبانی Python را تا سطحی یاد بگیرید که بتوانید فایل بخوانید، متغیر و تابع تعریف کنید، با فهرستها و دیکشنریها کار کنید و خطاهای ساده را پیدا و بررسی کنید. مستندات رسمی Python نیز مباحثی مانند ساختارهای داده، توابع، خواندن و نوشتن فایل و مدیریت خطاها را در مبانی این زبان پوشش میدهد.
هدف این گام تبدیل شدن به برنامهنویس حرفهای نیست. بلکه ایجاد پایهای است که بتوانید تحلیل داده را روی آن انجام دهید.
مهارتها
ابزارها
مفاهیم تکمیلی
- تبدیل پرسش کسبوکار به پرسش قابلاندازهگیری
- تعریف متغیر هدف و واحد تحلیل
- نوع داده و ساختارهای داده در Python
- شرط، حلقه و تابع
- خواندن و نوشتن فایلهای متنی و CSV
- مدیریت خطاهای ساده
پروژه پیشنهادی: یک مسئله ساده کسبوکار را تعریف کنید و یک برنامه Python بنویسید که داده اولیه آن را از فایل CSV بخواند، چند شاخص ساده محاسبه کند و نتیجه را در قالبی قابلفهم نمایش دهد.
معیار پایان گام: میتوانید یک مسئله ساده را به چند پرسش قابلاندازهگیری تبدیل کنید و با Python فایل داده را بخوانید، دادهها را پردازش کنید و یک تابع ساده برای انجام تحلیل بنویسید.
-
۴۵ ساعت
استخراج داده با SQL
هدف گام: یادگیری استخراج، ترکیب و بررسی دادههای مورد نیاز از پایگاه داده با SQL.
دانشمند داده معمولا داده را به شکل آماده دریافت نمیکند. باید بتوانید ساختار جدولها را بخوانید، ارتباط میان آنها را بفهمید و داده مناسب مسئله را استخراج کنید.
ابتدا SELECT، فیلتر، مرتبسازی، تجمیع و GROUP BY را تمرین کنید و سپس به JOIN، زیرپرسوجو و توابع پنجرهای برسید. هنگام اتصال جدولها نیز بررسی کنید هر JOIN چه تعداد رکورد ایجاد میکند و آیا باعث تکثیر ناخواسته داده شده است یا خیر. این بررسی برای جلوگیری از تحلیل نادرست اهمیت زیادی دارد.
مهارتها
ابزارها
مفاهیم تکمیلی
انتخاب، فیلتر و مرتبسازی دادهتجمیع و گروهبندیاتصال جدولها و کنترل تکثیر رکوردزیرپرسوجو و عبارتهای جدولی مشترکتوابع پنجرهایبررسی بازه زمانی و دانهبندی دادهپروژه پیشنهادی: یک پایگاه داده چندجدولی انتخاب کنید و با SQL داده مورد نیاز برای یک مسئله تحلیلی را استخراج کنید. در گزارش پروژه، منطق اتصال جدولها و کنترل تعداد رکوردهای خروجی را نیز توضیح دهید.
معیار پایان گام: میتوانید از چند جدول مرتبط، داده مورد نیاز یک مسئله را استخراج کنید، JOIN مناسب را انتخاب کنید و درستی تعداد و دانهبندی رکوردهای خروجی را بررسی کنید.
-
۵۵ ساعت
آمار کاربردی و تفکر آزمایشی
هدف گام: یادگیری استفاده از آمار برای توصیف داده، سنجش عدمقطعیت و طراحی مقایسههای آزمایشی.
آمار در علم داده فقط مجموعهای از فرمولها نیست؛ ابزاری برای توصیف داده و سنجش عدمقطعیت است. آمار توصیفی، شکل توزیع، میانگین، میانه، واریانس، صدک و همبستگی را با داده واقعی تمرین کنید.
همچنین باید بدانید که همبستگی بهتنهایی رابطه علّی را اثبات نمیکند و یک میانگین کلی ممکن است تفاوت میان گروههای مختلف را پنهان کند.
در ادامه، نمونهگیری، فاصله اطمینان، فرض صفر، مقدار p و خطاهای نوع اول و دوم را در مسئلههای ساده بررسی کنید. برای تحلیل محصول یا کمپین نیز منطق مقایسه گروه کنترل و گروه آزمایش را یاد بگیرید. انتخاب روش آماری باید به نوع متغیر، داده و پرسش مورد بررسی وابسته باشد.
مهارتها
ابزارها
مفاهیم تکمیلی
آمار توصیفی و شکل توزیعنمونهگیری و سوگیری نمونههمبستگی و محدودیت تفسیر آنفاصله اطمینانآزمون فرض و مقدار pخطاهای نوع اول و دومگروه کنترل و گروه آزمایشپروژه پیشنهادی: یک مجموعهداده واقعی را بررسی کنید، آمار توصیفی آن را محاسبه کنید و یک پرسش آماری مشخص برای مقایسه دو گروه تعریف و تحلیل کنید.
معیار پایان گام: میتوانید شاخصهای آماری مناسب را انتخاب کنید، نتایج آزمون آماری را تفسیر کنید و میان همبستگی، تفاوت آماری و رابطه علّی تمایز بگذارید.
-
۶۰ ساعت
پاکسازی، آمادهسازی و تحلیل اکتشافی داده
هدف گام: یادگیری آمادهسازی دادههای خام و کشف الگوها، خطاها و محدودیتهای داده پیش از مدلسازی.
بخش مهمی از کار واقعی علم داده به آمادهسازی و بررسی داده اختصاص دارد. با pandas داده را بارگذاری کنید، نوع ستونها و دامنه مقادیر را بررسی کنید و برای دادههای گمشده، تکراری، ناسازگار و پرت تصمیمی مستند بگیرید. pandas ابزارهایی برای تشخیص و مدیریت دادههای گمشده و همچنین عملیات گروهبندی و ترکیب داده فراهم میکند.
در تحلیل اکتشافی داده (Exploratory Data Analysis یا EDA)، از جدولهای خلاصه و نمودارها برای یافتن الگو، خطای داده و تغییرات مهم استفاده کنید. پیش از ساخت مدل، توزیع متغیر هدف، تغییرات زمانی و احتمال وجود نشتی داده را بررسی کنید.
مهارتها
ابزارها
مفاهیم تکمیلی
بررسی نوع و دامنه متغیرهامدیریت مقادیر گمشدهشناسایی رکوردهای تکراری و ناسازگارتشخیص و تفسیر دادههای پرتتحلیل تکمتغیره و چندمتغیرهبررسی تغییرات زمانیشناسایی نشتی دادهپروژه پیشنهادی: یک مجموعهداده خام را دریافت و پاکسازی کنید، کیفیت ستونها را بررسی کنید و با چند تحلیل و نمودار، مهمترین الگوها و محدودیتهای داده را گزارش دهید.
معیار پایان گام: میتوانید کیفیت داده را بررسی کنید، روش برخورد با دادههای گمشده و پرت را توضیح دهید و یک تحلیل اکتشافی منظم و قابلتکرار ارائه کنید.
-
۳۵ ساعت
مصورسازی و انتقال بینش به تصمیمگیرنده
هدف گام: یادگیری انتخاب نمودار مناسب و تبدیل نتایج تحلیل داده به بینش قابلفهم برای تصمیمگیرنده.
نمودار باید به یک پرسش مشخص پاسخ دهد. نوع نمودار را بر اساس هدف تحلیل، مانند مقایسه، روند، توزیع یا بررسی رابطه میان متغیرها انتخاب کنید. عنوان، مقیاس، برچسبها و بازه زمانی نیز باید به خواننده کمک کنند نتیجه را درست تفسیر کند.
در ارائه نتایج، میان مشاهده، تفسیر و پیشنهاد تفاوت بگذارید. برای مثال، کاهش نرخ خرید یک مشاهده است؛ علت آن یک فرضیه است و پیشنهاد آزمایش یک اقدام احتمالی. این تفکیک هنگام ارائه نتایج به تیم محصول، بازاریابی یا عملیات اهمیت دارد.
برای ساخت داشبورد نیز میتوانید با توجه به محیط کاری از Microsoft Power BI یا ابزارهای مشابه استفاده کنید. داشبوردسازی پیشنیاز یادگیری مدلسازی نیست.
مهارتها
ابزارها
مفاهیم تکمیلی
انتخاب نمودار متناسب با پرسشطراحی مقیاس و برچسب قابلخواندنروایت داده و ترتیب ارائه یافتههاتفکیک مشاهده، تفسیر و پیشنهادبیان عدمقطعیت و محدودیت تحلیلطراحی گزارش مدیریتیپروژه پیشنهادی: نتایج تحلیل گام قبل را در قالب یک گزارش تصویری یا داشبورد ارائه کنید و برای هر نمودار، پرسش، مشاهده و برداشت اصلی را مشخص کنید.
معیار پایان گام: میتوانید نمودار مناسب را برای یک پرسش مشخص انتخاب کنید و نتایج تحلیل را در قالب گزارشی قابلفهم برای مخاطب فنی و غیرفنی ارائه دهید.
-
۶۵ ساعت
مدلسازی پایه یادگیری ماشین
هدف گام: یادگیری ساخت، مقایسه و ارزیابی مدلهای پایه برای مسائل رگرسیون و طبقهبندی.
یادگیری ماشین را با تعریف مسئله و ساخت یک خط مبنا شروع کنید، نه با مدلهای پیچیده. ابتدا مشخص کنید پیشبینی چه چیزی قرار است به تصمیمگیری کمک کند. سپس داده را به بخشهای آموزش و ارزیابی تقسیم کنید و روش اعتبارسنجی مناسب را انتخاب کنید.
یک مدل ساده مانند رگرسیون خطی یا لجستیک را بهعنوان خط مبنا بسازید و مدلهای دیگر را با استفاده از داده و معیارهای یکسان مقایسه کنید.
معیار ارزیابی باید با نوع مسئله و هزینه خطا هماهنگ باشد. در دادههای نامتوازن، دقت کلی میتواند تصویر ناقصی از عملکرد مدل ارائه دهد. در چنین شرایطی، معیارهایی مانند دقت (Precision)، بازخوانی (Recall) و امتیاز F1 را نیز بررسی کنید. ماتریس درهمریختگی (Confusion Matrix) نیز برای بررسی خطاهای مدلهای طبقهبندی کاربرد دارد.
مهارتها
ابزارها
مفاهیم تکمیلی
تعریف مسئله رگرسیون و طبقهبندیتقسیم داده آموزش و ارزیابیاعتبارسنجی متقابلمدل خط مبنابیشبرازش و کمبرازشانتخاب سنجه ارزیابیداده نامتوازنماتریس درهمریختگیپروژه پیشنهادی: برای یک مسئله رگرسیون یا طبقهبندی، ابتدا یک مدل خط مبنا بسازید و سپس حداقل یک مدل دیگر را با معیار مناسب ارزیابی و مقایسه کنید. دلیل انتخاب معیار ارزیابی را نیز توضیح دهید.
معیار پایان گام: میتوانید یک مسئله یادگیری ماشین را تعریف کنید، مدل خط مبنا بسازید، روش ارزیابی مناسب انتخاب کنید و محدودیتهای نتیجه را توضیح دهید.
-
۴۰ ساعت
مهندسی ویژگی و بازتولیدپذیری تحلیل
هدف گام: یادگیری ساخت ویژگیهای مناسب، جلوگیری از نشتی داده و ایجاد پروژههای قابلبازبینی و بازتولیدپذیر.
ویژگی مناسب از شناخت مسئله و زمان تولید داده به دست میآید، نه فقط از افزایش تعداد ستونها. هنگام ساخت ویژگیهای جدید بررسی کنید که آیا این اطلاعات در زمان پیشبینی واقعا در دسترس هستند یا خیر. ویژگیهایی که به آینده یا برچسب هدف وابستهاند، میتوانند باعث نشتی داده شوند و عملکرد مدل را بهتر از واقعیت نشان دهند.
همزمان، پروژه را بازتولیدپذیر کنید. کد، دادههای عمومی یا روش دریافت داده، فرضها، نسخه کتابخانهها و نتایج اجرا را در مخزن Git ثبت کنید. دفترچه ژوپیتر باید خوانا باشد، اما بخشهای تکراری را تا حد امکان به توابع یا فایلهای جدا منتقل کنید.
در این مرحله لازم نیست استقرار صنعتی مدل را بهصورت عمیق یاد بگیرید؛ این موضوع در مسیر مهندس یادگیری ماشین با جزئیات بیشتری دنبال میشود.
مهارتها
ابزارها
مفاهیم تکمیلی
ساخت ویژگی از داده خامدسترسپذیری ویژگی در زمان پیشبینیکنترل نشتی دادهتبدیل و مقیاسبندی متغیرهاانتخاب ویژگی و تفسیر اثر آنثبت فرضها و نسخه دادهساختاردهی مخزن تحلیلپروژه پیشنهادی: پروژه یادگیری ماشین گام قبل را توسعه دهید، چند ویژگی معنادار بسازید و اثر آنها را ارزیابی کنید. سپس کل پروژه را در یک مخزن Git با ساختار مشخص، README و دستورالعمل اجرای آن قرار دهید.
معیار پایان گام: میتوانید ویژگیهای جدید را بدون ایجاد نشتی داده تولید کنید و پروژهای بسازید که فرد دیگری بتواند با دنبال کردن مستندات، آن را دوباره اجرا و بررسی کند.
-
۸۰ ساعت
پروژه سرتاسری و انتخاب مسیر تخصصی
هدف گام: تجمیع مهارتهای مسیر در یک پروژه واقعی و انتخاب حوزه تخصصی متناسب با هدف شغلی.
یک پروژه سرتاسری انتخاب کنید که مسئله، داده و معیار موفقیت آن مشخص باشد. پروژه باید دریافت داده از SQL یا یک منبع عمومی، پاکسازی، تحلیل اکتشافی، تعریف فرضیه یا مسئله پیشبینی، ساخت مدل خط مبنا، ارزیابی و گزارش نهایی را دربرگیرد.
ارزش پروژه فقط به عملکرد مدل وابسته نیست. باید نشان دهید چرا مسئله اهمیت دارد، داده چه محدودیتهایی دارد و نتیجه تحلیل یا مدل چه تصمیمی را میتواند پشتیبانی کند.
پس از تکمیل هسته مسیر، حوزه تخصصی خود را با توجه به نوع داده و هدف شغلی انتخاب کنید. برای تحلیل محصول و آزمایش، روی دادههای رویداد محصول و طراحی آزمایش تمرکز کنید. برای پردازش زبان طبیعی، آمادهسازی متن و مدلهای زبانی را ادامه دهید. برای بینایی ماشین، آمادهسازی تصویر و مدلهای بینایی را یاد بگیرید. اگر هدف شما استقرار، پایش و نگهداری مدلها در مقیاس است، مسیر مهندس یادگیری ماشین میتواند مسیر مکمل مناسبی باشد.
لازم نیست همه این شاخهها را همزمان یاد بگیرید.
مهارتها
تحلیل دادهپاکسازی و آمادهسازی دادهمدلسازی با یادگیری ماشینمهندسی ویژگی در یادگیری ماشینارائه و انتقال بینشهای حاصل از دادهکنترل نسخهابزارها
مفاهیم تکمیلی
تعریف دامنه و معیار موفقیت پروژهخط لوله تحلیل از داده خام تا گزارشمقایسه مدل با خط مبنامستندسازی محدودیت و فرضهاتبدیل یافته به پیشنهاد قابلآزمونانتخاب تخصص بر اساس نوع داده و مسئلهبازبینیپذیری و بازتولید نتیجهپروژه پیشنهادی: یک پروژه کامل علم داده انجام دهید که از دریافت داده تا ارائه نتیجه را پوشش دهد. پروژه باید شامل کد، داده یا روش دریافت داده، تحلیل اکتشافی، مدل خط مبنا، ارزیابی، README و توضیح محدودیتها باشد.
معیار پایان گام: میتوانید یک پروژه سرتاسری را از تعریف مسئله تا ارائه نتیجه اجرا کنید و تصمیمهای تحلیلی، روش ارزیابی، محدودیت داده و نتیجه نهایی را مستند کنید.
زمان تقریبی یادگیری
برآورد مجموع زمان آموزش، مطالعه و تمرین تا رسیدن به سطح کاربردی؛ بسته به پیشزمینه شما میتواند کمتر یا بیشتر باشد.
ابزارهای مسیر
موارد زیر تصویری کلی از این بخش برای این مسیر ارائه میکنند.
خطاهای رایج مسیر
در ادامه، مهمترین موارد این بخش به تفکیک معرفی شدهاند.
-
شروع با مدلهای پیچیده پیش از فهم مسئله
پیش از انتخاب مدل، مسئله، متغیر هدف و معیار موفقیت را مشخص کنید. ابتدا یک خط مبنا بسازید و سپس سراغ مدلهای پیچیدهتر بروید.
-
تمرکز بر دقت مدل بدون انتخاب سنجه مناسب
هزینه خطا را از مسئله استخراج کنید. در طبقهبندی نامتوازن، علاوه بر دقت کلی (accuracy)، معیارهایی مانند دقت پیشبینی مثبت (precision)، پوشش موارد مثبت (recall)، میانگین موزون آنها (F1) و ماتریس درهمریختگی را بررسی کنید.
-
نادیده گرفتن کیفیت داده
پیش از مدلسازی، نوع داده، مقادیر گمشده، رکوردهای تکراری، دادههای پرت و ناسازگاریهای احتمالی را بررسی کنید.
-
ایجاد نشتی داده در ویژگیها یا تقسیم داده
اطمینان پیدا کنید اطلاعاتی که فقط پس از زمان پیشبینی در دسترس هستند وارد ویژگیها یا فرایند آموزش مدل نشده باشند.
-
ساخت نمونهکارهای پراکنده و بدون مسئله روشن
بهجای چند Notebook کوتاه، دستکم یک پروژه سرتاسری بسازید که مسئله، منبع داده، SQL، پاکسازی، تحلیل، مدل پایه، ارزیابی و محدودیتها را نشان دهد.
-
نتیجهگیری علّی از همبستگی
همبستگی را مشاهده اولیه بدانید، نه اثبات علت. متغیرهای مخدوشکننده، سوگیری انتخاب و نیاز به آزمایش یا داده بیشتر را در گزارش ذکر کنید.
-
پنهان کردن محدودیتها برای بهتر دیده شدن نتیجه
محدودیت داده، فرضهای تحلیل و خطاهای مدل را شفاف بیان کنید. گزارش خوب فقط نتیجه مطلوب را نشان نمیدهد.
-
انتخاب تخصص پیش از ساخت هسته مشترک
ابتدا Python، SQL، آمار، تحلیل داده و یادگیری ماشین را در حد مورد نیاز یاد بگیرید و سپس بر اساس علاقه و هدف شغلی وارد حوزه تخصصی شوید.
چکلیست آمادگی شغلی
پیش از ادامه، فهرست زیر را مرور کنید و مطمئن شوید همه موارد را پوشش دادهاید:
- میتوانم یک مسئله کسبوکار را به پرسش دادهای، متغیر هدف و معیار موفقیت تبدیل کنم.
- میتوانم با SQL داده را از چند جدول مرتبط استخراج و درستی خروجی را کنترل کنم.
- میتوانم با Python و pandas دادههای گمشده، تکراری و ناسازگار را بررسی و پاکسازی کنم.
- میتوانم با آمار توصیفی و نمودار، الگوها و محدودیتهای داده را توضیح دهم.
- میتوانم یک فرضیه آماری مناسب بنویسم و نتیجه آن را بدون ادعای علّی تفسیر کنم.
- میتوانم برای یک مسئله طبقهبندی یا رگرسیون، مدل خط مبنا بسازم و مدلها را با سنجه مناسب مقایسه کنم.
- میتوانم نشتی داده، بیشبرازش و نامتوازن بودن داده را در ارزیابی مدل بررسی کنم.
- میتوانم یافتهها، محدودیتها و پیشنهادهای عملی را در گزارش قابلفهم برای مخاطب غیرفنی ارائه کنم.
- یک پروژه سرتاسری را با کد، داده یا روش دریافت داده، README و مستندات لازم بازتولید کنم.
پرسشهای پرتکرار
پرسشها و پاسخهای زیر، برخی از موضوعات مهم درباره نقشه راه شغلی دانشمند داده را روشن میکنند.
برای دانشمند داده شدن از Python شروع کنم یا SQL؟
در این مسیر ابتدا Python و مبانی صورتبندی مسئله آموزش داده میشود و سپس SQL قرار میگیرد. این ترتیب کمک میکند ابتدا توانایی پایه برای کار با داده را به دست آورید و بعد استخراج داده از پایگاه داده را یاد بگیرید.
آیا برای شروع علم داده باید ریاضیات دانشگاهی قوی داشته باشم؟
برای شروع این مسیر به ریاضیات پیشرفته نیاز ندارید. آمار توصیفی، احتمال و مفاهیم آماری مورد نیاز بهتدریج و در ارتباط با مسئلههای واقعی آموزش داده میشوند.
یادگیری عمیق را از چه زمانی شروع کنم؟
ابتدا هسته مشترک علم داده شامل Python، SQL، آمار، تحلیل داده و یادگیری ماشین را یاد بگیرید. پس از آن، اگر هدف شما پردازش زبان طبیعی، بینایی ماشین یا حوزههای مشابه است، میتوانید یادگیری عمیق را به مسیر خود اضافه کنید.
برای نمونهکار دانشمند داده چند پروژه لازم است؟
تعداد پروژه بهتنهایی معیار مناسبی برای سنجش آمادگی نیست. بهتر است حداقل یک پروژه سرتاسری داشته باشید که مسئله، داده، پاکسازی، تحلیل، مدلسازی، ارزیابی و مستندسازی را پوشش دهد.
آیا باید همه ابزارهای علم داده را یاد بگیرم؟
خیر. ابتدا ابزارهای اصلی مورد نیاز مسیر مانند Python، SQL، pandas، NumPy و scikit-learn را یاد بگیرید. ابزارهای دیگر را بر اساس نوع پروژه و نیاز شغلی خود اضافه کنید.
آیا داشبوردسازی برای دانشمند داده ضروری است؟
داشبوردسازی برای همه موقعیتهای شغلی دانشمند داده یک پیشنیاز نیست. با این حال، توانایی ارائه نتایج و انتقال بینش به مخاطبان مختلف برای بسیاری از موقعیتهای این حوزه اهمیت دارد.
پس از این مسیر، کدام تخصص را انتخاب کنم؟
انتخاب تخصص به نوع داده، مسئله و هدف شغلی شما بستگی دارد. تحلیل محصول و آزمایش، پردازش زبان طبیعی و بینایی ماشین از مسیرهای ممکن هستند. برای علاقهمندان به استقرار و نگهداری مدل در مقیاس نیز مهندسی یادگیری ماشین یک مسیر مرتبط است.
آموزشهای مرتبط در فرادرس
-
آموزش مسیر تبدیل شدن به دانشمند علم داده (رایگان)
-
آموزش برنامه نویسی پایتون Python، مقدماتی + گواهینامه
-
آموزش تجزیه و تحلیل و آماده سازی داده ها با پایتون Python + گواهینامه
-
آموزش پانداس pandas برای تحلیل اطلاعات در پایتون + گواهینامه
-
آموزش کتابخانه های NumPy و Matplotlib در پایتون، تحلیل داده تا رسم نمودار + گواهینامه
-
آموزش ریاضی برای یادگیری ماشین + پیاده سازی در پایتون + گواهینامه
-
آموزش یادگیری ماشین با پایتون، ماشین لرنینگ با Python + گواهینامه