معرفی و تعریف
ارزیابی سامانههای هوش مصنوعی، توانایی سنجش نظاممند کیفیت، ایمنی، پایداری و ارزش عملی خروجی مدلها و اپلیکیشنهای هوش مصنوعی است. فرد ارزیاب ابتدا مسئله و معیار موفقیت را مشخص میکند، سپس مجموعه ارزیابی میسازد، خروجیها را با معیارهای کمّی و کیفی میسنجد و الگوهای خطا را تحلیل میکند.
این مهارت هم ارزیابی مدلهای پیشبینیگر و هم سامانههای مولد را پوشش میدهد. در مدلهای پیشبینیگر، با داده برچسبخورده، تفکیک داده آموزش و آزمون، دقت، Precision و Recall، آستانه تصمیم و خطاهای داده کار میکنید. در سامانههای مولد، پاسخ درست همیشه یک جواب ثابت ندارد. بنابراین باید Rubric یا راهنمای امتیازدهی تعریف کنید، نمونههای مرزی و خطاهای پرخطر را پوشش دهید و در صورت نیاز، قضاوت انسانی را کنار ارزیابی خودکار قرار دهید.
در بازار کار ایران، این توانمندی معمولا بخشی از مسئولیتهای «مهندس هوش مصنوعی»، «مهندس یادگیری ماشین»، «مهندس پردازش زبان طبیعی» و گاهی عنوانهای غیررسمی مانند «توسعهدهنده LLM» است. نمونهکار مناسب برای این نقشها باید مجموعه ارزیابی، معیارها، نتایج، تحلیل خطا و تصمیم اصلاحی را نشان دهد، نه فقط چند خروجی مطلوب از مدل.
اگر با Python و مبانی یادگیری ماشین آشنا باشید، معمولا با ۸ تا ۱۰ ساعت تمرین هفتگی، ۸۰ تا ۱۲۰ ساعت برای رسیدن به سطح کاربردی اولیه زمان نیاز دارید. فردی که تازه ارزیابی سامانههای مولد را آغاز میکند و همزمان مبانی لازم را میآموزد، معمولا با همین میزان تمرین هفتگی به ۱۴۰ تا ۱۸۰ ساعت نیاز دارد.
این مهارت را با نامهای دیگری نیز میشناسند:
- ارزیابی مدلهای هوش مصنوعی
- سنجش عملکرد سامانههای هوش مصنوعی
- ارزیابی مدلهای زبانی
- ارزیابی مدلهای پیشبینیگر
- AI Evaluation
- AI System Evaluation
- AI Model Evaluation
- LLM Evaluation
- LLM Evals
- Predictive Model Evaluation
اهمیت و کاربردها
چرا این مهارت مهم است؟
خروجی یک مدل مولد ممکن است با تغییر تنظیمات نمونهگیری، نسخه مدل، نسخه سرویس یا پیکربندی زیرساخت تغییر کند. حتی وقتی اجرای یک مدل ظاهراً تکرارپذیر است، تغییر مدل، پرامپت، داده بازیابی یا تنظیمات اجرا میتواند کیفیت را جابهجا کند. به همین دلیل، هر تغییر مهم باید دوباره روی یک مجموعه ارزیابی ثابت بررسی شود.
یک پاسخ روان ممکن است اطلاعات نادرست بسازد، به پرسش پاسخ ندهد یا برای سناریوی حساس کسبوکار نامناسب باشد. ارزیابی، این تفاوت را از برداشت شخصی به شواهد قابل بررسی تبدیل میکند. در مدلهای پیشبینیگر نیز ممکن است یک دقت کلی مناسب، خطاهای پرهزینه در یک گروه داده یا در آستانه تصمیم مشخص را پنهان کند.
برای مهندس هوش مصنوعی یا مهندس یادگیری ماشین، توانایی مقایسه کیفیت، نرخ خطا، تأخیر و هزینه، بهویژه در تیمهای محصولی که قابلیت هوش مصنوعی را به کاربر ارائه میکنند، ارزش عملی دارد. این یک توصیه برای ساخت نمونهکار و تصمیم فنی است، نه یک انتظار یکسان برای همه آگهیها و شرکتها.
این مهارت با تست نرمافزار یکی نیست. تست نرمافزار معمولا رفتار مشخص و قابل انتظار را بررسی میکند، اما در ارزیابی هوش مصنوعی باید با ابهام، پاسخهای قابل قبول متعدد، تغییر نسخه مدل، کیفیت داده و دادههای واقعی کاربران نیز کار کنید. انتخاب سرویسهای جهانی، APIها یا مدلهای محلی نیز به دسترسی، هزینه و سیاست داده سازمان وابسته است.
کاربردها
-
انتخاب مدل برای یک قابلیت محصول
چند مدل یا نسخه را روی مجموعهای ثابت از درخواستهای واقعی میسنجید و کیفیت، تأخیر و هزینه هر گزینه را برای تصمیمگیری مقایسه میکنید.
-
ارزیابی مدل پیشبینیگر
با داده برچسبخورده، عملکرد مدل را روی داده دیدهنشده میسنجید، Precision و Recall را بررسی میکنید و آستانه تصمیم را بر اساس هزینه خطا تنظیم میکنید.
-
ارزیابی سامانه RAG
بررسی میکنید آیا بازیابی، سند مرتبط را پیدا کرده است، پاسخ بر شواهد بازیابیشده تکیه دارد و ارجاعهای نادرست یا ادعاهای بیپشتوانه تولید نمیشود.
-
تحلیل خطای دستیار گفتوگویی
پاسخهای ناموفق را دستهبندی میکنید. مانند سوءبرداشت از پرسش، پاسخ ناقص، توهم، لحن نامناسب یا نقض محدودیتهای کسبوکار.
-
کنترل رگرسیون پس از تغییر پرامپت یا مدل
پس از تغییر پرامپت، مدل، داده بازیابی یا تنظیمات، مجموعه ارزیابی را دوباره اجرا میکنید تا افت کیفیت در سناریوهای مهم آشکار شود.
-
تعریف مسیر ارجاع به انسان
برای پاسخهای کماطمینان، حساس یا خارج از دامنه، معیارهایی تعیین میکنید تا سامانه بهجای پاسخ پرخطر، کاربر را به نیروی انسانی ارجاع دهد.
ابزارهای مرتبط
پیشنیازها
پیش از شروع، بهتر است با موارد زیر آشنا باشید.
- مهارت مدلسازی با یادگیری ماشین Machine Learning Modeling
- مهارت ریاضیات و آمار برای یادگیری ماشین Mathematics and Statistics for Machine Learning
- توانایی خواندن مستندات فنی انگلیسی
- دسترسی به یک مدل یا API برای اجرای آزمایشها
مسیر یادگیری ارزیابی سامانههای هوش مصنوعی
-
۱۴ ساعت
مسئله و معیار موفقیت را تعریف کنید
برای یک قابلیت مشخص، کاربر، وظیفه و پیامد خطا را بنویسید. معیارهایی مانند صحت، مرتبطبودن، کاملبودن، وفاداری به منبع، ایمنی و لحن را از هم تفکیک کنید. یاد بگیرید هر معیار چه زمانی قابل اندازهگیری خودکار است و چه زمانی به داوری انسانی نیاز دارد.
-
۱۸ ساعت
مجموعه ارزیابی نماینده بسازید
نمونهها را از درخواستهای واقعیِ بدون اطلاعات حساس، سناریوهای طراحیشده و موارد مرزی گردآوری کنید. مجموعه را بر اساس نوع وظیفه، دشواری و ریسک دستهبندی کنید. برای هر نمونه، ورودی، خروجی یا ویژگی مورد انتظار و علت اهمیت آن را ثبت کنید.
-
۲۰ ساعت
مدلهای پیشبینیگر را با داده برچسبخورده بسنجید
داده را به بخشهای آموزش، اعتبارسنجی و آزمون تفکیک کنید تا نتیجه آزمون تحت تأثیر انتخاب مدل قرار نگیرد. برای وظایف طبقهبندی، دقت، Precision و Recall را در کنار ماتریس خطا بررسی کنید. آستانه تصمیم را با توجه به هزینه مثبت کاذب و منفی کاذب انتخاب کنید و نمونههای خطادار را برای یافتن نقص برچسبگذاری، پوشش ناکافی داده یا سوگیری داده بازبینی کنید.
-
۱۶ ساعت
Rubric و روش امتیازدهی طراحی کنید
برای کیفیتهای ذهنی، Rubric روشن با سطحهای امتیاز و مثال بنویسید. Rubric باید به ارزیاب بگوید چه شواهدی یک پاسخ را قابل قبول، ناقص یا مردود میکند. چند نمونه را مستقل امتیاز دهید، اختلاف ارزیابان را ثبت کنید و ابهامهای دستورالعمل را اصلاح کنید.
-
۱۸ ساعت
ارزیابی خودکار و انسانی را اجرا کنید
با Python میتوانید ورودیها، خروجیها و نمرهها را تکرارپذیر ثبت و تحلیل کنید. Jupyter Notebook برای آزمایش تعاملی و مستندسازی تحلیل مناسب است، اما جایگزین اجرای خودکار و نسخهبندیشده نیست. pandas برای خلاصهسازی نمرهها و دستههای خطا کاربرد دارد، ولی کیفیت Rubric یا برچسبها را تضمین نمیکند. MLflow میتواند اجرای مدل، تنظیمات و نتایج را رهگیری کند. در پروژه کوچک، یک جدول نسخهبندیشده نیز جایگزین سادهتری است.
معیارهای خودکار را برای وظایف مناسب به کار ببرید، اما آنها را جانشین بازبینی انسانی ندانید. برای خروجیهای مولد، نمونهبرداری، داوری انسانی و ثبت دلیل امتیاز را تمرین کنید.
-
۱۶ ساعت
خطاها را به اقدام اصلاحی تبدیل کنید
خطاها را بر اساس علت و شدت دستهبندی کنید، نه فقط تعداد. مشخص کنید هر دسته با تغییر داده، پرامپت، بازیابی، مدل، محدودیت پاسخ یا ارجاع به انسان بهتر حل میشود. سپس همان موارد را به مجموعه رگرسیون اضافه کنید. یک تغییر را فقط زمانی بهبود بدانید که روی نمونههای نگهداشتهشده نیز اثر مثبت داشته باشد و کیفیت سناریوهای پرخطر را کاهش ندهد.
-
۱۸ ساعت
کیفیت را کنار هزینه و تأخیر گزارش کنید
برای هر اجرای ارزیابی، کیفیت، نرخ خطا، زمان پاسخ و هزینه تقریبی هر درخواست را کنار هم ثبت کنید. نتیجه را به شکل یک گزارش تصمیمپذیر ارائه دهید: چه گزینهای برای چه سناریویی مناسب است، چه ریسکهایی باقی مانده و چه آزمایش بعدی لازم است.
زمان تقریبی یادگیری
برآورد مجموع زمان آموزش، مطالعه و تمرین تا رسیدن به سطح کاربردی؛ بسته به پیشزمینه شما میتواند کمتر یا بیشتر باشد.
پروژههای تمرینی
موارد زیر تصویری کلی از این بخش برای این مهارت ارائه میکنند.
-
مجموعه ارزیابی برای دستیار پرسشوپاسخ فارسی
توضیح پروژه: برای یک دستیار فرضی درباره قوانین داخلی یک شرکت، ۴۰ پرسش ساده، مبهم، خارج از دامنه و پرخطر طراحی کنید. برای هر پرسش، ورودی، منبع یا پاسخ مرجع، ریسک و معیار پذیرش را ثبت کنید. Rubric سه سطح امتیاز، تعریف قابل مشاهده و نمونه پاسخ قابل قبول یا مردود داشته باشد. ۱۰ پاسخ را دو ارزیاب مستقل نمره دهند و اختلافها و تصمیم نهایی ثبت شود. اصلاح فقط با بهبود روی نمونههای نگهداشتهشده و بدون افت نمره سناریوهای پرخطر پذیرفته شود.
-
مقایسه دو مدل یا دو پرامپت
توضیح پروژه: یک مجموعه ثابت از درخواستها را با دو تنظیم متفاوت اجرا کنید. کیفیت، تأخیر و هزینه را در یک جدول ثبت کنید و با شواهد مشخص، گزینه مناسب برای سناریوی فرضی را پیشنهاد دهید.
-
تحلیل خطای یک سامانه RAG
توضیح پروژه: برای پاسخهای یک سامانه RAG، خطاهای بازیابی و خطاهای تولید پاسخ را جداگانه برچسب بزنید. سه اصلاح اولویتدار پیشنهاد دهید و اثر آنها را با اجرای دوباره مجموعه ارزیابی بررسی کنید.
-
ارزیابی یک مدل طبقهبندی
توضیح پروژه: یک مدل طبقهبندی را با داده برچسبخورده روی داده آزمون ارزیابی کنید. ماتریس خطا، Precision، Recall و اثر تغییر آستانه تصمیم را گزارش کنید و نمونههای خطای پرتکرار را بررسی کنید.
-
گزارش انتشار قابلیت هوش مصنوعی
توضیح پروژه: یک گزارش کوتاه برای تصمیم انتشار بنویسید که معیارها، نتایج، سناریوهای پرخطر، محدودیتها و شرایط ارجاع به انسان را پوشش دهد.
پرسشهای رایج درباره ارزیابی سامانههای هوش مصنوعی
اگر درباره این مهارت پرسشی دارید، ممکن است پاسخ آن را در میان موارد زیر پیدا کنید.
آیا ارزیابی سامانه هوش مصنوعی فقط محاسبه Accuracy است؟
خیر. دقت طبقهبندی (Accuracy) برای وظایفی کاربرد دارد که برچسب درست مشخص دارند، اما ممکن است خطاهای مهم یک کلاس را پنهان کند. برای مدلهای پیشبینیگر باید Precision، Recall و هزینه خطا را نیز بسنجید. برای مدلهای مولد، مرتبطبودن، صحت، کاملبودن، ایمنی، وفاداری به منبع، هزینه و تأخیر نیز اهمیت دارند.
برای ارزیابی مدلهای زبانی به برنامهنویسی پایتون نیاز دارم؟
خیر، برای شروع میتوانید مجموعه کوچک، Rubric و داوری انسانی را با صفحهگسترده اجرا کنید. Python برای خودکارسازی اجرای مجموعههای بزرگ، مقایسه نسخهها و تحلیل تکرارپذیر نتایج مهارت پیشنهادی و بسیار کاربردی است.
Rubric در ارزیابی هوش مصنوعی چیست؟
Rubric راهنمای امتیازدهی است که معیار، سطحهای کیفیت و نمونههای قابل قبول یا مردود را روشن میکند. Rubric خوب باعث میشود ارزیابهای مختلف، پاسخها را با برداشت نزدیکتری قضاوت کنند.
آیا میتوان داوری انسانی را کاملا با یک مدل دیگر جایگزین کرد؟
معمولا خیر. مدل داور میتواند ارزیابی را سریعتر و مقیاسپذیرتر کند، اما ممکن است سوگیری یا خطای خودش را وارد نتیجه کند. باید آن را با نمونههای امتیازدهیشده انسانی اعتبارسنجی و موارد حساس را انسانی بازبینی کنید.
برای نمونهکار این مهارت چه چیزی ارائه دهم؟
یک مخزن یا گزارش قابل بازبینی ارائه دهید که مسئله، مجموعه ارزیابی، Rubric، روش اجرا، توافق ارزیابان، تحلیل خطا، مقایسه کیفیت و هزینه، و تصمیمهای اصلاحی را نشان دهد. نمایش چند پاسخ خوب بهتنهایی نمونهکار ارزیابی نیست.
ارزیابی RAG چه تفاوتی با ارزیابی یک چتبات معمولی دارد؟
در RAG علاوه بر پاسخ نهایی، باید کیفیت بازیابی را نیز بسنجید: آیا سند درست پیدا شده، آیا پاسخ به همان سند متکی است و آیا ارجاع یا نقلقول ساختگی تولید نشده است.
آموزشهای مرتبط در فرادرس
-
معیارهای دقت در یادگیری ماشین + گواهینامه
-
آموزش یادگیری ماشین، جامع و با مفاهیم کلیدی + گواهینامه
-
آموزش یادگیری ماشین با پایتون، ماشین لرنینگ با Python + گواهینامه
-
آموزش ریاضی برای یادگیری ماشین + پیاده سازی در پایتون + گواهینامه
-
آموزش پردازش زبان طبیعی با ترنسفورمر در پایتون + مثال عملی در Hugging Face