ارزیابی سامانه‌های هوش مصنوعی چیست و چگونه یاد بگیریم؟

معرفی و تعریف

ارزیابی سامانه‌های هوش مصنوعی، توانایی سنجش نظام‌مند کیفیت، ایمنی، پایداری و ارزش عملی خروجی مدل‌ها و اپلیکیشن‌های هوش مصنوعی است. فرد ارزیاب ابتدا مسئله و معیار موفقیت را مشخص می‌کند، سپس مجموعه ارزیابی می‌سازد، خروجی‌ها را با معیارهای کمّی و کیفی می‌سنجد و الگوهای خطا را تحلیل می‌کند.

این مهارت هم ارزیابی مدل‌های پیش‌بینی‌گر و هم سامانه‌های مولد را پوشش می‌دهد. در مدل‌های پیش‌بینی‌گر، با داده برچسب‌خورده، تفکیک داده آموزش و آزمون، دقت، Precision و Recall، آستانه تصمیم و خطاهای داده کار می‌کنید. در سامانه‌های مولد، پاسخ درست همیشه یک جواب ثابت ندارد. بنابراین باید Rubric یا راهنمای امتیازدهی تعریف کنید، نمونه‌های مرزی و خطاهای پرخطر را پوشش دهید و در صورت نیاز، قضاوت انسانی را کنار ارزیابی خودکار قرار دهید.

در بازار کار ایران، این توانمندی معمولا بخشی از مسئولیت‌های «مهندس هوش مصنوعی»، «مهندس یادگیری ماشین»، «مهندس پردازش زبان طبیعی» و گاهی عنوان‌های غیررسمی مانند «توسعه‌دهنده LLM» است. نمونه‌کار مناسب برای این نقش‌ها باید مجموعه ارزیابی، معیارها، نتایج، تحلیل خطا و تصمیم اصلاحی را نشان دهد، نه فقط چند خروجی مطلوب از مدل.

اگر با Python و مبانی یادگیری ماشین آشنا باشید، معمولا با ۸ تا ۱۰ ساعت تمرین هفتگی، ۸۰ تا ۱۲۰ ساعت برای رسیدن به سطح کاربردی اولیه زمان نیاز دارید. فردی که تازه ارزیابی سامانه‌های مولد را آغاز می‌کند و هم‌زمان مبانی لازم را می‌آموزد، معمولا با همین میزان تمرین هفتگی به ۱۴۰ تا ۱۸۰ ساعت نیاز دارد.

این مهارت را با نام‌های دیگری نیز می‌شناسند:

  • ارزیابی مدل‌های هوش مصنوعی
  • سنجش عملکرد سامانه‌های هوش مصنوعی
  • ارزیابی مدل‌های زبانی
  • ارزیابی مدل‌های پیش‌بینی‌گر
  • AI Evaluation
  • AI System Evaluation
  • AI Model Evaluation
  • LLM Evaluation
  • LLM Evals
  • Predictive Model Evaluation

اهمیت و کاربردها

چرا این مهارت مهم است؟

خروجی یک مدل مولد ممکن است با تغییر تنظیمات نمونه‌گیری، نسخه مدل، نسخه سرویس یا پیکربندی زیرساخت تغییر کند. حتی وقتی اجرای یک مدل ظاهراً تکرارپذیر است، تغییر مدل، پرامپت، داده بازیابی یا تنظیمات اجرا می‌تواند کیفیت را جابه‌جا کند. به همین دلیل، هر تغییر مهم باید دوباره روی یک مجموعه ارزیابی ثابت بررسی شود.

یک پاسخ روان ممکن است اطلاعات نادرست بسازد، به پرسش پاسخ ندهد یا برای سناریوی حساس کسب‌وکار نامناسب باشد. ارزیابی، این تفاوت را از برداشت شخصی به شواهد قابل بررسی تبدیل می‌کند. در مدل‌های پیش‌بینی‌گر نیز ممکن است یک دقت کلی مناسب، خطاهای پرهزینه در یک گروه داده یا در آستانه تصمیم مشخص را پنهان کند.

برای مهندس هوش مصنوعی یا مهندس یادگیری ماشین، توانایی مقایسه کیفیت، نرخ خطا، تأخیر و هزینه، به‌ویژه در تیم‌های محصولی که قابلیت هوش مصنوعی را به کاربر ارائه می‌کنند، ارزش عملی دارد. این یک توصیه برای ساخت نمونه‌کار و تصمیم فنی است، نه یک انتظار یکسان برای همه آگهی‌ها و شرکت‌ها.

این مهارت با تست نرم‌افزار یکی نیست. تست نرم‌افزار معمولا رفتار مشخص و قابل انتظار را بررسی می‌کند، اما در ارزیابی هوش مصنوعی باید با ابهام، پاسخ‌های قابل قبول متعدد، تغییر نسخه مدل، کیفیت داده و داده‌های واقعی کاربران نیز کار کنید. انتخاب سرویس‌های جهانی، APIها یا مدل‌های محلی نیز به دسترسی، هزینه و سیاست داده سازمان وابسته است.

کاربردها

  • انتخاب مدل برای یک قابلیت محصول

    چند مدل یا نسخه را روی مجموعه‌ای ثابت از درخواست‌های واقعی می‌سنجید و کیفیت، تأخیر و هزینه هر گزینه را برای تصمیم‌گیری مقایسه می‌کنید.

  • ارزیابی مدل پیش‌بینی‌گر

    با داده برچسب‌خورده، عملکرد مدل را روی داده دیده‌نشده می‌سنجید، Precision و Recall را بررسی می‌کنید و آستانه تصمیم را بر اساس هزینه خطا تنظیم می‌کنید.

  • ارزیابی سامانه RAG

    بررسی می‌کنید آیا بازیابی، سند مرتبط را پیدا کرده است، پاسخ بر شواهد بازیابی‌شده تکیه دارد و ارجاع‌های نادرست یا ادعاهای بی‌پشتوانه تولید نمی‌شود.

  • تحلیل خطای دستیار گفت‌وگویی

    پاسخ‌های ناموفق را دسته‌بندی می‌کنید. مانند سوءبرداشت از پرسش، پاسخ ناقص، توهم، لحن نامناسب یا نقض محدودیت‌های کسب‌وکار.

  • کنترل رگرسیون پس از تغییر پرامپت یا مدل

    پس از تغییر پرامپت، مدل، داده بازیابی یا تنظیمات، مجموعه ارزیابی را دوباره اجرا می‌کنید تا افت کیفیت در سناریوهای مهم آشکار شود.

  • تعریف مسیر ارجاع به انسان

    برای پاسخ‌های کم‌اطمینان، حساس یا خارج از دامنه، معیارهایی تعیین می‌کنید تا سامانه به‌جای پاسخ پرخطر، کاربر را به نیروی انسانی ارجاع دهد.

پیش‌نیازها

پیش از شروع، بهتر است با موارد زیر آشنا باشید.

  • توانایی خواندن مستندات فنی انگلیسی
  • دسترسی به یک مدل یا API برای اجرای آزمایش‌ها

مسیر یادگیری ارزیابی سامانه‌های هوش مصنوعی

  1. مسئله و معیار موفقیت را تعریف کنید

    ۱۴ ساعت

    برای یک قابلیت مشخص، کاربر، وظیفه و پیامد خطا را بنویسید. معیارهایی مانند صحت، مرتبط‌بودن، کامل‌بودن، وفاداری به منبع، ایمنی و لحن را از هم تفکیک کنید. یاد بگیرید هر معیار چه زمانی قابل اندازه‌گیری خودکار است و چه زمانی به داوری انسانی نیاز دارد.

  2. مجموعه ارزیابی نماینده بسازید

    ۱۸ ساعت

    نمونه‌ها را از درخواست‌های واقعیِ بدون اطلاعات حساس، سناریوهای طراحی‌شده و موارد مرزی گردآوری کنید. مجموعه را بر اساس نوع وظیفه، دشواری و ریسک دسته‌بندی کنید. برای هر نمونه، ورودی، خروجی یا ویژگی مورد انتظار و علت اهمیت آن را ثبت کنید.

  3. مدل‌های پیش‌بینی‌گر را با داده برچسب‌خورده بسنجید

    ۲۰ ساعت

    داده را به بخش‌های آموزش، اعتبارسنجی و آزمون تفکیک کنید تا نتیجه آزمون تحت تأثیر انتخاب مدل قرار نگیرد. برای وظایف طبقه‌بندی، دقت، Precision و Recall را در کنار ماتریس خطا بررسی کنید. آستانه تصمیم را با توجه به هزینه مثبت کاذب و منفی کاذب انتخاب کنید و نمونه‌های خطادار را برای یافتن نقص برچسب‌گذاری، پوشش ناکافی داده یا سوگیری داده بازبینی کنید.

  4. Rubric و روش امتیازدهی طراحی کنید

    ۱۶ ساعت

    برای کیفیت‌های ذهنی، Rubric روشن با سطح‌های امتیاز و مثال بنویسید. Rubric باید به ارزیاب بگوید چه شواهدی یک پاسخ را قابل قبول، ناقص یا مردود می‌کند. چند نمونه را مستقل امتیاز دهید، اختلاف ارزیابان را ثبت کنید و ابهام‌های دستورالعمل را اصلاح کنید.

  5. ارزیابی خودکار و انسانی را اجرا کنید

    ۱۸ ساعت

    با Python می‌توانید ورودی‌ها، خروجی‌ها و نمره‌ها را تکرارپذیر ثبت و تحلیل کنید. Jupyter Notebook برای آزمایش تعاملی و مستندسازی تحلیل مناسب است، اما جایگزین اجرای خودکار و نسخه‌بندی‌شده نیست. pandas برای خلاصه‌سازی نمره‌ها و دسته‌های خطا کاربرد دارد، ولی کیفیت Rubric یا برچسب‌ها را تضمین نمی‌کند. MLflow می‌تواند اجرای مدل، تنظیمات و نتایج را رهگیری کند. در پروژه کوچک، یک جدول نسخه‌بندی‌شده نیز جایگزین ساده‌تری است.

    معیارهای خودکار را برای وظایف مناسب به کار ببرید، اما آن‌ها را جانشین بازبینی انسانی ندانید. برای خروجی‌های مولد، نمونه‌برداری، داوری انسانی و ثبت دلیل امتیاز را تمرین کنید.

  6. خطاها را به اقدام اصلاحی تبدیل کنید

    ۱۶ ساعت

    خطاها را بر اساس علت و شدت دسته‌بندی کنید، نه فقط تعداد. مشخص کنید هر دسته با تغییر داده، پرامپت، بازیابی، مدل، محدودیت پاسخ یا ارجاع به انسان بهتر حل می‌شود. سپس همان موارد را به مجموعه رگرسیون اضافه کنید. یک تغییر را فقط زمانی بهبود بدانید که روی نمونه‌های نگه‌داشته‌شده نیز اثر مثبت داشته باشد و کیفیت سناریوهای پرخطر را کاهش ندهد.

  7. کیفیت را کنار هزینه و تأخیر گزارش کنید

    ۱۸ ساعت

    برای هر اجرای ارزیابی، کیفیت، نرخ خطا، زمان پاسخ و هزینه تقریبی هر درخواست را کنار هم ثبت کنید. نتیجه را به شکل یک گزارش تصمیم‌پذیر ارائه دهید: چه گزینه‌ای برای چه سناریویی مناسب است، چه ریسک‌هایی باقی مانده و چه آزمایش بعدی لازم است.

زمان تقریبی یادگیری

حدود ۱۲۰ ساعت

برآورد مجموع زمان آموزش، مطالعه و تمرین تا رسیدن به سطح کاربردی؛ بسته به پیش‌زمینه شما می‌تواند کمتر یا بیشتر باشد.

پروژه‌های تمرینی

موارد زیر تصویری کلی از این بخش برای این مهارت ارائه می‌کنند.

  • مجموعه ارزیابی برای دستیار پرسش‌وپاسخ فارسی

    توضیح پروژه: برای یک دستیار فرضی درباره قوانین داخلی یک شرکت، ۴۰ پرسش ساده، مبهم، خارج از دامنه و پرخطر طراحی کنید. برای هر پرسش، ورودی، منبع یا پاسخ مرجع، ریسک و معیار پذیرش را ثبت کنید. Rubric سه سطح امتیاز، تعریف قابل مشاهده و نمونه پاسخ قابل قبول یا مردود داشته باشد. ۱۰ پاسخ را دو ارزیاب مستقل نمره دهند و اختلاف‌ها و تصمیم نهایی ثبت شود. اصلاح فقط با بهبود روی نمونه‌های نگه‌داشته‌شده و بدون افت نمره سناریوهای پرخطر پذیرفته شود.

  • مقایسه دو مدل یا دو پرامپت

    توضیح پروژه: یک مجموعه ثابت از درخواست‌ها را با دو تنظیم متفاوت اجرا کنید. کیفیت، تأخیر و هزینه را در یک جدول ثبت کنید و با شواهد مشخص، گزینه مناسب برای سناریوی فرضی را پیشنهاد دهید.

  • تحلیل خطای یک سامانه RAG

    توضیح پروژه: برای پاسخ‌های یک سامانه RAG، خطاهای بازیابی و خطاهای تولید پاسخ را جداگانه برچسب بزنید. سه اصلاح اولویت‌دار پیشنهاد دهید و اثر آن‌ها را با اجرای دوباره مجموعه ارزیابی بررسی کنید.

  • ارزیابی یک مدل طبقه‌بندی

    توضیح پروژه: یک مدل طبقه‌بندی را با داده برچسب‌خورده روی داده آزمون ارزیابی کنید. ماتریس خطا، Precision، Recall و اثر تغییر آستانه تصمیم را گزارش کنید و نمونه‌های خطای پرتکرار را بررسی کنید.

  • گزارش انتشار قابلیت هوش مصنوعی

    توضیح پروژه: یک گزارش کوتاه برای تصمیم انتشار بنویسید که معیارها، نتایج، سناریوهای پرخطر، محدودیت‌ها و شرایط ارجاع به انسان را پوشش دهد.

پرسش‌های رایج درباره ارزیابی سامانه‌های هوش مصنوعی

اگر درباره این مهارت پرسشی دارید، ممکن است پاسخ آن را در میان موارد زیر پیدا کنید.

آیا ارزیابی سامانه هوش مصنوعی فقط محاسبه Accuracy است؟

خیر. دقت طبقه‌بندی (Accuracy) برای وظایفی کاربرد دارد که برچسب درست مشخص دارند، اما ممکن است خطاهای مهم یک کلاس را پنهان کند. برای مدل‌های پیش‌بینی‌گر باید Precision، Recall و هزینه خطا را نیز بسنجید. برای مدل‌های مولد، مرتبط‌بودن، صحت، کامل‌بودن، ایمنی، وفاداری به منبع، هزینه و تأخیر نیز اهمیت دارند.

برای ارزیابی مدل‌های زبانی به برنامه‌نویسی پایتون نیاز دارم؟

خیر، برای شروع می‌توانید مجموعه کوچک، Rubric و داوری انسانی را با صفحه‌گسترده اجرا کنید. Python برای خودکارسازی اجرای مجموعه‌های بزرگ، مقایسه نسخه‌ها و تحلیل تکرارپذیر نتایج مهارت پیشنهادی و بسیار کاربردی است.

Rubric در ارزیابی هوش مصنوعی چیست؟

Rubric راهنمای امتیازدهی است که معیار، سطح‌های کیفیت و نمونه‌های قابل قبول یا مردود را روشن می‌کند. Rubric خوب باعث می‌شود ارزیاب‌های مختلف، پاسخ‌ها را با برداشت نزدیک‌تری قضاوت کنند.

آیا می‌توان داوری انسانی را کاملا با یک مدل دیگر جایگزین کرد؟

معمولا خیر. مدل داور می‌تواند ارزیابی را سریع‌تر و مقیاس‌پذیرتر کند، اما ممکن است سوگیری یا خطای خودش را وارد نتیجه کند. باید آن را با نمونه‌های امتیازدهی‌شده انسانی اعتبارسنجی و موارد حساس را انسانی بازبینی کنید.

برای نمونه‌کار این مهارت چه چیزی ارائه دهم؟

یک مخزن یا گزارش قابل بازبینی ارائه دهید که مسئله، مجموعه ارزیابی، Rubric، روش اجرا، توافق ارزیابان، تحلیل خطا، مقایسه کیفیت و هزینه، و تصمیم‌های اصلاحی را نشان دهد. نمایش چند پاسخ خوب به‌تنهایی نمونه‌کار ارزیابی نیست.

ارزیابی RAG چه تفاوتی با ارزیابی یک چت‌بات معمولی دارد؟

در RAG علاوه بر پاسخ نهایی، باید کیفیت بازیابی را نیز بسنجید: آیا سند درست پیدا شده، آیا پاسخ به همان سند متکی است و آیا ارجاع یا نقل‌قول ساختگی تولید نشده است.

آموزش‌های مرتبط در فرادرس

منابع پیشنهادی

برچسب‌ها و کلیدواژه‌ها