یادداشت تحلیلی / هوش مصنوعی پزشکی

کالیبراسیون مدل پزشکی؛ وقتی احتمال ۸۰ درصد باید معنا داشته باشد

تفکیک افراد پرخطر از کم‌خطر با درست‌بودن احتمال‌های اعلام‌شده فرق دارد. مفهوم کالیبراسیون را با یک مثال فرضی بخوانید.

تصویر مفهومی شبکهٔ داده در مکعب شیشه‌ای و نمودار

اگر مدل برای گروهی از افراد احتمال یکسانی اعلام کند، انتظار داریم فراوانی مشاهده‌شدهٔ پیامد در آن گروه با آن احتمال سازگار باشد. این ایدهٔ ساده، هستهٔ کالیبراسیون است.

رتبه‌بندی با احتمال فرق دارد

مدلی ممکن است افراد را خوب از نظر خطر مرتب کند، اما احتمال‌ها را بیش از اندازه بزرگ گزارش دهد. در چنین حالتی، یک معیار تفکیک خوب به‌تنهایی کافی نیست. مقالهٔ کالیبراسیون مدل‌های پیش‌بینی — BMC Medicine این جنبه از کیفیت مدل‌های پیش‌بینی را توضیح می‌دهد.

مثال صرفاً آموزشی

فرض کنید مدل به صد مورد، خطر ۸۰ درصد داده و در همان گروه، پیامد بسیار کمتر رخ داده است. برای تفسیر دقیق باید حجم نمونه، زمان پیامد و روش ارزیابی را بدانیم؛ اما همین اختلاف نشان می‌دهد احتمال‌های خروجی نیاز به بررسی دارند. این مثال دادهٔ یک مطالعهٔ واقعی یا توصیه برای تصمیم درمانی نیست.

اگر تصمیم بر اساس آستانهٔ خطر گرفته شود، خطا در احتمال می‌تواند مهم باشد. بنابراین در گزارش، علاوه بر معیارهای تفکیک، نمودار یا معیارهای مناسب کالیبراسیون نیز باید متناسب با طراحی بررسی شوند.

انتقال به محیط تازه

تغییر جمعیت، شیوهٔ ثبت داده یا فراوانی پیامد می‌تواند ارزیابی دوباره را لازم کند. داشتن عملکرد خوب در مجموعهٔ توسعه، پایان بررسی نیست. TRIPOD+AI؛ گزارش مدل‌های پیش‌بینی به گزارش روشن ارزیابی مدل کمک می‌کند.

در جلسهٔ انتخاب ابزار، بپرسید احتمال‌های اعلام‌شده چگونه و روی چه داده‌ای بررسی شده‌اند. پاسخ «دقت کلی بالا است» به این پرسش پاسخ نمی‌دهد؛ باید همان ویژگی‌ای را بسنجیم که قرار است مبنای تصمیم قرار گیرد.

برای بررسی و مطالعهٔ بیشتر

منابع این یادداشت

  1. کالیبراسیون مدل‌های پیش‌بینی — BMC Medicine link.springer.com
  2. TRIPOD+AI؛ گزارش مدل‌های پیش‌بینی www.bmj.com
میلاد جلالی
دربارهٔ نویسنده

دکتر میلاد جلالی

بنیان‌گذار ریسرچ ادیتور و محتوانگار. کار من به پژوهش، آموزش هوش مصنوعی و برندینگ پزشکی متصل است.

رزومه و سوابق ↖پروژه‌ها ↖