
اگر مدل برای گروهی از افراد احتمال یکسانی اعلام کند، انتظار داریم فراوانی مشاهدهشدهٔ پیامد در آن گروه با آن احتمال سازگار باشد. این ایدهٔ ساده، هستهٔ کالیبراسیون است.
رتبهبندی با احتمال فرق دارد
مدلی ممکن است افراد را خوب از نظر خطر مرتب کند، اما احتمالها را بیش از اندازه بزرگ گزارش دهد. در چنین حالتی، یک معیار تفکیک خوب بهتنهایی کافی نیست. مقالهٔ کالیبراسیون مدلهای پیشبینی — BMC Medicine این جنبه از کیفیت مدلهای پیشبینی را توضیح میدهد.
مثال صرفاً آموزشی
فرض کنید مدل به صد مورد، خطر ۸۰ درصد داده و در همان گروه، پیامد بسیار کمتر رخ داده است. برای تفسیر دقیق باید حجم نمونه، زمان پیامد و روش ارزیابی را بدانیم؛ اما همین اختلاف نشان میدهد احتمالهای خروجی نیاز به بررسی دارند. این مثال دادهٔ یک مطالعهٔ واقعی یا توصیه برای تصمیم درمانی نیست.
اگر تصمیم بر اساس آستانهٔ خطر گرفته شود، خطا در احتمال میتواند مهم باشد. بنابراین در گزارش، علاوه بر معیارهای تفکیک، نمودار یا معیارهای مناسب کالیبراسیون نیز باید متناسب با طراحی بررسی شوند.
انتقال به محیط تازه
تغییر جمعیت، شیوهٔ ثبت داده یا فراوانی پیامد میتواند ارزیابی دوباره را لازم کند. داشتن عملکرد خوب در مجموعهٔ توسعه، پایان بررسی نیست. TRIPOD+AI؛ گزارش مدلهای پیشبینی به گزارش روشن ارزیابی مدل کمک میکند.
در جلسهٔ انتخاب ابزار، بپرسید احتمالهای اعلامشده چگونه و روی چه دادهای بررسی شدهاند. پاسخ «دقت کلی بالا است» به این پرسش پاسخ نمیدهد؛ باید همان ویژگیای را بسنجیم که قرار است مبنای تصمیم قرار گیرد.
منابع این یادداشت
- کالیبراسیون مدلهای پیشبینی — BMC Medicine link.springer.com
- TRIPOD+AI؛ گزارش مدلهای پیشبینی www.bmj.com


