یادداشت تحلیلی / پژوهش و نگارش علمی

نشت داده در پژوهش پزشکی؛ وقتی مدل پیشاپیش پاسخ را دیده است

چرا جداسازی داده در سطح ردیف همیشه کافی نیست؟ نشت میان بیماران، زمان‌ها و مراحل پردازش را با یک مثال تصویربرداری بررسی می‌کنیم.

تصویر مفهومی سرور و ارتباط میان مخزن‌های داده

ممکن است یک مدل در آزمون بسیار دقیق باشد، چون چیزی از پاسخ را پیش‌تر دیده است. این اتفاق همیشه با کپی مستقیم برچسب رخ نمی‌دهد؛ انتخاب نادرست روش تقسیم داده یا پردازش قبل از جداسازی هم می‌تواند اطلاعات را منتقل کند.

بیمار، واحد تصویر نیست

فرض کنید از هر بیمار چند تصویر داریم. اگر تصویرهای یک بیمار در آموزش و آزمون پخش شوند، مدل ممکن است ویژگی‌های اختصاصی همان فرد یا شیوهٔ تصویربرداری را بشناسد. در این حالت، نتیجه لزوماً نشان‌دهندهٔ عملکرد روی بیمار تازه نیست. واحد جداسازی باید با پرسشی که دربارهٔ تعمیم می‌پرسیم سازگار باشد.

پژوهش Kapoor و Narayanan؛ نشت داده و بازتولیدپذیری نشان می‌دهد نشت داده از مشکلات جدی ارزیابی و بازتولیدپذیری مطالعات یادگیری ماشین است. عدد عملکرد باید همراه با روش ساخت مجموعهٔ آزمون خوانده شود.

نشت در آماده‌سازی داده

اگر انتخاب ویژگی یا برآورد پارامترهای پیش‌پردازش با کل داده انجام شود، اطلاعات آزمون می‌تواند وارد آموزش شود. در پروژه‌های زمانی، استفاده از متغیری که فقط پس از زمان تصمیم در دسترس است نیز مسئله ایجاد می‌کند. سؤال عملی این است: «آیا این اطلاعات در لحظهٔ واقعی استفاده وجود داشت؟»

یک نقشه برای بازبینی

شناسهٔ بیمار، مرکز، زمان و مسیر تولید متغیرها را روی کاغذ بیاورید. سپس مشخص کنید هر جداسازی در کدام مرحله انجام شده است. این نقشه معمولاً از بحث کلی دربارهٔ «دقت بالا» مفیدتر است و به داور نشان می‌دهد استقلال آزمون چگونه حفظ شده است.

برای بررسی و مطالعهٔ بیشتر

منابع این یادداشت

  1. Kapoor و Narayanan؛ نشت داده و بازتولیدپذیری www.sciencedirect.com
  2. CLAIM؛ به‌روزرسانی ۲۰۲۴ pubs.rsna.org
میلاد جلالی
دربارهٔ نویسنده

دکتر میلاد جلالی

بنیان‌گذار ریسرچ ادیتور و محتوانگار. کار من به پژوهش، آموزش هوش مصنوعی و برندینگ پزشکی متصل است.

رزومه و سوابق ↖پروژه‌ها ↖