
جملهٔ «دادهها با روش یادگیری ماشین تحلیل شدند» تقریباً هیچ تصمیم پژوهشی را روشن نمیکند. روش باید نشان دهد داده از کجا آمده، چه تغییرهایی کرده و نتیجه از چه مسیری به دست آمده است.
زنجیرهٔ تصمیمها
از ورود داده تا گزارش خروجی، مراحل را به ترتیب واقعی بنویسید: معیار انتخاب، دادهٔ گمشده، پاکسازی، ساخت متغیر، تقسیم داده، آموزش و ارزیابی. هر مرحلهای که میتواند نتیجه را تغییر دهد، باید توضیح یا ارجاع دقیق داشته باشد. در مدلهای پیشبینی، TRIPOD+AI؛ گزارش مدلهای پیشبینی به شفافتر شدن گزارش کمک میکند.
یک مثال قابل بازسازی
فرض کنید پیش از مدلسازی، مقادیر گمشده را جایگزین کردهاید. خواننده باید بداند روش جایگزینی چه بوده و پارامترهای آن از کدام بخش داده برآورد شدهاند. نام بستهٔ نرمافزاری بهتنهایی پاسخ این دو پرسش نیست. همچنین مشخص کنید چه متغیری پیامد را تعریف کرده و زمان ثبت آن چه نسبتی با ورودیها داشته است.
فایل مکمل چه کاری میکند؟
فرهنگ متغیرها، نسخهٔ کد، تنظیمات اجرا و نمونهٔ ساختار داده میتوانند متن اصلی را خواناتر کنند. اصول اصول FAIR برای مدیریت دادهٔ علمی بر پیداشدن، دسترسیپذیری، تعاملپذیری و استفادهٔ مجدد از داده تأکید دارند؛ دسترسیپذیری لزوماً به معنای انتشار عمومی اطلاعات محرمانه نیست.
برای کنترل نهایی، از همکاری که تحلیل را انجام نداده بخواهید مسیر را روی کاغذ بازسازی کند. هر جا مجبور شد حدس بزند، احتمالاً توضیحی در روش یا فایل مکمل کم است.
منابع این یادداشت
- TRIPOD+AI؛ گزارش مدلهای پیشبینی www.bmj.com
- اصول FAIR برای مدیریت دادهٔ علمی www.nature.com


