
فایل تصاویر بههمراه چند پوشه با نام بیماری، هنوز یک مجموعهٔ دادهٔ آمادهٔ پژوهش نیست. نفر بعدی باید بتواند بفهمد هر برچسب چطور ایجاد شده و در موارد مبهم چه تصمیمی گرفته شده است. این توضیح به اندازهٔ تعداد تصاویر ارزش دارد.
دستورالعمل کوتاه، با مثال مرزی برای هر برچسب، تعریف، موارد ورود و خروج و چند مثال مبهم بنویسید. نمونههای واضح اختلاف زیادی ایجاد نمیکنند؛ اختلاف واقعی معمولاً در مرز تعریفهاست. پیش از برچسبگذاری همهٔ داده، یک دور محدود اجرا کنید و بر اساس اختلافها دستورالعمل را اصلاح کنید.
اختلاف را پاک نکنید خروجی ارزیاب اول و دوم را نگه دارید و نتیجهٔ حل اختلاف را در ستون جدا ثبت کنید. در این صورت میتوان منشأ برچسب نهایی را بازسازی کرد. از توافق ظاهری پس از بحث، بهعنوان توافق مستقل اولیه گزارش ندهید.
بیمار را میان مجموعهها تقسیم نکنید تصاویر متعدد یک بیمار باید با شناسهٔ مناسب قابل ردیابی باشند تا جداسازی آموزش و آزمون در سطح درست انجام شود. نام فایل لزوماً شناسهٔ بیمار نیست. برای دادهٔ ناشناسسازیشده نیز به یک نگاشت داخلی کنترلشده نیاز دارید که اطلاعات شناسایی را وارد مجموعهٔ عمومی نکند.
استاندارد را به کار روزانه ترجمه کنید ADA؛ استانداردهای هوش مصنوعی در دندانپزشکی به استانداردهای برچسبگذاری تصاویر دوبعدی و دادهٔ آزمون مستقل اشاره میکند. برای تیم کوچک، شروع عملی میتواند یک فرهنگ داده، نسخهٔ دستورالعمل و دفتر ثبت تغییرات باشد. اصول FAIR برای مدیریت دادهٔ علمی هم بر قابل فهم و استفاده بودن داده برای دیگران تأکید دارد؛ انتشار عمومی تمام دادهها پیششرط این نظم نیست.
منابع این یادداشت
- ADA؛ استانداردهای هوش مصنوعی در دندانپزشکی adanews.ada.org
- اصول FAIR برای مدیریت دادهٔ علمی www.nature.com



