
سامانهای که زیر پاسخ چند لینک نشان میدهد، لزوماً پاسخ مستند تولید نکرده است. باید دید اسناد مرتبط بازیابی شدهاند و جملههای پاسخ واقعاً از همان اسناد پشتیبانی میگیرند یا نه.
دو مرحله، دو محل خطا
در معماری RAG، بازیابی اطلاعات با تولید پاسخ ترکیب میشود؛ ایدهٔ پایه در مقالهٔ Lewis و همکاران؛ Retrieval-Augmented Generation توضیح داده شده است. برای یک کاربرد پزشکی، خطا میتواند در پیداکردن سند، انتخاب بخش مناسب یا تفسیر آن رخ دهد. بنابراین ارزیابی فقط متن نهایی، محل مشکل را پنهان میکند.
یک مثال برای آزمون
فرض کنید سؤال دربارهٔ یک گروه سنی مشخص است، اما سامانه متنی دربارهٔ جمعیتی دیگر پیدا کرده. پاسخ ممکن است دقیقاً همان متن را خلاصه کند و همچنان برای سؤال نامتناسب باشد. در آزمون، هم ارتباط سند با سؤال و هم وفاداری پاسخ به سند را بررسی کنید.
نسخه و تاریخ اسناد هم مهماند. یک منبع معتبرِ قدیمی ممکن است برای پرسشی دربارهٔ وضعیت فعلی کافی نباشد. مجموعهٔ اسناد باید مسئول نگهداری و روش روشن بهروزرسانی داشته باشد.
سه خروجی مفید برای کنترل
سؤال کاربر، بخشهای بازیابیشده و پاسخ نهایی را برای نمونههای آزمون کنار هم نگه دارید. ادعاهای بدون شاهد را علامت بزنید و مواردی را که پاسخ باید «اطلاعات کافی ندارم» باشد در مجموعهٔ آزمون بگنجانید. ملاحظات مدلهای مولد در سلامت در WHO؛ مدلهای بزرگ چندوجهی در سلامت مطرح شدهاند.
RAG نام یک معماری است؛ گواهی کیفیت پزشکی نیست. ارزش آن را باید در کاربرد مشخص، با اسناد مشخص و معیارهای قابل اندازهگیری سنجید.
منابع این یادداشت
- Lewis و همکاران؛ Retrieval-Augmented Generation arxiv.org
- WHO؛ مدلهای بزرگ چندوجهی در سلامت www.who.int


