
جدول مشخصات نشان میدهد یک مدل چه ظرفیتی دارد، اما نمیگوید برای کار شما کدام انتخاب بهتر است. برای مقایسهٔ مدلهای جدید هوش مصنوعی، یک مجموعهٔ کوچک از کارهای واقعی و بدون اطلاعات حساس آماده کنید. معیار قبولی باید پیش از دیدن نام مدل روشن باشد.
مشخصات را درست بخوانید در زمان نگارش، OpenAI؛ مقایسهٔ مدلها مدلهایی مانند GPT-6 Astra و GPT-5.6 Terra را کنار هم قرار میدهد. تفاوت تعرفه، ورودی پشتیبانیشده و ظرفیت زمینه، فقط بخشی از مقایسه است. در خانوادهٔ دیگر، Anthropic؛ مشخصات و دسترسی Claude Fable اطلاعات Fable 5.1 را منتشر کرده است. شرایط حساب، ابزارهای فعال و نسخهٔ محصول را هم ثبت کنید.
آزمون را به کار خودتان نزدیک کنید برای پژوهش، وفاداری خلاصه به سند و حفظ محدودیت مطالعه را بسنجید. برای آموزش هوش مصنوعی پزشکی، وضوح توضیح برای مخاطب و نبود ادعای افزوده مهماند. برای آیتی، اجرای درست وظیفه و قابل نگهداری بودن خروجی را بررسی کنید. یک نمرهٔ کلی همهٔ اینها را پوشش نمیدهد.
هزینهٔ اصلاح را کنار هزینهٔ مدل بگذارید مدلی با تعرفهٔ کمتر ممکن است به چند بار تلاش و ویرایش بیشتری نیاز داشته باشد؛ مدل گرانتر هم لزوماً برای کار ساده ارزش اضافه ایجاد نمیکند. تعداد تلاش، زمان انسان و هزینهٔ ابزارهای جانبی را در یک جدول ثبت کنید. قیمتها را با تاریخ استعلام بنویسید تا جدول بعداً گمراهکننده نشود.
ارزیابی را با تغییر نسخه تکرار کنید نمونههای آزمون را نگه دارید و با تغییر مدل یا درخواست دوباره اجرا کنید. OpenAI؛ راهنمای ارزیابی خروجی مدل برای سازمان دادن این کار مفید است. نتیجهٔ مناسب، حکمی دربارهٔ برتری همیشگی یک نام تجاری نیست؛ یک تصمیم مستند برای یک وظیفه و یک زمان مشخص است.
منابع این یادداشت
- OpenAI؛ مقایسهٔ مدلها developers.openai.com
- Anthropic؛ مشخصات و دسترسی Claude Fable www.anthropic.com
- OpenAI؛ راهنمای ارزیابی خروجی مدل developers.openai.com

