شرکت متا اخیراً دو مدل جدید هوش مصنوعی به نامهای Scout و Maverick را تحت مجموعه Llama 4 معرفی کرده است. مدل Maverick بهسرعت در سایت ارزیابی هوش مصنوعی LMArena به رتبه دوم دست یافت و از مدلهایی مانند GPT-4o و Gemini 2.0 Flash پیشی گرفت. با این حال، بحثهایی پیرامون این موفقیت به وجود آمد؛ زیرا مشخص شد نسخهای از Maverick که برای این ارزیابی ارائه شده بود، یک نسخه آزمایشی و بهینهشده برای مکالمه بوده که در دسترس عموم قرار ندارد. این موضوع نگرانیهایی درباره صحت مقایسههای انجامشده در ارزیابیها ایجاد کرد. متا در پاسخ اعلام کرد که هدفش آزمایش با نسخههای مختلف مدلها بوده و تأکید کرد که هیچ آموزشی بر روی مجموعه دادههای آزمون انجام نشده است. منتقدان معتقدند چنین اقداماتی اعتبار ارزیابیهای هوش مصنوعی را زیر سؤال میبرد، بهویژه زمانی که امتیازات این ارزیابیها بر تصمیمگیری توسعهدهندگان تأثیر میگذارد. این رویداد باعث بررسی دقیقتر روشهای ارزیابی هوش مصنوعی و استراتژی انتشار متا شده است. در پاسخ به این موضوع، LMArena سیاستهای خود را برای اطمینان از ارزیابیهای منصفانهتر بهروزرسانی میکند. این جنجال نشاندهنده تنش فزاینده در صنعت هوش مصنوعی درباره شفافیت و تلاش برای ادعای رهبری فناوری است.