Alibaba Cloudسامانهای به نام Aegaeon را رونمایی کرده است که با هدف بهینهسازی مصرف کارتهای گرافیکی (GPU) در سرویسهای هوش مصنوعی بزرگ طراحی شده است. در آزمایش بتای سهماهه، این سیستم موفق شده تعداد کارتهای Nvidia مورد نیاز را از ۱٬۱۹۲ به تنها ۲۱۳ عدد کاهش دهد — معادل کاهش تقریبی ۸۲٪ در مصرف GPU. کلید موفقیت این سامانه، روش زمانبندی در سطح «توکن» (token-level scheduling) است؛ به جای اینکه هر مدل هوش مصنوعی به یک GPU ثابت متصل شود، Aegaeon به قسمتهای کوچکی از کارها (توکنها) این امکان را میدهد که روی یک استخر مشترک از GPU ها اجرا شوند.
نتیجه این است که یک کارت GPU میتواند چند مدل بزرگ زبان (LLM) را همزمان اجرا کند و به افزایش بهرهوری تا ۹برابر نیز منجر شده است. این دستاورد مخصوصاً در شرایطی که واردات کارتهای پیشرفته برای چین محدود شدهاند، اهمیت دارد؛ چون کاهش نیاز به سختافزار به معنای کاهش هزینه و وابستگی است.