شرکت DeepSeek، استارتاپ چینی حوزه هوش مصنوعی، مدل چندرسانهای جدیدی بهنام DeepSeek‑OCRرا عرضه کرده که از قدرت بینایی ماشین (vision) برای فشردهسازی ورودیهای متنی بهره میبرد. این مدل بازمتن (open-source) از پلتفرمهایی مثل Hugging Face و GitHub در دسترس است. بنابر گزارش، با استفاده از ترکیب “انتکدِر بینایی” (vision encoder) و مبدل متنی، این سیستم توانسته تعداد “توکنها” (کوچکترین واحد پردازش متن) را ۷تا ۲۰ برابر کاهش دهد؛ یعنی متنهای بسیار بزرگتر را با هزینه محاسباتی بسیار کمتر پردازش کند. بدین ترتیب، مدلهای زبان بزرگ (LLM) میتوانند اسناد بسیار طولانی یا مجموعه دادههای حجیم را با کارایی بهتر و هزینه کمتر مدیریت کنند.