MGMoeinGiftPREMIUM DIGITAL STORE ورود / ثبت‌نام
خانهمجلهFreeToken چیست؟ اجرای مدل‌های MoE روی کامپیوتر شخصی

FreeToken چیست؟ اجرای مدل‌های MoE روی کامپیوتر شخصی

FreeToken چیست؟ اجرای مدل‌های MoE روی کامپیوتر شخصی

تا همین چند سال پیش، اجرای مدل‌های هوش مصنوعی با صدها میلیارد پارامتر به سرورهای دیتاسنتری و چندین کارت گرافیک قدرتمند نیاز داشت. پروژه متن‌باز FreeToken می‌خواهد این محدودیت را کاهش دهد و اجرای مدل‌های بزرگ Mixture-of-Experts یا MoE را روی لپ‌تاپ‌های قدرتمند، کامپیوترهای گیمینگ و ایستگاه‌های کاری امکان‌پذیر کند.

بر اساس مقاله رسمی این پروژه، FreeToken با ترکیب هوشمند توان GPU، پردازنده، حافظه اصلی و مسیر ارتباطی میان آن‌ها، از مدل ۳۵ میلیارد پارامتری روی لپ‌تاپ تا مدل ۲۸۴ میلیارد پارامتری روی یک دسکتاپ گیمینگ و مدل GLM-5.2 با ۷۵۳ میلیارد پارامتر روی یک GPU ورک‌استیشن را پوشش می‌دهد. البته مدل قابل اجرا و سرعت نهایی کاملاً به سخت‌افزار، حافظه، نوع کوانتیزاسیون و تنظیمات سیستم بستگی دارد.

FreeToken چیست؟

FreeToken یک موتور سروینگ Edge-Native برای مدل‌های متن‌باز MoE است. برخلاف موتورهایی که کامپیوتر شخصی را فقط یک GPU کوچک در نظر می‌گیرند، FreeToken همه منابع سیستم را به‌صورت یک سکوی استنتاج یکپارچه مدیریت می‌کند. در این معماری، بخشی از وزن‌های مدل در حافظه اصلی نگهداری می‌شود، متخصصان موردنیاز در زمان مناسب به GPU منتقل می‌شوند و در بعضی شرایط بخشی از محاسبات مستقیماً روی CPU انجام می‌گیرد.

این پروژه بیش از ۲۰ مدل MoE را پشتیبانی می‌کند و برای اجرای عامل‌های برنامه‌نویسی، فراخوانی ابزارها و گفت‌وگوهای طولانی طراحی شده است. API سازگار با OpenAI و Anthropic نیز اتصال آن به ابزارهایی مانند Codex، Claude Code، OpenCode و OpenClaw را آسان‌تر می‌کند.

مدل MoE چگونه اجرای مدل‌های بزرگ را ساده‌تر می‌کند؟

در معماری Mixture-of-Experts همه پارامترهای مدل برای تولید هر توکن فعال نمی‌شوند. مدل از تعداد زیادی «متخصص» تشکیل شده و مسیریاب فقط چند متخصص مرتبط را برای پردازش هر توکن انتخاب می‌کند. برای نمونه، طبق مقاله FreeToken، مدل DeepSeek-V4-Flash در هر مرحله تنها بخشی از پارامترهای خود را فعال می‌کند؛ در نتیجه میزان محاسبه فعال بسیار کمتر از اندازه کامل مدل است.

با این حال، وزن کامل متخصصان همچنان باید جایی در RAM یا حافظه ذخیره‌سازی نگهداری شود. چالش اصلی FreeToken این است که متخصص مناسب را با کمترین تأخیر میان حافظه سیستم، CPU و GPU جابه‌جا یا اجرا کند.

مهم‌ترین قابلیت‌های FreeToken

۱. اجرای هم‌زمان روی CPU و GPU

FreeToken از سیاستی با نام q-star استفاده می‌کند. این سیاست با توجه به پهنای باند واقعی حافظه و PCIe تصمیم می‌گیرد کدام متخصص به کش GPU منتقل شود و کدام متخصص مستقیماً روی CPU اجرا شود. این تصمیم برای سخت‌افزار هر کاربر تنظیم می‌شود و به یک روش ثابت برای همه سیستم‌ها وابسته نیست.

۲. کش هوشمند متخصصان

متخصصانی که اخیراً بیشتر استفاده شده‌اند، در یک کش اشتراکی LRU داخل حافظه GPU باقی می‌مانند. چون توکن‌های متوالی معمولاً به متخصصان مشابهی مراجعه می‌کنند، این روش تعداد انتقال‌های تکراری میان RAM و VRAM را کاهش می‌دهد و سرعت تولید پاسخ را افزایش می‌دهد.

۳. کش معنایی برای گفت‌وگوها و عامل‌ها

عامل‌های هوش مصنوعی هنگام استفاده از ابزارها، بخش‌هایی از سابقه گفتگو یا بلوک‌های استدلال را تغییر می‌دهند. FreeToken در مرزهای معنایی مانند پایان فراخوانی ابزار، خروجی ابزار یا نوبت گفتگو نقطه بازیابی ایجاد می‌کند. به این ترتیب پس از تغییر زمینه، فقط بخش جدید دوباره محاسبه می‌شود و نیازی به پردازش کامل تاریخچه نیست.

۴. مدیریت پویای حافظه

مقدار VRAM آزاد در کامپیوتر شخصی ثابت نیست؛ مرورگر، بازی‌ها و برنامه‌های دیگر می‌توانند بخشی از آن را مصرف کنند. FreeToken می‌تواند سهم حافظه کش متخصصان و KV Cache را هنگام اجرا تغییر دهد، بدون اینکه موتور از ابتدا راه‌اندازی یا تمام وزن‌ها دوباره بارگذاری شوند.

۵. پشتیبانی از فرمت‌های مختلف

در مستندات پروژه، پشتیبانی از فرمت‌های کوانتیزاسیون و دقت محاسباتی مانند MXFP4، NVFP4، FP8 و BF16 ذکر شده است. انتخاب فرمت مناسب روی میزان RAM، VRAM، سرعت و کیفیت خروجی تأثیر می‌گذارد.

FreeToken از چه مدل‌هایی پشتیبانی می‌کند؟

فهرست مدل‌های پشتیبانی‌شده در حال توسعه است، اما سازندگان پروژه سه مدل زیر را از نمونه‌های اصلی معرفی کرده‌اند:

  • Qwen3.6-35B-A3B: مدلی سبک‌تر برای لپ‌تاپ‌ها و سیستم‌های مصرفی قدرتمند.
  • DeepSeek-V4-Flash: مدل MoE با ۲۸۴ میلیارد پارامتر که در آزمایش مقاله روی دسکتاپ گیمینگ اجرا شده است.
  • GLM-5.2: مدل ۷۵۳ میلیارد پارامتری که آزمایش آن روی یک GPU ورک‌استیشن RTX PRO 6000 انجام شده است.

پشتیبانی اسمی از یک مدل به این معنا نیست که آن مدل روی هر کامپیوتری اجرا خواهد شد. مقدار حافظه سیستم، VRAM، فضای SSD، نسل PCIe و فرمت وزن‌ها تعیین می‌کنند کدام مدل برای دستگاه شما مناسب است.

عملکرد FreeToken در آزمایش‌های رسمی

بر اساس نتایج منتشرشده توسط نویسندگان مقاله، FreeToken روی RTX 5090 برای Qwen3.6-35B-A3B به سرعت ۷۷ تا ۸۳ توکن بر ثانیه و برای DeepSeek-V4-Flash به ۲۲ تا ۲۵ توکن بر ثانیه رسیده است. همچنین در مجموعه آزمایش‌های ارائه‌شده، سرعت Decode آن نسبت به موتورهای Edge مقایسه‌شده حدود ۱٫۵ تا ۲٫۳ برابر بیشتر گزارش شده است.

رده سخت‌افزار نمونه مدل نتیجه گزارش‌شده
لپ‌تاپ با RTX 4060 و ۸GB VRAM مدل ۳۵B حدود ۳۹٫۳ توکن بر ثانیه
دسکتاپ گیمینگ با RTX 5090 و ۳۲GB VRAM DeepSeek-V4-Flash 284B اجرای تعاملی با حدود ۲۲ تا ۲۵ توکن بر ثانیه
ورک‌استیشن با RTX PRO 6000 GLM-5.2 753B دو برابر توان عملیاتی llama.cpp در آزمایش مقاله
نکته مهم: این اعداد از آزمایش‌های منتشرشده توسط تیم سازنده به دست آمده‌اند و نتیجه واقعی می‌تواند با توجه به سخت‌افزار، نسخه نرم‌افزار، طول زمینه و نوع وظیفه متفاوت باشد.

سخت‌افزار موردنیاز برای FreeToken

FreeToken از کارت‌های گرافیک NVIDIA سری RTX 30، RTX 40 و RTX 50 پشتیبانی می‌کند، اما انتخاب مدل باید متناسب با منابع سیستم باشد. پیش از دانلود وزن‌های بزرگ، این موارد را بررسی کنید:

  • مقدار VRAM کارت گرافیک و RAM سیستم
  • فضای خالی SSD؛ بعضی مدل‌ها به ده‌ها یا صدها گیگابایت فضا نیاز دارند
  • پهنای باند RAM و نسل PCIe
  • فرمت کوانتیزاسیون مدل
  • سیستم‌عامل و درایور سازگار NVIDIA

بنابراین عبارت «اجرای مدل غول‌پیکر روی کامپیوتر شخصی» به معنی اجرای همه مدل‌ها روی هر لپ‌تاپ معمولی نیست. مزیت FreeToken این است که از ترکیب منابع موجود بهتر استفاده می‌کند و امکان اجرای مدل‌هایی را فراهم می‌سازد که پیش‌تر برای آن رده سخت‌افزار دشوار یا غیرعملی بودند.

آموزش نصب FreeToken

نصب با نسخه دسکتاپ

ساده‌ترین روش برای کاربران ویندوز و لینوکس، دریافت برنامه دسکتاپ از وب‌سایت رسمی FlashML است. نسخه گرافیکی مراحل راه‌اندازی موتور، دانلود و اجرای مدل، گفت‌وگو و تنظیم منابع را ساده‌تر می‌کند.

نصب از طریق خط فرمان

برای نصب نسخه پایتون، در مستندات رسمی استفاده از uv پیشنهاد شده است:

uv pip install "freetoken[accel]"

برای ساخت مستقیم از سورس نیز می‌توانید مخزن را دریافت و محیط مجازی ایجاد کنید:

git clone https://github.com/FlashML-org/FreeToken.git cd FreeToken uv venv source .venv/bin/activate uv pip install -e ".[accel]"
راهنمای ویندوز: دستور فعال‌سازی محیط مجازی در Windows PowerShell متفاوت است؛ بنابراین کاربران ویندوز بهتر است راهنمای رسمی متناسب با سیستم‌عامل یا نسخه دسکتاپ دارای رابط گرافیکی را استفاده کنند.

مزایا و محدودیت‌های FreeToken

مزایا

  • اجرای محلی مدل‌های متن‌باز و کاهش وابستگی به API ابری
  • استفاده هم‌زمان از GPU، CPU و حافظه اصلی
  • مناسب برای عامل‌های برنامه‌نویسی و فراخوانی ابزار
  • مدیریت پویای VRAM بدون راه‌اندازی مجدد موتور
  • API سازگار با OpenAI و Anthropic
  • متن‌باز با مجوز Apache 2.0

محدودیت‌ها

  • مدل‌های بزرگ همچنان به RAM و فضای ذخیره‌سازی قابل‌توجه نیاز دارند
  • سرعت به پهنای باند حافظه و PCIe وابسته است
  • راه‌اندازی مدل‌های بسیار بزرگ برای کاربران مبتدی ساده نیست
  • پروژه جدید است و نتایج بنچمارک مستقل بیشتری برای ارزیابی کامل لازم خواهد بود

FreeToken برای چه کسانی مناسب است؟

این ابزار برای پژوهشگران هوش مصنوعی، توسعه‌دهندگان عامل‌های برنامه‌نویسی، تیم‌های کوچک، علاقه‌مندان اجرای محلی LLM و کاربرانی مناسب است که سخت‌افزار قدرتمند دارند و می‌خواهند کنترل بیشتری روی مدل و داده‌های خود داشته باشند. اگر فقط استفاده روزمره و سریع از هوش مصنوعی مدنظر شماست، سرویس‌های آنلاین همچنان ساده‌تر هستند؛ اما FreeToken برای آزمایش مدل‌های متن‌باز در مقیاس بزرگ، گزینه‌ای قابل‌توجه محسوب می‌شود.

جمع‌بندی

FreeToken تلاش می‌کند فاصله میان مدل‌های متن‌باز پیشرفته و سخت‌افزارهای شخصی را کمتر کند. ترکیب اجرای CPU و GPU، کش هوشمند متخصصان، بازیابی معنایی زمینه و مدیریت پویای حافظه باعث شده است مدل‌های MoE بسیار بزرگ روی سخت‌افزارهای مصرفی و ورک‌استیشن قابل‌استفاده‌تر شوند.

با این حال، پیش از نصب باید ظرفیت واقعی سیستم و اندازه مدل را بررسی کنید. FreeToken محدودیت سخت‌افزار را حذف نمی‌کند؛ بلکه از منابع موجود بسیار هوشمندانه‌تر استفاده می‌کند.

سؤالات متداول درباره FreeToken

آیا FreeToken رایگان است؟

بله. کد FreeToken با مجوز متن‌باز Apache 2.0 منتشر شده است؛ با این حال دانلود وزن بعضی مدل‌ها ممکن است شرایط مجوز جداگانه‌ای داشته باشد.

آیا FreeToken روی هر لپ‌تاپی اجرا می‌شود؟

خود نرم‌افزار برای رده‌های مختلف سخت‌افزار طراحی شده، اما مدل قابل اجرا به VRAM، RAM، فضای SSD و نوع GPU بستگی دارد. اجرای مدل‌های صدها میلیارد پارامتری به سیستم قدرتمند نیاز دارد.

آیا FreeToken جایگزین Ollama یا llama.cpp است؟

FreeToken روی سروینگ مدل‌های MoE بزرگ و استفاده ترکیبی از منابع سیستم تمرکز دارد. انتخاب میان این ابزارها به مدل، سخت‌افزار و نوع استفاده بستگی دارد.

آیا اطلاعات در FreeToken روی سیستم باقی می‌ماند؟

در اجرای محلی، پردازش مدل روی دستگاه کاربر انجام می‌شود؛ اما حفظ حریم خصوصی نهایی به تنظیمات، ابزارهای متصل، کلاینت و سرویس‌های جانبی نیز وابسته است.

از کجا FreeToken را دانلود کنیم؟

برای دریافت نسخه معتبر، از مخزن رسمی FreeToken در GitHub یا وب‌سایت رسمی FlashML استفاده کنید. جزئیات فنی و نتایج آزمایش‌ها نیز در مقاله FreeToken در arXiv منتشر شده است.

اشتراک‌گذاری مطلبتلگرام

سؤالات متداول

چطور محصول مناسب خودم را انتخاب کنم؟

در صفحه محصولات، توضیحات و شرایط هر سرویس را بررسی کنید و در صورت نیاز از پشتیبانی کمک بگیرید.

آیا مطالب مجله به‌روز می‌شوند؟

بله؛ مطالب مهم و تغییرات سرویس‌ها به‌صورت دوره‌ای بررسی و به‌روزرسانی می‌شوند.