تا همین چند سال پیش، اجرای مدلهای هوش مصنوعی با صدها میلیارد پارامتر به سرورهای دیتاسنتری و چندین کارت گرافیک قدرتمند نیاز داشت. پروژه متنباز FreeToken میخواهد این محدودیت را کاهش دهد و اجرای مدلهای بزرگ Mixture-of-Experts یا MoE را روی لپتاپهای قدرتمند، کامپیوترهای گیمینگ و ایستگاههای کاری امکانپذیر کند.
بر اساس مقاله رسمی این پروژه، FreeToken با ترکیب هوشمند توان GPU، پردازنده، حافظه اصلی و مسیر ارتباطی میان آنها، از مدل ۳۵ میلیارد پارامتری روی لپتاپ تا مدل ۲۸۴ میلیارد پارامتری روی یک دسکتاپ گیمینگ و مدل GLM-5.2 با ۷۵۳ میلیارد پارامتر روی یک GPU ورکاستیشن را پوشش میدهد. البته مدل قابل اجرا و سرعت نهایی کاملاً به سختافزار، حافظه، نوع کوانتیزاسیون و تنظیمات سیستم بستگی دارد.
FreeToken چیست؟
FreeToken یک موتور سروینگ Edge-Native برای مدلهای متنباز MoE است. برخلاف موتورهایی که کامپیوتر شخصی را فقط یک GPU کوچک در نظر میگیرند، FreeToken همه منابع سیستم را بهصورت یک سکوی استنتاج یکپارچه مدیریت میکند. در این معماری، بخشی از وزنهای مدل در حافظه اصلی نگهداری میشود، متخصصان موردنیاز در زمان مناسب به GPU منتقل میشوند و در بعضی شرایط بخشی از محاسبات مستقیماً روی CPU انجام میگیرد.
این پروژه بیش از ۲۰ مدل MoE را پشتیبانی میکند و برای اجرای عاملهای برنامهنویسی، فراخوانی ابزارها و گفتوگوهای طولانی طراحی شده است. API سازگار با OpenAI و Anthropic نیز اتصال آن به ابزارهایی مانند Codex، Claude Code، OpenCode و OpenClaw را آسانتر میکند.
مدل MoE چگونه اجرای مدلهای بزرگ را سادهتر میکند؟
در معماری Mixture-of-Experts همه پارامترهای مدل برای تولید هر توکن فعال نمیشوند. مدل از تعداد زیادی «متخصص» تشکیل شده و مسیریاب فقط چند متخصص مرتبط را برای پردازش هر توکن انتخاب میکند. برای نمونه، طبق مقاله FreeToken، مدل DeepSeek-V4-Flash در هر مرحله تنها بخشی از پارامترهای خود را فعال میکند؛ در نتیجه میزان محاسبه فعال بسیار کمتر از اندازه کامل مدل است.
با این حال، وزن کامل متخصصان همچنان باید جایی در RAM یا حافظه ذخیرهسازی نگهداری شود. چالش اصلی FreeToken این است که متخصص مناسب را با کمترین تأخیر میان حافظه سیستم، CPU و GPU جابهجا یا اجرا کند.
مهمترین قابلیتهای FreeToken
۱. اجرای همزمان روی CPU و GPU
FreeToken از سیاستی با نام q-star استفاده میکند. این سیاست با توجه به پهنای باند واقعی حافظه و PCIe تصمیم میگیرد کدام متخصص به کش GPU منتقل شود و کدام متخصص مستقیماً روی CPU اجرا شود. این تصمیم برای سختافزار هر کاربر تنظیم میشود و به یک روش ثابت برای همه سیستمها وابسته نیست.
۲. کش هوشمند متخصصان
متخصصانی که اخیراً بیشتر استفاده شدهاند، در یک کش اشتراکی LRU داخل حافظه GPU باقی میمانند. چون توکنهای متوالی معمولاً به متخصصان مشابهی مراجعه میکنند، این روش تعداد انتقالهای تکراری میان RAM و VRAM را کاهش میدهد و سرعت تولید پاسخ را افزایش میدهد.
۳. کش معنایی برای گفتوگوها و عاملها
عاملهای هوش مصنوعی هنگام استفاده از ابزارها، بخشهایی از سابقه گفتگو یا بلوکهای استدلال را تغییر میدهند. FreeToken در مرزهای معنایی مانند پایان فراخوانی ابزار، خروجی ابزار یا نوبت گفتگو نقطه بازیابی ایجاد میکند. به این ترتیب پس از تغییر زمینه، فقط بخش جدید دوباره محاسبه میشود و نیازی به پردازش کامل تاریخچه نیست.
۴. مدیریت پویای حافظه
مقدار VRAM آزاد در کامپیوتر شخصی ثابت نیست؛ مرورگر، بازیها و برنامههای دیگر میتوانند بخشی از آن را مصرف کنند. FreeToken میتواند سهم حافظه کش متخصصان و KV Cache را هنگام اجرا تغییر دهد، بدون اینکه موتور از ابتدا راهاندازی یا تمام وزنها دوباره بارگذاری شوند.
۵. پشتیبانی از فرمتهای مختلف
در مستندات پروژه، پشتیبانی از فرمتهای کوانتیزاسیون و دقت محاسباتی مانند MXFP4، NVFP4، FP8 و BF16 ذکر شده است. انتخاب فرمت مناسب روی میزان RAM، VRAM، سرعت و کیفیت خروجی تأثیر میگذارد.
FreeToken از چه مدلهایی پشتیبانی میکند؟
فهرست مدلهای پشتیبانیشده در حال توسعه است، اما سازندگان پروژه سه مدل زیر را از نمونههای اصلی معرفی کردهاند:
- Qwen3.6-35B-A3B: مدلی سبکتر برای لپتاپها و سیستمهای مصرفی قدرتمند.
- DeepSeek-V4-Flash: مدل MoE با ۲۸۴ میلیارد پارامتر که در آزمایش مقاله روی دسکتاپ گیمینگ اجرا شده است.
- GLM-5.2: مدل ۷۵۳ میلیارد پارامتری که آزمایش آن روی یک GPU ورکاستیشن RTX PRO 6000 انجام شده است.
پشتیبانی اسمی از یک مدل به این معنا نیست که آن مدل روی هر کامپیوتری اجرا خواهد شد. مقدار حافظه سیستم، VRAM، فضای SSD، نسل PCIe و فرمت وزنها تعیین میکنند کدام مدل برای دستگاه شما مناسب است.
عملکرد FreeToken در آزمایشهای رسمی
بر اساس نتایج منتشرشده توسط نویسندگان مقاله، FreeToken روی RTX 5090 برای Qwen3.6-35B-A3B به سرعت ۷۷ تا ۸۳ توکن بر ثانیه و برای DeepSeek-V4-Flash به ۲۲ تا ۲۵ توکن بر ثانیه رسیده است. همچنین در مجموعه آزمایشهای ارائهشده، سرعت Decode آن نسبت به موتورهای Edge مقایسهشده حدود ۱٫۵ تا ۲٫۳ برابر بیشتر گزارش شده است.
| رده سختافزار | نمونه مدل | نتیجه گزارششده |
|---|---|---|
| لپتاپ با RTX 4060 و ۸GB VRAM | مدل ۳۵B | حدود ۳۹٫۳ توکن بر ثانیه |
| دسکتاپ گیمینگ با RTX 5090 و ۳۲GB VRAM | DeepSeek-V4-Flash 284B | اجرای تعاملی با حدود ۲۲ تا ۲۵ توکن بر ثانیه |
| ورکاستیشن با RTX PRO 6000 | GLM-5.2 753B | دو برابر توان عملیاتی llama.cpp در آزمایش مقاله |
سختافزار موردنیاز برای FreeToken
FreeToken از کارتهای گرافیک NVIDIA سری RTX 30، RTX 40 و RTX 50 پشتیبانی میکند، اما انتخاب مدل باید متناسب با منابع سیستم باشد. پیش از دانلود وزنهای بزرگ، این موارد را بررسی کنید:
- مقدار VRAM کارت گرافیک و RAM سیستم
- فضای خالی SSD؛ بعضی مدلها به دهها یا صدها گیگابایت فضا نیاز دارند
- پهنای باند RAM و نسل PCIe
- فرمت کوانتیزاسیون مدل
- سیستمعامل و درایور سازگار NVIDIA
بنابراین عبارت «اجرای مدل غولپیکر روی کامپیوتر شخصی» به معنی اجرای همه مدلها روی هر لپتاپ معمولی نیست. مزیت FreeToken این است که از ترکیب منابع موجود بهتر استفاده میکند و امکان اجرای مدلهایی را فراهم میسازد که پیشتر برای آن رده سختافزار دشوار یا غیرعملی بودند.
آموزش نصب FreeToken
نصب با نسخه دسکتاپ
سادهترین روش برای کاربران ویندوز و لینوکس، دریافت برنامه دسکتاپ از وبسایت رسمی FlashML است. نسخه گرافیکی مراحل راهاندازی موتور، دانلود و اجرای مدل، گفتوگو و تنظیم منابع را سادهتر میکند.
نصب از طریق خط فرمان
برای نصب نسخه پایتون، در مستندات رسمی استفاده از uv پیشنهاد شده است:
برای ساخت مستقیم از سورس نیز میتوانید مخزن را دریافت و محیط مجازی ایجاد کنید:
مزایا و محدودیتهای FreeToken
مزایا
- اجرای محلی مدلهای متنباز و کاهش وابستگی به API ابری
- استفاده همزمان از GPU، CPU و حافظه اصلی
- مناسب برای عاملهای برنامهنویسی و فراخوانی ابزار
- مدیریت پویای VRAM بدون راهاندازی مجدد موتور
- API سازگار با OpenAI و Anthropic
- متنباز با مجوز Apache 2.0
محدودیتها
- مدلهای بزرگ همچنان به RAM و فضای ذخیرهسازی قابلتوجه نیاز دارند
- سرعت به پهنای باند حافظه و PCIe وابسته است
- راهاندازی مدلهای بسیار بزرگ برای کاربران مبتدی ساده نیست
- پروژه جدید است و نتایج بنچمارک مستقل بیشتری برای ارزیابی کامل لازم خواهد بود
FreeToken برای چه کسانی مناسب است؟
این ابزار برای پژوهشگران هوش مصنوعی، توسعهدهندگان عاملهای برنامهنویسی، تیمهای کوچک، علاقهمندان اجرای محلی LLM و کاربرانی مناسب است که سختافزار قدرتمند دارند و میخواهند کنترل بیشتری روی مدل و دادههای خود داشته باشند. اگر فقط استفاده روزمره و سریع از هوش مصنوعی مدنظر شماست، سرویسهای آنلاین همچنان سادهتر هستند؛ اما FreeToken برای آزمایش مدلهای متنباز در مقیاس بزرگ، گزینهای قابلتوجه محسوب میشود.
جمعبندی
FreeToken تلاش میکند فاصله میان مدلهای متنباز پیشرفته و سختافزارهای شخصی را کمتر کند. ترکیب اجرای CPU و GPU، کش هوشمند متخصصان، بازیابی معنایی زمینه و مدیریت پویای حافظه باعث شده است مدلهای MoE بسیار بزرگ روی سختافزارهای مصرفی و ورکاستیشن قابلاستفادهتر شوند.
با این حال، پیش از نصب باید ظرفیت واقعی سیستم و اندازه مدل را بررسی کنید. FreeToken محدودیت سختافزار را حذف نمیکند؛ بلکه از منابع موجود بسیار هوشمندانهتر استفاده میکند.
سؤالات متداول درباره FreeToken
آیا FreeToken رایگان است؟
بله. کد FreeToken با مجوز متنباز Apache 2.0 منتشر شده است؛ با این حال دانلود وزن بعضی مدلها ممکن است شرایط مجوز جداگانهای داشته باشد.
آیا FreeToken روی هر لپتاپی اجرا میشود؟
خود نرمافزار برای ردههای مختلف سختافزار طراحی شده، اما مدل قابل اجرا به VRAM، RAM، فضای SSD و نوع GPU بستگی دارد. اجرای مدلهای صدها میلیارد پارامتری به سیستم قدرتمند نیاز دارد.
آیا FreeToken جایگزین Ollama یا llama.cpp است؟
FreeToken روی سروینگ مدلهای MoE بزرگ و استفاده ترکیبی از منابع سیستم تمرکز دارد. انتخاب میان این ابزارها به مدل، سختافزار و نوع استفاده بستگی دارد.
آیا اطلاعات در FreeToken روی سیستم باقی میماند؟
در اجرای محلی، پردازش مدل روی دستگاه کاربر انجام میشود؛ اما حفظ حریم خصوصی نهایی به تنظیمات، ابزارهای متصل، کلاینت و سرویسهای جانبی نیز وابسته است.
از کجا FreeToken را دانلود کنیم؟
برای دریافت نسخه معتبر، از مخزن رسمی FreeToken در GitHub یا وبسایت رسمی FlashML استفاده کنید. جزئیات فنی و نتایج آزمایشها نیز در مقاله FreeToken در arXiv منتشر شده است.
