سیستم من چه مدل هوش مصنوعیای را میتواند اجرا کند؟
در بخش قبلی مجموعه آموزش Local AI با مفهوم هوش مصنوعی محلی و روش پیدا کردن مدلها آشنا شدیم. حالا قبل از دانلود چند گیگابایت فایل، باید بفهمیم کدام مدل واقعاً با سختافزار سیستم ما سازگار است و با سرعت قابلقبولی اجرا میشود.
برای انتخاب مدل لوکال فقط دانستن نام مدل کافی نیست. ظرفیت RAM، مقدار VRAM، توان پردازنده، نوع Quantization و Context Length همگی روی امکان اجرا، سرعت پاسخگویی و پایداری مدل اثر دارند. ممکن است یک مدل روی سیستم شما باز شود، اما بهدلیل کمبود حافظه آنقدر کند باشد که عملاً استفاده از آن دشوار شود.
نکته مهم: «قابل اجرا بودن» با «اجرای سریع و روان» یکی نیست. اعداد این راهنما تقریبیاند و معماری مدل، Quantization، طول Context، سیستمعامل و میزان انتقال لایهها به GPU میتوانند نتیجه را تغییر دهند.
چه مشخصاتی برای اجرای Local AI مهم هستند؟
۱. حافظه RAM
RAM محل نگهداری وزنهای مدل، بافرهای اجرایی، KV Cache و بخشی از دادههای برنامه است. اگر مدل بهطور کامل داخل VRAM کارت گرافیک جا نشود، معمولاً بخشی از آن در RAM سیستم قرار میگیرد. به همین دلیل باید علاوه بر حافظه موردنیاز مدل، فضایی برای سیستمعامل و برنامههای باز هم باقی بماند.
طبق راهنمای رسمی LM Studio، برای تجربه مناسب حداقل ۱۶ گیگابایت RAM توصیه میشود. دستگاههای ۸ گیگابایتی نیز ممکن است مدلهای کوچک را اجرا کنند، اما بهتر است Context محدود و مدل سبک انتخاب شود.
۲. حافظه گرافیکی یا VRAM
اگر کارت گرافیک مجزا دارید، VRAM یکی از اصلیترین عوامل سرعت است. هرچه بخش بیشتری از مدل داخل VRAM قرار بگیرد، معمولاً تولید توکن سریعتر میشود. در صورت کمبود VRAM، برنامههایی مبتنی بر llama.cpp میتوانند بخشی از لایهها را روی GPU و بقیه را روی CPU و RAM اجرا کنند؛ این روش اجرای مدل بزرگتر را ممکن میکند، اما معمولاً سرعت آن کمتر از اجرای کامل روی GPU است.
در ویندوز هنگام بررسی کارت گرافیک، عدد Dedicated GPU Memory مهمتر از Shared GPU Memory است. حافظه اشتراکی از RAM سیستم قرض گرفته میشود و جایگزین کاملی برای VRAM سریع کارت گرافیک نیست.
۳. پردازنده یا CPU
حتی بدون کارت گرافیک هم بسیاری از مدلهای GGUF قابل اجرا هستند، اما سرعت به تعداد هستهها، پهنای باند حافظه و نسل پردازنده وابسته است. برای استفاده روزمره، CPU جدید با هستههای بیشتر و RAM دوکاناله یا چندکاناله نتیجه بهتری میدهد. نسخه x64 برنامه LM Studio در ویندوز و لینوکس به پشتیبانی پردازنده از دستورالعمل AVX2 نیاز دارد.
۴. فضای ذخیرهسازی و حجم فایل مدل
SSD باعث میشود دانلود، بارگذاری اولیه و جابهجایی مدلها سریعتر شود، اما بهتنهایی سرعت تولید پاسخ را تعیین نمیکند. همیشه چند گیگابایت فضای آزاد بیشتر از حجم فایل در نظر بگیرید؛ زیرا ممکن است چند نسخه Quantized، فایلهای Cache و بهروزرسانیها نیز روی دیسک ذخیره شوند.
چرا حجم فایل مدل معیار کافی نیست؟
یک اشتباه رایج این است که بگوییم: «فایل مدل ۸ گیگابایت است، پس با ۸ گیگابایت RAM اجرا میشود.» هنگام اجرا، علاوه بر وزنهای مدل به حافظهای برای Context، KV Cache، بافرهای محاسباتی و خود سیستمعامل نیاز داریم. بنابراین حافظه واقعی موردنیاز معمولاً از حجم فایل دانلودشده بیشتر است.
یک تخمین ساده برای وزن خام مدل
Parameters × Bits ÷ 8
مثلاً وزن خام یک مدل 7B در دقت ۴ بیت حدود ۳.۵ گیگابایت میشود؛ اما فایل واقعی و حافظه زمان اجرا بهدلیل متادیتا، بعضی تانسورها و سربار برنامه بیشتر خواهد بود. پس این فرمول فقط برای تخمین اولیه است.
راهنمای سریع انتخاب مدل بر اساس سختافزار
اعداد زیر برای مدلهای متنی Quantized، استفاده تککاربره و Context معمولی نوشته شدهاند. مدلهای تصویری، صوتی و چندرسانهای ممکن است حافظه بیشتری مصرف کنند.
۸ گیگابایت RAM
مدلهای 1B تا 3B با Quantization چهار بیتی انتخاب منطقیتری هستند. بعضی مدلهای 7B ممکن است با تنظیمات محدود باز شوند، اما فضای کمی برای سیستمعامل و Context باقی میماند و تجربه همیشه روان نیست.
۱۶ گیگابایت RAM بدون GPU قدرتمند
مدلهای 7B و 8B با Q4 معمولاً قابل استفادهاند، اما سرعت آنها به CPU بستگی دارد. مدلهای 12B یا 14B ممکن است با Context کم اجرا شوند، ولی برای استفاده دائمی همیشه انتخاب راحتی نیستند.
۱۶ گیگابایت RAM همراه ۸ گیگابایت VRAM
مدلهای 7B و 8B چهار بیتی معمولاً گزینههای خوبی هستند و بخش عمده یا تمام مدل میتواند روی GPU قرار بگیرد. بعضی مدلهای 12B و 14B با Offload ترکیبی اجرا میشوند، اما میزان Context و معماری مدل تعیینکننده است.
۳۲ گیگابایت RAM همراه ۱۲ یا ۱۶ گیگابایت VRAM
مدلهای 14B چهار بیتی معمولاً تجربه خوبی ارائه میدهند. اجرای بعضی مدلهای 20B تا 32B نیز با انتقال بخشی از لایهها به RAM ممکن است، اما سرعت کمتر و مصرف حافظه بیشتر خواهد بود.
۶۴ گیگابایت RAM همراه ۲۴ گیگابایت VRAM
مدلهای 32B چهار بیتی معمولاً گزینه قدرتمندی هستند. مدلهای 70B چهار بیتی نیز ممکن است با اجرای ترکیبی GPU و RAM و Context کنترلشده باز شوند، اما الزاماً سریع نیستند و برای بهترین تجربه به حافظه و پهنای باند بیشتری نیاز دارند.
پیشنهاد عملی: همیشه مدلی را انتخاب کنید که کمی پایینتر از سقف حافظه سیستم شما باشد. این حاشیه امن اجازه میدهد Context بزرگتر، برنامههای پسزمینه و سربار زمان اجرا باعث خطای کمبود حافظه نشوند.
Quantization چه تغییری ایجاد میکند؟
Quantization یا کوانتیزهسازی، وزنهای مدل را با دقت عددی پایینتر ذخیره میکند. برای مثال نسخه ۴ بیتی یک مدل حافظه بسیار کمتری از نسخه FP16 میخواهد. به همین دلیل مدلهایی با برچسبهایی مانند Q4، Q5 یا Q8 منتشر میشوند.
دقت پایینتر معمولاً حجم و مصرف حافظه را کم میکند، اما ممکن است مقدار کمی از کیفیت مدل کاهش یابد. برای شروع در LM Studio، نسخههایی مانند Q4_K_M معمولاً تعادل مناسبی بین حجم، سرعت و کیفیت ایجاد میکنند. انتخاب نهایی باید با توجه به مدل و سختافزار آزمایش شود.
Context Length چرا حافظه را زیاد میکند؟
Context Length مشخص میکند مدل چه مقدار از متن گفتگو، فایل یا دستور شما را همزمان در حافظه نگه دارد. با افزایش تعداد توکنها، KV Cache نیز بزرگتر میشود و RAM یا VRAM بیشتری مصرف میکند. بنابراین ممکن است یک مدل در Context برابر ۴ هزار توکن بدون مشکل اجرا شود، اما در ۳۲ هزار توکن با خطای کمبود حافظه روبهرو شود.
اگر مدل باز نمیشود یا حافظه پر میشود، پیش از دانلود نسخه کوچکتر ابتدا Context را کاهش دهید و تعداد لایههای منتقلشده به GPU را تنظیم کنید.
کامپیوتر بدون کارت گرافیک هم میتواند مدل اجرا کند؟
بله. مدلهای GGUF با ابزارهایی مانند llama.cpp و LM Studio میتوانند فقط روی CPU اجرا شوند. تفاوت اصلی معمولاً در سرعت است. برای پرسشهای کوتاه، مدل کوچک و استفاده شخصی ممکن است CPU کافی باشد؛ اما برای پاسخ سریع، متن بلند یا مدل بزرگتر، GPU مزیت محسوسی ایجاد میکند.
نکته مخصوص مکهای Apple Silicon
در مکهای Apple Silicon، CPU و GPU از Unified Memory یا حافظه یکپارچه استفاده میکنند. بنابراین نباید RAM این دستگاهها را دقیقاً مانند مجموع RAM و VRAM یک کامپیوتر ویندوزی تفسیر کرد. بااینحال، بخشی از حافظه همچنان در اختیار macOS و برنامههاست؛ پس یک مک ۱۶ گیگابایتی تمام ۱۶ گیگابایت را به مدل اختصاص نمیدهد. LM Studio در حال حاضر Apple Silicon و macOS 14 یا جدیدتر را پشتیبانی میکند.
چطور مشخصات سیستم خود را پیدا کنیم؟
در ویندوز
کلیدهای Ctrl + Shift + Esc را بزنید، وارد بخش Performance شوید و مقدار RAM، نام CPU و حافظه Dedicated کارت گرافیک را بررسی کنید. برای دیدن نسخه ویندوز نیز میتوانید Settings > System > About را باز کنید.
در macOS
از منوی Apple گزینه About This Mac را انتخاب کنید. نام تراشه و مقدار Unified Memory نمایش داده میشود. برای بررسی مصرف لحظهای حافظه نیز Activity Monitor را باز کنید.
در لینوکس
برای مشاهده پردازنده و RAM میتوانید از این دستورها استفاده کنید:
lscpu free -h lspci | grep -Ei 'vga|3d'
تخمین حافظه در LM Studio
در نسخههای جدید LM Studio میتوانید پیش از بارگذاری مدل، تخمین حافظه را با توجه به Context و میزان استفاده از GPU بررسی کنید. در خط فرمان LM Studio نیز دستور زیر فقط تخمین حافظه GPU و حافظه کل را نمایش میدهد و مدل را بارگذاری نمیکند:
lms load --estimate-only <model>
این تخمین از حدسزدن بر اساس حجم فایل دقیقتر است، زیرا Context Length، تنظیم GPU و ویژگیهای مدل را نیز در نظر میگیرد. بااینحال، بهتر است مقداری حاشیه امن برای سیستمعامل باقی بگذارید.
یک روش مطمئن برای انتخاب مدل
مرحله ۱: مقدار RAM و VRAM واقعی سیستم را یادداشت کنید.
مرحله ۲: ابتدا یک مدل Instruct کوچک با Quantization چهار بیتی انتخاب کنید.
مرحله ۳: Context را برای شروع روی ۴۰۹۶ یا ۸۱۹۲ توکن قرار دهید.
مرحله ۴: تخمین حافظه را ببینید و حداقل چند گیگابایت برای سیستمعامل خالی بگذارید.
مرحله ۵: سرعت تولید، دمای سیستم و مصرف حافظه را آزمایش کنید؛ سپس در صورت نیاز سراغ مدل بزرگتر بروید.
اشتباهات رایج هنگام انتخاب مدل لوکال
- انتخاب مدل فقط بر اساس حجم فایل دانلودی
- اشتباه گرفتن Shared GPU Memory با VRAM اختصاصی
- قرار دادن Context روی حداکثر مقدار از همان اجرای اول
- پر کردن تمام RAM و نادیده گرفتن حافظه موردنیاز سیستمعامل
- تصور اینکه تعداد پارامتر بیشتر همیشه به معنی مدل بهتر برای نیاز شماست
- انتظار سرعت GPU از یک اجرای کاملاً CPU-based
پرسشهای متداول
آیا مدل 7B روی ۸ گیگابایت RAM اجرا میشود؟
بعضی نسخههای چهار بیتی ممکن است با Context پایین اجرا شوند، اما فضای حافظه بسیار محدود میشود. برای سیستم ۸ گیگابایتی، مدلهای 1B تا 3B انتخاب مطمئنتری هستند.
برای اجرای مدل حتماً کارت گرافیک NVIDIA لازم است؟
خیر. اجرای CPU-only و همچنین پشتیبانی از برخی GPUهای AMD، Intel و Apple Silicon وجود دارد. نوع پشتیبانی و سرعت به نرمافزار، سیستمعامل و Backend انتخابشده بستگی دارد.
RAM مهمتر است یا VRAM؟
برای اینکه مدل اصلاً بارگذاری شود، مجموع حافظه در دسترس اهمیت دارد؛ برای سرعت بالاتر معمولاً VRAM بیشتر مزیت دارد. اگر مدل در VRAM جا نشود، اجرای ترکیبی با RAM ممکن است، اما سرعت کاهش پیدا میکند.
Q4، Q5 و Q8 کدام بهتر است؟
Q4 حافظه کمتری مصرف میکند، Q8 معمولاً به نسخه دقیقتر نزدیکتر است اما حجم بیشتری دارد و Q5 میان این دو قرار میگیرد. برای شروع، Q4_K_M اغلب انتخاب متعادلی است.
جمعبندی
برای فهمیدن اینکه سیستم شما چه مدل هوش مصنوعی لوکالی را اجرا میکند، فقط به نام یا حجم فایل نگاه نکنید. RAM، VRAM، CPU، Quantization و Context Length را در کنار هم بسنجید. ابتدا از مدل کوچکتر و Q4 شروع کنید، چند گیگابایت حاشیه امن نگه دارید و بعد از یک تست واقعی به سراغ مدلهای بزرگتر بروید.
در قسمت بعدی آموزش Local AI
میرویم سراغ دو مفهوم کلیدی: 7B، 14B و 32B دقیقاً یعنی چه؟ Quantization چیست و چگونه کمک میکند مدلهای بزرگ را روی سیستمهای معمولی اجرا کنیم؟
