رقابت مدلهای هوش مصنوعی دوباره داغ شده و اینبار Grok 4.7 وارد میدان شده است.
شرکت xAI نسخه جدید Grok را در ۲۱ سپتامبر ۲۰۲۶ معرفی کرد؛ مدلی که بیش از نسخههای قبلی برای برنامهنویسی، کارهای چندمرحلهای، تحلیل اسناد و Knowledge Work بهینه شده است.
اما مهمترین تغییر Grok 4.7 فقط یک افزایش ساده در Benchmarkها نیست. xAI میگوید مدل جدید برای مدت بیشتری روی مسئلههایی آموزش دیده که حل آنها ممکن است ساعتها طول بکشد؛ یعنی هدف فقط «سریع جواب دادن» نیست، بلکه مدل باید بتواند روی یک مسئله پیچیده کار کند، نتیجه خودش را بررسی کند و در صورت نیاز مسیر را اصلاح کند.
در این مقاله از معین گیفت بررسی میکنیم Grok 4.7 چه قابلیتهایی دارد، نسبت به Grok 4.6 چه تغییری کرده، Context Window جدید چه کاربردی دارد و ادعای برتری آن نسبت به GPT-5.6 Sol و Fable 5.1 چقدر دقیق است.
Grok 4.7 چیست؟
Grok 4.7 جدیدترین مدل Frontier شرکت xAI برای کدنویسی، انجام وظایف Agentic و کارهای حرفهای مبتنی بر دانش است.
طبق توضیحات رسمی xAI، این نسخه از یک Base Model بزرگتر نسبت به Grok 4.6 استفاده میکند و دوره Reinforcement Learning طولانیتری را پشت سر گذاشته است.
مجموعه تمرینهای مدل نیز بیشتر به سمت مسئلههایی سوق داده شده که:
- چندین مرحله دارند،
- به بررسی نتیجه نیاز دارند،
- ممکن است مدت زیادی طول بکشند،
- و با یک پاسخ سریع و سطحی حل نمیشوند.
به همین دلیل Grok 4.7 بیشتر از قبل برای پروژههای واقعی برنامهنویسی و کارهای طولانیمدت طراحی شده است.
تفاوت اصلی Grok 4.7 با Grok 4.6 چیست؟
Grok 4.7 فقط یک Update کوچک روی مدل قبلی نیست.
xAI اعلام کرده در این نسخه از یک Base Model بزرگتر استفاده شده و Post-Training نیز روی مجموعه سختتری از مسائل انجام شده است.
مهمترین تغییرات را میتوان در چند بخش خلاصه کرد:
- عملکرد بهتر در Coding و Software Engineering
- توانایی بیشتر در انجام Taskهای طولانی
- Self-Verification بهتر
- مدیریت بهتر Contextهای بزرگ
- بهبود در ساخت Document و Presentation
- عملکرد بهتر در برخی وظایف مهندسی و حرفهای
Grok 4.7 بیشتر «کار میکند» و کمتر فقط جواب میدهد
یکی از جالبترین بخشهای معرفی رسمی Grok 4.7، تمرکز روی مسئلههای Multi-Hour است.
مدلهای قدیمیتر هوش مصنوعی عمدتاً برای این طراحی شده بودند که سؤال را دریافت کنند و در مدت کوتاهی پاسخ تولید کنند.
اما نسل جدید مدلهای Agentic باید بتوانند روی پروژههایی کار کنند که شامل:
- بررسی چند فایل
- تحلیل پروژه
- نوشتن و اصلاح کد
- اجرای تست
- بررسی نتیجه
- اصلاح خطا
- و ادامه کار تا رسیدن به خروجی نهایی
هستند.
Grok 4.7 دقیقاً برای همین نوع Workflowها بیشتر بهینه شده است.
Context Window مدل به 500 هزار توکن رسیده است
یکی از مهمترین مشخصات فنی Grok 4.7، Context Window برابر با 500,000 توکن است.
Context Window مشخص میکند مدل چه مقدار اطلاعات را میتواند در یک درخواست یا جریان کاری در اختیار داشته باشد.
500 هزار توکن یعنی میتوان حجم بسیار بزرگی از:
- کدهای یک پروژه
- مستندات فنی
- قراردادها
- گزارشهای سازمانی
- اسناد پژوهشی
- فایلهای متنی بزرگ
را در Context مدل قرار داد.
البته 500K Context به این معنی نیست که مدل همیشه باید تمام این ظرفیت را مصرف کند؛ بلکه در پروژههای بزرگ، فضای بیشتری برای نگهداشتن اطلاعات مرتبط در اختیار مدل قرار میدهد.
Grok 4.7 برای برنامهنویسی ساخته شده است؟
یکی از تمرکزهای اصلی نسخه جدید، Software Engineering است.
xAI مدل را در Benchmarkهایی آزمایش کرده که صرفاً شامل نوشتن یک تابع کوتاه نیستند، بلکه نیاز به کار طولانیتر روی پروژه دارند.
برای مثال در CursorBench 4.0 که روی Taskهای طولانی برنامهنویسی تمرکز دارد، نتایج رسمی منتشرشده به شکل زیر است:
| مدل | امتیاز CursorBench 4.0 |
|---|---|
| Grok 4.7 | 46.3% |
| Grok 4.6 | 40.4% |
| GPT-5.6 Sol | 41.7% |
| Fable 5.1 | 51.8% |
در این تست Grok 4.7 از Grok 4.6 و GPT-5.6 Sol جلوتر قرار گرفته، اما Fable 5.1 همچنان امتیاز بالاتری دارد.
آیا Grok 4.7 از GPT-5.6 Sol بهتر است؟
پاسخ کوتاه این است: در بعضی Benchmarkها بله و در بعضی دیگر خیر.
در جدول رسمی xAI، Grok 4.7 در چند تست مهم از GPT-5.6 Sol جلو افتاده است.
برای مثال:
| Benchmark | Grok 4.7 | GPT-5.6 Sol |
|---|---|---|
| CursorBench 4.0 | 46.3% | 41.7% |
| Terminal-Bench 4.0 | 38.0% | 37.3% |
| EEBench | 64.0% | 39.4% |
| Harvey Legal Agent Benchmark | 19.6% | 2.5% |
| HealthBench Professional | 56.7% | 60.5% |
در مقابل، GPT-5.6 Sol در برخی تستها مانند DeepSWE و HealthBench Professional نتیجه بهتری ثبت کرده است.
بنابراین جمله «Grok 4.7 از GPT-5.6 Sol بهتر است» بیش از حد کلی است.
عبارت دقیقتر این است:
Grok 4.7 در بعضی وظایف مهندسی، Agentic و Knowledge Work از GPT-5.6 Sol جلوتر قرار گرفته، اما برتری آن در تمام حوزهها ثابت نیست.
مقایسه Grok 4.7 با Fable 5.1
مقایسه با Fable 5.1 حتی پیچیدهتر است.
Fable 5.1 هنوز در تعدادی از Benchmarkهای مهم عملکرد بهتری دارد.
برای مثال:
- در CursorBench 4.0، Fable 5.1 جلوتر است.
- در AA Briefcase، Fable 5.1 کمی بالاتر قرار دارد.
- در Terminal-Bench 4.0 اختلاف قابل توجهی به نفع Fable وجود دارد.
- در HealthBench Professional نیز Fable امتیاز بیشتری دارد.
اما Grok 4.7 در بعضی تستهای دیگر مانند EEBench، DeepSWE و Harvey Legal Agent Benchmark نتیجه بسیار رقابتی یا بهتری ثبت کرده است.
در نتیجه بهتر است Grok 4.7 را نه «قویترین مدل در همهچیز»، بلکه یکی از مدلهای Frontier بسیار رقابتی مخصوصاً از نظر Price-to-Performance بدانیم.
نکته مهم درباره Benchmarkها
اعداد منتشرشده در صفحه معرفی Grok 4.7 عمدتاً توسط خود xAI گزارش شدهاند.
این موضوع به معنی غلط بودن نتایج نیست، اما Benchmarkهای مستقل میتوانند تصویر دقیقتری از عملکرد واقعی مدل ارائه کنند.
علاوه بر این، نتیجه مدلها میتواند به مواردی مانند:
- Reasoning Effort
- Harness مورد استفاده
- مقدار Context
- Tool Access
- روش ارزیابی
وابسته باشد.
بنابراین هنگام مقایسه مدلها بهتر است فقط به یک عدد یا یک جدول اکتفا نکنیم.
یکی از نقاط قوت Grok 4.7؛ Electrical Engineering
یکی از جالبترین نتایج نسخه جدید مربوط به EEBench است.
این Benchmark وظایف مربوط به Electrical Engineering را بررسی میکند.
نتیجه رسمی:
- Grok 4.7: 64.0%
- Grok 4.6: 53.0%
- GPT-5.6 Sol: 39.4%
- Fable 5.1: 56.4%
در این تست Grok 4.7 بالاترین امتیاز جدول را کسب کرده است.
پیشرفت بزرگ در کارهای Terminal
یکی دیگر از تغییرات قابل توجه، عملکرد در Terminal-Bench 4.0 است.
امتیاز Grok از:
20.3% در Grok 4.6
به:
38.0% در Grok 4.7
رسیده است.
این جهش نشان میدهد xAI تمرکز زیادی روی Agentهایی داشته که باید مدت بیشتری داخل Terminal کار کنند.
البته Fable 5.1 در جدول رسمی همین Benchmark با امتیاز 57.9 درصد همچنان فاصله قابل توجهی دارد.
Grok 4.7 برای ساخت اسناد و پاورپوینت هم بهتر شده است
یکی از بخشهای جالب معرفی رسمی xAI این است که Grok 4.7 فقط برای Coding بهینه نشده.
شرکت اعلام کرده مدل در ایجاد:
- Document
- Presentation
- گزارشهای حرفهای
- کارهای چندمرحلهای اداری
نیز عملکرد بهتری نسبت به نسل قبل دارد.
این حوزه از طریق Benchmarkهایی مثل GDPval و AA Briefcase ارزیابی شده که وظایف مشابه کارهای واقعی افراد حرفهای را شامل میشوند.
مدل حالا بهتر کار خودش را بررسی میکند
یکی از مهمترین مشکلات مدلهای Agentic این است که ممکن است یک مسیر اشتباه را انتخاب کنند و بدون بررسی نتیجه ادامه دهند.
xAI میگوید Grok 4.7 بیشتر برای Self-Verification آموزش دیده است.
یعنی مدل باید بهتر بتواند:
- خروجی خودش را بررسی کند،
- متوجه خطا شود،
- نتیجه تست را تحلیل کند،
- و در صورت نیاز راهحل خود را اصلاح کند.
این ویژگی برای Coding Agentها بسیار مهمتر از یک Benchmark ساده سؤال و جواب است.
قیمت Grok 4.7 چقدر است؟
یکی از مهمترین نقاط قوت Grok 4.7 قیمت آن است.
برای Promptهایی با کمتر از 200 هزار توکن، قیمت API به شکل زیر اعلام شده است:
- Input: 2 دلار به ازای هر یک میلیون توکن
- Cached Input: 0.50 دلار به ازای هر یک میلیون توکن
- Output: 6 دلار به ازای هر یک میلیون توکن
برای Promptهای بزرگتر از 200 هزار توکن، قیمت افزایش پیدا میکند:
- Input: 4 دلار
- Cached Input: 1 دلار
- Output: 12 دلار
همین موضوع باعث شده Grok 4.7 از نظر قیمت در مقایسه با بعضی مدلهای Frontier جایگاه جذابی داشته باشد.
Reasoning Effort در Grok 4.7
Grok 4.7 از چند سطح مختلف Reasoning پشتیبانی میکند:
- Low
- Medium
- High
- xHigh
سطح پیشفرض High است.
برای کارهای سادهتر میتوان Reasoning پایینتر را انتخاب کرد و برای پروژههای پیچیدهتر از xHigh استفاده کرد.
البته Reasoning بیشتر معمولاً به معنی مصرف Token بیشتر و زمان بیشتر برای رسیدن به نتیجه است.
Grok 4.7 Fast چیست؟
xAI علاوه بر مدل اصلی، نسخه سریعتری با نام Grok 4.7 Fast نیز ارائه میکند.
طبق اطلاعات رسمی، این Variant تقریباً دو برابر Output Speed دارد اما هزینه Token آن نیز دو برابر است.
نسخه Fast در حال حاضر از طریق Cursor و Grok Build ارائه میشود و روی API عمومی xAI در دسترس نیست.
Grok 4.7 را از کجا میتوان استفاده کرد؟
طبق اعلام رسمی، مدل از مسیرهای مختلف در دسترس است:
- Grok API
- Grok Build
- Cursor
- برخی Coding Harnessها
- Model Routerها و پلتفرمهای Cloud
Model ID آن در API:
grok-4.7
است.
آیا 500K Context یعنی یک پروژه کامل را میتوان به Grok داد؟
در بسیاری از پروژهها بله، اما موضوع کمی پیچیدهتر است.
Context بزرگتر کمک میکند فایلها و بخش بیشتری از پروژه همزمان در اختیار مدل قرار بگیرند؛ اما قرار دادن کل Repository داخل Prompt همیشه بهترین روش نیست.
برای پروژههای بزرگتر هنوز استفاده از:
- File Search
- Agent Tools
- Repository Indexing
- Context Selection
میتواند کارآمدتر باشد.
یعنی Context بزرگتر ابزار بسیار خوبی است، اما جای مدیریت هوشمند Context را نمیگیرد.
Grok 4.7 برای چه کسانی جذابتر است؟
با توجه به مشخصات فعلی، نسخه جدید مخصوصاً برای این گروهها جذاب است:
- توسعهدهندگان نرمافزار
- تیمهای Engineering
- کاربران Cursor
- سازندگان AI Agent
- تحلیلگران اسناد
- تیمهای Knowledge Work
- کسبوکارهایی که حجم بالایی Token مصرف میکنند
آیا باید از مدل قبلی به Grok 4.7 مهاجرت کرد؟
اگر از Grok 4.6 استفاده میکنید، نسخه جدید تقریباً در تمام Benchmarkهای رسمی نمایشدادهشده نسبت به نسل قبلی پیشرفت کرده است.
در عین حال قیمت پایه آن نیز در همان محدوده باقی مانده است.
بنابراین برای Workflowهایی که از Grok استفاده میکنند، تست Grok 4.7 منطقی است.
اما برای پروژه Production بهتر است قبل از مهاجرت کامل:
- کیفیت خروجی را روی Dataset واقعی خودتان تست کنید،
- Latency را اندازه بگیرید،
- مصرف Token را مقایسه کنید،
- و هزینه واقعی هر Task را محاسبه کنید.
جمعبندی؛ Grok 4.7 چقدر مهم است؟
Grok 4.7 یک ارتقای قابل توجه برای خانواده مدلهای xAI محسوب میشود.
Base Model بزرگتر، آموزش طولانیتر روی Taskهای چندساعته، Self-Verification بهتر و Context Window برابر با 500 هزار توکن باعث شده مدل بیشتر از قبل برای پروژههای واقعی و Agentic مناسب باشد.
در بعضی Benchmarkها Grok 4.7 حتی از GPT-5.6 Sol و Fable 5.1 جلوتر قرار میگیرد، اما نتایج نشان نمیدهند که این مدل در تمام حوزهها قویترین گزینه بازار باشد.
شاید مهمترین ویژگی Grok 4.7 نه «قویترین بودن»، بلکه ترکیب این سه مورد باشد:
قدرت بالا + Context بزرگ + قیمت رقابتی
و همین ترکیب میتواند Grok 4.7 را به یکی از گزینههای جدی برای برنامهنویسان، سازندگان Agent و تیمهایی تبدیل کند که با حجم زیادی از اسناد و کد سروکار دارند.
اخبار هوش مصنوعی در معین گیفت
در معین گیفت جدیدترین مدلها، ابزارها و سرویسهای هوش مصنوعی را بررسی میکنیم و سعی میکنیم فراتر از تیترهای تبلیغاتی، Benchmarkها، قیمت و کاربرد واقعی آنها را مقایسه کنیم.