چهار آزمایشگاه برجسته هوش مصنوعی (AI) در بازهای سههفتهای در ژوئیه ۲۰۲۶ مدلهای زبانی مرزی را منتشر کردند و شکاف میان آنچه این سیستمها بدون دخالت انسان به پایان میرسانند و آنچه پیشتر وجود داشت، بهطور محسوسی کاهش یافته است.
غولهای هوش مصنوعی در عرض ۳ هفته ۴ مدل پیشرو را منتشر کردند؛ رقابت وارد فاز شتابگرفته شد

نکات کلیدی
- xAI در ۸ ژوئیه Grok 4.5 را با قیمت ۲/۶ دلار بهازای هر یک میلیون توکن عرضه کرد و قیمتگذاری Opus 4.8 را بیش از ۶۰٪ پایینتر زد.
- Anthropic در ۲۴ ژوئیه Claude Opus 5 را بهعنوان مدل پیشفرض جدید در اشتراکهای Claude Max منتشر کرد.
- Moonshot AI مدل Kimi K3 را منتشر کرد؛ بزرگترین مدل این شرکت با ۲.۸ تریلیون پارامتر.
Grok 4.5 از xAI، Claude Opus 5 از Anthropic، خانواده GPT-5.6 از OpenAI و Kimi K3 از Moonshot AI همگی یک مسئله را هدف میگیرند: واداشتن یک سیستم هوش مصنوعی به انجام یک کار چندساعته—از پژوهش تا کدنویسی تا گزارشدهی ساختیافته—بدون اینکه مسیر برنامه را گم کند.
Grok 4.5 با نشستهای واقعی توسعهدهندگان آموزش میبیند
xAI در ۸ ژوئیه Grok 4.5 را منتشر کرد. این مدل بر پایهای با ۱.۵ تریلیون پارامتر اجرا میشود و تا حدی با دادههای واقعی استفاده از Cursor آموزش دیده است؛ پلتفرم کدنویسیای که SpaceXAI اوایل امسال آن را خریداری کرد. قیمتگذاری برابر است با ۲ دلار بهازای هر یک میلیون توکن ورودی و ۶ دلار بهازای هر یک میلیون توکن خروجی، با پنجره زمینه ۵۰۰,۰۰۰ توکنی.

ایلان ماسک Grok 4.5 را توصیف کرد بهعنوان مدلی در کلاس Opus که سریعتر و با هزینه کمتر اجرا میشود. رهگیرهای مستقل آن را در رتبه چهارم «شاخص هوش Artificial Analysis» قرار میدهند؛ بالاتر از هر مدل متنبازِ وزندار، با قیمتگذاریای بیش از ۶۰٪ پایینتر از Claude Opus 4.8 و GPT-5.5. در Terminal-Bench 2.1—آزمایشی که امتیاز میدهد یک مدل تا چه حد وظایف مهندسی خط فرمان را کامل میکند—Grok 4.5 امتیاز ۸۳.۳٪ را کسب کرد.
تغییر بزرگتر، کارایی توکن است. xAI میگوید این مدل برای وظایف مشابه، تقریباً به یکپنجم توکنهای خروجیای نیاز دارد که Opus 4.8 لازم داشت؛ چیزی که هزینه اجرای نشستهای طولانی عاملمحور را کاهش میدهد.
Claude Opus 5 در قیمت، خط را نگه میدارد
Anthropic در ۲۴ ژوئیه Claude Opus 5 را منتشر کرد و آن را بهعنوان مدلی معرفی کرد که به عملکرد Claude Fable 5—توانمندترین عرضه شرکت—نزدیک میشود، با نصف قیمتگذاری ورودی ۱۰ دلاری و خروجی ۵۰ دلاریِ Fable. خود Opus 5 همان قیمتگذاری ۵ دلار ورودی و ۲۵ دلار خروجیِ مدل قبلیاش، Opus 4.8، را حفظ میکند.

این مدل با پنجره زمینه ۱ میلیون توکنی، حداکثر ۱۲۸,۰۰۰ توکن خروجی، و یک تنظیم «میزان تلاش استدلال» قابلتنظیم عرضه میشود که از حالت low تا حالت جدید xhigh را پوشش میدهد. Anthropic میگوید Opus 5 رکوردهای تازهای در Frontier-Bench و GDPval-AA—دو ارزیابی برای کدنویسی و کار دانشی—ثبت میکند، هرچند در وظایف امنیت سایبری از مدل محدودشده Claude Mythos 5 عقبتر است. Opus 5 اکنون مدل پیشفرض در Claude Max و قویترین گزینه در Claude Pro است.
OpenAI، GPT-5.6 را به سه رده تقسیم میکند
OpenAI در ۹ ژوئیه GPT-5.6 را به دسترسی عمومی منتقل کرد؛ پس از یک پیشنمایش دو هفتهای که به حدود ۲۰ سازمانِ راستیآزماییشده توسط دولت آمریکا محدود بود و در پی یک فرمان اجرایی مرتبط با بازبینی ایمنی مدلهای مرزی انجام شد. این خانواده در سه رده عرضه میشود: Sol، پرچمدار، با قیمت ۵ دلار ورودی و ۳۰ دلار خروجی بهازای هر یک میلیون توکن؛ Terra، مدل میانرده با قیمت ۲.۵۰ و ۱۵ دلار که OpenAI میگوید با نصف هزینه، با GPT-5.5 برابری میکند؛ و Luna، رده سریع و کمهزینه با قیمت ۱ و ۶ دلار.

OpenAI گزارش میدهد Sol در «شاخص عامل کدنویسی Artificial Analysis» پیشتاز است و در Terminal-Bench 2.1 به ۸۸.۸٪ میرسد؛ و زمانی که مدل در حالت جدید ultra چهار زیرعامل را بهصورت موازی اجرا میکند، این عدد به ۹۱.۹٪ افزایش مییابد. هر سه رده، بالاترین رتبه ریسک داخلی OpenAI را از نظر پتانسیل سوءاستفاده سایبری و زیستی دارند؛ موضوعی که در دوره پیشنمایشِ محدود به دولت، بازبینیهای اضافی را فعال کرد.
Kimi K3 مدلهای متنبازِ وزندار را به سمت مرز پیش میبرد
Moonshot AI در ۱۶ ژوئیه Kimi K3 را منتشر کرد؛ یک مدل «ترکیب متخصصها» با ۲.۸ تریلیون پارامتر که در مجموع ۸۹۶ متخصص دارد و در هر وظیفه ۱۶ متخصص فعال میشوند. این مدل دارای پنجره زمینه ۱ میلیون توکنی و ورودی چندوجهیِ بومی است، با قیمت API برابر با ۳ دلار ورودی و ۱۵ دلار خروجی بهازای هر یک میلیون توکن. Moonshot متعهد شده است تا ۲۷ ژوئیه وزنهای کامل متنباز را منتشر کند.

K3 بزرگترین مدل متنبازِ وزندارِ منتشرشده تا امروز است؛ حدود ۷۵٪ بزرگتر از بزرگترین مدل متنبازِ پیشین که بهطور گسترده استفاده میشد. رهگیرهای مستقل، K3 را در میان سیستمهای مرزی کنونی در رتبه چهارم قرار میدهند؛ پشتِ Claude Fable 5 و GPT-5.6 Sol، اما جلوتر از Claude Opus 4.8.
چرا شکاف با مدلهای قدیمیتر مهم است
پنجرههای زمینه کمتر از ۲۰۰,۰۰۰ توکن، زمانی توسعهدهندگان را مجبور میکردند پایگاههای کد بزرگ یا بستههای پژوهشی را به تکهها تقسیم کنند. اکنون هر مدل در این گروه با ۵۰۰,۰۰۰ توکن یا بیشتر اجرا میشود و سه مورد از چهار مدل به ۱ میلیون میرسند؛ بهطوری که یک نشست واحد میتواند یک مخزن کامل یا مجموعهای از اسناد منبعِ اولیه را در خود نگه دارد.
قابلیت اتکای عاملها نیز تغییر کرده است. سیستمهای دوره ۲۰۲۳ و ۲۰۲۴ اغلب پس از چند فراخوانی ابزار، برنامه خود را از دست میدادند. مدلهای منتشرشده در این ماه برای حفظ دهها گام هماهنگ ساخته شدهاند و وقتی یک فراخوانی ابزار داده بد برمیگرداند، بهجای از کار افتادن، بازیابی میکنند.
برای توسعهدهندگان، اثر عملی این روند، هزینه کمتر بهازای کارِ بهپایانرسیده است، نه الزاماً سقف بالاتر در هر بنچمارک منفرد. کنترلهای تلاش در Opus 5، قیمتگذاری پلهای در GPT-5.6 و ادعاهای کارایی پشت Grok 4.5 همگی به یک هدف اشاره دارند: اینکه تیمها بتوانند انتخاب کنند هر کار چقدر محاسبه (compute) میارزد، بهجای اینکه برای هر درخواست، قیمت پرچمدار پرداخت کنند.
برای شرکتها و سیاستگذاران، عرضه محدود به دولتِ GPT-5.6 نشان میدهد که نظارت اکنون در برنامههای انتشار بزرگترین مدلها تعبیه شده است، نه اینکه بعداً به آن اضافه شود. تعلیق کوتاهمدتِ Anthropic، یعنی تعلیقِ هدایتشده توسط دولتِ دسترسی به Fable و Mythos در ژوئن، نسخهای پیشین از همین الگو بود.
این مقاله با استفاده از هوش مصنوعی از انگلیسی ترجمه شده است. نسخه اصلی انگلیسی منبع معتبر است؛ ترجمههای خودکار ممکن است حاوی نادرستیهایی باشند، بهویژه در اصطلاحات حقوقی و قانونی.

















