Sağlayan
Technology

Yapay Zeka Devleri, Yarışın Hız Kazanmasıyla 3 Hafta İçinde 4 Öncü Modeli Piyasaya Sürdü

2026 yılının Temmuz ayında, üç haftalık bir süre içinde dört önde gelen yapay zeka (AI) laboratuvarı çığır açan dil modellerini piyasaya sürdü ve bu sistemlerin insan müdahalesi olmaksızın başardıkları ile önceki sistemler arasındaki fark önemli ölçüde azaldı.

PAYLAŞ
Yapay Zeka Devleri, Yarışın Hız Kazanmasıyla 3 Hafta İçinde 4 Öncü Modeli Piyasaya Sürdü

Önemli Noktalar

  • xAI, 8 Temmuz'da Grok 4.5'i milyon token başına 2/6 dolar fiyatla piyasaya sürdü ve Opus 4.8'in fiyatını %60'ın üzerinde geride bıraktı.
  • Anthropic, 24 Temmuz'da Claude Max abonelikleri için yeni varsayılan model olarak Claude Opus 5'i piyasaya sürdü.
  • Moonshot AI, 2,8 trilyon parametreye sahip en büyük modeli olan Kimi K3'ü yayınladı.

xAI'nin Grok 4.5'i, Anthropic'in Claude Opus 5'i, OpenAI'nin GPT-5.6 ailesi ve Moonshot AI'nin Kimi K3'ü, hepsi aynı sorunu hedefliyor: Bir AI sisteminin, planını kaybetmeden araştırmadan kodlamaya ve yapılandırılmış raporlamaya kadar uzanan saatler süren bir görevi yerine getirmesini sağlamak.

Grok 4.5, Gerçek Geliştirici Oturumları Üzerinde Eğitildi

xAI, 8 Temmuz’da Grok 4.5’i piyasaya sürdü. Model, 1,5 trilyon parametrelik bir temele dayanıyor ve kısmen, SpaceXAI’nin bu yılın başlarında satın aldığı kodlama platformu Cursor’dan elde edilen gerçek kullanım verileriyle eğitildi. Fiyatlandırma, 500.000 tokenlik bir bağlam penceresi ile giriş tokeni başına 2 dolar ve çıkış tokeni başına 6 dolar olarak belirlenmiştir.

Elon X post screenshot.
Elon, 8 Temmuz 2026'da Grok 4.5'in piyasaya sürülmesini tartışıyor.

Elon Musk, Grok 4.5'i daha hızlı ve daha düşük maliyetle çalışan bir Opus sınıfı model olarak tanımladı. Bağımsız izleme kuruluşları, bu modeli Yapay Analiz Zekası Endeksi'nde dördüncü sıraya yerleştiriyor; model, tüm açık ağırlıklı modellerin önünde yer alırken, fiyatı Claude Opus 4.8 ve GPT-5.5'ten %60'tan fazla daha düşük. Bir modelin komut satırı mühendislik görevlerini ne kadar iyi tamamladığını puanlayan Terminal-Bench 2.1 testinde, Grok 4.5 %83,3 puan aldı.

Daha büyük değişiklik ise token verimliliğinde yaşanıyor. xAI, modelin benzer görevler için Opus 4.8’in ihtiyaç duyduğu çıktı tokenlarının yaklaşık beşte birine ihtiyaç duyduğunu belirtiyor; bu da uzun ajan oturumlarını çalıştırma maliyetini düşürüyor.

Claude Opus 5, Fiyat Konusunda Pozisyonunu Koruyor

Anthropic, 24 Temmuz'da Claude Opus 5'i piyasaya sürdü ve bu modeli, şirketin en yetenekli sürümü olan Claude Fable 5'in performansına yakın bir seviyeye ulaşan, ancak Fable'ın 10 dolarlık giriş ve 50 dolarlık çıkış fiyatının yarısı kadar bir maliyetle sunulan bir model olarak konumlandırdı. Opus 5 ise, önceki sürümü Opus 4.8 ile aynı 5 dolarlık giriş ve 25 dolarlık çıkış fiyatlandırmasına sahip.

Claude X post screenshot.
X üzerinden yapılan Claude Opus 5 duyurusu.

Model, 1 milyon tokenlik bir bağlam penceresi, 128.000 maksimum çıktı tokeni ve düşük seviyeden yeni bir xhigh moduna kadar ayarlanabilen akıl yürütme çabası ayarıyla birlikte sunuluyor. Anthropic, Opus 5'in iki kodlama ve bilgi işleme değerlendirme testi olan Frontier-Bench ve GDPval-AA'da yeni rekorlar kırdığını, ancak siber güvenlik görevlerinde sınırlı erişimli Claude Mythos 5 modelinin gerisinde kaldığını belirtiyor. Opus 5 artık Claude Max'ta varsayılan model ve Claude Pro'da en güçlü seçenek konumunda.

OpenAI, GPT-5.6’yı Üç Seviyeye Ayırdı

OpenAI, sınır modeli güvenlik incelemesiyle ilgili bir başkanlık kararnamesinin ardından, ABD hükümeti tarafından onaylanmış yaklaşık 20 kuruluşla sınırlı iki haftalık ön izleme döneminin ardından, 9 Temmuz'da GPT-5.6'yı genel kullanıma sundu. Bu model ailesi üç kademede sunuluyor: Amiral gemisi olan Sol, milyon token başına 5 dolarlık girdi ve 30 dolarlık çıktı fiyatıyla; OpenAI'nin GPT-5.5 ile eşdeğer olduğunu ancak maliyetinin yarısı kadar olduğunu belirttiği orta seviye model Terra, giriş başına 2,50 dolar ve çıkış başına 15 dolar; ve hızlı, düşük maliyetli bir seviye olan Luna, giriş başına 1 dolar ve çıkış başına 6 dolar.

OpenAI X post screenshot.
X üzerinden yapılan ChatGPT 5.6 Sol duyurusu.

OpenAI, Sol'un Yapay Analiz Kodlama Ajanı Endeksi'nde lider olduğunu ve Terminal-Bench 2.1'de %88,8'e ulaştığını, modelin yeni ultra modunda dört alt ajanı paralel olarak çalıştırdığında bu oranın %91,9'a yükseldiğini bildiriyor. Üç seviye de, siber ve biyolojik kötüye kullanım potansiyeli açısından OpenAI’nin en yüksek iç risk derecesine sahip; bu durum, hükümetin denetimindeki ön izleme aşamasında ek inceleme yapılmasına neden oldu.

Kimi K3, Açık Ağırlıklı Modelleri Sınırlara Taşıyor

Moonshot AI, 16 Temmuz'da toplam 896 uzman ve görev başına 16 aktif uzman içeren, 2,8 trilyon parametreli bir uzman karışımı modeli olan Kimi K3'ü piyasaya sürdü. Model, 1 milyon tokenlik bir bağlam penceresi ve yerel multimodal giriş özelliğine sahiptir; API fiyatlandırması ise milyon token başına 3 dolarlık giriş ve 15 dolarlık çıkış ücretidir. Moonshot, 27 Temmuz'a kadar tam açık ağırlıkları yayınlamayı taahhüt etmiştir.

Kimi Moonshot X post screenshot.
X üzerinden yapılan Kimi K3 duyurusu.

K3, bugüne kadar piyasaya sürülen en büyük açık ağırlıklı modeldir ve daha önce yaygın olarak kullanılan en büyük açık modelden yaklaşık %75 daha büyüktür. Bağımsız izleme kuruluşları, K3'ü mevcut öncü sistemler arasında Claude Fable 5 ve GPT-5.6 Sol'un ardından dördüncü, ancak Claude Opus 4.8'in önünde konumlandırmaktadır.

Eski Modellerle Aradaki Fark Neden Önemli?

200.000 token'ın altındaki bağlam pencereleri, bir zamanlar geliştiricileri büyük kod tabanlarını veya araştırma paketlerini parçalara ayırmaya zorluyordu. Bu gruptaki her model artık 500.000 token veya üzerinde çalışıyor; dördünden üçü 1 milyon token kapasitesine sahip, böylece tek bir oturumda tam bir depo veya bir dizi birincil kaynak belgesi tutulabiliyor.

Ajan güvenilirliği de gelişme kaydetmiştir. 2023 ve 2024 dönemine ait sistemler, genellikle birkaç araç çağrısından sonra planlarını yitirirdi. Bu ay piyasaya sürülen modeller, düzinelerce koordineli adımı sürdürebilecek ve bir araç çağrısı hatalı veri döndürdüğünde durmak yerine toparlanabilecek şekilde tasarlanmıştır.

Geliştiriciler açısından pratik etki, herhangi bir tek bir benchmarkta daha yüksek bir tavan değerinden ziyade, tamamlanan görev başına daha düşük bir maliyet anlamına geliyor. Opus 5’teki çaba kontrolleri, GPT-5.6’daki kademeli fiyatlandırma ve Grok 4.5’in arkasındaki verimlilik iddiaları aynı hedefe işaret ediyor: ekiplerin her istek için en üst düzey fiyatlar ödemek yerine, bir görevin ne kadar hesaplama gücü gerektirdiğini seçmelerine olanak sağlamak.

Kurumlar ve politika yapıcılar açısından, GPT-5.6’nın hükümet denetiminde piyasaya sürülmesi, en büyük modellerin sürüm takvimlerine denetimin artık önceden entegre edildiğini, sonradan eklenmediğini gösteriyor. Anthropic’in Haziran ayında Fable ve Mythos erişimini hükümetin talimatıyla kısa süreliğine askıya alması, aynı modelin daha önceki bir örneğiydi.

Bu makale yapay zeka kullanılarak İngilizceden çevrilmiştir. Orijinal İngilizce sürüm yetkili kaynaktır; otomatik çeviriler, özellikle hukuki ve düzenleyici terminolojide hatalar içerebilir.