Empat laboratorium kecerdasan buatan (AI) terkemuka meluncurkan model bahasa terdepan dalam rentang waktu tiga minggu pada Juli 2026, dan selisih antara hasil yang dicapai sistem-sistem ini tanpa campur tangan manusia dengan pencapaian sebelumnya telah menyempit secara drastis.
Raksasa-raksasa AI Meluncurkan 4 Model Terdepan dalam 3 Minggu Saat Persaingan Memasuki Tahap Puncak

Poin Utama
- xAI meluncurkan Grok 4.5 pada 8 Juli dengan harga $2/$6 per juta token, yang lebih murah lebih dari 60% dibandingkan harga Opus 4.8.
- Anthropic merilis Claude Opus 5 pada 24 Juli sebagai model default baru untuk langganan Claude Max.
- Moonshot AI merilis Kimi K3, model terbesarnya dengan 2,8 triliun parameter.
Grok 4.5 dari xAI, Claude Opus 5 dari Anthropic, keluarga GPT-5.6 dari OpenAI, dan Kimi K3 dari Moonshot AI masing-masing menargetkan masalah yang sama: membuat sistem AI mampu menangani tugas berjam-jam, mulai dari riset hingga pemrograman hingga pelaporan terstruktur, tanpa kehilangan fokus pada rencana.
Grok 4.5 Dilatih Menggunakan Sesi Pengembang Nyata
xAI merilis Grok 4.5 pada 8 Juli. Model ini beroperasi dengan basis 1,5 triliun parameter dan sebagian dilatih menggunakan data penggunaan nyata dari Cursor, platform pemrograman yang diakuisisi SpaceXAI awal tahun ini. Harga ditetapkan sebesar $2 per juta token masukan dan $6 per juta token keluaran, dengan jendela konteks sebesar 500.000 token.

Elon Musk menggambarkan Grok 4.5 sebagai model kelas Opus yang berjalan lebih cepat dan dengan biaya lebih rendah. Pelacak independen menempatkannya di peringkat keempat pada Indeks Kecerdasan Analisis Buatan (Artificial Analysis Intelligence Index), di atas semua model open-weight, dengan harga lebih dari 60% lebih rendah dibandingkan Claude Opus 4.8 dan GPT-5.5. Pada Terminal-Bench 2.1, sebuah tes yang menilai seberapa baik suatu model menyelesaikan tugas-tugas rekayasa baris perintah, Grok 4.5 meraih skor 83,3%.
Perubahan yang lebih signifikan terletak pada efisiensi token. xAI menyatakan bahwa model ini hanya membutuhkan sekitar seperlima dari jumlah token keluaran yang dibutuhkan Opus 4.8 untuk tugas-tugas serupa, sehingga menurunkan biaya menjalankan sesi agen yang panjang.
Claude Opus 5 Tetap Mempertahankan Harganya
Anthropic merilis Claude Opus 5 pada 24 Juli, memposisikannya sebagai model yang mendekati kinerja Claude Fable 5—rilis paling canggih perusahaan tersebut—dengan harga setengah dari Fable, yaitu $10 untuk input dan $50 untuk output. Opus 5 sendiri memiliki harga yang sama dengan pendahulunya, Opus 4.8, yaitu $5 untuk input dan $25 untuk output.

Model ini dilengkapi dengan jendela konteks 1 juta token, output maksimum 128.000 token, dan pengaturan tingkat upaya penalaran yang dapat disesuaikan, mulai dari tingkat rendah hingga mode xhigh yang baru. Anthropic menyatakan bahwa Opus 5 mencetak rekor baru pada Frontier-Bench dan GDPval-AA, dua evaluasi pemrograman dan pekerjaan berbasis pengetahuan, meskipun kinerjanya masih di bawah model Claude Mythos 5 yang dibatasi pada tugas-tugas keamanan siber. Opus 5 kini menjadi model default di Claude Max dan opsi terkuat di Claude Pro.
OpenAI Membagi GPT-5.6 Menjadi Tiga Tingkatan
OpenAI meluncurkan GPT-5.6 untuk umum pada 9 Juli setelah masa pratinjau selama dua minggu yang terbatas pada sekitar 20 organisasi yang telah diverifikasi oleh pemerintah AS, menyusul perintah eksekutif terkait tinjauan keamanan model terdepan. Keluarga model ini tersedia dalam tiga tingkatan: Sol, sebagai model andalan, dengan harga $5 untuk input dan $30 untuk output per juta token; Terra, model tingkat menengah dengan tarif $2,50 dan $15 yang menurut OpenAI setara dengan GPT-5.5 dengan biaya setengahnya; dan Luna, tingkatan yang cepat dan berbiaya rendah dengan tarif $1 dan $6.

OpenAI melaporkan bahwa Sol memimpin Indeks Agen Pengkodean Analisis Buatan (Artificial Analysis Coding Agent Index) dan mencapai skor 88,8% pada Terminal-Bench 2.1, naik menjadi 91,9% saat model tersebut menjalankan empat sub-agen secara paralel di bawah mode ultra barunya. Ketiga tingkatan tersebut memiliki peringkat risiko internal tertinggi dari OpenAI terkait potensi penyalahgunaan siber dan biologis, yang memicu tinjauan tambahan selama pratinjau yang dibatasi oleh pemerintah.
Kimi K3 Mendorong Model Bobot Terbuka Menuju Batas Terdepan
Moonshot AI merilis Kimi K3 pada 16 Juli, sebuah model campuran ahli (Mixture of Experts) dengan 2,8 triliun parameter, yang terdiri dari total 896 ahli dan 16 ahli aktif per tugas. Model ini memiliki jendela konteks 1 juta token dan input multimodal bawaan, dengan harga API sebesar $3 untuk input dan $15 untuk output per juta token. Moonshot telah berkomitmen untuk mempublikasikan bobot terbuka secara penuh pada 27 Juli.

K3 adalah model bobot terbuka terbesar yang dirilis hingga saat ini, kira-kira 75% lebih besar daripada model terbuka terbesar sebelumnya yang digunakan secara luas. Pelacak independen menempatkan K3 di urutan keempat di antara sistem terdepan saat ini, di belakang Claude Fable 5 dan GPT-5.6 Sol, tetapi di depan Claude Opus 4.8.
Mengapa Kesenjangan dengan Model Lama Penting
Jendela konteks di bawah 200.000 token dulu memaksa pengembang untuk memecah basis kode besar atau paket penelitian menjadi fragmen-fragmen. Setiap model dalam kelompok ini kini berjalan pada 500.000 token atau lebih, dengan tiga dari empat model mencapai 1 juta token, sehingga satu sesi dapat menampung repositori lengkap atau tumpukan dokumen sumber utama.
Keandalan agen juga telah meningkat. Sistem dari periode 2023 dan 2024 sering kali kehilangan rencana setelah beberapa panggilan alat. Model yang dirilis bulan ini dirancang untuk mempertahankan puluhan langkah terkoordinasi dan pulih ketika panggilan alat mengembalikan data yang buruk, alih-alih terhenti.
Bagi para pengembang, dampak praktisnya adalah biaya per tugas yang diselesaikan menjadi lebih rendah, bukan batas atas yang lebih tinggi pada satu tolok ukur tertentu. Kontrol upaya di Opus 5, penetapan harga berjenjang di GPT-5.6, dan klaim efisiensi di balik Grok 4.5 mengarah pada tujuan yang sama: memungkinkan tim memilih seberapa banyak daya komputasi yang layak untuk suatu tugas, alih-alih membayar harga model unggulan untuk setiap permintaan.
Bagi perusahaan dan pembuat kebijakan, peluncuran GPT-5.6 yang dibatasi oleh pemerintah menandakan bahwa pengawasan kini sudah terintegrasi ke dalam jadwal rilis model-model terbesar, bukan ditambahkan setelahnya. Penangguhan sementara akses ke Fable dan Mythos oleh Anthropic pada bulan Juni atas arahan pemerintah merupakan versi awal dari pola yang sama.
Artikel ini diterjemahkan dari bahasa Inggris menggunakan AI. Versi asli berbahasa Inggris adalah sumber yang berwenang; terjemahan otomatis dapat mengandung ketidakakuratan, terutama dalam terminologi hukum dan peraturan.

















