Dikuasakan oleh
Technology

Gergasi AI Melancarkan 4 Model Perintis dalam 3 Minggu ketika Perlumbaan Memasuki Fasa Pecutan Penuh

Empat makmal kecerdasan buatan (AI) berprofil tinggi melancarkan model bahasa peringkat frontier dalam tempoh tiga minggu pada Julai 2026, dan jurang antara apa yang sistem ini dapat siapkan tanpa campur tangan manusia dan apa yang wujud sebelum ini telah mengecil dengan ketara.

DITULIS OLEH
KONGSI
Gergasi AI Melancarkan 4 Model Perintis dalam 3 Minggu ketika Perlumbaan Memasuki Fasa Pecutan Penuh

Intipati Utama

  • xAI melancarkan Grok 4.5 pada 8 Julai pada harga $2/$6 bagi setiap sejuta token, menewaskan harga Opus 4.8 lebih 60% lebih murah.
  • Anthropic melancarkan Claude Opus 5 pada 24 Julai sebagai model lalai baharu untuk langganan Claude Max.
  • Moonshot AI menerbitkan Kimi K3, model terbesarnya dengan 2.8 trilion parameter.

Grok 4.5 daripada xAI, Claude Opus 5 daripada Anthropic, keluarga GPT-5.6 daripada OpenAI, dan Kimi K3 daripada Moonshot AI masing-masing menyasarkan masalah yang sama: menjadikan sistem AI mampu menjalankan tugasan berjam-jam, daripada penyelidikan ke pengekodan hingga pelaporan berstruktur, tanpa hilang jejak pelan.

Grok 4.5 Dilatih Menggunakan Sesi Pembangun Sebenar

xAI melancarkan Grok 4.5 pada 8 Julai. Model ini berjalan pada asas 1.5 trilion parameter dan dilatih sebahagiannya menggunakan data penggunaan sebenar daripada Cursor, platform pengekodan yang SpaceXAI peroleh awal tahun ini. Harganya ialah $2 bagi setiap sejuta token input dan $6 bagi setiap sejuta token output, dengan tetingkap konteks 500,000 token.

Elon X post screenshot.
Elon membincangkan pelancaran Grok 4.5 pada 8 Julai 2026.

Elon Musk menggambarkan Grok 4.5 sebagai model kelas Opus yang berjalan lebih pantas dan pada kos lebih rendah. Penjejak bebas meletakkannya di tempat keempat dalam Artificial Analysis Intelligence Index, mendahului setiap model berat terbuka, pada harga lebih 60% lebih rendah daripada Claude Opus 4.8 dan GPT-5.5. Pada Terminal-Bench 2.1, ujian yang menilai sejauh mana model melengkapkan tugasan kejuruteraan baris arahan, Grok 4.5 mencatat 83.3%.

Perubahan yang lebih besar ialah kecekapan token. xAI mengatakan model ini memerlukan kira-kira satu perlima token output yang diperlukan Opus 4.8 untuk tugasan setara, yang menurunkan kos menjalankan sesi ejen yang panjang.

Claude Opus 5 Mengekalkan Harga

Anthropic melancarkan Claude Opus 5 pada 24 Julai, memposisikannya sebagai model yang hampir mencapai prestasi Claude Fable 5, keluaran paling berkeupayaan syarikat itu, pada separuh daripada harga Fable iaitu $10 untuk input dan $50 untuk output. Opus 5 sendiri mengekalkan harga yang sama seperti pendahulunya, Opus 4.8, iaitu $5 untuk input dan $25 untuk output.

Claude X post screenshot.
Pengumuman Claude Opus 5 melalui X.

Model ini hadir dengan tetingkap konteks 1 juta token, maksimum 128,000 token output, dan tetapan usaha penaakulan boleh laras yang bermula daripada rendah hingga mod xhigh baharu. Anthropic berkata Opus 5 mencatat penanda aras baharu pada Frontier-Bench dan GDPval-AA, dua penilaian kerja pengekodan dan kerja pengetahuan, walaupun ia ketinggalan di belakang model Claude Mythos 5 yang terhad bagi tugasan keselamatan siber. Opus 5 kini menjadi model lalai pada Claude Max dan pilihan paling kuat pada Claude Pro.

OpenAI Membahagikan GPT-5.6 Kepada Tiga Tahap

OpenAI menjadikan GPT-5.6 tersedia secara umum pada 9 Julai selepas pratonton dua minggu yang dihadkan kepada kira-kira 20 organisasi yang disaring oleh kerajaan A.S., susulan perintah eksekutif yang berkaitan dengan semakan keselamatan model frontier. Keluarga ini hadir dalam tiga tahap: Sol, model unggulan, berharga $5 untuk input dan $30 untuk output bagi setiap sejuta token; Terra, model pertengahan pada $2.50 dan $15 yang menurut OpenAI menyamai GPT-5.5 pada separuh kos; dan Luna, tahap pantas kos rendah pada $1 dan $6.

OpenAI X post screenshot.
Pengumuman ChatGPT 5.6 Sol melalui X.

OpenAI melaporkan Sol mendahului Artificial Analysis Coding Agent Index dan mencapai 88.8% pada Terminal-Bench 2.1, meningkat kepada 91.9% apabila model menjalankan empat sub-ejen secara selari di bawah mod ultra baharunya. Ketiga-tiga tahap membawa penarafan risiko dalaman tertinggi OpenAI bagi potensi penyalahgunaan siber dan biologi, yang mencetuskan semakan tambahan semasa pratonton berpalang kerajaan.

Kimi K3 Menolak Model Berat Terbuka Ke Arah Frontier

Moonshot AI melancarkan Kimi K3 pada 16 Julai, model campuran pakar dengan 2.8 trilion parameter, dengan 896 pakar keseluruhan dan 16 aktif bagi setiap tugasan. Model ini membawa tetingkap konteks 1 juta token dan input multimodal natif, dengan harga API $3 untuk input dan $15 untuk output bagi setiap sejuta token. Moonshot telah komited untuk menerbitkan berat terbuka penuh menjelang 27 Julai.

Kimi Moonshot X post screenshot.
Pengumuman Kimi K3 melalui X.

K3 ialah model berat terbuka terbesar yang dilancarkan setakat ini, kira-kira 75% lebih besar daripada model terbuka terbesar yang sebelum ini digunakan secara meluas. Penjejak bebas meletakkan K3 di tempat keempat dalam kalangan sistem frontier semasa, di belakang Claude Fable 5 dan GPT-5.6 Sol tetapi mendahului Claude Opus 4.8.

Mengapa Jurang Dengan Model Lama Itu Penting

Tetingkap konteks di bawah 200,000 token suatu ketika dahulu memaksa pembangun memecahkan pangkalan kod besar atau paket penyelidikan kepada serpihan. Setiap model dalam kumpulan ini kini berjalan pada 500,000 token atau lebih, dengan tiga daripada empat pada 1 juta, membolehkan satu sesi memuatkan keseluruhan repositori atau timbunan dokumen sumber primer.

Kebolehpercayaan ejen turut berubah. Sistem dari tempoh 2023 dan 2024 sering kehilangan pelan mereka selepas beberapa panggilan alat. Model yang dilancarkan bulan ini dibina untuk mengekalkan berpuluh langkah terselaras dan pulih apabila panggilan alat memulangkan data buruk, bukannya terhenti.

Bagi pembangun, kesan praktikalnya ialah kos yang lebih rendah bagi setiap tugasan yang siap, bukannya siling yang lebih tinggi pada mana-mana penanda aras tunggal. Kawalan usaha dalam Opus 5, harga berperingkat dalam GPT-5.6, dan dakwaan kecekapan di sebalik Grok 4.5 semuanya menuju matlamat yang sama: membolehkan pasukan memilih berapa banyak pengiraan yang patut diberikan kepada sesuatu tugasan, bukannya membayar harga unggulan untuk setiap permintaan.

Bagi perusahaan dan pembuat dasar, pelancaran GPT-5.6 yang dipagar kerajaan menandakan bahawa pengawasan kini dibina ke dalam jadual pelancaran untuk model terbesar, bukan ditambah selepas kejadian. Penggantungan ringkas oleh Anthropic yang diarahkan kerajaan terhadap akses Fable dan Mythos pada Jun merupakan versi lebih awal bagi corak yang sama.

Artikel ini telah diterjemahkan daripada bahasa Inggeris menggunakan AI. Versi asal dalam bahasa Inggeris ialah sumber yang berwibawa; terjemahan automatik mungkin mengandungi ketidaktepatan, terutamanya dalam terminologi undang-undang dan kawal selia.