Được cung cấp bởi
Technology

Các “gã khổng lồ” AI ra mắt 4 mô hình tiên phong chỉ trong 3 tuần khi cuộc đua bước vào giai đoạn nước rút

Bốn phòng thí nghiệm trí tuệ nhân tạo (AI) hàng đầu đã công bố các mô hình ngôn ngữ tiên tiến trong vòng ba tuần vào tháng 7 năm 2026, và khoảng cách giữa những gì các hệ thống này có thể hoàn thành mà không cần sự can thiệp của con người so với các mô hình trước đó đã thu hẹp đáng kể.

TÁC GIẢ
CHIA SẺ
Các “gã khổng lồ” AI ra mắt 4 mô hình tiên phong chỉ trong 3 tuần khi cuộc đua bước vào giai đoạn nước rút

Điểm chính

  • xAI đã ra mắt Grok 4.5 vào ngày 8 tháng 7 với mức giá 2–6 USD cho mỗi triệu token, thấp hơn mức giá của Opus 4.8 hơn 60%.
  • Anthropic đã ra mắt Claude Opus 5 vào ngày 24 tháng 7 với tư cách là mô hình mặc định mới cho các gói đăng ký Claude Max.
  • Moonshot AI đã công bố Kimi K3, mô hình lớn nhất của họ với 2,8 nghìn tỷ tham số.

Grok 4.5 của xAI, Claude Opus 5 của Anthropic, dòng GPT-5.6 của OpenAI và Kimi K3 của Moonshot AI đều nhắm đến cùng một vấn đề: giúp hệ thống AI thực hiện một nhiệm vụ kéo dài nhiều giờ, từ nghiên cứu đến lập trình và lập báo cáo có cấu trúc, mà không làm mất phương hướng.

Grok 4.5 được huấn luyện dựa trên các phiên làm việc thực tế của nhà phát triển

xAI đã ra mắt Grok 4.5 vào ngày 8 tháng 7. Mô hình này hoạt động trên nền tảng 1,5 nghìn tỷ tham số và được huấn luyện một phần dựa trên dữ liệu sử dụng thực tế từ Cursor, nền tảng lập trình mà SpaceXAI đã mua lại vào đầu năm nay. Giá dịch vụ là 2 USD cho mỗi triệu token đầu vào và 6 USD cho mỗi triệu token đầu ra, với cửa sổ ngữ cảnh 500.000 token.

Elon X post screenshot.
Elon thảo luận về việc ra mắt Grok 4.5 vào ngày 8 tháng 7 năm 2026.

Elon Musk mô tả Grok 4.5 là một mô hình thuộc lớp Opus, hoạt động nhanh hơn và với chi phí thấp hơn. Các tổ chức theo dõi độc lập xếp mô hình này ở vị trí thứ tư trên Chỉ số Trí tuệ Phân tích Nhân tạo (Artificial Analysis Intelligence Index), đứng trên mọi mô hình mã nguồn mở, với mức giá thấp hơn hơn 60% so với Claude Opus 4.8 và GPT-5.5. Trên Terminal-Bench 2.1, một bài kiểm tra đánh giá mức độ hoàn thành các tác vụ kỹ thuật dòng lệnh của mô hình, Grok 4.5 đạt 83,3%.

Sự thay đổi lớn hơn nằm ở hiệu quả token. xAI cho biết mô hình này chỉ cần khoảng 1/5 số token đầu ra so với Opus 4.8 cho các tác vụ tương đương, giúp giảm chi phí khi chạy các phiên tác nhân kéo dài.

Claude Opus 5 giữ nguyên mức giá

Anthropic đã ra mắt Claude Opus 5 vào ngày 24 tháng 7, định vị nó là mô hình có hiệu suất gần bằng Claude Fable 5 – phiên bản mạnh nhất của công ty – với mức giá chỉ bằng một nửa so với Fable (10 USD cho đầu vào và 50 USD cho đầu ra). Bản thân Opus 5 vẫn giữ mức giá đầu vào 5 USD và đầu ra 25 USD giống như phiên bản tiền nhiệm, Opus 4.8.

Claude X post screenshot.
Thông báo về Claude Opus 5 qua X.

Mô hình này được trang bị cửa sổ ngữ cảnh 1 triệu token, tối đa 128.000 token đầu ra và cài đặt mức độ nỗ lực suy luận có thể điều chỉnh, dao động từ mức thấp đến chế độ xhigh mới. Anthropic cho biết Opus 5 đã thiết lập các mốc mới trên Frontier-Bench và GDPval-AA, hai bài đánh giá về lập trình và công việc tri thức, mặc dù nó vẫn xếp sau mô hình Claude Mythos 5 (phiên bản giới hạn) trong các tác vụ an ninh mạng. Opus 5 hiện là mô hình mặc định trên Claude Max và là tùy chọn mạnh nhất trên Claude Pro.

OpenAI chia GPT-5.6 thành ba cấp độ

OpenAI đã đưa GPT-5.6 vào sử dụng rộng rãi vào ngày 9 tháng 7 sau hai tuần thử nghiệm giới hạn cho khoảng 20 tổ chức được chính phủ Hoa Kỳ kiểm duyệt, theo một sắc lệnh hành pháp liên quan đến việc đánh giá an toàn của các mô hình tiên tiến. Dòng sản phẩm này được phân thành ba cấp độ: Sol, mẫu cao cấp nhất, có giá 5 USD cho đầu vào và 30 USD cho đầu ra trên mỗi triệu token; Terra, mô hình cấp trung với mức giá 2,50 USD và 15 USD mà OpenAI cho biết tương đương với GPT-5.5 nhưng chỉ bằng một nửa chi phí; và Luna, cấp độ nhanh, chi phí thấp với mức giá 1 USD và 6 USD.

OpenAI X post screenshot.
Thông báo về ChatGPT 5.6 Sol qua X.

OpenAI báo cáo rằng Sol dẫn đầu Chỉ số Đại lý Mã hóa Phân tích Trí tuệ Nhân tạo (AACA) và đạt 88,8% trên Terminal-Bench 2.1, tăng lên 91,9% khi mô hình chạy bốn đại lý con song song trong chế độ "ultra" mới. Cả ba gói dịch vụ này đều được OpenAI xếp hạng rủi ro nội bộ cao nhất về khả năng lạm dụng trong lĩnh vực mạng và sinh học, điều này đã dẫn đến việc phải tiến hành đánh giá bổ sung trong giai đoạn thử nghiệm có sự giám sát của chính phủ.

Kimi K3 đẩy các mô hình trọng số mở tiến tới ranh giới mới

Moonshot AI đã ra mắt Kimi K3 vào ngày 16 tháng 7, một mô hình hỗn hợp chuyên gia (Mixture of Experts) với 2,8 nghìn tỷ tham số, bao gồm tổng cộng 896 chuyên gia và 16 chuyên gia hoạt động cho mỗi tác vụ. Mô hình này có cửa sổ ngữ cảnh 1 triệu token và hỗ trợ đầu vào đa phương thức gốc, với mức giá API là 3 USD cho đầu vào và 15 USD cho đầu ra trên mỗi triệu token. Moonshot đã cam kết công bố toàn bộ trọng số mở vào ngày 27 tháng 7.

Kimi Moonshot X post screenshot.
Thông báo về Kimi K3 trên X.

K3 là mô hình trọng số mở lớn nhất được phát hành cho đến nay, lớn hơn khoảng 75% so với mô hình mở lớn nhất được sử dụng rộng rãi trước đó. Các tổ chức theo dõi độc lập xếp K3 ở vị trí thứ tư trong số các hệ thống tiên phong hiện tại, sau Claude Fable 5 và GPT-5.6 Sol nhưng trước Claude Opus 4.8.

Tại sao khoảng cách với các mô hình cũ lại quan trọng

Cửa sổ ngữ cảnh dưới 200.000 token từng buộc các nhà phát triển phải chia nhỏ các cơ sở mã nguồn lớn hoặc các gói nghiên cứu thành các phần nhỏ. Hiện nay, mọi mô hình trong nhóm này đều hoạt động ở mức 500.000 token trở lên, với ba trong số bốn mô hình đạt 1 triệu token, cho phép một phiên làm việc duy nhất chứa toàn bộ kho lưu trữ hoặc một tập hợp các tài liệu nguồn chính.

Độ tin cậy của các tác nhân cũng đã được cải thiện. Các hệ thống từ giai đoạn 2023 và 2024 thường mất kế hoạch sau một vài lần gọi công cụ. Các mô hình được phát hành trong tháng này được xây dựng để duy trì hàng chục bước phối hợp và phục hồi khi một lệnh gọi công cụ trả về dữ liệu sai thay vì bị đình trệ.

Đối với các nhà phát triển, hiệu quả thực tế là chi phí trên mỗi tác vụ hoàn thành thấp hơn thay vì mức trần cao hơn trên bất kỳ tiêu chuẩn đánh giá nào. Các cơ chế kiểm soát nỗ lực trong Opus 5, chính sách giá theo cấp độ trong GPT-5.6 và những tuyên bố về hiệu quả của Grok 4.5 đều hướng tới cùng một mục tiêu: cho phép các đội ngũ lựa chọn mức tài nguyên tính toán phù hợp cho từng tác vụ thay vì phải trả mức giá cao nhất cho mọi yêu cầu.

Đối với các doanh nghiệp và nhà hoạch định chính sách, việc triển khai GPT-5.6 dưới sự kiểm soát của chính phủ cho thấy rằng việc giám sát hiện đã được tích hợp vào lịch trình phát hành của các mô hình lớn nhất, chứ không phải được thêm vào sau đó. Việc Anthropic tạm ngừng quyền truy cập vào Fable và Mythos trong tháng 6 theo chỉ đạo của chính phủ là một phiên bản trước đó của mô hình tương tự.

Bài viết này được dịch từ tiếng Anh bằng AI. Phiên bản gốc bằng tiếng Anh là nguồn có thẩm quyền; các bản dịch tự động có thể chứa thông tin không chính xác, đặc biệt là trong thuật ngữ pháp lý và quy định.