2026년 7월, 3주 동안 4곳의 유명 인공지능(AI) 연구소가 최첨단 언어 모델을 공개했으며, 이러한 시스템이 사람의 개입 없이 완성해 낸 결과물과 기존 모델 간의 격차가 급격히 좁혀졌다.
경쟁이 본격화되면서 AI 거대 기업들이 3주 만에 4개의 최첨단 모델을 잇달아 선보였다

주요 내용
- xAI는 7월 8일 Grok 4.5를 토큰 100만 개당 2달러/6달러에 출시하며, Opus 4.8의 가격보다 60% 이상 저렴하게 책정했다.
- Anthropic은 7월 24일, Claude Max 구독 서비스의 새로운 기본 모델로 Claude Opus 5를 출시했다.
- Moonshot AI는 2.8조 개의 파라미터를 가진 자사 최대 규모 모델인 Kimi K3를 선보였다.
xAI의 Grok 4.5, Anthropic의 Claude Opus 5, OpenAI의 GPT-5.6 제품군, Moonshot AI의 Kimi K3는 모두 동일한 문제를 해결하는 것을 목표로 합니다. 바로 AI 시스템이 연구부터 코딩, 체계적인 보고서 작성에 이르기까지 수 시간에 걸친 작업을 계획을 잃지 않고 수행할 수 있도록 하는 것입니다.
Grok 4.5, 실제 개발자 세션으로 훈련
xAI는 7월 8일 Grok 4.5를 출시했다. 이 모델은 1.5조 파라미터 기반에서 구동되며, 올해 초 SpaceXAI가 인수한 코딩 플랫폼인 Cursor의 실제 사용 데이터를 부분적으로 활용해 훈련되었다. 요금은 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러이며, 컨텍스트 윈도우는 50만 토큰이다.

엘론 머스크는 Grok 4.5를 더 빠르고 저렴한 비용으로 구동되는 ‘Opus급’ 모델이라고 설명했습니다. 독립적인 추적 기관들은 이 모델을 인공 분석 지능 지수(Artificial Analysis Intelligence Index)에서 4위로 평가했으며, 모든 오픈 소스 모델을 앞섰고, 가격은 Claude Opus 4.8 및 GPT-5.5보다 60% 이상 저렴합니다. 모델이 명령줄 엔지니어링 작업을 얼마나 잘 수행하는지 평가하는 테스트인 ‘터미널-벤치 2.1’에서 Grok 4.5는 83.3%의 점수를 기록했다.
더 큰 변화는 토큰 효율성입니다. xAI에 따르면 이 모델은 유사한 작업을 수행하는 데 Opus 4.8이 필요로 했던 출력 토큰의 약 5분의 1만 필요로 하여, 장시간 에이전트 세션을 실행하는 데 드는 비용을 낮춥니다.
Claude Opus 5, 가격 경쟁력은 유지
Anthropic은 7월 24일 Claude Opus 5를 출시하며, 이 모델을 자사의 가장 뛰어난 모델인 Claude Fable 5에 근접한 성능을 제공하면서도 Fable의 입력 10달러, 출력 50달러 가격 정책의 절반 수준으로 책정했다고 밝혔다. Opus 5 자체는 전작인 Opus 4.8과 동일한 입력 5달러, 출력 25달러의 가격 정책을 적용하고 있습니다.

이 모델은 100만 토큰의 컨텍스트 윈도우, 최대 128,000 토큰의 출력, 그리고 ‘낮음’에서 새로운 ‘xhigh’ 모드에 이르기까지 조절 가능한 추론 노력 설정을 갖추고 출시되었습니다. Anthropic에 따르면 Opus 5는 코딩 및 지식 작업 평가 지표인 Frontier-Bench와 GDPval-AA에서 새로운 기록을 세웠으나, 사이버 보안 과제에서는 제한된 Claude Mythos 5 모델에 뒤처진다고 합니다. Opus 5는 이제 Claude Max의 기본 모델이자 Claude Pro에서 가장 강력한 옵션입니다.
오픈AI, GPT-5.6을 세 가지 등급으로 구분
오픈AI는 최첨단 모델 안전성 검토와 관련된 행정 명령에 따라, 미국 정부가 심사한 약 20개 기관으로 제한된 2주간의 프리뷰 기간을 거친 후, 7월 9일 GPT-5.6을 일반에 공개했습니다. 이 제품군은 세 가지 등급으로 제공됩니다: 플래그십 모델인 ‘솔(Sol)’은 토큰 100만 개당 입력 5달러, 출력 30달러입니다; 중간 등급 모델인 ‘테라(Terra)’는 입력당 2.50달러, 출력당 15달러로, 오픈AI에 따르면 절반의 비용으로 GPT-5.5와 동등한 성능을 제공한다고 합니다; 그리고 빠르고 저렴한 등급인 ‘루나(Luna)’는 입력당 1달러, 출력당 6달러입니다.

오픈AI에 따르면 솔은 인공 분석 코딩 에이전트 지수(Artificial Analysis Coding Agent Index)에서 선두를 달리고 있으며, 터미널-벤치 2.1(Terminal-Bench 2.1)에서 88.8%를 기록했고, 새로운 울트라 모드에서 4개의 하위 에이전트를 병렬로 실행할 경우 91.9%까지 상승한다. 이 세 가지 티어 모두 사이버 및 생물학적 오용 가능성에 대해 OpenAI의 최고 내부 위험 등급을 받았으며, 이로 인해 정부 승인 프리뷰 기간 동안 추가 검토가 이루어졌습니다.
Kimi K3, 오픈 웨이트 모델의 한계를 넓히다
문샷 AI(Moonshot AI)는 7월 16일, 총 896명의 전문가와 작업당 16명의 활성 전문가를 갖춘 2.8조 매개변수 규모의 전문가 혼합 모델인 ‘키미 K3(Kimi K3)’를 출시했다. 이 모델은 100만 토큰의 컨텍스트 윈도우와 네이티브 멀티모달 입력을 지원하며, API 요금은 토큰 100만 개당 입력 3달러, 출력 15달러입니다. Moonshot은 7월 27일까지 전체 오픈 웨이트를 공개하겠다고 약속했습니다.

K3는 현재까지 공개된 모델 중 가장 큰 규모로, 이전에 널리 사용되던 최대 규모의 공개 모델보다 약 75% 더 큽니다. 독립적인 추적 기관들은 K3를 현재 최첨단 시스템 중 4위로 평가하며, Claude Fable 5와 GPT-5.6 Sol에 뒤지지만 Claude Opus 4.8보다는 앞선다고 밝혔습니다.
기존 모델과의 격차가 중요한 이유
20만 토큰 미만의 컨텍스트 윈도우로 인해 개발자들은 과거에 대규모 코드베이스나 연구 자료를 여러 조각으로 분할해야만 했습니다. 이 그룹에 속한 모든 모델은 이제 50만 토큰 이상으로 실행되며, 4개 모델 중 3개는 100만 토큰을 지원하여 단일 세션으로 전체 리포지토리나 방대한 원본 문서 스택을 처리할 수 있게 되었습니다.
에이전트의 신뢰성도 향상되었습니다. 2023년과 2024년에 출시된 시스템들은 소수의 도구 호출 후에도 종종 실행 계획을 상실하곤 했습니다. 반면 이번 달에 출시된 모델들은 수십 개의 조율된 단계를 지속할 수 있도록 설계되었으며, 도구 호출이 잘못된 데이터를 반환하더라도 중단되지 않고 복구할 수 있습니다.
개발자 입장에서 볼 때, 이는 개별 벤치마크의 상한선이 높아진 것보다는 완료된 작업당 비용이 낮아진 실질적인 효과를 의미합니다. Opus 5의 노력 제어 기능, GPT-5.6의 계층형 가격 정책, 그리고 Grok 4.5가 내세우는 효율성 주장은 모두 동일한 목표를 가리키고 있습니다. 바로 팀이 요청마다 플래그십 가격을 지불하는 대신, 각 작업에 필요한 컴퓨팅 자원을 직접 선택할 수 있도록 하는 것입니다.
기업과 정책 입안자들에게 있어, 정부의 승인을 거쳐 진행된 GPT-5.6의 출시 소식은 이제 초대형 모델의 출시 일정에 사후 추가가 아닌 감독 메커니즘이 내재되어 있음을 시사합니다. 지난 6월 앤트로픽(Anthropic)이 정부의 지시에 따라 Fable과 Mythos에 대한 접근을 일시 중단했던 사례는 이러한 패턴의 초기 형태였습니다.
이 기사는 AI를 사용하여 영어에서 번역되었습니다. 영어 원본이 권위 있는 출처이며, 자동 번역에는 특히 법률 및 규제 용어에서 부정확한 내용이 포함될 수 있습니다.

















