Quatro laboratórios de inteligência artificial (IA) de grande destaque lançaram modelos de linguagem de ponta em um período de três semanas em julho de 2026, e a diferença entre o que esses sistemas conseguem realizar sem intervenção humana e o que se via anteriormente diminuiu drasticamente.
Gigantes da IA lançam quatro modelos de ponta em três semanas, à medida que a corrida ganha força

Principais conclusões
- A xAI lançou o Grok 4.5 em 8 de julho a US$ 2/US$ 6 por milhão de tokens, oferecendo um preço mais de 60% inferior ao do Opus 4.8.
- A Anthropic lançou o Claude Opus 5 em 24 de julho como o novo modelo padrão nas assinaturas do Claude Max.
- A Moonshot AI lançou o Kimi K3, seu maior modelo, com 2,8 trilhões de parâmetros.
O Grok 4.5 da xAI, o Claude Opus 5 da Anthropic, a família GPT-5.6 da OpenAI e o Kimi K3 da Moonshot AI têm, cada um, o mesmo objetivo: fazer com que um sistema de IA execute uma tarefa de várias horas — desde a pesquisa até a codificação e a elaboração de relatórios estruturados — sem perder o foco no plano.
O Grok 4.5 é treinado com sessões reais de desenvolvedores
A xAI lançou o Grok 4.5 em 8 de julho. O modelo opera com uma base de 1,5 trilhão de parâmetros e foi treinado, em parte, com dados reais de uso do Cursor, a plataforma de programação adquirida pela SpaceXAI no início deste ano. Os preços são de US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída, com uma janela de contexto de 500 mil tokens.

Elon Musk descreveu o Grok 4.5 como um modelo da classe Opus que funciona mais rápido e a um custo menor. Analisadores independentes o colocam em quarto lugar no Índice de Inteligência de Análise Artificial, à frente de todos os modelos de peso aberto, com um preço mais de 60% inferior ao do Claude Opus 4.8 e do GPT-5.5. No Terminal-Bench 2.1, um teste que avalia o desempenho de um modelo na execução de tarefas de engenharia de linha de comando, o Grok 4.5 obteve 83,3%.
A mudança mais significativa está na eficiência de tokens. A xAI afirma que o modelo precisa de aproximadamente um quinto dos tokens de saída que o Opus 4.8 exigia para tarefas comparáveis, o que reduz o custo de execução de longas sessões de agente.
Claude Opus 5 mantém o preço
A Anthropic lançou o Claude Opus 5 em 24 de julho, posicionando-o como um modelo que se aproxima do desempenho do Claude Fable 5 — o lançamento mais avançado da empresa —, pela metade do preço do Fable: US$ 10 para entrada e US$ 50 para saída. O próprio Opus 5 mantém os mesmos preços de US$ 5 para entrada e US$ 25 para saída que seu antecessor, o Opus 4.8.

O modelo vem com uma janela de contexto de 1 milhão de tokens, 128.000 tokens máximos de saída e uma configuração ajustável de esforço de raciocínio que varia de baixo a um novo modo xhigh. A Anthropic afirma que o Opus 5 estabelece novos recordes no Frontier-Bench e no GDPval-AA, duas avaliações de codificação e trabalho de conhecimento, embora fique atrás do modelo restrito Claude Mythos 5 em tarefas de segurança cibernética. O Opus 5 é agora o modelo padrão no Claude Max e a opção mais potente no Claude Pro.
OpenAI divide o GPT-5.6 em três níveis
A OpenAI disponibilizou o GPT-5.6 para o público em geral em 9 de julho, após um período de pré-visualização de duas semanas limitado a cerca de 20 organizações aprovadas pelo governo dos EUA, em conformidade com uma ordem executiva relacionada à revisão de segurança de modelos de ponta. A família é oferecida em três níveis: o Sol, modelo principal, com preço de US$ 5 por entrada e US$ 30 por saída por milhão de tokens; o Terra, um modelo de nível intermediário a US$ 2,50 e US$ 15, que, segundo a OpenAI, equivale ao GPT-5.5 pela metade do custo; e o Luna, um nível rápido e de baixo custo a US$ 1 e US$ 6.

A OpenAI informa que o Sol lidera o Índice de Agentes de Codificação de Análise Artificial (AACA) e atinge 88,8% no Terminal-Bench 2.1, subindo para 91,9% quando o modelo executa quatro subagentes em paralelo em seu novo modo “ultra”. Todos os três níveis apresentam a classificação interna de risco mais alta da OpenAI quanto ao potencial de uso indevido cibernético e biológico, o que desencadeou uma análise adicional durante a prévia restrita ao governo.
Kimi K3 leva os modelos de peso aberto à vanguarda
A Moonshot AI lançou o Kimi K3 em 16 de julho, um modelo de mistura de especialistas com 2,8 trilhões de parâmetros, totalizando 896 especialistas e 16 ativos por tarefa. O modelo possui uma janela de contexto de 1 milhão de tokens e entrada multimodal nativa, com preços de API de US$ 3 para entrada e US$ 15 para saída por milhão de tokens. A Moonshot se comprometeu a publicar os pesos totalmente abertos até 27 de julho.

O K3 é o maior modelo de pesos abertos lançado até o momento, cerca de 75% maior do que o anterior maior modelo aberto amplamente utilizado. Analisadores independentes colocam o K3 em quarto lugar entre os sistemas de ponta atuais, atrás do Claude Fable 5 e do GPT-5.6 Sol, mas à frente do Claude Opus 4.8.
Por que a diferença em relação aos modelos mais antigos é importante
Janelas de contexto com menos de 200.000 tokens antes obrigavam os desenvolvedores a dividir grandes bases de código ou pacotes de pesquisa em fragmentos. Todos os modelos desse grupo agora operam com 500.000 tokens ou mais, sendo que três dos quatro chegam a 1 milhão, permitindo que uma única sessão abranja um repositório completo ou uma pilha de documentos de fonte primária.
A confiabilidade dos agentes também evoluiu. Sistemas dos anos de 2023 e 2024 frequentemente perdiam seu plano após algumas chamadas de ferramentas. Os modelos lançados neste mês foram projetados para sustentar dezenas de etapas coordenadas e se recuperar quando uma chamada de ferramenta retorna dados incorretos, em vez de travar.
Para os desenvolvedores, o efeito prático é um custo menor por tarefa concluída, em vez de um teto mais alto em qualquer benchmark específico. Os controles de esforço no Opus 5, a estrutura de preços em camadas no GPT-5.6 e as alegações de eficiência por trás do Grok 4.5 apontam para o mesmo objetivo: permitir que as equipes escolham quanto poder de computação uma tarefa merece, em vez de pagar preços de modelos top de linha por cada solicitação.
Para empresas e formuladores de políticas, o lançamento do GPT-5.6, controlado pelo governo, sinaliza que a supervisão agora está incorporada aos cronogramas de lançamento dos maiores modelos, e não é adicionada posteriormente. A breve suspensão do acesso ao Fable e ao Mythos pela Anthropic em junho, determinada pelo governo, foi uma versão anterior desse mesmo padrão.
Este artigo foi traduzido do inglês usando IA. A versão original em inglês é a fonte autorizada; traduções automáticas podem conter imprecisões, especialmente em terminologia jurídica e regulatória.

















