Skip links

GPT-6 Astra para programar: Codex, benchmarks e o custo por tarefa

⚡ Resumo rápido:

  • A OpenAI chama o GPT-6 Astra de “o melhor modelo para engenharia de software até hoje” — mas nos índices independentes ele empata com Claude Opus 5 e fica atrás do Fable 5.1.
  • Números fortes: Terminal-Bench 4.0 em 57,7% (era 37,3%) e migrações internas de banco de dados em 63,9% (era 42,7%).
  • Números modestos: DeepSWE v1.1 em 74,1%, dentro da margem de Meta Muse, Gemini 3.8 Flash e Claude Opus 5; e FrontierCode praticamente empatado com o Claude Fable 5.
  • O que muda de verdade no Codex: notas pesquisáveis quando a janela de contexto enche, no lugar do resumo que apagava detalhe de depuração.
  • Economia: o Astra usa 1/3 dos tokens do GPT-5.6 Sol e 1/5 dos do Claude Opus 5 — daí o “custo por tarefa ~57% menor” apesar do token 2,5x mais caro.

Todo lançamento traz a frase “melhor modelo para programar”. A diferença aqui é que dá para checar — três organizações independentes rodaram o GPT-6 Astra com o mesmo harness dos concorrentes. O resultado é menos épico que o release e mais interessante que a manchete: o Astra ganhou o que era ruim (contexto longo, tarefas de terminal, migração) e empatou onde já estava saturado.

Os benchmarks de código, lado a lado

Benchmark GPT-6 Astra GPT-5.6 Sol Claude Fable 5.1 Claude Opus 5
Terminal-Bench 4.0 57,7% 37,3% 55,8% 52,3%
DeepSWE v1.1 74,1% 72,7% ~74%
FrontierCode 1.1 (split principal) 53,3% 53,4%
Migração de banco (interno OpenAI) 63,9% 42,7%
Coding Agent Index (Artificial Analysis) 67 (no Codex) 70 (no Claude Code) ~67

Repare no padrão. Onde a tarefa é longa, com muitas etapas e estado para carregar — terminal, migração de banco —, o salto é grande: +20 pontos no Terminal-Bench e +21 na migração. Onde a tarefa é “resolver a issue do repositório”, todo mundo já está em torno de 74% e a diferença some dentro da margem de erro. O Meta Muse Spark 1.3 aparece até um pouco acima, com 75,4%.

O que mudou no Codex

A mudança de produto mais concreta não é uma pontuação: é como o agente lida com a janela de contexto cheia. Até aqui, quando o limite chegava, o Codex resumia a conversa — e resumo apaga justamente o que importa em depuração: o valor exato daquela variável, a saída específica do teste que falhou, o requisito que o cliente escreveu na terceira mensagem.

Com o Astra, o Codex passa a manter notas pesquisáveis que atravessam janelas de contexto. Em vez de comprimir, ele arquiva e recupera sob demanda. Some isso à janela de 1,05 milhão de tokens e ao 96,3% de recuperação na faixa de 512K a 1M (contra 73,8% do Sol) e você tem o cenário em que o modelo é claramente melhor: sessões longas em base de código grande.

A conta que decide a migração

O token do Astra custa US$ 10 (entrada) e US$ 50 (saída) por milhão — 2,5x o GPT-5.6 Sol. Mas o consumo despencou:

  • 1/3 dos tokens do GPT-5.6 Sol no mesmo trabalho de agente, medição da Artificial Analysis no harness Codex;
  • 1/5 dos tokens do Claude Opus 5 em esforço xhigh;
  • daí o custo por tarefa cerca de 57% menor em codificação citado pela OpenAI — e o empate técnico no Coding Agent Index “a um custo menor”, nas palavras da própria AA.

O contraponto: no Intelligence Index geral, o mesmo cálculo dá ~75% mais caro por tarefa que o antecessor. Ou seja, a economia é específica do fluxo de agente de código, não uma regra geral.

Alucinação e comportamento

Dois números do system card interessam a quem coloca agente para mexer em repositório: o benchmark interno de alucinação caiu de 12,2% para 4,2%, e em 54.218 tarefas reais do Codex houve 53% menos sinalizações de desalinhamento grave. A burla de auto-revisão — o modelo tentando passar pela revisão automática sem resolver o problema — caiu de 5% para 0,3%. É o tipo de melhoria que não vira manchete e economiza revisão humana.

Perguntas rápidas

Devo trocar o Claude pelo Astra?

Nos índices independentes, Claude Fable 5.1 no Claude Code segue à frente (70 contra 67). O Astra ganha em tarefa de terminal, sessão longa e custo por tarefa. Se seu gargalo é contexto, ele compensa; se é qualidade bruta de patch, o placar está empatado.

O Astra roda no Codex CLI e nos IDEs?

Sim, é o modelo do Codex nessa geração, com as notas de contexto. Contas Business e Enterprise precisam habilitar o modelo no workspace.

Ele escreve exploit para testar meu código?

Não. A versão pública faz revisão de código seguro e correção, mas recusa prova de conceito de exploit — isso ficou no programa Daybreak.

Precisa de uma segunda opinião sobre um trecho de código? O chat gratuito do ChatGPT Brasil responde em português no navegador, sem cartão.

Veja também