Skip links

GPT-6 Astra vs Claude, Gemini e Meta: quem lidera de verdade em setembro de 2026

⚡ Resumo rápido:

  • No índice independente da Artificial Analysis, quem lidera é o Claude Fable 5.1 com 66; o GPT-6 Astra fica em 61, empatado com o próprio GPT-5.6 Sol.
  • Em agente de código o placar é apertado: Fable 5.1 no Claude Code 70, contra 67 do Astra no Codex e do Claude Opus 5.
  • O Astra domina onde ninguém chega perto: uso de computador, cibersegurança (100% no ExploitBench, 88% no SRE-Bench) e contexto longo.
  • Preço: Astra e Fable 5.1 empatam em US$ 10 / US$ 50 por milhão de tokens. Meta Muse custa US$ 1,25 / US$ 4,25 e Gemini 3.8 Flash, US$ 0,75 / US$ 3,75.
  • Onde o Astra perde feio: Humanity’s Last Exam com ferramentas (57,2% contra 65,0% do Fable 5.1).

A OpenAI lançou o GPT-6 Astra dizendo ser “o modelo mais inteligente e mais alinhado do mundo”. A frase é testável — e o teste não foi feito só pela OpenAI. Com os números de terceiros na mesa, o mapa de setembro de 2026 é de liderança repartida: cada laboratório manda em uma faixa, e a escolha depende do que você roda.

O placar geral (medido por terceiros)

Índice — Artificial Analysis Líder GPT-6 Astra
Intelligence Index v4.1.1 Claude Fable 5.1: 66 61 (Opus 5: 63; Fable 5: 62)
Coding Agent Index Fable 5.1 no Claude Code: 70 67 no Codex (Opus 5 e Muse Spark 1.3: ~67)
Consumo de tokens (agente) GPT-6 Astra 1/3 dos tokens do Sol; 1/5 dos do Opus 5
GDPval-AA v2 (trabalho real) queda de ~80 pontos de Elo vs. antecessor

Onde o Astra ganha sem discussão

  • Uso de computador: 72,6% no OSWorld 2.0 (Opus 5: 70,2%) e 92,7% no ScreenSpot-Pro, com 47% menos tempo por tarefa.
  • Cibersegurança: 100% no ExploitBench contra 70,0% do Fable 5.1; no SRE-Bench, 88,0% de resolução na primeira tentativa contra 12,5% do Fable 5.1 — a maior distância de todo o comparativo.
  • Automação de escritório: 41,4% no AutomationBench, contra 31,4% do Fable 5.1 e 26,9% do Opus 5.
  • Matemática de fronteira: 97,6% no FrontierMath Tier 4 v2, contra 87,8% do Fable 5.1 — com a ressalva de que a OpenAI financiou o benchmark e tem acesso exclusivo a parte dele.
  • Contexto longo: 96,3% de recuperação entre 512K e 1M de tokens (Sol: 73,8%).

Onde a Anthropic segue na frente

  • Inteligência geral no índice independente: 66 contra 61.
  • Humanity’s Last Exam com ferramentas: Fable 5.1 com 65,0%, Fable 5 com 63,8% e Opus 5 com 63,6% — o Astra fica em 57,2%, o único teste público em que perde para os três.
  • FrontierCode 1.1: empate técnico no split principal (53,3% do Astra contra 53,4% do Opus 5) e vantagem do Fable 5 no split estendido (64,9% contra 64,5%).
  • Agente de código: a liderança do índice segue com o Fable 5.1 rodando no Claude Code.

Preço: quem cobra o quê

Modelo Entrada (US$/1M) Saída (US$/1M)
GPT-6 Astra 10,00 50,00
Claude Fable 5.1 10,00 50,00
GPT-5.6 Sol 4,00 20,00
Meta Muse Spark 1.3 1,25 4,25
Gemini 3.8 Flash 0,75 3,75

O detalhe que muda a conta: preço por token não é preço por tarefa. O Astra é caro por token e econômico por tarefa em fluxo de agente — daí empatar no Coding Agent Index gastando menos. Já no Intelligence Index, o custo por tarefa ficou ~75% acima do antecessor. E há concorrentes que fazem 74% no DeepSWE v1.1 cobrando 8x menos por token: Gemini 3.8 Flash e Meta Muse Spark 1.3 (75,4%) — ambos dentro da margem do Astra nesse teste específico.

Como escolher

  • Agente que opera telas e sistemas: GPT-6 Astra, sem empate.
  • Segurança defensiva, resposta a incidente, SRE: GPT-6 Astra.
  • Raciocínio geral, redação técnica, análise com ferramentas: Claude Fable 5.1.
  • Sessão longa em base de código grande: Astra, pela janela de 1,05 milhão de tokens e pelas notas pesquisáveis do Codex.
  • Volume alto com orçamento apertado: Gemini 3.8 Flash ou Meta Muse — o custo por token é uma ordem de grandeza menor.

Perguntas rápidas

Afinal, qual é o melhor modelo hoje?

Não existe um. Astra lidera uso de computador, cibersegurança e contexto longo; Fable 5.1 lidera inteligência geral e agente de código; Gemini e Muse ganham em custo.

Por que os números da OpenAI e os independentes divergem tanto?

Harness e esforço de raciocínio. O caso extremo é o ARC-AGI-3: 99,9% no adaptador da OpenAI, 62,7% no harness padrão da ARC Prize.

Isso muda amanhã?

Provavelmente. Entre julho e setembro de 2026 já trocaram de líder três vezes — e nenhuma dessas medições sobrevive a um lançamento novo sem revisão.

Quer testar sem escolher plano nenhum? O chat gratuito do ChatGPT Brasil responde em português no navegador, sem cartão.

Veja também