⚡ Resumo rápido:
- No índice independente da Artificial Analysis, quem lidera é o Claude Fable 5.1 com 66; o GPT-6 Astra fica em 61, empatado com o próprio GPT-5.6 Sol.
- Em agente de código o placar é apertado: Fable 5.1 no Claude Code 70, contra 67 do Astra no Codex e do Claude Opus 5.
- O Astra domina onde ninguém chega perto: uso de computador, cibersegurança (100% no ExploitBench, 88% no SRE-Bench) e contexto longo.
- Preço: Astra e Fable 5.1 empatam em US$ 10 / US$ 50 por milhão de tokens. Meta Muse custa US$ 1,25 / US$ 4,25 e Gemini 3.8 Flash, US$ 0,75 / US$ 3,75.
- Onde o Astra perde feio: Humanity’s Last Exam com ferramentas (57,2% contra 65,0% do Fable 5.1).
A OpenAI lançou o GPT-6 Astra dizendo ser “o modelo mais inteligente e mais alinhado do mundo”. A frase é testável — e o teste não foi feito só pela OpenAI. Com os números de terceiros na mesa, o mapa de setembro de 2026 é de liderança repartida: cada laboratório manda em uma faixa, e a escolha depende do que você roda.
O placar geral (medido por terceiros)
| Índice — Artificial Analysis | Líder | GPT-6 Astra |
|---|---|---|
| Intelligence Index v4.1.1 | Claude Fable 5.1: 66 | 61 (Opus 5: 63; Fable 5: 62) |
| Coding Agent Index | Fable 5.1 no Claude Code: 70 | 67 no Codex (Opus 5 e Muse Spark 1.3: ~67) |
| Consumo de tokens (agente) | GPT-6 Astra | 1/3 dos tokens do Sol; 1/5 dos do Opus 5 |
| GDPval-AA v2 (trabalho real) | — | queda de ~80 pontos de Elo vs. antecessor |
Onde o Astra ganha sem discussão
- Uso de computador: 72,6% no OSWorld 2.0 (Opus 5: 70,2%) e 92,7% no ScreenSpot-Pro, com 47% menos tempo por tarefa.
- Cibersegurança: 100% no ExploitBench contra 70,0% do Fable 5.1; no SRE-Bench, 88,0% de resolução na primeira tentativa contra 12,5% do Fable 5.1 — a maior distância de todo o comparativo.
- Automação de escritório: 41,4% no AutomationBench, contra 31,4% do Fable 5.1 e 26,9% do Opus 5.
- Matemática de fronteira: 97,6% no FrontierMath Tier 4 v2, contra 87,8% do Fable 5.1 — com a ressalva de que a OpenAI financiou o benchmark e tem acesso exclusivo a parte dele.
- Contexto longo: 96,3% de recuperação entre 512K e 1M de tokens (Sol: 73,8%).
Onde a Anthropic segue na frente
- Inteligência geral no índice independente: 66 contra 61.
- Humanity’s Last Exam com ferramentas: Fable 5.1 com 65,0%, Fable 5 com 63,8% e Opus 5 com 63,6% — o Astra fica em 57,2%, o único teste público em que perde para os três.
- FrontierCode 1.1: empate técnico no split principal (53,3% do Astra contra 53,4% do Opus 5) e vantagem do Fable 5 no split estendido (64,9% contra 64,5%).
- Agente de código: a liderança do índice segue com o Fable 5.1 rodando no Claude Code.
Preço: quem cobra o quê
| Modelo | Entrada (US$/1M) | Saída (US$/1M) |
|---|---|---|
| GPT-6 Astra | 10,00 | 50,00 |
| Claude Fable 5.1 | 10,00 | 50,00 |
| GPT-5.6 Sol | 4,00 | 20,00 |
| Meta Muse Spark 1.3 | 1,25 | 4,25 |
| Gemini 3.8 Flash | 0,75 | 3,75 |
O detalhe que muda a conta: preço por token não é preço por tarefa. O Astra é caro por token e econômico por tarefa em fluxo de agente — daí empatar no Coding Agent Index gastando menos. Já no Intelligence Index, o custo por tarefa ficou ~75% acima do antecessor. E há concorrentes que fazem 74% no DeepSWE v1.1 cobrando 8x menos por token: Gemini 3.8 Flash e Meta Muse Spark 1.3 (75,4%) — ambos dentro da margem do Astra nesse teste específico.
Como escolher
- Agente que opera telas e sistemas: GPT-6 Astra, sem empate.
- Segurança defensiva, resposta a incidente, SRE: GPT-6 Astra.
- Raciocínio geral, redação técnica, análise com ferramentas: Claude Fable 5.1.
- Sessão longa em base de código grande: Astra, pela janela de 1,05 milhão de tokens e pelas notas pesquisáveis do Codex.
- Volume alto com orçamento apertado: Gemini 3.8 Flash ou Meta Muse — o custo por token é uma ordem de grandeza menor.
Perguntas rápidas
Afinal, qual é o melhor modelo hoje?
Não existe um. Astra lidera uso de computador, cibersegurança e contexto longo; Fable 5.1 lidera inteligência geral e agente de código; Gemini e Muse ganham em custo.
Por que os números da OpenAI e os independentes divergem tanto?
Harness e esforço de raciocínio. O caso extremo é o ARC-AGI-3: 99,9% no adaptador da OpenAI, 62,7% no harness padrão da ARC Prize.
Isso muda amanhã?
Provavelmente. Entre julho e setembro de 2026 já trocaram de líder três vezes — e nenhuma dessas medições sobrevive a um lançamento novo sem revisão.
Quer testar sem escolher plano nenhum? O chat gratuito do ChatGPT Brasil responde em português no navegador, sem cartão.
Veja também
- Os benchmarks do GPT-6 Astra: o que os números dizem — e o que escondem
- GPT-6 Astra: preço, planos e como acessar
- Ox Alpha: o modelo misterioso que dominou o OpenRouter era chinês
Fontes
- Artificial Analysis — Benchmarking GPT-6 Astra (03/09/2026)
- Trending Topics — GPT-6 Astra trails top models from Anthropic and Meta in benchmarks (2026)
- Vellum — GPT-6 Astra benchmarks explained (03/09/2026)
- DataCamp — GPT-6 Astra: features, benchmarks and pricing (2026)
- OpenAI — Documentação do modelo gpt-6-astra (preços)