⚡ Resumo rápido:
- O eixo do GPT-6 Astra é uso de computador: o modelo opera telas, preenche formulários, navega entre abas e mexe em planilhas — e a OpenAI resumiu no anúncio do X: “o que você faz num computador, o Astra faz por você. Rápido.”
- OSWorld 2.0: 72,6% (contra 65,7% do GPT-5.6 Sol), com 47% menos tempo por tarefa.
- ScreenSpot-Pro: 92,7% (era 76,9%) — a métrica de acertar onde clicar numa interface densa.
- No ChatGPT, o uso de computador ficou quase 2x mais rápido; benchmark de segurança interno de uso de computador caiu de 22,0% para 2,4% de comportamento indevido.
- Há um freio de mão: política de confirmação — o modelo para e pede autorização antes de ações consequentes.
Desde o Operator, em 2025, “IA que usa o computador” era mais demonstração do que ferramenta: funcionava em fluxo limpo e travava em qualquer tela fora do script. O GPT-6 Astra é a primeira geração em que os números de uso de computador saem do território de protótipo — e é por isso que Greg Brockman disse que “uso de computador é uma parte particularmente importante do que há de novo”.
Os números
| Avaliação | O que mede | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|
| OSWorld 2.0 | Tarefas reais em desktop Linux | 72,6% | 65,7% |
| ScreenSpot-Pro | Localizar o elemento certo na tela | 92,7% | 76,9% |
| Agents’ Last Exam | Tarefas de agente difíceis | 59,3 | 53,6 |
| BrowseComp | Pesquisa e navegação na web | 91,5% | 90,4% |
| AutomationBench | Automação de trabalho de escritório | 41,4% | 18,1% |
| Segurança em uso de computador (interno) | Comportamento indevido — menor é melhor | 2,4% | 22,0% |
O AutomationBench é o mais revelador do conjunto: 41,4% contra 31,4% do Claude Fable 5.1 e 18,1% do próprio antecessor. É mais que o dobro do GPT-5.6 Sol em tarefas que se parecem com o trabalho de um estagiário administrativo — atualizar CRM, transportar dados entre sistemas, conferir planilha contra formulário.
O que dá para fazer na prática
- Fluxos de várias telas. Abrir um sistema web, buscar um registro, copiar campo por campo para outro sistema e devolver um relatório do que foi feito.
- Planilhas de verdade. Não “gerar um CSV”, mas abrir a planilha, aplicar a fórmula, checar o resultado e formatar seguindo o template.
- Documentos e apresentações “de entregar”. A OpenAI destaca a capacidade de seguir modelo e estilo de escrita, em vez de devolver texto cru.
- QA e testes de interface. Percorrer a aplicação, reproduzir bug e anotar o passo a passo.
- Perguntar menos. Uma mudança de comportamento citada no anúncio: o modelo faz pergunta de esclarecimento só quando a resposta muda o resultado — o resto ele assume e registra.
Velocidade — o detalhe que muda o uso
Precisão sem velocidade não resolve agente: 20 minutos para preencher um formulário é pior que fazer à mão. Aqui estão os dois ganhos que importam: no OSWorld 2.0 o Astra completa as tarefas gastando 47% menos tempo que o antecessor, e no ChatGPT a OpenAI diz que o uso de computador ficou quase 2x mais rápido — parte por modelo, parte por otimização de infraestrutura (que rendeu ~60% de ganho de velocidade também nos modelos antigos). Há ainda o modo Fast na API: 2,5x mais rápido pelo dobro do preço.
Os limites (e o freio de mão)
O system card traz o contrapeso. Ganhou uma política de confirmação: antes de ações consequentes — compras, envios, exclusões — o modelo interrompe e pede aprovação. E o vetor de ataque continua sendo a tela: em injeção de prompt indireta, texto malicioso escondido numa página que o agente lê, a taxa de sucesso caiu de 27,0% para 8,5% — melhor, não resolvido. Num teste da UK AISI simulando ataque de cadeia de suprimentos, o modelo executou ação maliciosa em 60 de 499 amostras quando o escopo da tarefa estava vago; com escopo explícito, 2 em 500.
Tradução prática: se você for soltar um agente numa máquina, escreva o que ele não pode fazer. Isso reduz erro em 30x — mais que qualquer troca de modelo.
Perguntas rápidas
Preciso instalar algo para usar o Astra no meu computador?
No ChatGPT, o uso de computador roda em ambiente da OpenAI, não na sua máquina. Controlar seu desktop local exige integração via API, com as ferramentas de computer use e hosted shell.
Ele consegue usar sistemas em português?
Sim — a leitura de tela não depende do idioma, e o modelo aceita imagem como entrada. Interfaces densas e não padronizadas continuam sendo o caso difícil.
Dá para deixar rodando sozinho?
Não é recomendado em fluxo que mexe em dinheiro, e-mail ou dado de cliente. A política de confirmação existe justamente para manter o humano no laço nesses pontos.
Quer testar um assistente em português agora? O chat gratuito do ChatGPT Brasil abre no navegador e não pede cartão.
Veja também
- GPT-6 Astra para programar: Codex, benchmarks e custo por tarefa
- GPT-6 Astra: o que a OpenAI lançou em 3 de setembro
- O 1º modelo “crítico” em cibersegurança — e a trava da OpenAI
Fontes
- OpenAI — GPT-6 Astra: a new generation of intelligence (03/09/2026)
- Fortune — OpenAI debuts GPT-6 Astra and touts its ability to use your computer (03/09/2026)
- Vellum — GPT-6 Astra benchmarks explained (03/09/2026)
- 9to5Mac — OpenAI releasing major upgrade to ChatGPT and Codex with GPT-6 Astra (03/09/2026)
- OpenAI — GPT-6 Astra System Card (03/09/2026)
Permalink