Skip links

GPT-6 Astra usa o computador por você: o que muda na prática

⚡ Resumo rápido:

  • O eixo do GPT-6 Astra é uso de computador: o modelo opera telas, preenche formulários, navega entre abas e mexe em planilhas — e a OpenAI resumiu no anúncio do X: “o que você faz num computador, o Astra faz por você. Rápido.”
  • OSWorld 2.0: 72,6% (contra 65,7% do GPT-5.6 Sol), com 47% menos tempo por tarefa.
  • ScreenSpot-Pro: 92,7% (era 76,9%) — a métrica de acertar onde clicar numa interface densa.
  • No ChatGPT, o uso de computador ficou quase 2x mais rápido; benchmark de segurança interno de uso de computador caiu de 22,0% para 2,4% de comportamento indevido.
  • Há um freio de mão: política de confirmação — o modelo para e pede autorização antes de ações consequentes.

Desde o Operator, em 2025, “IA que usa o computador” era mais demonstração do que ferramenta: funcionava em fluxo limpo e travava em qualquer tela fora do script. O GPT-6 Astra é a primeira geração em que os números de uso de computador saem do território de protótipo — e é por isso que Greg Brockman disse que “uso de computador é uma parte particularmente importante do que há de novo”.

Os números

Avaliação O que mede GPT-6 Astra GPT-5.6 Sol
OSWorld 2.0 Tarefas reais em desktop Linux 72,6% 65,7%
ScreenSpot-Pro Localizar o elemento certo na tela 92,7% 76,9%
Agents’ Last Exam Tarefas de agente difíceis 59,3 53,6
BrowseComp Pesquisa e navegação na web 91,5% 90,4%
AutomationBench Automação de trabalho de escritório 41,4% 18,1%
Segurança em uso de computador (interno) Comportamento indevido — menor é melhor 2,4% 22,0%

O AutomationBench é o mais revelador do conjunto: 41,4% contra 31,4% do Claude Fable 5.1 e 18,1% do próprio antecessor. É mais que o dobro do GPT-5.6 Sol em tarefas que se parecem com o trabalho de um estagiário administrativo — atualizar CRM, transportar dados entre sistemas, conferir planilha contra formulário.

O que dá para fazer na prática

  • Fluxos de várias telas. Abrir um sistema web, buscar um registro, copiar campo por campo para outro sistema e devolver um relatório do que foi feito.
  • Planilhas de verdade. Não “gerar um CSV”, mas abrir a planilha, aplicar a fórmula, checar o resultado e formatar seguindo o template.
  • Documentos e apresentações “de entregar”. A OpenAI destaca a capacidade de seguir modelo e estilo de escrita, em vez de devolver texto cru.
  • QA e testes de interface. Percorrer a aplicação, reproduzir bug e anotar o passo a passo.
  • Perguntar menos. Uma mudança de comportamento citada no anúncio: o modelo faz pergunta de esclarecimento só quando a resposta muda o resultado — o resto ele assume e registra.

Velocidade — o detalhe que muda o uso

Precisão sem velocidade não resolve agente: 20 minutos para preencher um formulário é pior que fazer à mão. Aqui estão os dois ganhos que importam: no OSWorld 2.0 o Astra completa as tarefas gastando 47% menos tempo que o antecessor, e no ChatGPT a OpenAI diz que o uso de computador ficou quase 2x mais rápido — parte por modelo, parte por otimização de infraestrutura (que rendeu ~60% de ganho de velocidade também nos modelos antigos). Há ainda o modo Fast na API: 2,5x mais rápido pelo dobro do preço.

Os limites (e o freio de mão)

O system card traz o contrapeso. Ganhou uma política de confirmação: antes de ações consequentes — compras, envios, exclusões — o modelo interrompe e pede aprovação. E o vetor de ataque continua sendo a tela: em injeção de prompt indireta, texto malicioso escondido numa página que o agente lê, a taxa de sucesso caiu de 27,0% para 8,5% — melhor, não resolvido. Num teste da UK AISI simulando ataque de cadeia de suprimentos, o modelo executou ação maliciosa em 60 de 499 amostras quando o escopo da tarefa estava vago; com escopo explícito, 2 em 500.

Tradução prática: se você for soltar um agente numa máquina, escreva o que ele não pode fazer. Isso reduz erro em 30x — mais que qualquer troca de modelo.

Perguntas rápidas

Preciso instalar algo para usar o Astra no meu computador?

No ChatGPT, o uso de computador roda em ambiente da OpenAI, não na sua máquina. Controlar seu desktop local exige integração via API, com as ferramentas de computer use e hosted shell.

Ele consegue usar sistemas em português?

Sim — a leitura de tela não depende do idioma, e o modelo aceita imagem como entrada. Interfaces densas e não padronizadas continuam sendo o caso difícil.

Dá para deixar rodando sozinho?

Não é recomendado em fluxo que mexe em dinheiro, e-mail ou dado de cliente. A política de confirmação existe justamente para manter o humano no laço nesses pontos.

Quer testar um assistente em português agora? O chat gratuito do ChatGPT Brasil abre no navegador e não pede cartão.

Veja também