Computer Use: o Agente de IA que Aprendeu a Operar Telas Como um Funcionário
Movimento.ai

Até aqui, a forma mais comum de conectar um agente de IA a um sistema corporativo passava por uma API — o MCP, que já exploramos aqui no blog, é o exemplo mais recente desse modelo. Mas boa parte dos sistemas que uma empresa usa no dia a dia não tem API nenhuma: são portais de fornecedores, sistemas legados de décadas, planilhas com macro, telas de terceiros que só existem via interface gráfica. Para esse universo, uma categoria de agente ganhou tração ao longo de 2026: o "computer use" — agentes que operam o computador enxergando a tela, movendo o mouse e digitando, exatamente como faria um funcionário.
O que muda em relação a um agente conectado por API
Um agente conectado via API (ou via MCP) recebe uma lista definida de ações possíveis — "criar um ticket", "consultar um pedido" — com parâmetros estruturados. Ele nunca "vê" a tela; troca dados diretamente com o sistema por trás dela. Um agente de computer use inverte essa lógica: ele não depende de nenhuma integração especial. Recebe uma captura de tela, interpreta visualmente o que está ali — botões, campos, menus — e decide a próxima ação de mouse ou teclado, do mesmo jeito que uma pessoa faria olhando o monitor.
Essa diferença o torna especialmente útil em três situações:
- Sistemas sem API aberta: ERPs antigos, portais de governo, sites de fornecedores e parceiros que não oferecem nenhuma integração programática.
- Automação de testes (QA): validar que uma tela de fato se comporta como esperado, navegando por ela como um usuário real navegaria.
- RPA de próxima geração: ao contrário da automação tradicional baseada em coordenadas fixas de tela, um agente de computer use interpreta o layout e se adapta quando um botão muda de lugar ou um campo é renomeado.
Como funciona o loop de percepção e ação
Por baixo do capô, um agente de computer use roda em um ciclo simples que se repete dezenas ou centenas de vezes até a tarefa terminar: ele tira uma captura de tela, um modelo com capacidade de visão interpreta o que está nela, decide a próxima ação (clicar em um ponto, digitar um texto, pressionar uma tecla), essa ação é executada por uma camada de controle do sistema operacional ou navegador, e uma nova captura de tela é feita para confirmar o resultado e planejar o próximo passo.
Esse ciclo de "ver, decidir, agir, conferir" evoluiu rápido: no benchmark OSWorld, que mede a capacidade de agentes de completarem tarefas reais em um computador, a taxa de acerto saltou de menos de 15% no fim de 2024 para 72,5% no início de 2026 — o salto que tirou essa tecnologia do estágio experimental e a levou para produção.
Onde já está em uso — e o que isso exige da governança
Times de tecnologia já usam agentes de computer use para preencher formulários em portais sem API, migrar dados entre sistemas que não conversam entre si, testar software automaticamente e executar tarefas repetitivas em telas legadas que ninguém quer — ou consegue — reescrever. O ganho ���� real: qualquer tela vira, em tese, uma superfície automatizável.
O preço dessa flexibilidade é o tamanho da superfície de risco. Um agente que enxerga e opera uma tela tem, em princípio, o mesmo nível de acesso que um usuário humano logado naquele sistema — incluindo botões como "excluir", "confirmar pagamento" ou "enviar". E, por depender de interpretação visual, ele também está sujeito a uma variante do prompt injection que já tratamos aqui no blog: texto malicioso embutido na própria tela (um pop-up, um anúncio, um campo preenchido por terceiros) pode tentar desviar a ação do agente.
Isso torna governança não negociável — e o cenário atual preocupa: apenas 1 em cada 5 empresas que já colocaram algum agente autônomo em produção afirma ter um modelo de governança maduro para lidar com eles. Na prática, isso significa definir, antes de ligar um agente de computer use em produção: em qual ambiente isolado ele roda, quais ações exigem aprovação humana antes de serem executadas, e como cada sessão é registrada para auditoria.
Para a arquitetura de IA da sua empresa, a pergunta certa não é "MCP ou computer use" — é mapear, sistema por sistema, qual camada de integração cada um pede. Onde existe API, ela continua sendo a opção mais rápida, barata e previsível. Onde não existe, o computer use vira a ponte que faltava. Se sua empresa tem sistemas críticos travados nessa lacuna, nossa consultoria em arquitetura de IA ajuda a definir onde vale a pena automatizar primeiro — e com que controles.
Consultoria brasileira especializada em implementação, treinamento e mentoria em IA para empresas. Conheça a movimento.ai
