Agentes de IA estão redefinindo o que significa usar inteligência artificial no dia a dia.
Há apenas dois anos, a maioria das pessoas interagia com modelos de IA basicamente como faria com um campo de busca mais esperto: fazia uma pergunta, recebia uma resposta.
Simples assim.
Mas esse cenário mudou — e rápido.
Hoje, ferramentas como o Claude Code e o Claude Cowork, da Anthropic, permitem que a IA escreva e execute código, gerencie arquivos, navegue por sistemas corporativos e conclua tarefas que atravessam múltiplos aplicativos, quase sem precisar de alguém segurando a mão o tempo todo.
É uma virada de chave real. 🔑
E com ela vêm ganhos de produtividade impressionantes — mas também um conjunto novo de responsabilidades e riscos que não existiam quando a IA só respondia perguntas.
Quando um agente age de forma autônoma, com menos supervisão humana, o espaço para erros de interpretação cresce. Surgem vulnerabilidades novas, como os ataques de prompt injection, em que instruções maliciosas são escondidas dentro de conteúdos que o agente processa.
E à medida que esses sistemas ficam mais poderosos e empresas confiam neles para ações cada vez mais importantes, a tendência é que ambos os riscos se intensifiquem.
Como garantir que agentes de IA sejam confiáveis de verdade?
É exatamente isso que a Anthropic tenta responder com seu framework para construção de agentes confiáveis, publicado originalmente em agosto do ano passado e agora detalhado em termos práticos. Esse framework se apoia em cinco princípios centrais: manter humanos no controle, alinhar o comportamento com os valores humanos, proteger as interações dos agentes, manter transparência e preservar a privacidade.
Desde a estrutura técnica que faz um agente funcionar até os princípios práticos de segurança, controle humano e transparência, passando pelo que vai além de uma única empresa e envolve toda a indústria — vamos explorar cada uma dessas camadas aqui.
Bora entender o que está em jogo. 👇
O que faz um agente de IA ser diferente de um chatbot comum
A diferença entre um chatbot tradicional e um agente de inteligência artificial vai muito além do nome. Um chatbot responde. Um agente age. E essa distinção muda completamente a forma como precisamos pensar sobre esses sistemas.
A Anthropic define um agente como um modelo de IA que dirige seus próprios processos e o uso de ferramentas ao cumprir uma tarefa — ou seja, ele decide por conta própria como alcançar o que o usuário quer, em vez de seguir um roteiro fixo. Na prática, isso significa que o agente opera num ciclo autodirigido: ele planeja, executa uma ação, observa o resultado, ajusta o plano e repete esse processo até a tarefa estar concluída ou até precisar consultar o humano.
Para deixar mais palpável, pense num exemplo real. Se você pedisse ao Claude no Claude Cowork para submeter os recibos de uma viagem de negócios, ele planejaria os passos um a um — transcrever cada foto de recibo, extrair o valor e o fornecedor, categorizar a despesa e enviá-la pelo sistema da sua empresa. Se uma cobrança de hotel fosse rejeitada por ultrapassar o limite de diária, o Claude não apenas perceberia que a submissão falhou, mas identificaria que não conhece qual é o teto permitido nem quais outras regras podem ser aplicáveis. Nesse ponto, ele pausaria para perguntar se deve consultar a política de despesas no drive compartilhado da empresa antes de tentar novamente. Com a sua aprovação, ele incorporaria o que aprendeu no plano e seguiria em frente.
Esse nível de integração com o mundo real — onde as ações têm consequências fora da janela do chat — é o que define um agente moderno e é também o que exige uma abordagem completamente nova em termos de segurança e governança.
A anatomia de um agente: quatro componentes essenciais
Para entender de onde vêm tanto as capacidades quanto os riscos de um agente, é preciso olhar para seus quatro componentes fundamentais. Cada um deles é ao mesmo tempo uma fonte de poder e um potencial ponto de vulnerabilidade:
- O modelo: é a inteligência que torna tudo possível. Essa inteligência é produto do processo de treinamento, que molda tanto o que o modelo sabe quanto como ele raciocina e se comporta.
- O harness (arnês de instruções): são as instruções e as barreiras de proteção sob as quais o modelo opera. No exemplo dos recibos, o harness poderia instruir o Claude a sinalizar qualquer valor acima de cem dólares ou a nunca submeter despesas sem confirmação do usuário.
- As ferramentas: são os serviços e aplicativos que o modelo pode usar — seu e-mail, calendário, software de despesas e por aí vai. Sem ferramentas, o Claude consegue ler o recibo, mas não consegue arquivá-lo.
- O ambiente: é onde o agente roda — se está configurado no Claude Code, no Claude Cowork ou em outro produto — e quais arquivos, sites ou sistemas ele pode acessar. O mesmo agente num laptop corporativo dentro de uma rede empresarial terá acessos e riscos completamente diferentes do que teria num celular pessoal.
A maior parte da conversa sobre políticas de IA hoje gira em torno do modelo, o que é compreensível — é de lá que vêm as capacidades centrais. Mas o comportamento de um agente depende das quatro camadas funcionando em conjunto. Um modelo bem treinado ainda pode ser explorado por meio de um harness mal configurado, uma ferramenta com permissões excessivas ou um ambiente exposto. É por isso que as proteções precisam cobrir todos esses níveis.
Autonomia real traz riscos reais
Quanto mais autonomia um agente possui, maior é a superfície de ataque disponível para que algo dê errado — seja por um erro genuíno de interpretação, seja por uma exploração maliciosa intencional.
Um dos riscos mais discutidos atualmente no campo da inteligência artificial é o chamado prompt injection, que funciona de maneira bastante insidiosa: instruções maliciosas são embutidas dentro de conteúdos que o agente vai processar durante a execução de uma tarefa. Imagine um agente que lê e-mails para gerenciar sua agenda — um e-mail cuidadosamente elaborado poderia conter instruções ocultas ordenando ao agente que encaminhe informações confidenciais para um endereço externo. O agente, sem perceber, executaria a instrução como se fosse legítima.
A Anthropic reconhece que, à medida que os modelos ficam mais capazes, a compreensão sobre prompt injection também evoluiu consideravelmente — tanto em relação a como os ataques funcionam quanto ao motivo pelo qual nenhuma linha de defesa isolada é suficiente para garantir proteção total. Quanto mais aberto é o ambiente de um agente, mais pontos de entrada existem. Quanto mais ferramentas ele pode usar, mais um atacante consegue fazer quando obtém acesso.
É por isso que a empresa constrói defesas em múltiplas camadas: treina o modelo para reconhecer padrões de injeção, monitora o tráfego em produção para bloquear ataques no mundo real e conta com red-teamers externos para testar e estressar seus sistemas.
Ainda assim, mesmo combinadas, essas proteções não são uma garantia absoluta. Por isso a recomendação da Anthropic é que os próprios clientes pensem cuidadosamente sobre quais ferramentas e dados disponibilizam para um agente, quais permissões concedem e em quais ambientes permitem que ele opere. Ações irreversíveis — como deletar dados permanentemente ou enviar mensagens em nome do usuário — devem ter um ponto de confirmação humana antes de serem executadas.
Esse equilíbrio entre eficiência e controle é um dos grandes desafios de design que toda a indústria de inteligência artificial enfrenta agora.
Princípios na prática: como a Anthropic toma decisões de produto
Construir agentes que são ao mesmo tempo úteis e confiáveis exige decisões de produto muito cuidadosas. O framework da Anthropic estabelece cinco princípios para guiar essas escolhas. Vamos olhar para três deles com exemplos concretos: controle humano, alinhamento com as expectativas do usuário e segurança. Os outros dois — transparência e privacidade — permeiam todos os demais.
Design pensado para manter o humano no controle
A tensão central dos agentes é clara: para serem úteis, precisam funcionar com autonomia, mas para serem seguros, os humanos precisam manter controle significativo sobre como eles trabalham.
A forma mais direta de o usuário manter controle sobre o Claude é decidindo o que ele pode e o que não pode fazer. No Claude.ai e no Claude Desktop, os usuários escolhem quais ferramentas ativar e configuram permissões — como sempre permitir, precisa de aprovação ou bloquear — para cada ação que o Claude executa. Isso permite, por exemplo, definir que é sempre seguro para o Claude ler seu calendário, mas ainda exigir aprovação antes de enviar um convite para alguém.
Essa abordagem funciona bem para tarefas simples. Mas quando uma tarefa envolve dezenas de ações, pedidos repetidos de aprovação viram uma fonte de atrito, e os usuários acabam ignorando esses prompts por fadiga. Para resolver essa lacuna, a Anthropic introduziu no Claude Code um recurso chamado Plan Mode. Em vez de pedir aprovação ação por ação, o Claude apresenta ao usuário seu plano completo de ação antecipadamente. O usuário pode revisar, editar e aprovar tudo antes que qualquer coisa aconteça — e ainda pode intervir em qualquer momento durante a execução. Isso desloca o nível de supervisão do passo individual para a estratégia geral, que tende a ser o ponto em que os usuários mais querem exercer seu julgamento.
Há também padrões de uso mais complexos surgindo. Cada vez mais, agentes em produtos como o Claude Code delegam parte do trabalho para subagentes — outros Claudes trabalhando em paralelo em diferentes partes de uma tarefa. Subagentes levantam questões novas sobre como os usuários podem compreender e direcionar fluxos de trabalho que já não são visíveis como uma sequência linear de ações. A Anthropic está explorando diferentes padrões de coordenação para endereçar isso, e o aprendizado obtido vai alimentar o design de supervisão para essa próxima geração de agentes.
Ajudando agentes a entenderem seus objetivos de verdade
Garantir que agentes persigam os objetivos certos, da forma que os usuários mais desejam, é um dos problemas não resolvidos mais difíceis no desenvolvimento de agentes. Um agente só consegue agir de acordo com o que o usuário realmente quer se souber quando parar e pedir esclarecimentos — seja quando está incerto, seja quando está prestes a cometer um erro.
Trabalhando numa tarefa, um agente frequentemente encontra situações que seu plano inicial não cobria. Ele pode resolver muitas dessas lacunas sozinho — pesquisando informações que precisa, por exemplo. Mas outras serão questões de preferência ou intenção que só o usuário pode resolver. O desafio para a Anthropic é ajudar seus modelos a reconhecer qual é qual, encontrando o equilíbrio certo entre pausar demais e não pausar o suficiente. Um agente que para a cada possível dúvida abre mão da maioria da autonomia que o torna útil. Um que sempre segue em frente arrisca interpretar mal o que o usuário realmente queria.
A Anthropic ataca esse problema de múltiplos ângulos durante o treinamento do Claude. Primeiro, constrói cenários de treinamento que colocam o modelo em situações ambíguas e reforça a escolha de pausar em vez de presumir. Segundo, a Constituição do Claude — que influencia diretamente como os modelos são treinados — reforça um instinto similar, favorecendo levantar preocupações, buscar esclarecimentos ou recusar prosseguir em vez de agir com base em suposições.
As pesquisas da Anthropic sobre uso de agentes ilustram bem o impacto desse treinamento. Em tarefas complexas, os usuários interrompem o Claude apenas um pouco mais frequentemente do que em tarefas simples, mas a taxa do próprio Claude de fazer check-ins praticamente dobra. Isso mostra a importância de calibrar os agentes na decisão sobre quando agir e quando devolver a decisão ao humano.
Segurança e transparência como pilares inegociáveis
Dentro da arquitetura de agentes de IA modernos, segurança e transparência não são recursos opcionais que se adicionam depois — são fundamentos que precisam estar presentes desde o início do design do sistema.
A transparência entra nesse contexto de uma forma bastante prática: se um agente não consegue explicar o que está fazendo ou por que está tomando determinada decisão, é impossível para um humano supervisionar seu comportamento de maneira eficaz. Por isso, sistemas bem projetados incluem mecanismos de logging detalhado, trilhas de auditoria e, em casos mais críticos, a capacidade de o próprio agente sinalizar quando encontra uma situação ambígua ou potencialmente arriscada e solicitar orientação humana antes de prosseguir.
Esse comportamento — parar e perguntar em vez de adivinhar — é um sinal de maturidade no design de um agente e reduz significativamente o risco de consequências indesejadas.
Há também uma dimensão mais ampla aqui que vai além de qualquer empresa específica. A construção de padrões de segurança e transparência para agentes autônomos é um desafio que toda a indústria de inteligência artificial precisa enfrentar de forma colaborativa. A transparência precisa ser não apenas uma característica técnica, mas um compromisso cultural de quem desenvolve essas ferramentas.
O que o ecossistema mais amplo pode fazer
As medidas descritas até aqui representam o que a Anthropic consegue fazer dentro de seus próprios produtos. Mas a segurança e a confiabilidade de agentes não podem ser alcançadas por nenhuma empresa isoladamente. A questão para todo o ecossistema é como criar as condições para que empresas possam experimentar com agentes e desenvolvedores possam continuar construindo com segurança.
Existem algumas frentes onde a indústria, órgãos de padronização e governos podem contribuir de forma significativa:
Benchmarks padronizados
Atualmente não existe uma forma rigorosa e padronizada de comparar sistemas de agentes em termos de resistência a prompt injection ou de quão confiavelmente eles sinalizam incertezas. Cada empresa testa seus próprios sistemas usando seus próprios métodos, e nenhum resultado é verificado de forma independente. Órgãos de padrões como o NIST, trabalhando junto a grupos da indústria, estão bem posicionados para manter benchmarks compartilhados e incentivar um ecossistema mais amplo de avaliação por terceiros.
Compartilhamento de evidências
A Anthropic já publicou extensivamente sobre como o Claude é usado como agente e onde ele apresenta dificuldades, e espera que essa prática se torne comum no campo. Quanto mais desenvolvedores compartilharem esse tipo de evidência, mais completa será a visão que formuladores de políticas terão de como agentes estão sendo realmente utilizados.
Padrões abertos
A Anthropic criou o Model Context Protocol (MCP) como um padrão aberto para a forma como modelos se comunicam com fontes de dados e ferramentas externas — e posteriormente doou o protocolo para a Agentic AI Foundation da Linux Foundation, para que ele pertença à comunidade mais ampla. A lógica por trás disso é que protocolos abertos permitem que propriedades de segurança sejam projetadas na infraestrutura uma única vez, em vez de serem remendadas individualmente a cada implantação. Padrões abertos também mantêm a competição focada na qualidade e segurança do agente, e não em quem controla as integrações.
Nenhuma dessas medidas substitui o trabalho que os desenvolvedores de modelos precisam fazer para construir agentes seguros, mas essa é o tipo de infraestrutura que nenhuma empresa sozinha consegue erguer.
O futuro próximo dos agentes e o papel do controle humano
O debate sobre o quanto de autonomia conceder a um agente de IA não tem uma resposta única — e provavelmente nunca terá. O nível adequado de independência depende do contexto, da criticidade da tarefa, da maturidade do sistema e do quanto o operador humano compreende o que está acontecendo nos bastidores. Um agente que gerencia lembretes de agenda pode operar com muito mais liberdade do que um agente que tem acesso a sistemas financeiros ou de infraestrutura crítica. Essa calibração entre eficiência e controle vai ser um exercício contínuo à medida que a tecnologia avança e os casos de uso se multiplicam.
O que fica cada vez mais claro é que o futuro dos agentes de inteligência artificial não é sobre substituir humanos, mas sobre construir sistemas em que humanos e agentes trabalham juntos de forma fluida — com o humano no papel de supervisor estratégico e o agente no papel de executor tático altamente capaz. Para que essa parceria funcione bem, a transparência sobre o que o agente está fazendo precisa ser constante, e os mecanismos de intervenção humana precisam ser simples, rápidos e eficazes.
Agentes vão remodelar a forma como as pessoas trabalham. Se isso acontecerá sobre uma base segura e aberta depende de como a indústria, a sociedade civil e os governos construírem essa fundação juntos.
A evolução dos agentes de IA já está acontecendo, com ou sem consenso sobre as melhores práticas. O que muda é a velocidade com que a indústria consegue estabelecer bases sólidas de segurança, transparência e responsabilidade antes que os sistemas se tornem complexos demais para serem facilmente auditados. Esse é o verdadeiro desafio do momento — e a forma como ele for resolvido vai definir não apenas o futuro da inteligência artificial, mas a relação que a sociedade vai ter com essa tecnologia nas próximas décadas. 🤖
