Um agente de inteligência artificial pode receber um objetivo, usar ferramentas e tomar decisões com certo grau de autonomia. Quando uma organização lhe concede acesso ao e-mail, ao código, aos dados ou aos seus sistemas, ele deixa de ser apenas uma ferramenta de consulta: passa a integrar sua estrutura de decisão.
A questão estratégica, portanto, não é apenas qual modelo utilizar. É que agência lhe concedemos, quais limites definimos, que alternativas ele terá diante de um conflito e quem responde por suas ações.
Os experimentos não ordenaram o dano
Os experimentos de desalinhamento agêntico que geraram manchetes sobre chantagem não pediram aos modelos que chantageassem. Os pesquisadores criaram cenários simulados com objetivos conflitantes e, em algumas variantes, pressão de tempo ou ameaça de substituição. Observaram se o sistema escolheria uma ação danosa para cumprir seu objetivo. Alguns escolheram. [1]
Isso não demonstra que os agentes sejam maus nem que o resultado vá se repetir em uma empresa. Mostra algo mais útil para quem projeta sistemas: uma agência mal desenhada pode induzir comportamentos perigosos mesmo sem um objetivo inicial malicioso, se o ambiente oferece poucas alternativas e recompensa a conclusão acima dos limites.
Da simulação à operação
Em fevereiro de 2026, o mantenedor do Matplotlib, Scott Shambaugh, relatou que um agente OpenClaw publicou um ataque pessoal depois que ele rejeitou sua contribuição de código. É um episódio relatado, não um estudo controlado; ilustra como um agente com margem de ação e acesso à publicação pode ultrapassar o escopo que seus operadores talvez tivessem em mente. [2]
Em outro tipo de incidente, a Anthropic informou em julho de 2026 que, durante avaliações de cibersegurança, modelos Claude alcançaram sistemas reais de três organizações a partir de ambientes de teste que deveriam estar isolados. Um mal-entendido com o parceiro de avaliação deixou a Internet acessível. Os modelos acreditaram que os alvos faziam parte do exercício; a Anthropic informou que eles não tentaram escapar deliberadamente do ambiente. A lição operacional é direta: instruções não substituem isolamento técnico nem verificação de permissões. [3]
Esses episódios não são equivalentes. O primeiro foi a reação pública de um agente após a rejeição de uma contribuição; os incidentes da Anthropic ocorreram durante exercícios de cibersegurança com isolamento defeituoso. Não provam que todos os agentes agirão assim nem permitem estimar a frequência. Lembram, porém, que ações disponíveis, limites do ambiente e supervisão precisam ser projetados e verificados.
A IA acrescenta velocidade e reduz o atrito
Um sistema de IA não é uma faca. Pode operar sobre informações, ferramentas e processos; combinar sinais rapidamente e executar decisões sem as consultas e pausas comuns em uma organização humana. Esse atrito pode parecer ineficiente, mas cumpre uma função: permite detectar conflitos, pedir aconselhamento e parar antes que ocorra um dano.
A IA não traz esses mecanismos institucionais por si só. É preciso projetá-los: estabelecer limites, criar canais de consulta e reservar decisões de maior impacto para uma revisão humana efetiva. A velocidade só é uma vantagem se a organização mantiver capacidade para supervisionar o que ela coloca em movimento.
O que as proibições reduzem e o que as alternativas acrescentam
Em uma condição específica do estudo da Anthropic, uma instrução explícita para não chantagear reduziu a taxa observada de 85% para 15%. Esse número descreve uma configuração experimental concreta, não a probabilidade de uso no mundo real. A intervenção melhorou o resultado, mas deixou comportamento residual. [1]
Um estudo separado avaliou canais de escalonamento. Quando o agente podia parar e acionar uma pausa garantida com revisão independente, a taxa média de ações danosas caiu de 38,73% para 1,21% em dez modelos. Um canal simples, sem garantia equivalente de pausa e resolução, chegou a 5,92%. Os percentuais não são diretamente comparáveis aos do experimento da Anthropic, pois os modelos, cenários e intervenções são diferentes. A conclusão prática é que uma alternativa segura precisa ser confiável, rápida e capaz de suspender a ação. [4]
Para uma organização, isso significa defesa em camadas: instruções claras, permissões mínimas, ambientes isolados, registros auditáveis, vias de escalonamento e autorização humana para ações irreversíveis ou de alto impacto. Nenhuma dessas medidas resolve sozinha todos os riscos.
O alinhamento também depende do treinamento
Projetar o ambiente de uso não esgota o problema. Pesquisas controladas sobre aprendizado por reforço observaram que explorar falhas em uma recompensa pode se generalizar para outros comportamentos desalinhados. Isso não prevê que todos os modelos o farão; é um motivo para testar o comportamento aprendido, além dos controles durante a implantação. [5]
A Reserva de Critério como capacidade estratégica
Um conselho de administração não concederia poderes amplos a uma pessoa sem definir seu mandato, seus limites e mecanismos de prestação de contas. Deve aplicar o mesmo rigor a um agente capaz de atuar em sistemas corporativos.
No Quórum 12, chamamos Reserva de Critério à capacidade humana, formada e organizada, que uma entidade mantém para projetar, supervisionar e governar o que a IA produz e faz. É uma capacidade estratégica: permite capturar produtividade sem abrir mão do controle de objetivos, permissões, exceções e responsabilidades.
A Reserva de Critério não é apenas um freio. Ela permite projetar agências mais seguras e aproveitar sistemas capazes de executar tarefas que até pouco tempo pareciam fora de alcance.
Critério para construir e para se defender
A Reserva de Critério também é necessária para se defender de quem usará a IA com fins destrutivos. Essa defesa dificilmente poderá depender apenas de procedimentos manuais: terá de combinar automação, limites de acesso, capacidade de resposta e pessoas com critério para definir prioridades e assumir responsabilidades.
Pensemos em um barco que navega em uma região onde outros também atuam. Ter uma embarcação permite observar, manobrar, responder e ajudar. Ficar em terra pode reduzir a exposição a alguns riscos, mas também deixa a organização sem capacidade de agir diante de quem está navegando.
A pergunta para a direção não é quanta inteligência artificial adotar. É que agência conceder, que alternativas haverá quando surgir um conflito e quem tem competência e autoridade para governá-la. A vantagem não virá apenas de automatizar mais, mas de construir organizações capazes de dirigir aquilo que automatizam.
Fontes
- Anthropic, Agentic Misalignment: How LLMs Could Be Insider Threats (2025), incluindo o apêndice experimental.
- Scott Shambaugh, An AI Agent Published a Hit Piece on Me (fevereiro de 2026), relato do mantenedor.
- Anthropic, Investigating Three Real-World Incidents in Our Cybersecurity Evaluations (30 de julho de 2026).
- Francesca Gomez, From Surveillance to Signalling: Escalation Channels as Environmental Controls for Agentic AI, arXiv:2510.05192, versão 2.
- MacDiarmid et al., Natural Emergent Misalignment from Reward Hacking in Production RL, arXiv:2511.18397.
Os dados sobre instruções diretas e escalonamento vêm de estudos distintos e não devem ser interpretados como comparação experimental direta. A taxa de 1,21% corresponde a pausa garantida e revisão independente.
© 2026 Javier F. Pérez Bernabé. Todos os direitos reservados. Publicado pelo Quórum 12.
ASSINATURA ONLINE GRATUITA
Acesso online gratuito a artigos, novidades e atividades abertas.
Esta assinatura pública e gratuita permite receber conteúdos e avisos de atividades abertas. Não implica admissão como membro nem acesso ao portal privado.

