Por Thiago R. de Souza

Até um tempo atrás, o phishing tradicional representava uma das principais ameaças para a segurança digital, enganando usuários por meio de mensagens com o objetivo de roubar dados confidenciais. Porém, diante do avanço da inteligência artificial, o perigo passou a aparecer de outra maneira, por meio da indirect prompt injection (injeção indireta de instruções), em que comandos maliciosos são inseridos em conteúdos que a IA processa.
À medida que empresas conectam sistemas de IA a e-mails, documentos internos, páginas web e outros conteúdos para ganhar produtividade, surge também uma nova possibilidade de ataque. Uma instrução maliciosa pode estar embutida em um e-mail, documento, página ou anexo que a ferramenta irá ler e, sem as proteções adequadas, tratar como uma ordem legítima. Já existem casos documentados publicamente de exfiltração de dados por essa forma de ataque, inclusive em assistentes corporativos de grandes fornecedores, em geral corrigidos após a divulgação.
A comparação com o phishing se torna evidente quando notamos que, apesar de mudar o alvo, o princípio de explorar confiança e linguagem é o mesmo. O phishing convence uma pessoa a clicar em um link ou entregar uma credencial, enquanto a injeção convence um sistema de IA a executar uma ação que não deveria. É como um funcionário extremamente prestativo que executa qualquer ordem escrita em qualquer papel que encontra sobre a mesa, sem verificar quem deixou aquela instrução.
Segundo a edição de agosto de 2026 do OWASP (Open Worldwide Application Security Project), uma comunidade global sem fins lucrativos dedicada a melhorar a segurança de softwares e aplicações, os modelos de linguagem não distinguem de forma confiável dado (conteúdo a ser processado) de instrução (ordem a ser cumprida). Essa é uma das razões pelas quais a prompt injection lidera, pelo terceiro ano consecutivo, a lista dos dez principais riscos para aplicações com esses modelos.
Quando os ataques são direcionados aos sistemas de inteligência artificial, eles ganham escala e velocidade. Diferentemente de um operador humano, que pode suspeitar de uma solicitação fora do comum e verificar sua autenticidade, o sistema processa continuamente os conteúdos que recebe e pode executar comandos em segundos. Portanto, enquanto o combate ao phishing tradicional também passa pelo treinamento e pela conscientização dos usuários, a segurança de modelos automatizados exige uma abordagem estrutural. A defesa deve focar na restrição de acessos e permissões de execução, ao invés de depender de uma suposta capacidade do próprio sistema identificar quando está sendo manipulado.
Sem esses limites, o pior cenário pode unir uma instrução maliciosa a um agente de IA com permissões excessivas. Se estiver conectado a e-mails, repositórios de código, APIs e sistemas internos, um agente manipulado pode expor informações confidenciais, enviar dados para fora do ambiente corporativo ou até executar ações em sistemas de produção. Como tudo isso pode ocorrer utilizando credenciais legítimas, a detecção também se torna mais difícil. Na mesma edição do OWASP, o excessive agency – funcionalidades e permissões além do necessário – saltou da sexta para a terceira posição, o maior avanço da lista: o impacto de uma injeção bem-sucedida é proporcional ao alcance que o agente comprometido possui.
Ferramentas como antivírus, firewalls e filtros de e-mail foram desenvolvidas para identificar códigos maliciosos, assinaturas conhecidas e anomalias de rede, mas uma prompt injection pode ser composta apenas por texto comum, dentro de um documento aparentemente legítimo, escapando desses critérios tradicionais. Como não é possível garantir a filtragem de 100% das tentativas de injeção, a arquitetura deve assumir que o modelo poderá ser enganado em algum momento (raciocínio semelhante ao do Zero Trust) e conter o dano com mecanismos específicos, como separar conteúdo confiável de não confiável, exigir aprovação humana para ações sensíveis e aplicar o princípio do menor privilégio, concedendo somente os acessos necessários para cada tarefa.
A engenharia social, historicamente direcionada às pessoas, passa agora a ganhar uma nova frente: sistemas de IA capazes de ler, interpretar e agir sobre linguagem também podem ser manipulados. Nos próximos anos, a resposta tende a passar pela gestão de agentes com identidade própria, permissões revisáveis e trilhas de auditoria, assim como ocorre com identidades humanas dentro das empresas.
Proibir a IA não é a solução, porque pode empurrar seu uso para a informalidade e agravar o problema. O caminho é adotá-la com visibilidade, sabendo quais sistemas estão em operação, o que cada um pode acessar e quais ações estão autorizados a executar. Para os gestores, uma pergunta simples pode ajudar a dimensionar o risco: “se a nossa IA for enganada hoje, até onde ela consegue chegar?”. A resposta revela o quanto a empresa está preparada (ou não) para essa nova superfície de ataque.
Thiago R. de Souza é Senior Cloud/DevOps Engineer com mais de nove anos de experiência em infraestrutura corporativa, AWS Community Builder e detentor de múltiplas certificações AWS nos níveis Professional e Specialty.
