Pseudonimizar é substituir nomes, CPF, contas e outros identificadores por marcadores, como <CLIENTE_01>, guardando a tabela de correspondência separada, no seu computador. Antes de enviar um documento a uma ferramenta de IA, isso reduz a exposição do cliente. Mas atenção: dado pseudonimizado continua sendo dado pessoal pela LGPD, porque a identidade pode ser recuperada com a tabela ou pelo contexto. Anonimização é outra coisa, e bem mais difícil de alcançar.

O método que funciona tem uma ordem: primeiro recortar só o necessário, depois substituir os identificadores, testar se algo vazou, enviar o texto transformado e restaurar os dados reais apenas no seu ambiente. Este guia mostra cada passo, com um exemplo.

Etapas da pseudonimização de dados jurídicosEtapas da pseudonimização de dados jurídicos

Pseudonimização e anonimização: a diferença na LGPD

PseudonimizaçãoAnonimização
O que éTroca de identificadores por marcadores, com a tabela guardada à parteRemoção da possibilidade de identificar a pessoa por meios razoáveis
A identidade pode ser recuperada?Sim, com a tabela ou pelo contextoNão, por meios razoáveis e disponíveis
Continua sendo dado pessoal?SimNão, salvo se a reversão for possível
Base na LGPDArt. 13, § 4º (no contexto de estudos de saúde pública)Arts. 5º, XI, e 12

O art. 12 da LGPD ressalva que o dado dito anônimo volta a ser pessoal quando a reversão for possível com esforços razoáveis. Por isso, trate o material pseudonimizado com os mesmos cuidados de qualquer dado pessoal.

A pseudonimização também não resolve, sozinha, a base legal, a transferência internacional, a retenção pelo fornecedor, o sigilo sobre estratégia ou o risco de acesso indevido ao seu computador. Esses pontos estão no guia de IA, LGPD e sigilo na advocacia.

Passo 1: recorte antes de substituir

Não pseudonimize o processo inteiro quando a tarefa precisa de três páginas. Defina o resultado que você quer, escolha os documentos e trechos necessários e só então substitua os identificadores.

A necessidade de precisão também depende da tarefa. Para revisar a redação, datas e valores podem virar categorias genéricas. Para calcular um prazo ou conferir um pagamento, eles precisam ficar exatos.

Passo 2: use marcadores que preservem o papel no caso

<PESSOA_01> esconde o nome, mas empobrece a análise. Prefira marcadores que indiquem o papel:

Modelo prático

Adapte os itens ao caso e confira o resultado antes de utilizá-lo.

<CLIENTE_01>

<PARTE_AUTORA_01>

<PARTE_RE_01>

<TESTEMUNHA_01>

<EMPRESA_FORNECEDORA_01>

<CONTA_CLIENTE_01>

<PROCESSO_01>

O mesmo marcador deve representar sempre a mesma pessoa. Se "Maria de Souza", "M. de Souza" e o CPF dela aparecem no texto, todos precisam virar o mesmo <CLIENTE_01>. E não acrescente atributos (profissão, parentesco, cidade) se eles não forem necessários à análise.

Passo 3: saiba o que procurar

Em documentos jurídicos brasileiros, procure:

  • nomes, apelidos, variações de grafia e assinaturas;
  • CPF, CNPJ, RG, CNH, passaporte e número da OAB;
  • e-mail, telefone, endereço e CEP;
  • conta, agência, chave Pix e outros dados financeiros;
  • número do processo, placa de veículo e matrícula de imóvel;
  • dados de saúde, biometria e outros dados sensíveis;
  • informações de crianças e adolescentes;
  • senhas e códigos de acesso;
  • nomes em arquivos, cabeçalhos, rodapés, comentários e imagens.

Não mascare toda sequência de números: artigos de lei, valores e datas podem ser essenciais ao sentido do texto.

Passo 4: combine ferramentas e revisão

Nenhum método encontra tudo sozinho. Combine:

  1. buscas por formato, que encontram CPF, CNPJ, e-mail, telefone e número de processo;
  2. reconhecimento de nomes, que identifica pessoas, empresas e endereços no contexto;
  3. uma lista do caso, com as partes, testemunhas, empresas e variações de nome já conhecidas;
  4. revisão humana, para o que as etapas anteriores deixaram passar.

A busca por formato perde nomes. O reconhecimento automático pode errar números brasileiros. E um documento com leitura automática de páginas digitalizadas (OCR) ruim pode ter um dígito trocado que escapa das duas. Se o material vem de PDF escaneado, faça antes uma boa extração do texto.

Passo 5: proteja a tabela de correspondência

A tabela que liga cada marcador ao dado real é o ponto mais sensível de todo o processo. Guarde-a separada do texto transformado, com criptografia e acesso restrito, e nunca a envie à ferramenta de IA. Evite deixá-la num arquivo aberto na mesma pasta do PDF e não reaproveite a tabela de um caso em outro: <CLIENTE_01> pode ser pessoas diferentes em casos diferentes.

Se não houver necessidade de restaurar os dados depois, apague a tabela. Se houver, defina por quanto tempo ela será guardada e por quê.

Passo 6: procure identificadores indiretos

Nome e CPF são só o começo. Uma combinação de cidade pequena, profissão rara, data e doença pode revelar a pessoa. Verifique também:

  • as propriedades e o nome do arquivo;
  • o texto escondido sob uma tarja preta no PDF (cobrir visualmente não apaga o texto selecionável);
  • comentários e alterações controladas no Word;
  • cabeçalhos, rodapés, tabelas e imagens;
  • endereços de e-mail que contêm o nome da pessoa.

Passo 7: envie e restaure com cuidado

Ao enviar o texto transformado, inclua uma instrução como:

Preserve exatamente os marcadores entre < >. Não crie pessoas, documentos ou identificadores. Se faltar informação, deixe a lacuna explícita.

Na volta, restaure os dados reais só no seu computador. Antes de liberar o resultado, confira se todos os marcadores existem na tabela, se a ferramenta não inventou marcadores novos, se a concordância (ele/ela, singular/plural) está certa e se não sobraram dados reais em arquivos temporários.

Exemplo com o Caso Helena

O Caso Helena é um exercício do livro Advocacia Aumentada: uma aposentada contesta um consignado digital que diz ter contratado achando que era uma revisão de juros. Os dados abaixo são fictícios.

Antes:

Modelo prático

Adapte os itens ao caso e confira o resultado antes de utilizá-lo.

A CCB eletrônica BV-884231 está em nome de Helena Nogueira, CPF 000.111.222-33,

beneficiária do INSS; ela contesta o consentimento para a contratação.

A conversa de WhatsApp vem do número (31) 90000-0000, e o extrato da conta

12345-6 mostra o crédito de R$ 12.900,00 em 12/01/2026.

Depois (para montar uma cronologia):

Modelo prático

Adapte os itens ao caso e confira o resultado antes de utilizá-lo.

A CCB eletrônica <CONTRATO_01> está em nome de <CLIENTE_01>, <CPF_CLIENTE_01>,

beneficiária do INSS; ela contesta o consentimento para a contratação.

A conversa de WhatsApp vem do número <TEL_01>, e o extrato da conta

<CONTA_01> mostra o crédito de <VALOR_CREDITO_01> em 12/01/2026.

O papel de cada parte, o evento e a fonte continuam claros; nome, CPF, telefone, conta, contrato e valor saíram. A data ficou porque a tarefa é justamente ordenar os eventos. Se a tarefa não dependesse do dia exato, daria para reduzi-la a mês e ano.

Como testar se a pseudonimização funcionou

Antes de usar em casos reais, teste com duas páginas autorizadas e sem enviar nada à IA:

O que medirPergunta
CoberturaTodos os identificadores sensíveis foram encontrados?
VazamentosSobrou algum dado exposto?
ExcessosAlgo foi removido sem necessidade?
ConsistênciaA mesma pessoa recebeu sempre o mesmo marcador?
RestauraçãoCada dado voltou ao lugar certo?
UtilidadeA tarefa ainda pode ser feita com o texto transformado?

Acompanhe separadamente os dados mais graves (saúde, crianças, contas e senhas): uma boa média geral pode esconder uma falha rara e séria. E teste a utilidade: se a cronologia perde a ordem ou uma parte troca de papel, a proteção custou a análise. O guia de cronologia processual oferece um bom caso de teste.

Se o destino for o ChatGPT, veja também ChatGPT é seguro para advogado?. As decisões sobre retenção e responsáveis devem constar da governança de IA do escritório.

Respostas rápidas

Perguntas frequentes

Pseudonimização é o mesmo que anonimização?

Não. Na pseudonimização, a identidade pode ser recuperada com a tabela de correspondência ou pelo contexto, e o dado continua sendo pessoal. Na anonimização, a identificação não é mais possível por meios razoáveis.

Dado pseudonimizado está fora da LGPD?

Não. Enquanto for possível reidentificar a pessoa, o dado continua pessoal e sujeito à LGPD.

Existe ferramenta para pseudonimizar documentos automaticamente?

Existem ferramentas que detectam nomes, CPF e outros identificadores, mas nenhuma encontra tudo. Combine a detecção automática com uma lista do caso e revisão humana.

Tarja preta no PDF protege os dados?

Nem sempre. Se a tarja só cobre visualmente o texto, ele continua selecionável e pode ser copiado. Use ferramentas que removem o texto de fato e confira o resultado.

Fontes e referências