
As organizações frequentemente acumulam centenas ou até milhares de documentos Word ao longo do tempo. Esses arquivos podem vir de diferentes departamentos, funcionários, fornecedores ou sistemas legados, resultando em fontes, estruturas de títulos, numeração, espaçamento, cabeçalhos e outras formatações inconsistentes.
Preparar tais documentos para publicação, migração ou arquivamento é mais do que uma simples tarefa de formatação. Em muitos casos, as organizações também precisam identificar o assunto de cada documento, extrair metadados importantes, criar resumos concisos e organizar os resultados em um índice de documentos pesquisável.
A automação tradicional do Word pode lidar bem com regras de formatação fixas, mas torna-se difícil quando as estruturas dos documentos variam. Uma abordagem baseada em IA pode primeiro entender o papel lógico do conteúdo — como títulos, cabeçalhos, corpo do texto, datas e tipos de documento — e, em seguida, aplicar as operações de documento apropriadas.
Neste artigo, usaremos o Spire.Agent.Office para .NET para construir um fluxo de trabalho de processamento de Word em três etapas em C#:
Documentos Word → Padronização de formatação → Extração de metadados e resumos → Índice de documentos
Por que a padronização de documentos Word com IA é importante
Padronizar uma coleção de documentos Word nem sempre é tão simples quanto definir a mesma fonte para todos os parágrafos.
Uma organização típica pode ter documentos como:
Input/
├── Politica_de_Viagens_Funcionarios.docx
├── Guia_de_Onboarding_Fornecedores.docx
├── Relatorio_de_Incidente_Seguranca.docx
└── Politica_de_Trabalho_Remoto.docx
Mesmo quando esses documentos cobrem processos de negócios semelhantes, sua estrutura interna pode diferir consideravelmente.
Por exemplo, um documento pode usar um estilo real de Título 1 do Word para títulos de seção, enquanto outro simplesmente usa texto em negrito de 16 pontos. Alguns documentos podem usar seções numeradas como:
1. Objetivo
2. Escopo
3. Responsabilidades
enquanto outros podem usar numeração inconsistente como:
I. Objetivo
Seção 2 - Escopo
3) Responsabilidades
A automação de documentos tradicional geralmente exige que os desenvolvedores inspecionem posições de parágrafos, estilos ou padrões de texto e escrevam regras para cada variação.
O processamento de documentos assistido por IA muda a abordagem. Em vez de especificar que "o parágrafo 3 deve ser um título", os desenvolvedores podem descrever o resultado desejado:
Identifique o título do documento e a hierarquia de cabeçalhos, normalize os estilos e a numeração dos cabeçalhos e preserve o conteúdo original.
A camada de IA interpreta a estrutura do documento, enquanto o motor de documentos Word subjacente realiza o processamento real do documento.
Isso torna a abordagem particularmente útil para coleções de documentos de negócios semiestruturados, onde o conteúdo é diferente, mas o padrão de saída desejado é consistente.
O que este exemplo irá automatizar
Nosso fluxo de trabalho de exemplo contém três etapas de processamento.
Etapa 1: Padronizar a formatação do Word
Cada documento de origem é analisado e reformatado de acordo com um estilo corporativo compartilhado. O processamento inclui:
- Normalização de fontes e tamanhos de fonte
- Identificação de títulos de documentos
- Aplicação de níveis de cabeçalho consistentes
- Normalização da numeração de cabeçalhos
- Padronização do espaçamento entre parágrafos
- Adição de um cabeçalho comum
- Adição de números de página ao rodapé
- Preservação do texto original, tabelas, imagens e hiperlinks
O resultado é uma versão padronizada de cada documento de entrada.
Etapa 2: Extrair metadados e resumos
Os documentos padronizados são então analisados individualmente para extrair informações como:
- Título do documento
- Departamento
- Tipo de documento
- Data de vigência ou emissão
- Palavras-chave
- Resumo
Cada resultado é salvo como um pequeno documento de metadados Word estruturado.
Etapa 3: Criar um índice de documentos
Finalmente, os arquivos de metadados são combinados e convertidos em um único índice de documentos Word.
O índice final pode conter informações semelhantes a:
| Nº | Título | Departamento | Tipo | Data | Resumo |
|---|---|---|---|---|---|
| 1 | Política de Viagens | Recursos Humanos | Política | 15 de julho de 2026 | Define requisitos de aprovação e reembolso de viagens. |
| 2 | Guia de Onboarding de Fornecedores | Compras | Procedimento | 3 de junho de 2026 | Descreve o processo de registro e aprovação de novos fornecedores. |
| 3 | Relatório de Incidente de Segurança | TI | Relatório | 8 de agosto de 2026 | Resume um incidente de segurança e as ações tomadas em resposta. |
Isso produz não apenas arquivos Word mais limpos, mas também uma visão geral útil de toda a coleção de documentos.
Configurando o Spire.Agent.Office para C#
Primeiro, crie um projeto .NET e instale o Spire.Agent.Office via NuGet.
Você pode instalar o pacote pelo Gerenciador de Pacotes NuGet do Visual Studio ou usar a CLI do .NET:
dotnet add package Spire.Agent.Office
Em seguida, importe os namespaces necessários:
using System;
using System.IO;
using Spire.Agent.Office.AI;
using Spire.Agent.Office.Extensions;
using Spire.Doc;
O processamento de documentos por IA segue um padrão simples.
Primeiro, configure uma instância de AIOptions com um SpireToken:
AIOptions options = new AIOptions();
options.SpireToken = "seu SpireToken";
Você pode solicitar um SpireToken temporário para testes na página de licença temporária do Spire. Após obter o token, atribua-o à propriedade SpireToken antes de chamar as APIs de processamento de IA.
Em seguida, carregue um documento Word e crie um AIDocumentProcessor:
using (Document doc = new Document())
{
doc.LoadFromFile("input.docx");
AIDocumentProcessor processor = doc.AI(options);
processor.ExecuteInstruction(
doc,
"Sua instrução em linguagem natural",
"output.docx"
);
}
A parte importante é a instrução. Em vez de escrever manualmente uma longa sequência de chamadas de API do Word, descrevemos como o documento deve ser e deixamos o agente realizar as operações correspondentes.
Nas seções a seguir, aplicaremos essa abordagem a um diretório inteiro de arquivos Word.
Padronizando a formatação do Word com IA
Suponha que documentos coletados de diferentes departamentos usem fontes, cabeçalhos, numeração e layouts de página inconsistentes.
Queremos que todos sigam o mesmo estilo de documento corporativo:
- Arial para todo o texto
- Texto do corpo com 11 pt
- Título do documento em negrito com 20 pt
- Título 1 em negrito com 16 pt
- Título 2 em negrito com 13 pt
- Numeração multinível consistente
- Espaçamento entre linhas de 1.15
- Um cabeçalho corporativo
- Números de página centralizados
- Sem alterações na redação original
O código a seguir processa cada arquivo .docx em um diretório de entrada e salva versões padronizadas em um novo diretório.
using System;
using System.IO;
using Spire.Agent.Office.AI;
using Spire.Agent.Office.Extensions;
using Spire.Doc;
string inputFolder = @"E:\Documents\Input";
string outputFolder = @"E:\Documents\Standardized";
string spireToken = "seu SpireToken";
Directory.CreateDirectory(outputFolder);
string aiRule = """
Analise a estrutura deste documento Word e padronize sua formatação de acordo com as seguintes regras corporativas:
1. Preserve toda a redação original. Não reescreva, resuma, encurte ou remova qualquer conteúdo do documento.
2. Use Arial como fonte padrão e 11 pt para o corpo do texto normal.
3. Identifique o título principal do documento e formate-o como negrito de 20 pt.
4. Identifique a hierarquia lógica de cabeçalhos e aplique estilos de cabeçalho Word apropriados. Use negrito de 16 pt para Título 1 e negrito de 13 pt para Título 2.
5. Normalize a numeração de seções em uma hierarquia consistente, como 1, 1.1 e 1.1.1, quando apropriado.
6. Use espaçamento entre linhas de 1.15 para parágrafos do corpo normal e mantenha o espaçamento entre parágrafos visualmente consistente.
7. Adicione 'Biblioteca de Documentos Corporativos' ao cabeçalho do documento.
8. Adicione números de página centralizados ao rodapé.
9. Preserve todas as tabelas, imagens, hiperlinks e outros objetos de documento existentes.
10. Mantenha a estrutura geral do documento e o significado original inalterados.
""";
var aiOpts = new AIOptions { SpireToken = spireToken };
foreach (var file in Directory.GetFiles(inputFolder, "*.docx"))
{
var fileName = Path.GetFileName(file);
var savePath = Path.Combine(outputFolder, fileName);
using var doc = new Document();
doc.LoadFromFile(file);
var res = doc.AI(aiOpts).ExecuteInstruction(doc, aiRule, savePath);
Console.WriteLine(res.Success ? $"Processado: {fileName}" : $"Falha: {fileName} - {res.ErrorMessage}");
}
Um detalhe importante na instrução é o requisito de identificar a hierarquia lógica de cabeçalhos.
Isso é diferente de simplesmente alterar a fonte de cada parágrafo em negrito. O agente pode analisar o que um parágrafo representa e determinar se ele funciona como um título de documento, título de seção principal, subseção ou texto de corpo normal.
Para fluxos de trabalho de gerenciamento de documentos, estilos de cabeçalho adequados são especialmente úteis porque podem melhorar a navegação, a geração automática de sumários, marcadores de PDF, acessibilidade e a análise posterior de documentos.
Outra regra importante é:
Preserve toda a redação original.
A formatação e a reescrita de conteúdo devem ser tratadas como tarefas separadas. Quando o objetivo desta etapa é a padronização de documentos, a IA não deve reescrever ou resumir o texto original simultaneamente.
Após a execução, o diretório de saída contém cópias padronizadas:
Standardized/
├── Politica_de_Viagens_Funcionarios.docx
├── Guia_de_Onboarding_Fornecedores.docx
├── Relatorio_de_Incidente_Seguranca.docx
└── Politica_de_Trabalho_Remoto.docx
O exemplo a seguir mostra como um documento Word formatado de forma inconsistente parece antes e depois da padronização com IA.

Extraindo metadados e gerando resumos de documentos
Uma vez que a formatação foi padronizada, o próximo passo é entender o que cada documento contém.
Abrir manualmente centenas de arquivos e registrar seus títulos, departamentos, datas, categorias e resumos é demorado. Esta é uma tarefa onde a compreensão de documentos por IA é particularmente útil.
Para este exemplo, extrairemos seis campos de cada documento:
- Título
- Departamento
- Tipo de documento
- Data
- Palavras-chave
- Resumo
Em vez de retornar texto livre, a instrução exige uma estrutura previsível. Isso torna os resultados mais fáceis de processar posteriormente.
using System;
using System.IO;
using Spire.Agent.Office.AI;
using Spire.Agent.Office.Extensions;
using Spire.Doc;
string inputFolder = @"E:\Documents\Standardized";
string outputFolder = @"E:\Documents\Metadata";
string spireToken = "seu SpireToken";
Directory.CreateDirectory(outputFolder);
string aiRule = """
Analise este documento Word e crie um relatório de metadados conciso.
Extraia as seguintes informações do conteúdo real do documento:
- Título
- Departamento ou função de negócio responsável
- Tipo de documento, como Política, Procedimento, Relatório, Guia ou Memorando
- Data de Vigência ou Data de Emissão
- 3 a 5 Palavras-chave
- Resumo de aproximadamente 80 a 120 palavras
Crie um novo documento conciso contendo apenas esses campos.
Use exatamente os seguintes rótulos:
Título:
Departamento:
Tipo de Documento:
Data:
Palavras-chave:
Resumo:
Não invente informações que não possam ser razoavelmente determinadas a partir da fonte. Se uma data ou departamento específico não estiver disponível, use 'Não especificado'. Mantenha o resumo factual e baseado apenas no documento de origem.
""";
var aiOpts = new AIOptions { SpireToken = spireToken };
foreach (var file in Directory.GetFiles(inputFolder, "*.docx"))
{
var fileName = Path.GetFileNameWithoutExtension(file);
var savePath = Path.Combine(outputFolder, $"{fileName}_Metadata.docx");
using var doc = new Document();
doc.LoadFromFile(file);
var res = doc.AI(aiOpts).ExecuteInstruction(doc, aiRule, savePath);
Console.WriteLine(res.Success ? $"Metadados extraídos: {fileName}" : $"Falha: {fileName} - {res.ErrorMessage}");
}
Um documento de metadados gerado parece com isto:

O requisito de usar rótulos fixos é importante.
Se o prompt simplesmente disser "resuma o documento", documentos diferentes podem produzir estruturas de saída substancialmente diferentes. Exigir campos consistentes torna os arquivos intermediários muito mais fáceis de combinar em um índice final.
A instrução também diz explicitamente ao agente para não inventar metadados ausentes. Para registros de negócios, "Não especificado" é geralmente mais útil do que adivinhar um departamento ou data que o documento nunca declara.
Criando um índice de documentos a partir de vários arquivos Word
Neste ponto, temos um arquivo de metadados para cada documento processado:
Metadata/
├── Politica_de_Viagens_Funcionarios_Metadata.docx
├── Guia_de_Onboarding_Fornecedores_Metadata.docx
├── Relatorio_de_Incidente_Seguranca_Metadata.docx
└── Politica_de_Trabalho_Remoto_Metadata.docx
O passo final é consolidar esses arquivos de metadados individuais em um único índice de documentos baseado em Word.
Em vez de abrir manualmente cada documento de metadados, extrair seu texto e mesclar os resultados em C#, podemos passar todos os arquivos de metadados diretamente para o Spire.Agent.Office através do parâmetro attachments. O agente de IA lê os documentos anexados, extrai os campos rotulados de cada um e cria um novo documento Word contendo um índice consolidado.
O parâmetro attachments é útil quando a tarefa de IA depende de vários arquivos de suporte em vez de um único documento de entrada principal. Neste exemplo, não há um documento Word existente que precise ser modificado. Portanto, criamos um objeto Document vazio e usamos os arquivos de metadados como fontes de informação para gerar o índice final.
using System;
using System.IO;
using Spire.Agent.Office.AI;
using Spire.Agent.Office.Extensions;
using Spire.Doc;
string metadataFolder = @"E:\Documents\Metadata";
string outputPath = @"E:\Documents\Document_Index.docx";
string spireToken = "seu SpireToken";
var attachments = Directory.GetFiles(metadataFolder, "*_Metadata.docx");
string aiRule = """
Leia todos os documentos de metadados fornecidos nos anexos e crie um índice de documentos Word consolidado.
Crie o título 'Índice de Documentos' no topo do documento.
Crie uma tabela com as seguintes colunas:
Nº | Título | Departamento | Tipo de Documento | Data | Palavras-chave | Resumo
Requisitos:
1. Crie uma linha para cada documento de metadados.
2. Numere os registros sequencialmente começando de 1.
3. Extraia os valores dos campos rotulados em cada anexo.
4. Preserve as informações extraídas e não invente dados ausentes.
5. Use 'Não especificado' quando um campo estiver indisponível.
6. Deixe o cabeçalho da tabela em negrito.
7. Dê à coluna Resumo mais largura do que as outras colunas.
8. Use um estilo profissional limpo adequado para um registro de documentos interno.
9. Produza um documento Word independente contendo apenas o índice final.
""";
var aiOpts = new AIOptions { SpireToken = spireToken };
using var doc = new Document();
var res = doc.AI(aiOpts).ExecuteInstruction(doc, aiRule, outputPath, attachments);
Console.WriteLine(res.Success
? $"Índice de documentos criado: {outputPath}"
: $"Falha ao criar índice de documentos: {res.ErrorMessage}");
A saída final é salva como:
Document_Index.docx
Em vez de abrir cada documento original individualmente, os funcionários agora podem usar um índice consolidado para entender rapidamente quais documentos estão disponíveis e o que cada arquivo contém.

Este tipo de índice pode ser particularmente útil antes de migrar arquivos para um sistema de gerenciamento de documentos, preparar uma base de conhecimento interna, revisar coleções de documentos legados ou organizar registros para retenção de longo prazo.
Melhores práticas para processamento confiável de documentos com IA
A IA torna o processamento de documentos semiestruturados mais flexível, mas resultados confiáveis ainda dependem fortemente de como a tarefa é projetada.
Separe a formatação da análise de conteúdo
Evite pedir ao agente para padronizar a formatação, reescrever o texto, resumir o documento e extrair metadados em uma única instrução grande.
Essas são operações diferentes com objetivos diferentes.
Um fluxo de trabalho mais seguro é:
Documento original
↓
Padronização de formatação
↓
Documento padronizado
↓
Extração de metadados
↓
Metadados estruturados
↓
Índice de documentos
Isso também torna os problemas mais fáceis de identificar e depurar.
Defina regras de formatação explicitamente
Instruções como:
Faça o documento parecer profissional.
deixam muita margem para interpretação.
Sempre que a consistência for importante, especifique as regras corporativas reais:
Arial, corpo do texto de 11 pt
Título do documento de 20 pt
Título 1 de 16 pt
Título 2 de 13 pt
Espaçamento entre linhas de 1.15
Numeração 1 / 1.1 / 1.1.1
O mesmo princípio se aplica a cabeçalhos, rodapés, formatação de tabelas e layout de página.
Proteja o conteúdo original
Para tarefas de formatação, inclua explicitamente requisitos como:
Preserve toda a redação original.
e:
Não reescreva, resuma, encurte ou exclua o conteúdo do documento.
Os arquivos de origem também devem ser retidos em vez de sobrescritos durante o processamento em lote automatizado.
Uma estrutura de pastas prática é:
Documents/
├── Input/
├── Standardized/
├── Metadata/
└── Document_Index.docx
Solicite metadados estruturados
Quando as informações extraídas forem reutilizadas programaticamente, a saída previsível é mais valiosa do que a saída criativa.
Em vez de:
Diga-me sobre o que é este documento.
use um esquema fixo:
Título:
Departamento:
Tipo de Documento:
Data:
Palavras-chave:
Resumo:
Isso torna o processamento posterior consideravelmente mais fácil.
Trate informações ausentes explicitamente
Nem todo documento contém um nome de departamento, data de vigência, número de documento ou proprietário.
Diga à IA o que fazer quando as informações estiverem faltando:
Use "Não especificado" em vez de adivinhar.
Isso é especialmente importante para gerenciamento de documentos, jurídico, financeiro, conformidade e outros fluxos de trabalho sensíveis a registros.
Revise saídas de alta importância
Metadados e resumos gerados por IA não devem ser tratados automaticamente como registros autorizados em fluxos de trabalho de alto risco.
Para organização interna comum de documentos, os resultados automatizados podem ser suficientes. Para arquivos regulamentados, registros legais, documentos de conformidade ou sistemas oficiais de retenção, os campos extraídos e as classificações ainda devem ser validados de acordo com os requisitos de revisão da organização.
Conclusão
O processamento de Word em lote geralmente envolve dois problemas diferentes.
O primeiro é a automação de documentos: alterar fontes, aplicar estilos, criar cabeçalhos e rodapés, gerenciar numeração e gerar arquivos Word.
O segundo é a compreensão de documentos: determinar o que o conteúdo representa, identificar tipos de documentos, encontrar datas e departamentos, extrair palavras-chave e produzir resumos.
APIs tradicionais do Word são altamente eficazes quando os desenvolvedores já sabem exatamente qual conteúdo modificar. O processamento assistido por IA torna-se particularmente útil quando os documentos são inconsistentes e o software deve primeiro entender sua estrutura antes de decidir como processá-los.
Usando o Spire.Agent.Office em C#, essas duas capacidades podem ser combinadas em um único fluxo de trabalho:
Analisar → Padronizar → Extrair → Organizar
No exemplo acima, uma pasta contendo documentos Word inconsistentes é transformada em uma coleção de documentos padronizada, um conjunto de registros de metadados estruturados e, finalmente, um índice de documentos Word centralizado.
A mesma arquitetura pode ser estendida a outros fluxos de trabalho empresariais, como bibliotecas de políticas, manuais de procedimentos, documentação de conformidade, arquivos de projetos, registros de RH, documentação de fornecedores e migração de documentos legados.
Em vez de revisar e organizar arquivos manualmente um por um, os desenvolvedores podem definir as regras de documento e a estrutura de informações necessárias em linguagem natural e automatizar as partes repetitivas do fluxo de trabalho, enquanto ainda produzem documentos Word reais e editáveis.