KI-gestützte Textformatierung, Zusammenfassung und Indizierung in C#

2026-09-02 08:54:56 jie zou
AI Summarize:
ChatGPT
ChatGPT
Claude
Grok
Perplexity
Quick
Quick
Concise overview
Highlights
Key takeaways
Detailed
Structured explanation
Brief
One sentence summary
Summarize |

KI-gestützte Word-Formatierung, Zusammenfassung und Indizierung

Unternehmen sammeln im Laufe der Zeit oft Hunderte oder sogar Tausende von Word-Dokumenten an. Diese Dateien stammen möglicherweise aus verschiedenen Abteilungen, von Mitarbeitern, Anbietern oder aus Altsystemen, was zu inkonsistenten Schriftarten, Überschriftenstrukturen, Nummerierungen, Abständen, Kopfzeilen und anderen Formatierungen führt.

Die Vorbereitung solcher Dokumente für die Veröffentlichung, Migration oder Archivierung ist mehr als eine einfache Formatierungsaufgabe. In vielen Fällen müssen Unternehmen auch identifizieren, worum es in jedem Dokument geht, wichtige Metadaten extrahieren, prägnante Zusammenfassungen erstellen und die Ergebnisse in einem durchsuchbaren Dokumentenindex organisieren.

Traditionelle Word-Automatisierung kann feste Formatierungsregeln gut handhaben, stößt aber an ihre Grenzen, wenn die Dokumentstrukturen variieren. Ein KI-gestützter Ansatz kann zunächst die logische Rolle von Inhalten verstehen – wie Titel, Überschriften, Fließtext, Daten und Dokumenttypen – und dann die entsprechenden Dokumentoperationen anwenden.

In diesem Artikel verwenden wir Spire.Agent.Office für .NET, um einen dreistufigen Word-Verarbeitungs-Workflow in C# zu erstellen:

Word-Dokumente → Formatierungsstandardisierung → Metadaten- und Zusammenfassungsextraktion → Dokumentenindex

Warum die KI-gestützte Standardisierung von Word-Dokumenten wichtig ist

Die Standardisierung einer Sammlung von Word-Dokumenten ist nicht immer so einfach, wie jeden Absatz auf dieselbe Schriftart einzustellen.

Ein typisches Unternehmen kann Dokumente haben wie:

Input/
├── Employee_Travel_Policy.docx
├── Vendor_Onboarding_Guide.docx
├── Security_Incident_Report.docx
└── Remote_Work_Policy.docx

Selbst wenn diese Dokumente ähnliche Geschäftsprozesse abdecken, kann ihre interne Struktur erheblich voneinander abweichen.

Zum Beispiel kann ein Dokument eine echte Word-Formatvorlage Überschrift 1 für Abschnittstitel verwenden, während ein anderes einfach fettgedruckten 16-Punkt-Text verwendet. Einige Dokumente verwenden möglicherweise nummerierte Abschnitte wie:

1. Zweck
2. Geltungsbereich
3. Verantwortlichkeiten

während andere inkonsistente Nummerierungen verwenden, wie:

I. Zweck
Abschnitt 2 - Geltungsbereich
3) Verantwortlichkeiten

Bei der traditionellen Dokumentenautomatisierung müssen Entwickler normalerweise die Absatzpositionen, Formatvorlagen oder Textmuster untersuchen und Regeln für jede Variation schreiben.

KI-gestützte Dokumentenverarbeitung ändert diesen Ansatz. Anstatt festzulegen, dass "Absatz 3 eine Überschrift sein sollte", können Entwickler das gewünschte Ergebnis beschreiben:

Identifizieren Sie den Dokumenttitel und die Überschriftenhierarchie, normalisieren Sie die Überschriftenformate und die Nummerierung und bewahren Sie den ursprünglichen Inhalt.

Die KI-Ebene interpretiert die Dokumentstruktur, während die zugrunde liegende Word-Dokumenten-Engine die eigentliche Dokumentverarbeitung durchführt.

Dies macht den Ansatz besonders nützlich für Sammlungen von semistrukturierten Geschäftsdokumenten, bei denen der Inhalt unterschiedlich ist, aber der gewünschte Ausgabestandard konsistent sein soll.

Was dieses Beispiel automatisieren wird

Unser Beispiel-Workflow umfasst drei Verarbeitungsschritte.

Schritt 1: Standardisierung der Word-Formatierung

Jedes Quelldokument wird analysiert und gemäß einem gemeinsamen Unternehmensstil neu formatiert. Die Verarbeitung umfasst:

  • Normalisierung von Schriftarten und Schriftgrößen
  • Identifizierung von Dokumenttiteln
  • Anwendung konsistenter Überschriftenebenen
  • Normalisierung der Überschriftennummerierung
  • Standardisierung von Absatzabständen
  • Hinzufügen einer gemeinsamen Kopfzeile
  • Hinzufügen von Seitenzahlen in der Fußzeile
  • Beibehaltung des ursprünglichen Textes, der Tabellen, Bilder und Hyperlinks

Das Ergebnis ist eine standardisierte Version jedes Eingabedokuments.

Schritt 2: Metadaten und Zusammenfassungen extrahieren

Die standardisierten Dokumente werden dann einzeln analysiert, um Informationen zu extrahieren, wie zum Beispiel:

  • Dokumenttitel
  • Abteilung
  • Dokumenttyp
  • Gültigkeits- oder Ausgabedatum
  • Schlüsselwörter
  • Zusammenfassung

Jedes Ergebnis wird als kleines strukturiertes Word-Metadatendokument gespeichert.

Schritt 3: Erstellen eines Dokumentenindex

Schließlich werden die Metadatendateien kombiniert und in einen einzigen Word-Dokumentenindex konvertiert.

Der fertige Index kann Informationen enthalten, die wie folgt aussehen:

Nr. Titel Abteilung Typ Datum Zusammenfassung
1 Reiserichtlinie für Mitarbeiter Personalwesen Richtlinie 15. Juli 2026 Definiert Anforderungen für Reisefreigaben und Kostenerstattungen.
2 Leitfaden für das Onboarding von Anbietern Beschaffung Verfahren 3. Juni 2026 Beschreibt den Prozess zur Registrierung und Genehmigung neuer Anbieter.
3 Sicherheitsvorfallbericht IT Bericht 8. August 2026 Fasst einen Sicherheitsvorfall und die als Reaktion ergriffenen Maßnahmen zusammen.

Dies führt nicht nur zu saubereren Word-Dateien, sondern auch zu einem nützlichen Überblick über die gesamte Dokumentsammlung.

Einrichtung von Spire.Agent.Office für C#

Erstellen Sie zunächst ein .NET-Projekt und installieren Sie Spire.Agent.Office über NuGet.

Sie können das Paket über den NuGet-Paket-Manager von Visual Studio installieren oder die .NET CLI verwenden:

dotnet add package Spire.Agent.Office

Importieren Sie dann die erforderlichen Namespaces:

using System;
using System.IO;
using Spire.Agent.Office.AI;
using Spire.Agent.Office.Extensions;
using Spire.Doc;

Die KI-Dokumentenverarbeitung folgt einem einfachen Muster.

Konfigurieren Sie zunächst eine AIOptions-Instanz mit einem SpireToken:

AIOptions options = new AIOptions();
options.SpireToken = "Ihr SpireToken";

Sie können ein temporäres SpireToken zum Testen auf der Spire-Seite für temporäre Lizenzen anfordern. Nachdem Sie das Token erhalten haben, weisen Sie es der Eigenschaft SpireToken zu, bevor Sie die KI-Verarbeitungs-APIs aufrufen.

Laden Sie als Nächstes ein Word-Dokument und erstellen Sie einen AIDocumentProcessor:

using (Document doc = new Document())
{
    doc.LoadFromFile("input.docx");

    AIDocumentProcessor processor = doc.AI(options);

    processor.ExecuteInstruction(
        doc,
        "Ihre Anweisung in natürlicher Sprache",
        "output.docx"
    );
}

Der wichtige Teil ist die Anweisung. Anstatt manuell eine lange Sequenz von Word-API-Aufrufen zu schreiben, beschreiben wir, wie das Dokument aussehen soll, und lassen den Agenten die entsprechenden Operationen ausführen.

In den folgenden Abschnitten werden wir diesen Ansatz auf ein ganzes Verzeichnis von Word-Dateien anwenden.

Standardisierung der Word-Formatierung mit KI

Angenommen, Dokumente, die aus verschiedenen Abteilungen gesammelt wurden, verwenden inkonsistente Schriftarten, Überschriften, Nummerierungen und Seitenlayouts.

Wir möchten, dass alle dem gleichen Unternehmensdokumentstil folgen:

  • Arial für den gesamten Text
  • 11 pt Fließtext
  • 20 pt fetter Dokumenttitel
  • 16 pt fette Überschrift 1
  • 13 pt fette Überschrift 2
  • Konsistente mehrstufige Nummerierung
  • 1,15 Zeilenabstand
  • Eine Unternehmenskopfzeile
  • Zentrierte Seitenzahlen
  • Keine Änderungen am ursprünglichen Wortlaut

Der folgende Code verarbeitet jede .docx-Datei in einem Eingabeverzeichnis und speichert standardisierte Versionen in einem neuen Verzeichnis.

using System;
using System.IO;
using Spire.Agent.Office.AI;
using Spire.Agent.Office.Extensions;
using Spire.Doc;

string inputFolder = @"E:\Documents\Input";
string outputFolder = @"E:\Documents\Standardized";
string spireToken = "Ihr SpireToken";
Directory.CreateDirectory(outputFolder);

string aiRule = """
Analysieren Sie die Struktur dieses Word-Dokuments und standardisieren Sie dessen Formatierung gemäß den folgenden Unternehmensregeln:

1. Bewahren Sie den gesamten ursprünglichen Wortlaut. Schreiben Sie keine Inhalte um, fassen Sie sie nicht zusammen, kürzen Sie sie nicht und entfernen Sie keine Dokumentinhalte.
2. Verwenden Sie Arial als Standardschriftart und 11 pt für normalen Fließtext.
3. Identifizieren Sie den Haupttitel des Dokuments und formatieren Sie ihn mit 20 pt fett.
4. Identifizieren Sie die logische Überschriftenhierarchie und wenden Sie die richtigen Word-Überschriftenformate an. Verwenden Sie 16 pt fett für Überschrift 1 und 13 pt fett für Überschrift 2.
5. Normalisieren Sie die Abschnittsnummerierung in eine konsistente Hierarchie wie 1, 1.1 und 1.1.1, wo dies angebracht ist.
6. Verwenden Sie 1,15 Zeilenabstand für normale Fließtextabsätze und halten Sie die Absatzabstände visuell konsistent.
7. Fügen Sie 'Unternehmensdokumentenbibliothek' zur Dokumentenkopfzeile hinzu.
8. Fügen Sie zentrierte Seitenzahlen in der Fußzeile hinzu.
9. Bewahren Sie alle vorhandenen Tabellen, Bilder, Hyperlinks und andere Dokumentobjekte.
10. Halten Sie die allgemeine Dokumentstruktur und die ursprüngliche Bedeutung unverändert.
""";

var aiOpts = new AIOptions { SpireToken = spireToken };

foreach (var file in Directory.GetFiles(inputFolder, "*.docx"))
{
    var fileName = Path.GetFileName(file);
    var savePath = Path.Combine(outputFolder, fileName);

    using var doc = new Document();
    doc.LoadFromFile(file);

    var res = doc.AI(aiOpts).ExecuteInstruction(doc, aiRule, savePath);
    Console.WriteLine(res.Success ? $"Verarbeitet: {fileName}" : $"Fehlgeschlagen: {fileName} - {res.ErrorMessage}");
}

Ein wichtiges Detail in der Anweisung ist die Anforderung, die logische Überschriftenhierarchie zu identifizieren.

Dies unterscheidet sich davon, einfach die Schriftart jedes fettgedruckten Absatzes zu ändern. Der Agent kann analysieren, was ein Absatz darstellt, und bestimmen, ob er als Dokumenttitel, Hauptabschnittsüberschrift, Unterabschnitt oder normaler Fließtext fungiert.

Für Dokumentenmanagement-Workflows sind korrekte Überschriftenformate besonders nützlich, da sie die Navigation, die automatische Erstellung von Inhaltsverzeichnissen, PDF-Lesezeichen, Barrierefreiheit und die spätere Dokumentenanalyse verbessern können.

Eine weitere wichtige Regel ist:

Bewahren Sie den gesamten ursprünglichen Wortlaut.

Formatierung und inhaltliche Überarbeitung sollten normalerweise als separate Aufgaben behandelt werden. Wenn der Zweck dieses Schrittes die Dokumentenstandardisierung ist, sollte die KI den Quelltext nicht gleichzeitig umschreiben oder zusammenfassen.

Nach der Ausführung enthält das Ausgabeverzeichnis standardisierte Kopien:

Standardized/
├── Employee_Travel_Policy.docx
├── Vendor_Onboarding_Guide.docx
├── Security_Incident_Report.docx
└── Remote_Work_Policy.docx

Das folgende Beispiel zeigt, wie ein inkonsistent formatiertes Word-Dokument vor und nach der KI-gestützten Standardisierung aussieht.

Vor und nach der Standardisierung der Dokumentformatierung

Metadaten extrahieren und Dokumentenzusammenfassungen erstellen

Sobald die Formatierung standardisiert wurde, besteht der nächste Schritt darin zu verstehen, was jedes Dokument enthält.

Das manuelle Öffnen von Hunderten von Dateien und das Aufzeichnen ihrer Titel, Abteilungen, Daten, Kategorien und Zusammenfassungen ist zeitaufwendig. Dies ist eine Aufgabe, bei der KI-Dokumentenverständnis besonders nützlich ist.

Für dieses Beispiel extrahieren wir sechs Felder aus jedem Dokument:

  • Titel
  • Abteilung
  • Dokumenttyp
  • Datum
  • Schlüsselwörter
  • Zusammenfassung

Anstatt frei formulierten Text zurückzugeben, erfordert die Anweisung eine vorhersehbare Struktur. Dies macht die Ergebnisse später einfacher zu verarbeiten.

using System;
using System.IO;
using Spire.Agent.Office.AI;
using Spire.Agent.Office.Extensions;
using Spire.Doc;

string inputFolder = @"E:\Documents\Standardized";
string outputFolder = @"E:\Documents\Metadata";
string spireToken = "Ihr SpireToken";

Directory.CreateDirectory(outputFolder);

string aiRule = """
Analysieren Sie dieses Word-Dokument und erstellen Sie einen prägnanten Metadatenbericht.

Extrahieren Sie die folgenden Informationen aus dem tatsächlichen Dokumentinhalt:
- Titel
- Abteilung oder verantwortliche Geschäftsfunktion
- Dokumenttyp, wie Richtlinie, Verfahren, Bericht, Leitfaden oder Memo
- Gültigkeitsdatum oder Ausgabedatum
- 3 bis 5 Schlüsselwörter
- Zusammenfassung von etwa 80 bis 120 Wörtern

Erstellen Sie ein neues, prägnantes Dokument, das nur diese Felder enthält.
Verwenden Sie genau die folgenden Bezeichnungen:

Titel:
Abteilung:
Dokumenttyp:
Datum:
Schlüsselwörter:
Zusammenfassung:

Erfinden Sie keine Informationen, die nicht vernünftigerweise aus der Quelle bestimmt werden können. Wenn ein bestimmtes Datum oder eine Abteilung nicht verfügbar ist, verwenden Sie 'Nicht angegeben'. Halten Sie die Zusammenfassung sachlich und basieren Sie sie nur auf dem Quelldokument.
""";

var aiOpts = new AIOptions { SpireToken = spireToken };

foreach (var file in Directory.GetFiles(inputFolder, "*.docx"))
{
    var fileName = Path.GetFileNameWithoutExtension(file);
    var savePath = Path.Combine(outputFolder, $"{fileName}_Metadata.docx");

    using var doc = new Document();
    doc.LoadFromFile(file);

    var res = doc.AI(aiOpts).ExecuteInstruction(doc, aiRule, savePath);
    Console.WriteLine(res.Success ? $"Metadaten extrahiert: {fileName}" : $"Fehlgeschlagen: {fileName} - {res.ErrorMessage}");
}

Ein generiertes Metadatendokument sieht wie folgt aus:

Extrahierte Metadaten und KI-generierte Zusammenfassung

Die Anforderung, feste Bezeichnungen zu verwenden, ist wichtig.

Wenn die Aufforderung einfach lautet "fassen Sie das Dokument zusammen", können verschiedene Dokumente wesentlich unterschiedliche Ausgabestrukturen erzeugen. Die Anforderung konsistenter Felder macht es viel einfacher, die Zwischendateien zu einem endgültigen Index zu kombinieren.

Die Anweisung weist den Agenten auch ausdrücklich an, keine fehlenden Metadaten zu erfinden. Für Geschäftsunterlagen ist "Nicht angegeben" im Allgemeinen nützlicher, als eine Abteilung oder ein Datum zu raten, das im Dokument nie angegeben wird.

Erstellen eines Dokumentenindex aus mehreren Word-Dateien

An diesem Punkt haben wir eine Metadatendatei für jedes verarbeitete Dokument:

Metadata/
├── Employee_Travel_Policy_Metadata.docx
├── Vendor_Onboarding_Guide_Metadata.docx
├── Security_Incident_Report_Metadata.docx
└── Remote_Work_Policy_Metadata.docx

Der letzte Schritt besteht darin, diese einzelnen Metadatendateien in einem einzigen Word-basierten Dokumentenindex zusammenzuführen.

Anstatt jedes Metadatendokument manuell zu öffnen, seinen Text zu extrahieren und die Ergebnisse in C# zusammenzuführen, können wir alle Metadatendateien direkt über den Parameter attachments an Spire.Agent.Office übergeben. Der KI-Agent liest die angehängten Dokumente, extrahiert die beschrifteten Felder aus jedem einzelnen und erstellt ein neues Word-Dokument, das einen konsolidierten Index enthält.

Der Parameter attachments ist nützlich, wenn die KI-Aufgabe von mehreren unterstützenden Dateien abhängt und nicht von einem einzelnen primären Eingabedokument. In diesem Beispiel gibt es kein vorhandenes Word-Dokument, das geändert werden muss. Wir erstellen daher ein leeres Document-Objekt und verwenden die Metadatendateien als Informationsquellen für die Generierung des endgültigen Index.

using System;
using System.IO;
using Spire.Agent.Office.AI;
using Spire.Agent.Office.Extensions;
using Spire.Doc;

string metadataFolder = @"E:\Documents\Metadata";
string outputPath = @"E:\Documents\Document_Index.docx";
string spireToken = "Ihr SpireToken";
var attachments = Directory.GetFiles(metadataFolder, "*_Metadata.docx");

string aiRule = """
Lesen Sie alle in den Anhängen bereitgestellten Metadatendokumente und erstellen Sie einen konsolidierten Word-Dokumentenindex.

Erstellen Sie den Titel 'Dokumentenindex' oben im Dokument.

Erstellen Sie eine Tabelle mit den folgenden Spalten:
Nr. | Titel | Abteilung | Dokumenttyp | Datum | Schlüsselwörter | Zusammenfassung

Anforderungen:
1. Erstellen Sie eine Zeile für jedes Metadatendokument.
2. Nummerieren Sie die Datensätze fortlaufend ab 1.
3. Extrahieren Sie die Werte aus den beschrifteten Feldern in jedem Anhang.
4. Bewahren Sie die extrahierten Informationen und erfinden Sie keine fehlenden Daten.
5. Verwenden Sie 'Nicht angegeben', wenn ein Feld nicht verfügbar ist.
6. Machen Sie die Tabellenüberschrift fett.
7. Geben Sie der Spalte 'Zusammenfassung' mehr Breite als den anderen Spalten.
8. Verwenden Sie einen sauberen, professionellen Stil, der für ein internes Dokumentenregister geeignet ist.
9. Erstellen Sie ein eigenständiges Word-Dokument, das nur den endgültigen Dokumentenindex enthält.
""";

var aiOpts = new AIOptions { SpireToken = spireToken };

using var doc = new Document();
var res = doc.AI(aiOpts).ExecuteInstruction(doc, aiRule, outputPath, attachments);

Console.WriteLine(res.Success
    ? $"Dokumentenindex erstellt: {outputPath}"
    : $"Fehler beim Erstellen des Dokumentenindex: {res.ErrorMessage}");

Die endgültige Ausgabe wird gespeichert als:

Document_Index.docx

Anstatt jedes Originaldokument einzeln zu öffnen, können Mitarbeiter nun einen konsolidierten Index verwenden, um schnell zu verstehen, welche Dokumente verfügbar sind und was jede Datei enthält.

Konsolidierter Dokumentenindex, generiert aus mehreren Word-Dateien

Diese Art von Index kann besonders nützlich sein, bevor Dateien in ein Dokumentenmanagementsystem migriert, eine interne Wissensdatenbank vorbereitet, Altdokumentensammlungen überprüft oder Unterlagen für die langfristige Aufbewahrung organisiert werden.

Best Practices für eine zuverlässige KI-Dokumentenverarbeitung

KI macht die Verarbeitung semistrukturierter Dokumente flexibler, aber zuverlässige Ergebnisse hängen immer noch stark davon ab, wie die Aufgabe konzipiert ist.

Trennung von Formatierung und Inhaltsanalyse

Vermeiden Sie es, den Agenten zu bitten, die Formatierung zu standardisieren, Text umzuschreiben, das Dokument zusammenzufassen und Metadaten in einer einzigen großen Anweisung zu extrahieren.

Dies sind unterschiedliche Operationen mit unterschiedlichen Zielen.

Ein sichererer Workflow ist:

Originaldokument
        ↓
Formatierungsstandardisierung
        ↓
Standardisiertes Dokument
        ↓
Metadatenextraktion
        ↓
Strukturierte Metadaten
        ↓
Dokumentenindex

Dies macht Probleme auch leichter zu identifizieren und zu beheben.

Formatierungsregeln explizit definieren

Anweisungen wie:

Lassen Sie das Dokument professionell aussehen.

lassen zu viel Spielraum für Interpretationen.

Wann immer Konsistenz wichtig ist, geben Sie die tatsächlichen Unternehmensregeln an:

Arial, 11 pt Fließtext
20 pt Dokumenttitel
16 pt Überschrift 1
13 pt Überschrift 2
1,15 Zeilenabstand
1 / 1.1 / 1.1.1 Nummerierung

Dasselbe Prinzip gilt für Kopfzeilen, Fußzeilen, Tabellenformatierung und Seitenlayout.

Schutz des ursprünglichen Inhalts

Fügen Sie für Formatierungsaufgaben explizit Anforderungen hinzu wie:

Bewahren Sie den gesamten ursprünglichen Wortlaut.

und:

Schreiben Sie den Dokumentinhalt nicht um, fassen Sie ihn nicht zusammen, kürzen Sie ihn nicht und löschen Sie ihn nicht.

Die Quelldateien sollten ebenfalls beibehalten und nicht während der automatisierten Stapelverarbeitung überschrieben werden.

Eine praktische Ordnerstruktur ist:

Documents/
├── Input/
├── Standardized/
├── Metadata/
└── Document_Index.docx

Anforderung strukturierter Metadaten

Wenn extrahierte Informationen programmatisch wiederverwendet werden sollen, ist eine vorhersehbare Ausgabe wertvoller als eine kreative Ausgabe.

Anstatt:

Sagen Sie mir, worum es in diesem Dokument geht.

verwenden Sie ein festes Schema:

Titel:
Abteilung:
Dokumenttyp:
Datum:
Schlüsselwörter:
Zusammenfassung:

Dies macht die nachgelagerte Verarbeitung erheblich einfacher.

Umgang mit fehlenden Informationen explizit festlegen

Nicht jedes Dokument enthält einen Abteilungsnamen, ein Gültigkeitsdatum, eine Dokumentnummer oder einen Eigentümer.

Sagen Sie der KI, was sie tun soll, wenn Informationen fehlen:

Verwenden Sie "Nicht angegeben", anstatt zu raten.

Dies ist besonders wichtig für Dokumentenmanagement, rechtliche, finanzielle, Compliance- und andere aufzeichnungensempfindliche Workflows.

Überprüfung von Ergebnissen mit hoher Bedeutung

KI-generierte Metadaten und Zusammenfassungen sollten in Workflows mit hohem Einsatz nicht automatisch als maßgebliche Aufzeichnungen behandelt werden.

Für die gewöhnliche interne Dokumentenorganisation können automatisierte Ergebnisse ausreichen. Für regulierte Archive, rechtliche Aufzeichnungen, Compliance-Dokumente oder offizielle Aufbewahrungssysteme sollten extrahierte Felder und Klassifizierungen dennoch gemäß den Überprüfungsanforderungen des Unternehmens validiert werden.

Fazit

Die Stapelverarbeitung von Word-Dokumenten beinhaltet oft zwei verschiedene Probleme.

Das erste ist Dokumentenautomatisierung: Schriftarten ändern, Formatvorlagen anwenden, Kopf- und Fußzeilen erstellen, Nummerierungen verwalten und Word-Dateien generieren.

Das zweite ist Dokumentenverständnis: bestimmen, was Inhalte darstellen, Dokumenttypen identifizieren, Daten und Abteilungen finden, Schlüsselwörter extrahieren und Zusammenfassungen erstellen.

Traditionelle Word-APIs sind äußerst effektiv, wenn Entwickler bereits genau wissen, welche Inhalte sie ändern müssen. KI-gestützte Verarbeitung wird besonders nützlich, wenn Dokumente inkonsistent sind und die Software zuerst ihre Struktur verstehen muss, bevor sie entscheidet, wie sie diese verarbeiten soll.

Mit Spire.Agent.Office in C# können diese beiden Fähigkeiten in einem Workflow kombiniert werden:

Analysieren → Standardisieren → Extrahieren → Organisieren

Im obigen Beispiel wird ein Ordner mit inkonsistenten Word-Dokumenten in eine standardisierte Dokumentsammlung, eine Reihe strukturierter Metadatensätze und schließlich einen zentralisierten Word-Dokumentenindex umgewandelt.

Die gleiche Architektur kann auf andere Unternehmens-Workflows ausgeweitet werden, wie z. B. Richtlinienbibliotheken, Verfahrenshandbücher, Compliance-Dokumentation, Projektarchive, Personalakten, Anbieterdokumentation und die Migration von Altdokumenten.

Anstatt Dateien einzeln manuell zu überprüfen und zu organisieren, können Entwickler die erforderlichen Dokumentregeln und Informationsstrukturen in natürlicher Sprache definieren und die repetitiven Teile des Workflows automatisieren, während sie gleichzeitig echte, bearbeitbare Word-Dokumente erstellen.

Siehe auch