Skip to main content
Mit der Dokumentenextraktion ziehst du strukturierte Felder aus Rechnungen, Formularen, Verträgen oder Belegen – zum Beispiel Rechnungsnummer, Betrag und Fälligkeitsdatum. Jeder extrahierte Wert kommt mit einer Konfidenz und einem Quellenbeleg und durchläuft ein Human-in-the-Loop-Review: Erst wenn eine Person den Wert bestätigt, gilt er als geprüft. Du findest die App in deinem Space in der Sidebar unterhalb der Standard-Ressourcen als Extraktion.

So funktioniert eine Extraktion

Die App führt dich in vier Schritten durch jeden Extraktionslauf:
1

Vorlage wählen

Wähle eine Vorlage mit festen Feldern – sie eignet sich für wiederkehrende Dokumenttypen mit gleichbleibenden Feldern. Alternativ beschreibst du mit einem benutzerdefinierten Prompt frei, was extrahiert werden soll.
2

Dokumente wählen

Wähle ein oder mehrere Dokumente aus, aus denen du Daten extrahieren möchtest.
3

Felder verfeinern

Passe die Felder der Vorlage an deine Fragestellung an: Felder ergänzen, entfernen oder ihre Beschreibung präzisieren.
4

Prüfen & Starten

Kontrolliere Vorlage, Felder und Dokumentauswahl und starte die Extraktion. Optional läuft sie im Modus „Seite für Seite” (siehe unten). Die extrahierten Werte prüfst und bestätigst du anschließend im Review – bis zur Bestätigung steht jedes Feld auf dem Review-Status „pending”.
Deine Extraktions-Jobs erscheinen zusätzlich in deiner Inbox – so behältst du sie auch spaceübergreifend im Blick.

Modus „Seite für Seite”

Neben dem Standard-Lauf gibt es den Modus „Seite für Seite” (intern: unit_by_unit). Damit verarbeitet die Extraktion dein Dokument seitenweise, statt es als Ganzes zu behandeln.

Modellwahl je Lauf

Unter Experten-Einstellungen wählst du das Extraktionsmodell für den jeweiligen Lauf. Welche Modelle zur Auswahl stehen, hängt davon ab, welche Basismodelle deinem Space über die Library bereitgestellt sind – mehr dazu unter Modellauswahl.
Wähle als Extraktionsmodell Opus 4.8 oder Sonnet 5. Das veraltete Opus 4.7 bricht Extraktionen still ab („Keine Ergebnisse”) – ein Modell-Artefakt, kein Plattform-Fehler. Das Modell muss dem Space über die Library provisioniert sein.

Output verstehen

Der Output je Feld enthält vier Bestandteile: Über den Quellenbeleg kannst du beim Review jeden Wert direkt gegen das Original prüfen, statt dem Modell blind zu vertrauen.

Gescannte Dokumente und Bild-PDFs

Das Dokument-Parsing nutzt OCR-Modelle. Damit funktioniert die Extraktion auch für gescannte Dokumente und Bild-PDFs ohne eingebetteten Text.

Grenzen: kein API-Zugriff

Die Dokumentenextraktion ist eine reine UI-App – sie hat keinen API-Zugriff. Wenn du strukturierte Extraktion programmatisch brauchst, nutze einen Agent mit response_format: json_object über die Localmind-API. Rezepte dazu findest du in den API Use Cases.

Nächste Schritte

Dokumentenanalyse

Dokumente inhaltlich auswerten – mit Vorlagen wie Management-Zusammenfassung oder Vertragsprüfung.

Dokumentenvergleich

Zwei Dokumente vergleichen – stellt die Unterschiede strukturiert gegenüber.

Modellauswahl

Modellkategorien verstehen und das richtige Modell für deinen Anwendungsfall wählen.

Dokumente

Dokumente hochladen und als Datenquelle in deinem Space nutzen.