KI-Bilderkennung: Daten aus Bilddateien lesen und in e! extrahieren
Lernen Sie, wie Sie die Bilderkennung in e! aktivieren, um Daten aus Bilddateien, gescannten Dokumenten und Fotos per KI zu extrahieren.
Heute freuen wir uns, Ihnen die Funktion „Recognize Image“ im File Upload Node auf unserer „e!“-Automatisierungsplattform vorzustellen. Lassen Sie uns gemeinsam herausfinden, wie dieses coole neue Tool funktioniert.
Zuerst einmal verarbeitet der File Upload Node zwei Arten von Dateien. Eine Art sind Textdateien wie Word-Dokumente, CSVs oder PDFs, die bereits für die Texterkennung (OCR) verarbeitet wurden. Aus diesen Dateien können Sie ganz einfach Text kopieren.
Auf der anderen Seite gibt es Dateien, die eher bildbasiert sind. Das können PDFs sein, die als Bilder gespeichert wurden, oder Dokumente mit Stempeln und handschriftlichen Notizen, bei denen Sie Text nicht so leicht auswählen können.
Genau hier kommt die Funktion „Recognize Image“ ins Spiel. Sie geht über die übliche Texterkennung hinaus. Anstatt nur nach Wörtern zu suchen, analysiert sie das gesamte Bild und gibt Ihnen Informationen basierend auf dem, wonach Sie fragen. Je besser Sie beschreiben, was Sie wissen möchten, desto bessere Antworten erhalten Sie von der KI.
Schauen wir uns nun an, wie Sie das in den Bots der „e!“-Plattform nutzen können:
Schritt 1: Fügen Sie den File Upload Node hinzu
Fügen Sie einen File Upload Node in Ihrem Bot über das „+“-Menü hinzu.

Schritt 2: Dateityp-Beschränkungen festlegen (optional)
Nachdem Sie den Feldnamen des File Upload Nodes für die interne Referenz geändert haben (beachten Sie, dass dieser Feldname für den Benutzer im Frontend nicht sichtbar ist), wählen Sie aus, ob Sie nur bestimmte Dateitypen zulassen möchten oder ob es keine Beschränkungen für Dateitypen geben soll. (In diesem Tutorial erlauben wir alle Dateitypen).


Schritt 3: Verknüpfen Sie die Datei mit einem AI Output Node
Um hochgeladene Dokumente in einem AI Output Node zu verwenden, müssen Sie den Schalter „Use in AI Output“ aktivieren. Wählen Sie aus dem Dropdown-Menü „Create or modify AI Settings“, um das Modal für die KI-Einstellungen zu öffnen. Geben Sie im Modal zuerst den Namen ein, wählen Sie dann den Anbieter, danach das KI-Modell – am wichtigsten ist die Auswahl von GPT4Turbo-Vision für die OCR-Lesefähigkeit des Bots – und schließlich den API Key. Sobald dies erledigt ist, klicken Sie auf den „save“-Button und die KI-Einstellung wird erstellt.
Beachten Sie, dass Sie dieselbe Einstellung im AI Output Node auswählen müssen.

Schritt 4: Den Prompt einstellen
Aktivieren Sie „Recognize Image“ und wählen Sie „EDIT PROMPT“. In diesem Beispiel verwenden wir Folgendes als System- und Dynamic Prompt:
System Prompt:
Du bist ein Experte im Extrahieren von Informationen aus Dokumenten. Gib das Stempeldatum an.
Dynamic Prompt:
Zeige das Datum im Format TT/MM/JJJJ an

Schritt 5: AI Output Node einstellen
Um den AI Output Node mit dem File Upload Node zu verbinden:
- Wählen Sie den File Upload Node aus dem Dropdown-Menü im AI Output Node aus.
- Geben Sie einen identischen Prompt ein, um eine konsistente KI-Aktion sicherzustellen.
- Lösen Sie die KI über einen speziellen Button aus – unser Beispiel heißt passenderweise „Check Date“ – und wählen Sie bei den Retrigger-Einstellungen „Never“.

Schritt 6: Text Field Node hinzufügen
Um die KI-Ausgabe im Frontend darzustellen, fügen Sie einen Text Field Node hinzu, der mit der AI Output Variable verknüpft ist.


Nachdem wir unsere Kreation im Vorschaumodus überprüft haben:
- Testen Sie den File Upload Node mit einem als Bild gespeicherten PDF und beobachten Sie die Upload-Zeiten, die von der Dateigröße abhängen.
- Nutzen Sie das Vorschau-Augensymbol, das nur in der Builder-Ansicht verfügbar ist, um den extrahierten Text genau zu prüfen.
