Multimodales RAG für Texte und Tabellen bei PRIMEO

Die effiziente Nutzung von Unternehmenswissen stellt eine zentrale Herausforderung dar, insbesondere wenn Informationen in komplexen Dokumenten mit textuellen und tabellarischen Daten versteckt sind. Diese Arbeit entwickelt ein multimodales Retrieval-Augmented Generation (RAG)-System, das sowohl Text als auch Tabellen integriert, um präzise Antworten zu generieren und die Wissensgewinnung in Unternehmen wie PRIMEO zu optimieren.

Text
Visualisierung eines simplen RAG-Systems

Ausgangslage

In vielen Unternehmen, darunter PRIMEO, sind geschäftskritische Informationen in einer Vielzahl von Dokumenten gespeichert, die sowohl textuelle als auch tabellarische Daten enthalten. Während textbasierte Suchsysteme gut etabliert sind, stossen sie bei der Verarbeitung von Tabellen und komplexen Dokumentlayouts an ihre Grenzen. Dies führt zu ineffizienten Suchprozessen und erschwert die Identifikation relevanter Informationen. Die Herausforderung besteht darin, ein System zu entwickeln, das beide Datenformen nahtlos integriert und präzise Antworten liefert.

Zielsetzung

Ziel dieser Arbeit ist die Entwicklung eines multimodalen RAG-Systems, das sowohl textuelle als auch tabellarische Daten effizient verarbeiten kann. Dazu wurden verschiedene PDF-Parsing-Tools evaluiert, Umwandlungsmethoden für Tabellen untersucht und Experimente durchgeführt, um das bestmögliche Modell zu erstellen. Die Evaluation des Systems erfolgte anhand von zwei Frameworks, um die Antwortqualität und den Retrieval-Prozess zu bewerten. Das System soll die Wissensgewinnung in Unternehmen wie PRIMEO erleichtern und die Identifikation von Synergien in der Projektlandschaft unterstützen.

PDF-Parsing mit LlamaParse

LlamaParse

LlamaParse ist ein GenAI-Dokument-Parser und kann komplexe Dokumentstrukturen, wie etwa mehrspaltige Layouts, Tabellen, Diagramme und Bilder erkennen und verarbeiten. Durch die Integration von LLMs und LVMs gewährleistet LlamaParse eine hohe Qualität der extrahierten Daten. Das ist für die Anforderungen dieser Arbeit von entscheidender Bedeutung. LlamaParse ist speziell für LLM-Anwendungsfälle optimiert und erlaubt die Verwendung von Anweisungen in natürlicher Sprache, um das Parsen zu steuern. Solche Anweisungen legen fest, was geparst werden soll und in welchem Format die Ausgabe erfolgen soll, ob als Text, Markdown oder JSON.

Integration tabellarischer Daten

Tabellenintegration

Die Integration von tabellarischen Daten verbesserte die Leistung des RAG-Systems signifikant. Die Markdown-Methode erzielte die besten Ergebnisse bei textbasierten Fragen, während JSON bei tabellarischen Fragestellungen überzeugte.

Durchführung von Experimenten

Experimente

Um die optimale Konfiguration des RAG-Systems zu ermitteln, wurden gezielte Experimente durchgeführt. Diese untersuchten den Einfluss verschiedener Komponenten wie Chunking-Strategien, Embedding-Modelle und Retrieval-Konfigurationen auf die Systemleistung. Die Ergebnisse dieser Experimente bildeten die Grundlage für die Entwicklung des besten Modells.

Ergebnisse

Die Ergebnisse zeigen, dass die Integration von tabellarischen Daten und die Auswahl optimierter Komponenten die Qualität der generierten Antworten signifikant verbessern. Das beste Modell kombiniert das Arctic-Embed 2.0 Modell, rekursives Chunking mit 3000 Zeichen, den Cross-Encoder mmarco-mMiniLM-v2-L12-H384-v1 und eine Retrieval-Konfiguration mit 100 abgerufenen sowie 25 weitergegebenen Chunks. Im Vergleich zum Baseline-Modell erzielte das beste Modell eine durchschnittliche Verbesserung der Metriken.

  • LlamaParse lieferte die besten Ergebnisse bei der Extraktion von Text und Tabellen aus komplexen Dokumenten.
  • Die Markdown-Methode erzielte eine bessere Gesamtleistung, während JSON bei tabellarischen Fragestellungen überzeugte.
  • Die Integration von tabellarischen Daten verbesserte die Metrikwerte durchschnittlich um 19.8% bei ROLAND Eval und um 22.4% bei RAGAs.
  • Das beste Modell kombiniert die leistungsstärksten Komponenten und Strategien. Somit stieg die Leistung bei ROLAND Eval um 45.1% und bei RAGAs um 30.7%

Diese Arbeit demonstriert, dass die gezielte Integration von tabellarischen Daten und die Optimierung von RAG-Komponenten die Effizienz und Genauigkeit von Knowledge-Assistant-Systemen erheblich steigern können.

Durch gezielte Vorverarbeitungsschritte wie das verbesserte RoI-Cropping und die Erweiterung der Bruchzonen konnte die Segmentierung optimiert werden. Allerdings waren die verfügbaren Daten nicht ausreichend, um eine zuverlässige Modellgeneralisierung zu gewährleisten.

Technische Schlüsselbegriffe

  • RAG Retrieval-Augmented Generation; Ein Framework, das externe Wissensquellen nutzt, um präzise Antworten zu generieren.
  • LlamaParse Ein Tool zur Extraktion von Text und Tabellen aus komplexen PDF-Dokumenten.
  • Markdown Eine Umwandlungsmethode für tabellarische Daten, die eine klare und kompakte Repräsentation ermöglicht.
  • Embedding Eine Technik zur Darstellung von Texten in einem Vektorraum, um semantische Ähnlichkeiten zu erfassen.
  • Arctic-Embed 2.0 Ein leistungsstarkes, multilinguales Embedding-Modell, welches das Verarbeiten von längeren Kontexten optimiert.
  • Retrieval Ein Prozess, bei dem relevante Informationen aus einer Wissensdatenbank abgerufen werden.
  • Reranking Ein Verfahren zur Neubewertung von Suchergebnissen, um die Relevanz zu erhöhen.
  • Cross-Encoder Ein Reranking-Modell, das die Qualität des Retrievals verbessern kann.
  • ROLAND Eval Ein eigenentwickeltes Evaluationsframework zur Bewertung der Antwortqualität und des Retrieval-Prozesses. (Retrieval-Oriented LLM-Assisted Nested Dynamic Evaluation)
  • RAGAs Ein populäres Evaluationsframework, das die Treue zu den abgerufenen Kontexten bewertet. (Retrieval-Augmented Generation Assessment)

Team

Nicko Emmenegger
Alexander Schilling

Betreuer
Prof. Dr. Daniel Perruchoud
Chantal Zwick