Grounded by Knowledge: RAG + KG – Automatisierte Bildbeschreibung und Wissensgraphen
Die Arbeit zeigt, wie KI-Modelle aus detailreichen Bildbeschreibungen automatisch Wissensgraphen erzeugen und so neue Anwendungen in Bildanalyse, Datenmanagement und Wissensrepräsentation ermöglichen.
Ausgangslage
Obwohl moderne Vision-Language-Modelle bereits kurze Bildbeschreibungen generieren können, gehen diesen Beschreibungen oft wichtige Informationen verloren. Gerade für komplexe Szenen oder technische Dokumentationen reichen ein bis zwei Sätze nicht aus. Eine mögliche Lösung liegt im sogenannten „Dense Captioning“ – also detaillierten Bildbeschreibungen, bei denen verschiedene Objekte, ihre Eigenschaften und Beziehungen explizit benannt werden. Auf dieser Basis lassen sich automatisch Szenengraphen erstellen, die für datengetriebene Anwendungen wertvolle Strukturinformationen liefern.
Zielsetzung
Im Rahmen der Arbeit wurde untersucht, wie sich hochdetaillierte Beschreibungen automatisiert gewinnen lassen und daraus (Subjekt, Prädikat, Objekt)-Beziehungen extrahiert werden können. Ziel war ein praxistaugliches Verfahren, das Bildinhalte zuverlässig erkennt, beschreibende Texte erzeugt und daraus einen formalen Wissensgraphen (Knowledge Graph) ableitet. Perspektivisch hilft dies Unternehmen oder Forschungseinrichtungen, ihre Bilddatenbanken effizienter zu durchforsten und neue Erkenntnisse aus visuellen Informationen zu ziehen.
Das Projekt befasst sich mit folgenden Forschungsfragen:
- Wie gut eignen sich aktuelle Vision-Language-Modelle für die Generierung von Dense Captions?
- Welche Prompt-Engineering-Strategien können die Qualität von Dense Captions messbar verbessern?
- Inwieweit können (Subjekt, Prädikat, Objekt)-Tripel automatisch aus Dense Captions abgeleitet werden?
- Welche Metriken eignen sich zur Bewertung der Qualität der resultierenden Tripel für die Verwendung in Wissensgraphen?
- Wie lassen sich KI-Agenten einsetzen, um fehlerhafte oder unvollständige Beschreibungen zu korrigieren?
1. Detaillierte Bildbeschreibung
Das Bild zeigt, wie ein Vision-Language-Modell eine detaillierte Bildbeschreibung auf Basis eines Prompts erzeugt. Als Ausgangspunkt dient eine reale Szene auf dem FHNW-Campus, die das Modell analysiert, um visuelle Elemente, Beziehungen, Handlungen und Stimmungen zu erfassen. Die resultierende Dense Caption (rechts dargestellt) beschreibt nicht nur die sichtbaren Objekte, sondern interpretiert auch Atmosphäre und räumliche Struktur. Diese semantisch angereicherte Beschreibung bildet die Grundlage für die weiteren Schritte in der Analysepipeline: faktische Validierung (Bild 2) und Wissensgraph-Erstellung (Bild 3).
2. Korrektur durch KI-Agenten
Diese schematische Darstellung zeigt den zweiten Schritt der Bildanalyse-Pipeline: Die automatische Überprüfung und Korrektur einer zuvor generierten Bildbeschreibung (Dense Caption). Einzelne Aussagen aus der Caption werden in atomare Fakten zerlegt und auf ihre Richtigkeit geprüft. Der KI-Agent erkennt halluzinierte (nicht im Bild vorhandene) Informationen und entfernt oder korrigiert sie. Diese Zwischenstufe ist entscheidend für die inhaltliche Qualität – nur konsistente, überprüfte Beschreibungen eignen sich als Basis für den nachfolgenden Aufbau eines strukturierten Wissensgraphen.
3. Grapherstellung
Die Abbildung zeigt das Ergebnis der automatisierten Wissensgraph-Erstellung: Aus den zuvor geprüften Bildbeschreibungen wurden strukturierte (Subjekt–Prädikat–Objekt)-Tripel extrahiert und als Graph visualisiert. Jeder Knoten repräsentiert ein erkanntes Objekt oder eine Entität im Bild, während die Kanten deren semantische Beziehungen zeigen – etwa „Person fährt Fahrrad“ oder „Baum steht neben Gebäude“. Diese Darstellung macht sichtbar, wie aus unstrukturierten Bilddaten eine maschinenlesbare Wissensstruktur entsteht – ein zentraler Baustein für weiterführende Anwendungen wie semantische Suche, visuelles Retrieval oder datengetriebene Analysen.
Ergebnisse
Die durchgeführten Experimente haben eindrücklich gezeigt, wie Bildinhalte automatisiert erfasst und in formalisierte Wissensgraphen überführt werden können. Dabei hat sich bestätigt, dass die Qualität der generierten Bildbeschreibungen (Dense Captions) massgeblich von verschiedenen Faktoren abhängt – allen voran vom gezielten Prompt-Design und der Einbindung spezieller KI-Agenten. Die wichtigsten Erkenntnisse und Resultate lassen sich wie folgt zusammenfassen:
- Verbesserte Detailtreue: Eine abgestufte Prompt-Strategie steigert die Menge und Präzision der erkannten Objekte. So konnten aus scheinbar unauffälligen Szenen bis zu 30 % mehr relevante Bilddetails extrahiert werden.
- Halluzinationsreduktion durch KI-Agenten: Spezielle Korrekturroutinen haben nachträglich fehlerhafte oder erfundene Beschreibungen („Halluzinationen“) ermittelt und entfernt, wodurch die generierten Captions deutlich konsistenter ausfielen.
- Übergang zum Wissensgraphen: Auf Basis der bereinigten Dense Captions liessen sich Subjekt–Prädikat–Objekt-Beziehungen (Tripel) erkennen und zu Szenengraphen zusammenführen. Diese Graphen ermöglichen eine strukturierte Abfrage und Auswertung der Bildinhalte.
- Skalierbarkeit: Trotz hoher Auflösungen und komplexer Szenen liessen sich die Schritte der Bildanalyse weitgehend automatisieren. Dies eröffnet die Möglichkeit, grosse Bildbestände effizient zu katalogisieren und semantisch durchsuchbar zu machen.
- Nächste Schritte: Eine engere Verzahnung mit Retrieval-Augmented-Generation (RAG) könnte künftig noch umfangreichere Kontextinformationen einbinden und die Genauigkeit der generierten Wissensgraphen weiter steigern.
Insgesamt belegen diese Ergebnisse das grosse Potenzial aktueller KI-Verfahren, sowohl für die hochdetaillierte Bildbeschreibung als auch für die automatische Ableitung semantischer Relationen. Damit wird eine wichtige Grundlage geschaffen, um Bilder in datengetriebenen Prozessen nutzbar zu machen und neue, wissensbasierte Anwendungen zu entwickeln.
Technische Schlüsselbegriffe
- Dense CaptioningDetaillierte Bildbeschreibungsgenerierung mit Fokus auf multiple Aspekte und Details
- Vision-Language-ModelleKI-Modelle, die Bildverständnis und Textgenerierung kombinieren
- WissensgraphenStrukturierte Darstellung von Entitäten und ihren Beziehungen
- SzenengraphenGraphbasierte Darstellung visueller Beziehungen in Bildern
- Tripel-ExtraktionAbleitung von Subjekt-Prädikat-Objekt-Beziehungen aus Text
- Graph-GenerierungErstellung strukturierter Wissensgraphen aus extrahierten Tripeln
Team
Fabian Jordi
Betreuer
Dr. Fernando Benites
Jonas Grüter