Artikel
Vom Datenkatalog zur Kontext-Plattform: Wie DataHub zum Bindeglied zwischen Daten und Agenten wurde
DataHub begann als Datenkatalog für Governance und Data Owner. Heute positioniert sich das Projekt als Kontext-Plattform, die KI-Agenten und Prozesse mit Unternehmensdaten verbindet. Was das für Entscheider bedeutet.
Vom Datenkatalog zur Kontext-Plattform: Wie DataHub zum Bindeglied zwischen Daten und Agenten wurde
Ein Tool, das jahrelang als Inventarliste für Data Owner galt, ist im Begriff, zur kritischen Infrastruktur für KI-Agenten zu werden. DataHub hat in den vergangenen Monaten eine bemerkenswerte Neupositionierung vollzogen: vom klassischen Datenkatalog für Governance hin zu einer „Kontext-Plattform”, die autonome Agenten und Prozesse mit verlässlichem Wissen über die Datenlandschaft eines Unternehmens versorgt. Für Manager ist das kein technisches Detail am Rand — es ist ein Signal dafür, wo der eigentliche Engpass beim produktiven Einsatz von KI liegt.
Wo DataHub herkommt: Katalog für Menschen
DataHub wurde ursprünglich bei LinkedIn gebaut und 2019 als Open Source veröffentlicht — als Nachfolger des 2016 freigegebenen Projekts WhereHows. Die ursprüngliche Aufgabe war klar umrissen und vertraut: ein zentrales Verzeichnis, in dem Mitarbeiter Datensätze finden, verstehen und vertrauen können.
Der klassische Datenkatalog beantwortet drei Fragen, die in jedem datengetriebenen Unternehmen immer wieder gestellt werden: Welche Daten gibt es überhaupt? Wem gehören sie? Kann ich ihnen trauen? DataHub deckte diese Bedürfnisse über die typischen Kataloggenerationen ab — von der monolithischen Such-App über eine eigenständige Metadaten-API bis hin zur dritten Generation, die LinkedIn maßgeblich geprägt hat: eine streamingbasierte Architektur, bei der jede Metadatenänderung als Event durch ein Kafka-Backbone fließt und in Echtzeit verfügbar ist.
Die Zielgruppe war über Jahre hinweg eindeutig: Data Owner, Data Stewards, Compliance-Verantwortliche und Analysten. Der Katalog war ein Werkzeug für Menschen — eine durchsuchbare Landkarte über Tabellen, Spalten, Dashboards und Pipelines, angereichert mit Eigentümerschaft, Tags, Glossar-Begriffen, Data Lineage (also der Herkunft und dem Fluss von Daten von der Quelle bis zur Auswertung) und Qualitätssignalen. Governance war der Kern: Wer darf was sehen, welche Daten unterliegen welchen Richtlinien, und wo entsteht beim nächsten Schema-Wechsel ein Schaden?
Der Bruch: KI-Agenten brauchen Kontext, kein Frontend
Mit dem Aufstieg agentischer KI hat sich das Problem verschoben. Ein Large Language Model kann formvollendete SQL-Abfragen schreiben und ganze Analysen formulieren — aber es weiß nicht, dass im konkreten Unternehmen die Tabelle orders_v2 die gültige ist und nicht orders, dass „Umsatz” hier netto nach Retouren bedeutet, oder dass die Kundentabelle aus Compliance-Gründen nicht ungefiltert abgefragt werden darf.
Genau hier liegt der entscheidende Punkt, den DataHub heute in den Mittelpunkt rückt: Ein Agent ist nur so gut wie der Kontext, den er bekommt. Wenn Metadaten, Dokumentation, Lineage und Governance-Regeln in getrennten Systemen liegen, arbeitet der Agent zwangsläufig mit unvollständiger Information — und produziert genau die plausibel klingenden, aber falschen Antworten, die in der Produktion teuer werden.
Die Zahlen, die DataHub dazu vorlegt, sind für Entscheider aufschlussreich. In einer im März 2026 veröffentlichten, von der unabhängigen Firma TrendCandy unter 250 IT- und Datenverantwortlichen durchgeführten Befragung (State of Context Management Report 2026) zeigt sich eine bemerkenswerte Diskrepanz zwischen Selbstbild und Realität:
- 82 % der Daten- und IT-Verantwortlichen sind überzeugt, dass agentische KI ohne eine Kontext-Plattform keinen produktiven Wert erreichen kann.
- 90 % der Organisationen halten sich für „AI-ready” — aber 87 % nennen genau die Datenreife als ihr größtes Hindernis auf dem Weg in die Produktion.
- 61 % verschieben KI-Initiativen regelmäßig, weil verlässliche Daten fehlen.
Übersetzt für die Vorstandsetage: Die Bereitschaft, in KI zu investieren, ist da. Was fehlt, ist die Schicht, die dem Agenten erklärt, was die Daten eigentlich bedeuten.
Die Neupositionierung: „Central Nervous System” statt Bücherei
DataHub beschreibt sich heute selbst nicht mehr primär als Datenkatalog, sondern als „Context Platform for your Data and AI Stack” — als zentrales Nervensystem des Datenstacks. Der strategische Schwenk lässt sich an drei konkreten Bausteinen festmachen.
Erstens: Der MCP-Server. Das Model Context Protocol (MCP) ist zu einem De-facto-Standard dafür geworden, wie KI-Agenten an externe Werkzeuge und Wissensquellen angedockt werden. DataHub stellt einen offiziellen MCP-Server bereit, der Agenten standardisierten, gouvernierten Echtzeit-Zugriff auf die Metadaten gibt: Entitäten suchen, Metadaten abrufen, Lineage durchlaufen, passende Beispiel-Queries finden. Statt selbst geschriebene Integrationen pro Tool zu pflegen, docken Agenten aus Cursor, Claude, LangChain, Snowflake Cortex, Databricks Genie oder Crew AI über eine einheitliche Schnittstelle an. Der entscheidende Zusatz ist das Wort gouverniert: Der Agent sieht nur, was er sehen darf — die alten Governance-Mechanismen werden nicht abgeschafft, sondern auf Agenten ausgeweitet.
Zweitens: Die Kontext-Intelligenz. Mit dem im Mai 2026 veröffentlichten Release rückt DataHub eine Fähigkeit in den Vordergrund, die über reine Schema-Beschreibung hinausgeht. Aus bestehenden Query-Logs, BI-Dashboards, dbt-Projekten und auch unstrukturierten Dokumenten (Confluence, Notion) extrahiert die Plattform kontinuierlich bewährte Join-, Filter- und Aggregationslogik und verdichtet sie zu einem strukturierten semantischen Index. Wenn ein Agent eine Frage erhält, bekommt er nicht nur die Tabellenstruktur, sondern validierte Abfragemuster, die ähnliche Fragen in der Vergangenheit bereits korrekt beantwortet haben. Über 100 Quellsysteme werden eingelesen, der Kontext wird zerlegt, eingebettet und in Echtzeit abrufbar gemacht.
Drittens: Der Mensch bleibt im Loop. Damit aus maschinell vorgeschlagenem Kontext kein neues Vertrauensproblem entsteht, gibt es einen Context Hub — einen Arbeitsbereich, in dem Fachexperten KI-vorgeschlagenen Kontext prüfen, anreichern und freigeben. In einer Text-to-SQL-Simulation lässt sich vorab durchspielen, wie sich eine Kontextänderung auf die Antworten des Agenten auswirkt, bevor sie veröffentlicht wird. Das ist der Punkt, an dem die alte Governance-Disziplin und die neue Agenten-Welt zusammenkommen: Die Data Stewards von gestern werden zu den Kuratoren des Kontexts, von dem morgen jeder Agent abhängt.
Was das in der Praxis bringt: Zahlen statt Versprechen
Der Reiz dieser Neupositionierung liegt für Entscheider darin, dass sie sich an harten Kennzahlen festmachen lässt. DataHub berichtet, dass Kunden mit der Kontext-Schicht in der Produktion eine Verdoppelung der Genauigkeit ihrer Analytics-Agenten erreichen — in einem Fall stieg die Trefferquote von knapp 50 % auf rund 90 %. Gleichzeitig wird von einer bis zu 60-fachen Beschleunigung bei der Beantwortung analytischer Fragen gesprochen.
Diese Zahlen stammen vom Anbieter und sind entsprechend einzuordnen — aber der Mechanismus dahinter ist plausibel: Ein Agent, der validierte Query-Muster und geprüfte Geschäftsdefinitionen mitgeliefert bekommt, rät schlicht weniger. Der Sprung von 50 % auf 90 % Genauigkeit ist dabei genau die Schwelle, die darüber entscheidet, ob ein Agent ein nettes Demo bleibt oder produktiv eingesetzt werden kann.
Auch der Charakter des Katalogs selbst verändert sich. Im praktischen Einsatz lassen sich agentische Workflows so aufsetzen, dass der Katalog von passiver Dokumentation zu einem aktiven Governance-Partner wird: Agenten agieren als „digitale Steward” — sie scannen kontinuierlich die Metadaten, identifizieren Lücken, schlagen Dokumentation und Aktualisierungen vor, erkennen Anomalien und geben Empfehlungen zu Zugriffsrechten und Aufbewahrung. Die mühsame, chronisch vernachlässigte Pflege des Katalogs — traditionell der Grund, warum so viele Katalogprojekte verkümmern — wird damit selbst zu einer von Agenten unterstützten Aufgabe.
Die strategische Einordnung für Manager
Hinter dem Wandel von DataHub steckt eine allgemeinere Verschiebung, die über ein einzelnes Produkt hinausweist. Über Jahre galt der Datenkatalog als „nice to have” — ein Governance-Werkzeug, dessen Nutzen schwer zu beziffern war und das in der Priorisierung gerne nach hinten rutschte. Mit dem Einzug agentischer KI ändert sich diese Rechnung grundlegend.
Drei Konsequenzen sollten Entscheider mitnehmen:
Kontext-Management wird zur Chefsache. Wenn 82 % der Verantwortlichen eine Kontext-Plattform für die Voraussetzung produktiver KI halten, dann ist die Metadaten-Schicht keine Backoffice-Angelegenheit mehr, sondern eine strategische Investition mit direktem Bezug zur KI-Roadmap. Die Frage lautet nicht mehr „Brauchen wir einen Katalog?”, sondern „Kann unser Katalog Agenten bedienen?”.
Die bestehende Governance-Arbeit zahlt sich neu aus. Unternehmen, die in den vergangenen Jahren in saubere Metadaten, klare Eigentümerschaft, ein gepflegtes Business-Glossar und durchgängige Lineage investiert haben, besitzen genau das Kapital, das Agenten jetzt brauchen. Wer diese Arbeit aufgeschoben hat, spürt die Lücke nun doppelt — als Datenschuld, die jede KI-Initiative ausbremst.
Vorsicht vor der Selbstüberschätzung. Die auffälligste Erkenntnis der Befragung ist die Kluft zwischen Anspruch und Wirklichkeit: 88 % behaupten, eine voll funktionsfähige Kontext-Plattform zu betreiben — während gleichzeitig die Mehrheit ihre KI-Vorhaben wegen mangelnder Datenreife verschiebt. Diese Diskrepanz ist eine Einladung zur ehrlichen Selbstprüfung. „Wir haben einen Katalog” ist nicht dasselbe wie „Unsere Agenten arbeiten mit verlässlichem Kontext”.
Fazit
DataHub ist ein gutes Beispiel dafür, wie sich die Rolle einer etablierten Technologie unter dem Druck von KI verschiebt. Aus dem Datenkatalog für Data Owner — einem Werkzeug, das Menschen beim Finden und Verstehen von Daten half — wird eine Kontext-Plattform, die Agenten und Prozesse mit dem maschinenlesbaren Wissen versorgt, ohne das sie in der Produktion scheitern.
Für Manager ist die Botschaft weniger ein Produkt-Pitch als eine strategische Pointe: Der Engpass beim produktiven KI-Einsatz liegt selten im Modell. Er liegt im Kontext. Und der Kontext entsteht nicht von selbst — er ist das Ergebnis genau jener Governance-, Metadaten- und Ownership-Arbeit, die in vielen Organisationen jahrelang als lästige Pflicht galt. Diese Arbeit ist gerade von der Kür zur Voraussetzung geworden.