Die drei Gesetze der Daten: Der Wert ist niemals den Daten an sich inhärent.
Erstens ein Szenario, das mir in den letzten zwei Jahren immer wieder begegnet ist.
Ein Unternehmen hat mehrere Millionen in die Datenverwaltung investiert. Standards wurden erstellt, Plattformen aufgebaut und historische Daten einmal bereinigt. Auf der Abnahmeveranstaltung war die Präsentation sehr überzeugend: Die Datenvollständigkeit stieg von 62 % auf 96 %, die Übereinstimmungsrate von 71 % auf 94 %, zudem wurde ein Branchenpreis gewonnen.
Bei einer Nachbesprechung ein halbes Jahr später lautete die Aussage der Fachabteilungen: "Die Daten sind immer noch ungenau, wir ziehen unsere Daten nach wie vor selbst in Excel."
Wo liegt das Problem?
Betrachtet man nur die Qualitätskennzahlen, war dieses Projekt ein Erfolg. Wechselt man aber die Perspektive, stellt man fest: Diese sauberen Daten liegen in der dritten Schicht des Data Warehouses. Um sie zu erhalten, müssen die Fachabteilungen ein Ticket einreichen, auf die Planung warten und die Genehmigung von zwei Abteilungen einholen. Bis die Daten vorliegen, ist die entsprechende Werbeaktion längst vorbei.
Die Qualität ist hoch, die Entfernung ist groß, die Zeit ist abgelaufen. Von drei Variablen wurde nur eine ernst genommen.
Der Wert von Daten ist niemals eine inhärente Eigenschaft der Daten selbst.
Er wird gemeinsam von drei Variablen bestimmt: Qualität, Entfernung und Zeit. Ich nenne die Regeln, die diese drei Variablen steuern, die drei Hauptgesetze der Daten.
Erstes Gesetz: Trägheitsgesetz der Daten – die Qualitätsrechnung kann nur an der Quelle abgerechnet werden
Haben Sie jemals darüber nachgedacht: Die Daten, die Sie gerade bearbeiten, sind längst nicht mehr die ursprünglichen Daten.
Fügen Sie den Daten Versionen, Alter und Lebenszyklus hinzu, dann stellen Sie fest, dass sie altern, sich teilen, kopiert und umgeschrieben werden. Sobald ein Datensatz von dem Moment seiner Entstehung an zu zirkulieren beginnt, ist er nicht mehr der, der er ursprünglich war.
Das ist das Trägheitsgesetz der Daten: Sobald Daten niedriger Qualität in den Zirkulationsprozess gelangen, sind die daraus entstehenden Auswirkungen nicht rückverfolgbar und unvermeidbar. Egal wie stark Sie sie später bereinigen oder Modelle erstellen, Sie zahlen nur immer wieder für die einmalige "Nachlässigkeit" vorher.
Ich vergleiche die Datenqualität oft mit der Geburt eines Kindes. Wenn Sie bei der Geburt etwas mehr Mühe aufwenden, um ein gesundes Kind zur Welt zu bringen, ist das tausendmal lohnender, als nach der Geburt alles nach und nach zu korrigieren.
In Formeln ausgedrückt: Die Qualitätsvariable Q ∈ [0, 1] misst den Grad, in dem Daten "von Geburt an gesund" sind. Beachten Sie ihre Eigenschaft: Eine Verschmutzung an der Quelle ist ein irreversibler Verlust. Sie ist eine Variable, die nur abnehmen und kaum erhöht werden kann.
Dieses Gesetz widerlegt den Irrglauben: "Man kann die Daten nachträglich sauber waschen."
Die typischen Symptome sind leicht zu erkennen: Dasselbe Feld wird wiederholt bereinigt, aber nie richtig sauber; nach Abschluss jedes Verwaltungsprojekts kehrt der Zustand nach einem halben Jahr wieder zum Alten zurück. Weil die Verschmutzungsquelle nicht beseitigt wurde, verdünnen Sie die Daten nur ständig im nachgelagerten Bereich.
Handlungsempfehlung: Verlagern Sie die Verwaltungsmaßnahmen an die fachliche Quelle, nicht erst zum Zeitpunkt des Einfügens in den Data Lake. Wo das Feld zum ersten Mal in ein System eingegeben wird, soll die Datenverwaltung auch stattfinden.
Zweites Gesetz: Das Ausschließlichkeitsgesetz der Daten – Allgemeingültigkeit und Wert stehen von Natur aus im Widerspruch
Je konzentrierter die Daten sind, desto wertvoller sind sie?
Ganz im Gegenteil – je weiter sie vom Fachgeschäft entfernt sind, desto weniger wertvoll sind sie.
Mit jeder Ebene, die die Daten vom Einsatzort des Fachgeschäfts entfernt sind, nimmt ihr Wert einmal ab. Die Formel lautet V(d) = V₀ · e^(−λd): V₀ ist der Wert der Daten in dem Moment, in dem sie am Einsatzort des Fachgeschäfts entstehen, d ist die Anzahl der Ebenen zum Einsatzort des Fachgeschäfts (Fachsystem → Erfassung → Bereinigung → Modellierung → Bericht → Entscheidung), λ ist der Kontext-Dämpfungskoeffizient.
Warum nimmt der Wert ab? Weil Allgemeingültigkeit und Wert von Natur aus im Widerspruch stehen.
Je sauberer und allgemeingültiger Sie die Daten abstrahieren, desto mehr verlieren sie den fachlichen Kontext, der ihren Wert ausmacht. Wenn sie so weit abstrahiert sind, dass sie sich vollständig vom fachlichen Kontext lösen, bleibt nur die Form erhalten, die Bedeutung geht verloren.
Aus diesem Gesetz ergeben sich vier Folgerungen, von denen jede in Unternehmen eine Entsprechung findet.
Folgerung 1: Das Paradoxon der Daten-Mittelplattform. Die Daten-Mittelplattform wurde für die Wiederverwendung geschaffen, aber die Ebene mit der höchsten Wiederverwendungsrate hat den niedrigsten Einzelwert. Das ist durch ihr Designziel bedingt, nicht durch eine unzureichende Umsetzung.
Folgerung 2: Starre Kennzahldefinitionen. Je weiter eine Kennzahldefinition vom Fachgeschäft entfernt ist, desto weniger Menschen trauen sich, sie zu ändern, und desto weniger Menschen trauen sich, sie zu verwenden. Am Ende wird sie zu einer Zahl, die jeder auswendig kennt, aber niemand glaubt.
Folgerung 3: Kostensteigerung. Die Kosten für die Behebung von Datenqualität im nachgelagerten Bereich entsprechen den im vorgelagerten Bereich eingesparten Kosten multipliziert mit der Anzahl der durchlaufenen Ebenen. Das ist die Kehrseite des ersten Gesetzes.
Folgerung 4: Die letzte Meile. 90 % des Datenwerts entstehen nur in der letzten Meile vor der Rückkehr zur fachlichen Handlung.
Handlungsempfehlung: Geben Sie die Definitionsgewalt für Kennzahlen an die Fachabteilungen zurück. Lassen Sie die Fachabteilungen nicht nur die IT-Kennzahlen prüfen, sondern lassen Sie sie selbst definieren, ändern und die Verantwortung übernehmen.
Drittes Gesetz: Das Zeitwertgesetz der Daten – zwei Goldene Phasen, dazwischen liegt eine Lückenzone
Je neuer die Daten sind, desto wertvoller sind sie?
Falsch. Tatsächlich gibt es zwei Goldene Phasen.
Die Formel lautet V(t) = A · e^(−αt) + B · (1 − e^(−βt)), die Summe der beiden Terme ergibt einen zweigipfligen Verlauf.
Der erste Gipfel liegt direkt nach der Entstehung – da können die Daten noch das Ergebnis beeinflussen. Sobald das Entscheidungsfenster geschlossen ist, fällt der Wert steil ab, α steht für das fachliche Tempo: Je schneller das Tempo, desto stärker die Dämpfung. Bei einem Echtzeit-Risikokontrollmodell hat es keinen Sinn, auch wenn seine Genauigkeit sehr hoch ist, wenn das Ergebnis erst berechnet wird, nachdem die Transaktion bereits abgeschlossen ist.
Der zweite Gipfel tritt nach ausreichend langer Zeit ein – wenn Sie genug lange historische Daten gesammelt haben, können sie wieder für Modellierung, Ursachenanalyse und Trendbeurteilung verwendet werden, der Wert steigt zum zweiten Mal. β steht für die historische Tiefe: Wie groß diese Tiefe sein muss, damit der Wert freigesetzt wird, hängt von der Frage ab, die Sie beantworten wollen.
Das Problem liegt im mittleren Bereich. Weder frisch noch alt genug – das ist die Lückenzone des Werts.
In den Data Warehouses der meisten Unternehmen entfallen 80 % der Speicherkosten auf diese Daten mit dem geringsten Wert.
Das ist die häufigste und am schwersten zu entdeckende Art von Verschwendung.
Es gibt noch eine leicht zu übersehende Folgerung, die ich Kontinuitätsprämie nenne: Der Wert historischer Daten liegt in ihrer "Kontinuität". Wenn die historische Aufzeichnung um ein Jahr unterbrochen wird, ist der Verlust weit mehr als 1/N, da die Musterableitung direkt ungültig wird – Sie können keine Lücken enthaltende Sequenz verwenden, um Zyklen zu bestimmen.
Handlungsempfehlung: Das hierarchische Speichersystem sollte nicht nur nach "Zugriffshäufigkeit" gestaltet werden, sondern nach der Zeitwertkurve. Drei weitere Maßnahmen lassen sich sofort umsetzen: Investitionen in Echtzeitfunktionen richten sich zuerst nach der Länge des Entscheidungsfensters, nur bei Geschäften mit einem Fenster von Minuten lohnt sich eine sekunden genaue Übertragungsstrecke; bei der Archivierungsstrategie soll ein kostengünstiger aber wieder aktivierbarer Wiederherstellungskanal vorgesehen werden; Löschen Sie keine historischen Daten, um Speicherkosten zu sparen – das ist die teuerste Art, Geld zu sparen.
Viertes Gesetz: Warum Multiplikation unverzichtbar ist – das ist der wichtigste Satz des gesamten Konzepts
Wenn die drei Gesetze zusammengefasst werden, lautet die Wertfunktion der Daten wie folgt:
V = Q × D × T
Ausführlich geschrieben lautet sie V(d, t) = Q · V₀ · e^(−λd) · [A·e^(−αt) + B·(1−e^(−βt))].
Achten Sie auf das Symbol in der Mitte: Es ist ein Multiplikationszeichen, kein Pluszeichen. Das ist äußerst wichtig.
Wenn es ein Pluszeichen wäre, könnten Sie den Mangel einer Variablen durch die Stärke einer anderen ausgleichen. Bei der Multiplikation geht das nicht.
Selbst bei bester Qualität nähert sich der Wert Null, wenn die Daten zu weit vom Fachgeschäft entfernt sind – eine Tabelle, die perfekt sauber ist aber außerhalb der dritten Schicht des Data Warehouses liegt, wird von niemandem verwendet, ihr Wert ist Null. Selbst bei geringster Entfernung wird der Wert Null, wenn das Entscheidungsfenster abgelaufen ist – selbst wenn die Echtzeitberechnung sehr genau ist, ist die Werbeaktion vorbei, wenn das Ergebnis vorliegt. Weder unsauber noch weit entfernt, aber in der Lückenzone steckend, hat der Wert den niedrigsten Stand – das ist am verborgensten und kostet am meisten Geld.
Daraus ergibt sich eine unangenehme Folgerung: Datenverwaltung kann nicht durch "einen einzelnen Durchbruch" gelingen.
Das ist genau der Grund, warum viele Teams scheitern. Sie erreichen eine Qualitätsbewertung von 90 Punkten, aber die Daten sind drei Ebenen vom Fachgeschäft entfernt, Q = 0,9, D = 0,1, das Produkt ergibt nur 0,09. Das Verhältnis von Aufwand zu Nutzen ist extrem schlecht, und dann kommt man zu dem Schluss, dass "Datenverwaltung nutzlos ist".
Das ist die Abbildung des Minimum-Faktoren-Gesetzes (Liebig-Gesetz) im Datenbereich: Der niedrigste der drei Variablen bestimmt die Obergrenze des Gesamtwerts. Wenn Sie Geld in die anderen zwei Variablen investieren, ändert sich diese Obergrenze nicht.
Fünftes Gesetz: Wie man es anwendet – zuerst diagnostizieren, dann investieren
Vier praktische Ratschläge, die in der richtigen Reihenfolge umgesetzt werden sollen.
Erstens: Zuerst diagnostizieren, nicht sofort ein Projekt starten. Bewerten Sie die drei Variablen Q / D / T jeweils einzeln, und ermitteln Sie die aktuell niedrigste Variable in Ihrem Team. Dieser Schritt dauert nicht mehr als zwei Wochen, kann aber das Budget für ein ganzes Jahr einsparen.
Zweitens: Die niedrigste Variable ist die einzige Richtung, in die es sich derzeit zu investieren lohnt. Nicht "vorrangig investieren", sondern "einzig". Die anderen zwei Variablen sollen nur so gehalten werden, dass sie sich nicht verschlechtern.
Drittens: Arbeiten Sie nicht an allen drei Variablen gleichzeitig. Das entspricht einer Verteilung des Budgets auf drei Tische, sodass an keinem Tisch genug zu essen ist.
Viertens: Führen Sie alle sechs Monate eine erneute Diagnose durch. Weil die niedrigste Variable sich ändert. Nachdem die Qualität verbessert wurde, wird die Entfernung oft zum neuen Engpass – das ist eigentlich ein gutes Zeichen, es bedeutet, dass die vorherige Phase richtig umgesetzt wurde.
Schnellübersicht über die drei Gesetze, empfohlen zum Speichern:
Abschließende Worte
Nachdem ich die drei Gesetze erläutert habe, geht es im Grunde um dasselbe: Der Wert von Daten ist niemals eine inhärente Eigenschaft der Daten selbst.
Er ist eine Funktion der drei Variablen Qualität, Entfernung und Zeit. Die gesamte Arbeit der Datenverwaltung besteht darin, diese drei Variablen gleichzeitig in eine vorteilhafte Richtung zu bewegen.
Kehren wir zu dem eingangs genannten Unternehmen zurück. Sein Problem liegt nicht darin, dass es keine Investitionen tätigen will, sondern darin, dass es nur in eine der drei Variablen investiert hat und erwartet, dass der Gesamtwert sich verdreifacht. In der Welt der Multiplikation gibt es so etwas nicht.
Wenn also das nächste Mal jemand fragt: "Ist Datenverwaltung überhaupt nützlich?", empfehle ich, zuerst zurückzufragen: Welche Variable ist derzeit die niedrigste in Ihrem Team?
Wenn Sie diese Frage nicht beantworten können, bedeutet das, dass Sie noch nicht angefangen haben.
Welche der drei Variablen ist in Ihrem Team die niedrigste? Diskutieren Sie es in den Kommentaren.
Ein Zusatz: Zu jedem der drei Gesetze habe ich eine etwa 40 Sekunden lange Audioversion aufgenommen, die bereits auf der WeChat-Videoplattform veröffentlicht wurde. Wer es schnell durchgehen will, kann dort zuhören; wer die Herleitungen und Umsetzungsmaßnahmen sehen will, findet das alles in diesem Artikel.