{"id":4470,"date":"2025-05-23T12:23:59","date_gmt":"2025-05-23T12:23:59","guid":{"rendered":"https:\/\/caipsgwdev1.bluetree-3476d3db.northeurope.azurecontainerapps.io\/uncategorized-de\/wie-gim-mit-einem-modularen-data-lakehouse-auf-azure-databricks-die-etl-zeit-um-80-verkuerzte\/"},"modified":"2025-10-10T09:28:27","modified_gmt":"2025-10-10T09:28:27","slug":"wie-gim-mit-einem-modularen-data-lakehouse-auf-azure-databricks-die-etl-zeit-um-80-verkuerzte","status":"publish","type":"post","link":"https:\/\/caipsgwdev1.bluetree-3476d3db.northeurope.azurecontainerapps.io\/de\/fallstudien\/wie-gim-mit-einem-modularen-data-lakehouse-auf-azure-databricks-die-etl-zeit-um-80-verkuerzte\/","title":{"rendered":"Wie GIM mit einem modularen Data Lakehouse auf Azure Databricks die ETL-Zeit um 80% verk\u00fcrzte"},"content":{"rendered":"\n<h2 class=\"wp-block-heading is-style-text-subtitle\"><strong>Der Kunde<\/strong><\/h2>\n\n<p><strong>GIM (Global Industrial Manufacturer)<\/strong> ist ein f\u00fchrender Hersteller von Zerspanungswerkzeugen und Werkzeugsystemen. Mit Lagern in Nordamerika, Europa und Asien umfasst die Logistik von GIM die Bereiche Transportplanung, Sendungsverfolgung, Bestandsverwaltung und Lieferantenkoordination.<br\/>Um diese Funktionen zu unterst\u00fctzen, liefert das Analyseteam von GIM Dashboards und Berichte zu KPIs wie Bestandsgeschwindigkeit, Leistung der Spediteure, Kosten pro Meile und Dock-to-Stock-Zeiten. <\/p>\n\n<p>Das alte, auf Azure SQL Server basierende Data Warehouse des Unternehmens hatte jedoch Schwierigkeiten, mit dem wachsenden Volumen und der Komplexit\u00e4t der Daten Schritt zu halten. Neue Quellen &#8211; von IoT-Telemetrie bis hin zu CSV-Dateien von Partnern &#8211; f\u00fchrten zu Datensilos, und die Aktualisierungen f\u00fcr Power BI-Dashboards wurden zunehmend verz\u00f6gert und unzuverl\u00e4ssig. <\/p>\n\n<h2 class=\"wp-block-heading is-style-text-subtitle\"><strong>Die Herausforderung<\/strong><\/h2>\n\n<p>Vor der Umstellung war GIM mit einer Reihe von allgemeinen, aber kritischen Datenproblemen konfrontiert:<\/p>\n\n<ul class=\"wp-block-list\">\n<li><strong>Semistrukturierte Datenflut:<\/strong> IoT-Ger\u00e4te und Partnersysteme lieferten Daten in verschiedenen Formaten wie JSON, XML und CSV. Das manuelle Staging und Parsing in SQL Server erh\u00f6hte den Entwicklungsaufwand und verringerte die Agilit\u00e4t. <\/li>\n\n\n\n<li><strong>Skalierungseinschr\u00e4nkungen:<\/strong> Die Skalierung der bestehenden SQL-Umgebung wurde unerschwinglich teuer. Das Hinzuf\u00fcgen von Rechenleistung trieb die Lizenzkosten in die H\u00f6he, w\u00e4hrend die Skalierung die Datenlandschaft fragmentierte. <\/li>\n\n\n\n<li><strong>Starre Entwicklungsumgebung:<\/strong> Die Dateningenieure hatten keine Sandbox f\u00fcr die Erkundungsarbeit, und selbst bei kleinen Schema\u00e4nderungen bestand die Gefahr, dass die Pipeline versagte.<\/li>\n\n\n\n<li><strong>Verz\u00f6gerte Einblicke:<\/strong> ETL-Prozesse liefen \u00fcber Nacht oder am Wochenende, und Power BI-Berichte brauchten Stunden, um aktualisiert zu werden, was Entscheidungen verz\u00f6gerte.<\/li>\n\n\n\n<li><strong>Begrenzte Datenherkunft:<\/strong> Um zu verstehen, woher ein einzelner KPI stammt, mussten oft Dutzende von Skripten und Tabellen manuell untersucht werden.<\/li>\n<\/ul>\n\n<p>Zusammengenommen verlangsamten diese Probleme die Innovation, belasteten den Betrieb und verringerten das Vertrauen in datengest\u00fctzte Entscheidungen.<\/p>\n\n<h2 class=\"wp-block-heading is-style-text-subtitle\"><strong>Die L\u00f6sung<\/strong><\/h2>\n\n<p>Um seine Analyseinfrastruktur zu modernisieren, ging GIM eine Partnerschaft mit IPS ein, um ein modulares, cloud-natives Data Lakehouse auf Azure Databricks zu entwickeln und zu implementieren. Die Architektur erweiterte das Bronze-Silber-Gold-Medaillon-Modell und f\u00fchrte acht logische Schichten ein, die eine vollst\u00e4ndige R\u00fcckverfolgbarkeit, geregelte Transformationen und Skalierbarkeit gew\u00e4hrleisten. <\/p>\n\n<p>Delta Lake bot ACID-Garantien, w\u00e4hrend Power BI eine intuitive, selbstverwaltete Berichterstattung erm\u00f6glichte. Die Rohdaten wurden kosteng\u00fcnstig in Azure Data Lake Storage Gen2 gespeichert, und Databricks-Cluster boten flexible Rechenumgebungen, die sowohl interaktive Entwicklung als auch automatisierte Workflows unterst\u00fctzten. <\/p>\n\n<p><strong>Zu den wichtigsten architektonischen Elementen geh\u00f6ren:<\/strong><\/p>\n\n<ul class=\"wp-block-list\">\n<li><strong>Acht logische Ebenen:<\/strong> Auf der Grundlage eines erweiterten Medaillonmodells (Bronze-Silber-Gold) hatte jede Schicht einen klaren Zweck &#8211; Strukturierung, R\u00fcckverfolgbarkeit der Daten und einfachere Verwaltung. Die Architektur verwies zwar auf eine &#8220;Data Vault&#8221;-Schicht (L5), wurde jedoch an die Bed\u00fcrfnisse von GIM angepasst und folgte nicht der strengen Data Vault-Modellierung. <\/li>\n\n\n\n<li><strong>Kosteneffiziente Speicherung:<\/strong> Rohdateien wurden in Azure Data Lake Storage Gen2 gespeichert. Die Rechenleistung wurde getrennt und nur bei Bedarf hochgefahren. <\/li>\n\n\n\n<li><strong>Databricks-Cluster f\u00fcr Entwicklung und Automatisierung:<\/strong> Cluster unterst\u00fctzen sowohl die interaktive Entwicklung als auch geplante Auftr\u00e4ge &#8211; das erh\u00f6ht die Agilit\u00e4t und reduziert den Overhead.<\/li>\n\n\n\n<li><strong>Power BI Semantische Modelle:<\/strong> Ein zentraler Datensatz, der Import- und DirectQuery-Tabellen kombiniert und damit Flexibilit\u00e4t und Skalierbarkeit f\u00fcr Gesch\u00e4ftsanwender gew\u00e4hrleistet.<\/li>\n<\/ul>\n\n<p><strong>Die L\u00f6sung wurde in f\u00fcnf strukturierten Phasen geliefert:<\/strong><\/p>\n\n<ol class=\"wp-block-list\">\n<li><strong>Bewertung &amp; Design:<\/strong><br\/>F\u00fchrte Workshops mit Interessenvertretern durch, um hochwertige KPIs zu definieren (termingerechte Lieferung, Dock-to-Stock, Kosten pro Palette), katalogisierte Datenl\u00fccken und Latenzanforderungen und erstellte einen Architekturentwurf einschlie\u00dflich CI\/CD-Mustern.<\/li>\n\n\n\n<li><strong>Plattformbereitstellung:<\/strong><br\/>Richten Sie Azure Databricks-Arbeitsbereiche, ADLS Gen2-Speicher, VNet-Peering, Authentifizierung und Zugriffskontrollen (Azure AD, RBAC, ACLs) ein und etablieren Sie Git-basierte CI\/CD-Pipelines mit automatischer Jobbereitstellung.<\/li>\n\n\n\n<li><strong>ETL Rebuild &amp; Migration:<\/strong><br\/>Wir haben alte SSIS-Pakete in skalierbare PySpark- und SQL-Jobs umgeschrieben und eine inkrementelle Ladelogik auf der Grundlage ge\u00e4nderter Zeitstempel implementiert, die den IPS-Architekturstandards entspricht.<\/li>\n\n\n\n<li><strong>Semantische Modellierung und Berichterstattung:<\/strong><br\/>Erstellung eines zusammengesetzten Power BI-Modells, das Import- und DirectQuery-Tabellen kombiniert, Entwicklung von Dashboards f\u00fcr wichtige Logistikkennzahlen (Lagerumschlag, Ausnahmen bei Sendungen, Scorecards f\u00fcr Spediteure) und Durchf\u00fchrung von Enablement-Workshops f\u00fcr Analysten und Betriebsleiter.<\/li>\n\n\n\n<li><strong>\u00dcbergabe &amp; Support:<\/strong><br\/>Umfassende Dokumentation, Implementierung eines Governance-Frameworks f\u00fcr das Onboarding neuer Quellen und die Verwaltung von Schema\u00e4nderungen sowie Unterst\u00fctzung bei der Einrichtung eines Data &amp; Analytics Center of Excellence, um kontinuierliche Verbesserungen zu erzielen.<\/li>\n<\/ol>\n\n<h2 class=\"wp-block-heading is-style-text-subtitle\"><strong>Ergebnisse &amp; Auswirkungen<\/strong><\/h2>\n\n<p>Die Modernisierung von Data Lakehouse f\u00fchrte zu messbaren Leistungsverbesserungen und schuf die Grundlage f\u00fcr skalierbare Echtzeit-Analysen:<\/p>\n\n<p>\u2705 <strong>ETL-Verarbeitungszeit um 80% reduziert<\/strong><br\/>N\u00e4chtliche ETL-Fenster schrumpften dank verteilter Spark-Pipelines von ~10 Stunden auf nur 2 Stunden.<\/p>\n\n<p>\u2705 <strong>Power BI-Berichte werden 61% schneller aktualisiert<\/strong><br\/>Die Aktualisierungszeiten f\u00fcr Datens\u00e4tze sind von 90 auf 35 Minuten gesunken, was eine schnellere Berichterstattung und Entscheidungsfindung erm\u00f6glicht.<\/p>\n\n<p>\u2705 <strong>Beschleunigte Time-to-Insight<\/strong><br\/>Neue Datenquellen k\u00f6nnen jetzt in einem Bruchteil der Zeit eingebunden werden, was die Agilit\u00e4t des gesamten Logistikteams verbessert.<\/p>\n\n<p>\u2705 <strong>Verbesserte Datentransparenz und -abfolge<\/strong><br\/>Klare Transformationsschichten und Versionskontrolle \u00fcber Delta Lake erh\u00f6hen die Nachvollziehbarkeit und das Vertrauen in KPIs.<\/p>\n\n<p>\u2705 <strong>Bef\u00e4higte Analysten und Operatoren<\/strong><br\/>Gesch\u00e4ftsteams k\u00f6nnen jetzt Dashboards nahezu in Echtzeit durchsuchen, Versandausnahmen sofort erkennen und mit gemeinsamen semantischen Modellen zusammenarbeiten.<\/p>\n\n<h2 class=\"wp-block-heading is-style-text-subtitle\"><strong>Warum es funktionierte<\/strong><\/h2>\n\n<p>Die Cloud-native Data Lakehouse-Modernisierung von GIM zeigt, wie sich Hersteller und gro\u00dfe Lagerh\u00e4user von veralteten Beschr\u00e4nkungen befreien k\u00f6nnen. IPS verf\u00fcgt \u00fcber ein tiefes Verst\u00e4ndnis sowohl der Cloud-Architektur als auch der Anforderungen an Logistikdaten. <\/p>\n\n<p>Aber der Erfolg dieser Transformation war nicht nur eine Frage der Technologie &#8211; es ging um Strategie, Struktur und enge Zusammenarbeit. Durch die Kombination von modularem Design, serverlosem Computing und modernen DevOps-Praktiken halfen wir GIM, seine Analysen zu modernisieren, ohne den Betrieb zu st\u00f6ren. Das hat den Unterschied ausgemacht:  <\/p>\n\n<ul class=\"wp-block-list\">\n<li><strong>Modulares, mehrschichtiges Design:<\/strong><br\/>IPS wandte eine klare Trennung der Belange in der achtschichtigen Architektur an. Jede Schicht hatte eine klar definierte Verantwortung, so dass die Teams \u00c4nderungen isolieren, Risiken reduzieren und bestimmte Teile der Pipeline weiterentwickeln konnten, ohne nachgelagerte Prozesse zu unterbrechen. <\/li>\n\n\n\n<li><strong>Delta Lake auf Databricks:<\/strong><br\/>Indem IPS auf Delta Lake aufbaute, brachte es Warehouse-Grade-Funktionen &#8211; wie ACID-Transaktionen, Schemaerzwingung und Zeitreisen &#8211; in einen skalierbaren, Cloud-nativen Data Lake. Dadurch erhielt GIM die Zuverl\u00e4ssigkeit und Datenintegrit\u00e4t, die zur Unterst\u00fctzung wichtiger Logistikanalysen erforderlich ist. <\/li>\n\n\n\n<li><strong>Serverless Compute &amp; Job Clusters:<\/strong><br\/>Das automatisierte Auf- und Abr\u00fcsten von Databricks-Clustern erm\u00f6glichte die Skalierung der Rechenressourcen mit der Nachfrage. Dadurch konnte GIM die Kosten in Zeiten geringer Auslastung optimieren und gleichzeitig die volle Leistung in Spitzenzeiten der Datenverarbeitung sicherstellen. <\/li>\n\n\n\n<li><strong>CI\/CD &amp; Test-Frameworks:<\/strong><br\/>Git-gest\u00fctzte Notebooks und skriptgesteuerte Bereitstellungen sorgten f\u00fcr Konsistenz in allen Umgebungen. W\u00e4hrend GIM keine automatisierten Testtools wie Great Expectations einsetzte, f\u00fchrte IPS eine klare DevOps-Pipeline ein, um wiederholbare Implementierungen und Versionskontrolle zu erm\u00f6glichen. <\/li>\n\n\n\n<li><strong>Business-Tech-Zusammenarbeit:<\/strong><br\/>Vom ersten Tag an waren kleine und mittelst\u00e4ndische Logistikunternehmen eng in die Designentscheidungen eingebunden. Dadurch wurde sichergestellt, dass die technische Entwicklung eng mit den betrieblichen Gegebenheiten und den wichtigen KPIs abgestimmt war &#8211; so wurde der Gesch\u00e4ftswert in jeder Phase maximiert. <\/li>\n<\/ul>\n\n<p>Mit IPS hat GIM nicht nur seinen Datenbestand aufger\u00fcstet, sondern auch eine Grundlage f\u00fcr kontinuierliche Einblicke, intelligentere Planung und skalierbares Wachstum geschaffen.<\/p>\n\n<h2 class=\"wp-block-heading is-style-text-subtitle\"><strong>Machen Sie den n\u00e4chsten Schritt<\/strong><\/h2>\n\n<p><strong>Werden Ihre logistischen Erkenntnisse durch veraltete Pipelines und langsame Berichte behindert?<\/strong><br\/>Lassen Sie uns eine skalierbare, kosteneffiziente Analyseplattform aufbauen, die mit der Geschwindigkeit Ihres Unternehmens Schritt h\u00e4lt.<\/p>\n\n<p><strong><a href=\"https:\/\/caipsgwdev1.bluetree-3476d3db.northeurope.azurecontainerapps.io\/de\/kontaktieren-sie-uns\/\" data-type=\"page\" data-id=\"2329\">Vereinbaren Sie einen Beratungstermin<\/a><\/strong><\/p>\n\n<figure class=\"wp-block-image size-full is-resized\"><img fetchpriority=\"high\" decoding=\"async\" width=\"1024\" height=\"1024\" src=\"https:\/\/caipsgwdev1.bluetree-3476d3db.northeurope.azurecontainerapps.io\/wp-content\/uploads\/2025\/04\/GIM-4.png\" alt=\"#client-logo\" class=\"wp-image-2667\" style=\"width:128px\" srcset=\"https:\/\/caipsgwdev1.bluetree-3476d3db.northeurope.azurecontainerapps.io\/wp-content\/uploads\/2025\/04\/GIM-4.png 1024w, https:\/\/caipsgwdev1.bluetree-3476d3db.northeurope.azurecontainerapps.io\/wp-content\/uploads\/2025\/04\/GIM-4-300x300.png 300w, https:\/\/caipsgwdev1.bluetree-3476d3db.northeurope.azurecontainerapps.io\/wp-content\/uploads\/2025\/04\/GIM-4-150x150.png 150w\" sizes=\"(max-width: 1024px) 100vw, 1024px\" \/><\/figure>\n\n<p><strong><br\/><\/strong><\/p>\n\n<p><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Der Kunde GIM (Global Industrial Manufacturer) ist ein f\u00fchrender Hersteller von Zerspanungswerkzeugen und Werkzeugsystemen. Mit Lagern in Nordamerika, Europa und Asien umfasst die Logistik von GIM die Bereiche Transportplanung, Sendungsverfolgung, Bestandsverwaltung und Lieferantenkoordination.Um diese Funktionen zu unterst\u00fctzen, liefert das Analyseteam von GIM Dashboards und Berichte zu KPIs wie Bestandsgeschwindigkeit, Leistung der Spediteure, Kosten pro Meile [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":3364,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"content-type":"","footnotes":""},"categories":[46,33],"tags":[138,139,140],"class_list":["post-4470","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-daten-und-analytik","category-fallstudien","tag-azure-de","tag-data-lakehouse-de","tag-databricks-de"],"_links":{"self":[{"href":"https:\/\/caipsgwdev1.bluetree-3476d3db.northeurope.azurecontainerapps.io\/de\/wp-json\/wp\/v2\/posts\/4470","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/caipsgwdev1.bluetree-3476d3db.northeurope.azurecontainerapps.io\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/caipsgwdev1.bluetree-3476d3db.northeurope.azurecontainerapps.io\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/caipsgwdev1.bluetree-3476d3db.northeurope.azurecontainerapps.io\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/caipsgwdev1.bluetree-3476d3db.northeurope.azurecontainerapps.io\/de\/wp-json\/wp\/v2\/comments?post=4470"}],"version-history":[{"count":4,"href":"https:\/\/caipsgwdev1.bluetree-3476d3db.northeurope.azurecontainerapps.io\/de\/wp-json\/wp\/v2\/posts\/4470\/revisions"}],"predecessor-version":[{"id":4512,"href":"https:\/\/caipsgwdev1.bluetree-3476d3db.northeurope.azurecontainerapps.io\/de\/wp-json\/wp\/v2\/posts\/4470\/revisions\/4512"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/caipsgwdev1.bluetree-3476d3db.northeurope.azurecontainerapps.io\/de\/wp-json\/wp\/v2\/media\/3364"}],"wp:attachment":[{"href":"https:\/\/caipsgwdev1.bluetree-3476d3db.northeurope.azurecontainerapps.io\/de\/wp-json\/wp\/v2\/media?parent=4470"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/caipsgwdev1.bluetree-3476d3db.northeurope.azurecontainerapps.io\/de\/wp-json\/wp\/v2\/categories?post=4470"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/caipsgwdev1.bluetree-3476d3db.northeurope.azurecontainerapps.io\/de\/wp-json\/wp\/v2\/tags?post=4470"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}