Ich baue Daten- und KI-Systeme, vor allem Datenplattformen, MLOps und agentische Infrastruktur, mit einem Hang dazu, mehr davon selbst zu hosten als eigentlich nötig wäre.
Mir geht es nicht nur darum, dass ein System funktioniert, sondern dass ich wirklich verstehe, wie es funktioniert: wo die Daten herkommen, wohin sie fließen und was passiert, wenn sich etwas ändert.
Die meisten meiner Nebenprojekte starten mit derselben Frage: Könnte ich das komplett selbst betreiben? Meistens ja, mit ein paar schmerzhaften Umwegen dazwischen. Mich mit Daten zu beschäftigen und Systeme zu bauen macht mir einfach Spaß. Angefangen hat das schon im Bachelor, und seitdem ist es eher mehr als weniger geworden. Den Ausgleich dazu finde ich beim Schwimmen und Wandern, am liebsten so oft wie möglich.
Wenn etwas kaputtgeht, will ich das sofort sehen, nicht drei Wochen später in einem Log entdecken.
Zugriffe und Governance denke ich von Anfang an mit, nicht als Nachtrag, wenn es schon zu spät ist.
Ich probiere neue Tools gerne aus, aber im Projekt landen nur die, die ein echtes Problem lösen.
Womit ich mich gerade beschäftige
DatenplattformenSpark, Iceberg, Airflow, Trino und die semantischen Schichten obendrauf.
KI-SystemeAgenten, MCP und genau so viel Zugriff auf Unternehmensdaten wie nötig, nicht mehr.
MLOpsDeployment, Monitoring, Retraining und Explainability, nicht nur das Modell.
Self-HostingWeil ein Dutzend Container zuhause offenbar als Hobby zählt.
Cloud & IaCVor allem Azure, Fabric und Terraform, reproduzierbar oder gar nicht.
Wo ich herkomme
Angefangen hat das alles ziemlich planlos. Ich habe Wirtschaftsinformatik im Bachelor studiert, vor allem weil ich meine wirtschaftliche Vorbildung nicht komplett aufgeben wollte, aber gleichzeitig schon immer an Computern hängen geblieben bin. Von Data Science hatte ich zu dem Zeitpunkt keine Ahnung. Irgendwann saß ich in einer Statistik-Vorlesung und war zum ersten Mal richtig fasziniert, ausgerechnet von einer linearen Regression.
Von da an ging es eher schleichend weiter. Ich habe mir zusätzliche Vorlesungen wie Advanced Business Analytics, Klassifikationsverfahren im Data Mining oder Maschinelles Lernen reingezogen, einfach weil mich das Thema nicht mehr losgelassen hat. Ein IT-Praktikum und meine Bachelorarbeit haben mir dann noch klarer gezeigt, wie viel es in der Informatik zu entdecken gibt und wie wenig ich eigentlich wusste, also habe ich mich für den Master in Artificial Intelligence & Data Science entschieden, quasi ein Fachwechsel von Wirtschaft zu Informatik.
Am Anfang bin ich damit ziemlich auf die Nase gefallen, die Mathematik war deutlich härter als gedacht, aber mit ein paar zu vielen durchgemachten Nächten habe ich die Lücken aufgeholt.
Parallel dazu bin ich als Werkstudent bei PREVISIONZ eingestiegen und habe dort zum ersten Mal gesehen, wie Datenplattformen auf Enterprise-Niveau wirklich aussehen. Irgendwann kam der Gedanke: Wenn das in der Cloud funktioniert, bekomme ich das eigentlich auch selbst hin, mit Open Source und eigener Hardware. Genau daraus sind meine ersten eigenen Projekte entstanden.
Heute arbeite ich Vollzeit als BI & Data Science Consultant bei PREVISIONZ in Saarbrücken und baue für Kunden Cloud-Plattformen und ML-Workflows.
Ein paar Dinge, die ich gebaut habe, um herauszufinden, wie sie wirklich funktionieren, nicht nur, wie sie funktionieren sollen.
On-Prem Data Lakehouse
Self-hosted
Ich wollte wissen, wie viel von einer enterprise-tauglichen Datenplattform ich selbst betreiben kann, also habe ich ein komplettes Lakehouse für Retaildaten auf einer einzigen Maschine gebaut: Batch-Verarbeitung, offene Tabellenformate, rollenbasierte Zugriffe und Analytics, ganz ohne Cloud.
LDAP-Rollen und Ranger-Policies sorgen dafür, dass der Trino-Zugriff eng begrenzt bleibt, statt offen für alle.
Airflow und Spark orchestrieren Bronze-, Silver- und Gold-Transformationen inklusive Data-Quality-Checks.
Trino, Cube und Superset stellen die kuratierten Daten bereit.
Der interessante Teil, wenn man einem KI-Agenten Zugriff auf Business-Daten gibt, war nie das Chat-Fenster. Er lag darin, sicherzustellen, dass der Agent wirklich nur sieht, was die Person dahinter sehen darf, also verbindet dieses Projekt Identität und Berechtigungen konsequent über Agent, MCP und semantische Schicht.
LDAP, Authentik OIDC/OAuth und ein eigenes Cube-MCP-Gateway regeln, wer reinkommt.
MCP-Abfragen tragen die angemeldete Identität, inklusive rollenbasierter PII-Maskierung auf diesem Pfad.
Agentenabfragen und Dashboard-Zugriff bleiben bewusst getrennt, das Dashboard läuft über eine eigene Service-Identität.
Ein Modell zu trainieren ist der einfache Teil. Dieses Projekt baut alles drumherum: Tracking, Batch-Inferenz, Monitoring, Drift-Erkennung, Explainability und Retraining, für ein Klassifikationsproblem, das wirklich produktiv laufen sollte, nicht nur im Notebook.
Airflow-DAGs verbinden Batch-Inferenz, Monitoring und Retraining, MLflow trackt jeden Lauf.
Klassifikationsmetriken, Feature-Drift und SHAP-Erklärungen laufen als wiederholbare, automatisierte Checks.
Challenger-Modelle werden per Cross-Validation verglichen, jede Promotion-Entscheidung wird protokolliert.
Ein Experiment darin, eine Microsoft-Fabric-Umgebung wie Software zu behandeln statt wie etwas, das man sich manuell zusammenklickt. Infrastruktur, Medallion-Pipeline, semantisches Modell und Power-BI-Reports werden über Terraform und fabric-cicd reproduzierbar bereitgestellt, mit einer optionalen KI-Schicht obendrauf.
Terraform stellt die Azure-Basisinfrastruktur und den Fabric-Workspace bereit.
Medallion-Pipeline, semantisches Modell und Power-BI-Report werden reproduzierbar veröffentlicht, ganz ohne manuelles Klicken.
Die lokale KI-Chat-Schicht und die Realtime-Erweiterung bleiben separate, optionale Module obendrauf.