030 4504-6000

Mo. – Fr.: 08:00 – 17:00 Uhr

Modul 1

Datenvorverarbeitung (Data Preparation and Data Wrangling)

Überblick

Überblick

Studienziele Modul 1

Die Teilnehmenden lernen Daten als zentralen Rohstoff der digitalen Transformation kennen und können Daten gegenüber Information und Wissen abgrenzen. Sie kennen die wichtigsten Datenquellen, beherrschen grundlegende Methoden des Datenzugriffs und beurteilen die Datenqualität kompetent. Ebenso (er-)kennen sie typische Fehlerquellen in der Datenhaltung und können diese konstruktiv beseitigen. Die Teilnehmenden kennen Methoden der Datenreinigung und -validierung, können sich einen Überblick über das Profil des Datensatzes  verschaffen und auswertungsbereite Datensätze erzeugen.

Technologisch steht die statistische Programmiersprache R und mit ihr das tidyverse-Ökosystem im Mittelpunkt. Die Teilnehmenden werden unterstützt, R-Programme mithilfe von KI-Werkzeugen in Python zu übersetzen und dabei die konzeptionelle Übertragbarkeit zu reflektieren. Analyseergebnisse werden mit Quarto dokumentiert und reproduzierbar gemacht. 

Die Teilnehmenden werden in die Nutzung relationaler Datenbanksysteme eingeführt und können Datenbankabfragen in der Structured Query Language (SQL) formulieren.    

Zugangsvoraussetzungen

  • Abschluss eines Hochschulstudiums oder eines vergleichbaren Studiums an einer Berufsakademie (BA)
  • mindestens ein Jahr für die Weiterbildung geeignete Berufserfahrung
  • Erste Erfahrungen bzw. Interesse am Arbeiten mit KI-Werkzeugen wie Copilot, Gemini, ChatGPT/Claude (freie Version)
  • Interesse an der Teilnahme durch berufliche Erfahrungen in einem der Themenfelder (Vorverarbeitung, Datenanalyse, Ergebniskommunikation).

Detaillierte Informationen

Detaillierte Informationen finden Sie hier als PDF

Dauer:
8 Wochen
Beginn:
Oktober 2026
Anmeldung:
jederzeit zum nächsten Beginn
Aktueller Anmeldeschluss:
20. September 2026
Präsenztermine:
Anfang Oktober und Anfang Dezember 2026 (jeweils 1,75 Tage, Fr/Sa)
Nutzungsentgelt
1.500 €
Studienkoordination
Gabriele Gessler, Dipl.-Ing.

Details

Lehrinhalte

  • Daten, Information, Wissen – Grundbegriffe und Abgrenzungen
  • Datentypen, Skalenniveaus, Transaktionsdaten, Open Data, Sensordaten
  • Datenzugriff: Datenbankverbindungen, REST-APIs, Dateiformate und Encoding
  • Datenqualität:Explorative Datenanalyse und Profililng
  • Bad Data / Good Data: Typische Fehlerquellen, Risiken tabellenkalkulationsbasierter Datenverwaltung; gute Dateiorganisation
  • Datenreinigung und -validierung:
    • Bearbeitung von Zeichenketten,
    • Funktionen für numerische Daten, Zeit- und Datumsangaben
    • Deduplizierung und Entity Resolution
    • Fehlende Werte
  • Auswertungsbereite Datensätze: Tidy Data und Data Wrangling – Konversion, Selektion, Filterung, Aggregation, Neuanordnung und Erweiterung (Join, Union)
  • SQL: Grundlagen und praktische Abfragen
  • Technologie: R/tidyverse, Quarto, KI-gestützte Code-Übersetzung von R nach Python (Pandas)
  • Überblick: Cloud-Datenspeicher und moderne ETL-Konzepte

Lehr- und Lernmethoden

Problem based learning; Vorträge, problemorientierte Übungen und Aufgaben

Abschluss

Hochschulzertifikat der Berliner Hochschule für Technik (bei Absolvierung der modulbegleitenden Aufgaben und der Modulprüfung; 5 Creditpoints nach ECTS); ansonsten Teilnahmebescheinigung

Downloadmaterial Data Science

Erfolgsgeschichten

Als Marktforscher hatte ich gewisse Vorkenntnisse in Statistik, wollte aber mit dem Zertifikatskurs Data Science meine Kenntnisse vor allem in Hinsicht auf Digitalisierung und Umgang mit Big Data aktualisieren, um mich auf dem Arbeitsmarkt für entsprechende Positionen zu qualifizieren. Insbesondere die intensive Anwendung der Programmiersprache R hat mir viel gebracht; als reiner Anwender bin ich der Programmierer-Denke etwas näher gekommen und habe vielfältige Möglichkeiten statistischer Datenanalyse kennengelernt. Der Kurs deckt ein ungemein breites Spektrum ab, das sicherlich auch für die unterschiedlichsten beruflichen Positionen Nutzen abwirft. Der Dozent Herr Dr. Lauf bringt die Inhalte mit großem Engagement und Sachverstand sehr verständlich näher, was bei mir auch eine gewisse Lernfreude ausgelöst hat. Es gibt unzählige Möglichkeiten und Anregungen, um Inhalte, die zur persönlichen Interessenlage oder zur persönlichen beruflichen Situation passen, zu vertiefen. Für mich hat der berufsbegleitende Aufbau von der zeitlichen Inanspruchnahme her funktioniert. Etwas zu kurz kommt meiner Meinung nach nur der interaktive Aspekt (sowohl Dozent-Student als auch die Studenten unter sich, was durch die coronabedingte Absage von Präsenzterminen natürlich noch einmal verstärkt wurde). Die Betreuung durch den Dozenten und durch das Fernstudieninstitut ließ jedoch keine Wünsche offen. „Coronabedingt“ hat sich für mich im alten Job einiges verändert, so dass meine beruflichen Veränderungspläne etwas zurückgestellt sind, aber meine Ausbeute an Bewerbungsgesprächen hatte sich (vor Corona) allein mit dem Vorweisen der beginnenden Zusatzqualifikation merklich verbessert, so dass ich die Weiterbildung jetzt als gute Absicherung für schwierige Zeiten auf dem Arbeitsmarkt sehe. Ich kann den Kurs also guten Gewissens allen empfehlen, die wie ich in relativ kurzer Zeit möglichst viel über Data Science lernen wollen

Michael S.

August 2020

Sie interessieren sich für "Datenvorverarbeitung (Data Preparation and Data Wrangling)"?

Beratung

Sabine Braun, M.A.

Berliner Hochschule für Technik
Fernstudieninstitut Berlin
Haus Bauwesen, D K36
Luxemburger Str. 10
13353 Berlin

030 4504-6018

Anmeldung

Melden Sie sich hier für die Teilnahme an unserem Studienprogramm an:

Online-Anmeldung

Jetzt unverbindlich Informationsmaterial anfordern