Warum Data Science?

Folgend werden Begriffe der Data Science erklärt.

Unter Data-Mining versteht man die systematische Anwendung statistischer Methoden auf große Datenbestände (insbesondere „Big Data“ bzw. Massendaten) mit dem Ziel, neue Querverbindungen und Trends zu erkennen. Solche Datenbestände werden aufgrund ihrer Größe mittels computergestützter Methoden verarbeitet. In der Praxis wurde der Unterbegriff Data-Mining auf den gesamten Prozess der sogenannten „Knowledge Discovery in Databases“ (englisch für Wissensentdeckung in Datenbanken; KDD) übertragen, der auch Schritte wie die Vorverarbeitung und Auswertung beinhaltet, während Data-Mining im engeren Sinne nur den eigentlichen Verarbeitungsschritt des Prozesses bezeichnet.

Extract, Transform, Load (ETL) ist ein Prozess, bei dem Daten aus mehreren, gegebenenfalls unterschiedlich strukturierten Datenquellen in einer Zieldatenbank vereinigt werden.

  • Extraktion: der relevanten Daten aus verschiedenen Quellen
  • Transformation: der Daten in das Schema und Format der Zieldatenbank
  • Laden: der Daten in die Zieldatenbank

Bekannt ist der Prozess vor allem durch die Verwendung beim Betrieb eines Data-Warehouses. Hier müssen große Datenmengen aus mehreren operationalen Datenbanken konsolidiert werden, um dann im Data-Warehouse gespeichert zu werden.

Ein Data Warehouse (kurz DWH oder DW; wörtlich „Datenlager“, im Deutschen dominiert die englische Schreibweise, die Schreibweise Datawarehouse wird jedoch auch verwendet) ist eine für Analysezwecke optimierte zentrale Datenbank, die Daten aus mehreren, in der Regel heterogenen Quellen zusammenführt. Der Begriff stammt aus dem Informationsmanagement in der Wirtschaftsinformatik. Vollständige Daten zum Beispiel eines Unternehmens oder eines größeren Projekts, die in der Regel als Rohdaten vorliegen und nicht bereits nach bestimmten Vorgaben verarbeitet oder ausgewählt wurden, werden hingegen in Data Lakes vorgehalten.

In der Datenanalyse wird mit statistischen Methoden gearbeitet, mit welchen aus vorliegenden numerischen Einzeldaten zusammenfassende Informationen (Kenngrößen) gewonnen und tabellarisch oder grafisch aufbereitet und dokumentiert werden.[1]

Statistische Datenanalysen sind ein fester Bestandteil in vielen Bereichen des täglichen Lebens. Das reicht von der Umfrageforschung über prospektive klinische Studien bis hin zu Analysen von latenten Zusammenhängen in sehr großen Datenbeständen (Data Mining).

In der tagtäglichen Praxis wird mit Prozentzahlen argumentiert und einschlägiges Datenmaterial präsentiert, das nicht immer den Kriterien einer profunden und zuverlässigen Datenanalyse genügt. Hier werden immer wieder auch einfache handwerkliche Fehler gemacht

Erklärvideo

  • Manuel Mustermann Kitzbühel

    Super verständlich! Ich werde mir die Dienstleistung kaufen.

  • Max Foidl St. Johann

    Die Erklärung ist mir unzureichend, aber ansonsten alles okay. 

  • Max Mustermann Oberndorf

    Guter Service und gute Erklärung.

Anfrage

Captcha reload