Schulung - PySpark - Big Data Analytics mit Apache Spark und Python
Verarbeitung und Analyse großer Datenmengen mit Apache Spark und Python praxisnah einsetzen.
Nach dem Seminar sind Sie in der Lage, große Datenmengen eigenständig zu laden, zu transformieren und gezielt auszuwerten. Sie kennen die Einsatzmöglichkeiten von PySpark im Kontext von Data Science und können fundierte Entscheidungen zur Datenverarbeitung in Big Data Projekten treffen.
Seminarinformationen
Referenz : 54450
- Dauer : 2 Tage (12 Stunden)
- Live Online Training
Wer sollte teilnehmen:
Zielgruppe
- Data Scientists und Data Analysts, die sich mit der Verarbeitung und Analyse großer Datenmengen mithilfe von Python und Apache Spark (PySpark) beschäftigen möchten.
Voraussetzungen
- Grundlegende Kenntnisse in Programmierung und SQL sind erforderlich.
- Erfahrungen in anderen Programmiersprachen sind von Vorteil, da sie den Einstieg in Python erleichtern.
- Englischkenntnisse, insbesondere im Verständnis von englischen Texten, sind hilfreich, da viele Dokumentationen und Kursmaterialien auf Englisch verfügbar sind.
Trainingsprogramm
Seminarprogramm herunterladenHinweis
Die Teilnehmer:innen benötigen zur Teilnahme einen eigenen Rechner, auf dem ein aktueller Browser (Chrome, Firefox, Edge) zur Teilnahme an der Video-Schulung installiert ist. Entsprechend sollten die Teilnehmer:innen auch über ein Mikrofon und Kopfhörer oder Lautsprecher verfügen. Eine Kamera für die Teilnehmer:innen ist optional und freiwillig, wäre aber sehr hilfreich.
Um ein möglichst realistisches Erlebnis zu ermöglichen, erhält jede:r Teilnehmende ein eigenes kleines Cluster innerhalb der Amazon Cloud, der Zugriff erfolgt über SSH und den Web-Browser. Damit wird neben einem Web-Browser auch keine weitere Software auf den Computern der Teilnehmenden benötigt.
Bitte prüfen Sie, ob Ihr Firmenlaptop Zugangsbeschränkungen im Internet hat. Die digitalen Unterlagen (Skript) werden im Seminar online zum Download zur Verfügung gestellt. Sie erhalten vor dem Seminar per E-Mail den Link zu einer Testdatei zum Download, um dies überprüfen zu können.
Sie sollten sich in firmenfremde WLAN-Netze registrieren können, um Zugang zum Internet am Veranstaltungsort zu haben. Einige Teilnehmer:innen können sich alternativ auch über Ihr Firmen-Handy ins Internet einwählen (WLAN-Tethering / Hotspot).
Als Backup Lösung ist es möglich, dass der USB-Port bei Ihrem Laptop freigeschaltet ist, um damit verwendete Dateien oder sonstige Unterlagen übertragen zu können.
Hinweis für Online-Schulungen:
Für ein optimales Lernerlebnis in unseren Online-Schulungen empfehlen wir Ihnen die Teilnahme mit einem zweiten Bildschirm. So können Sie die Schulungsinhalte verfolgen, Anwendungen öffnen und parallel an praktischen Übungen teilnehmen.
Weitere Seminare aus dem Bereich Data Science, Machine Learning & KI
Weiterführende Informationen: Eine Auswahl vertiefender Inhalte und praxisorientierter Beiträge zum Thema Datenkompetenz findet sich im Datenkompetenz‑Blog.
Häufig gestellte Fragen (FAQ)
Für wen ist dieses Seminar geeignet?
Der Kurs richtet sich primär an Data Scientists und Data Analysts, die große Datenmengen mit Python und Apache Spark (PySpark) verarbeiten und analysieren möchten.Welche Voraussetzungen sollten die Teilnehmenden mitbringen?
Teilnehmende sollten über grundlegende Kenntnisse in Programmierung und SQL verfügen. Englischkenntnisse sind hilfreich, da einige Materialien nur auf Englisch verfügbar sind.Welche Vorteile bringt die Teilnahme an diesem Seminar?
Die Teilnahme am Seminar ermöglicht es den Teilnehmenden, umfangreiche Kenntnisse in der Verarbeitung großer Datenmengen mit Apache Spark und Python zu erwerben. Dies kann die beruflichen Fähigkeiten erweitern und die Karrierechancen in der Data-Science-Branche verbessern. Das Seminar bietet den Teilnehmenden damit einen praxisnahen Einstieg in Big Data Analytics - auch für Einsteiger:innen ohne Spark-Erfahrung.Welche Lernmethoden kommen zum Einsatz?
Das Seminar legt großen Wert auf praktische Anwendungen. Die behandelten Konzepte werden durch Folien und praktische Beispiele veranschaulicht, und die Teilnehmenden haben die Möglichkeit, das Gelernte mithilfe von Python in der Cloud mit Jupyter Notebooks umzusetzen.Was ist der Unterschied zwischen PySpark und Apache Spark?
Apache Spark ist ein Framework zur verteilten Datenverarbeitung. PySpark ist das offizielle Python-Interface für Spark und ermöglicht es, Spark-Cluster mit Python-Syntax zu programmieren. So lassen sich große Datenmengen effizient analysieren, ohne Scala oder Java zu beherrschen.Welche Vorteile bietet PySpark Data Scientists sowie Analystinnen und Analysten?
PySpark kombiniert die einfache Syntax von Python mit der hohen Performance von Spark. Damit können Sie Daten aus verschiedenen Quellen verarbeiten, Machine-Learning-Modelle trainieren und Analysen im Big-Data-Maßstab durchführen - alles in einer einheitlichen Entwicklungsumgebung.Benötigt man Vorkenntnisse in Spark oder Hadoop, um an dem Seminar teilzunehmen?
Nein, das Seminar ist praxisnah für Einsteiger:innen konzipiert. Grundkenntnisse in Python und SQL sind ausreichend, um die Übungen und Beispiele erfolgreich umzusetzen. Spark- und Hadoop-Konzepte werden Schritt für Schritt eingeführt.Wie praxisorientiert ist die Schulung?
Sehr praxisorientiert, da alle Teilnehmenden in einer Cloud-Umgebung mit eigenem Spark-Cluster arbeiten. Übungen und Projekte werden über Jupyter Notebooks umgesetzt - ideal, um reale Workflows aus Data-Science- und Big-Data-Projekten nachzuvollziehen.Wird im Seminar auch Machine Learning mit PySpark behandelt?
Ja, Sie lernen, wie Sie Machine-Learning-Modelle mit PySpark MLlib erstellen, trainieren und evaluieren. Dabei werden typische Verfahren wie Regression, Klassifikation und Modellbewertung anhand realer Datensätze geübt.Welche Vorteile bietet PySpark gegenüber Pandas oder reinen Python-Workflows?
Während Pandas für kleinere Datenmengen optimiert ist, kann PySpark gigantische Datenbestände verteilt auf Cluster verarbeiten. Es skaliert horizontal und eignet sich ideal für Big-Data- und Cloud-Analysen, ohne dass der Code manuell parallelisiert werden muss.Wie können die Teilnehmenden nach dem Seminar weiter mit PySpark arbeiten?
Sie können Ihr Wissen direkt in Big-Data-Projekten anwenden oder aufbauende Kurse zu Data Engineering, Spark Streaming oder <Offenes Seminar mit Teilnehmenden aus unterschiedlichen Unternehmen zu einem festen Termin.
Preis ab
Referenz : 54450
- Dauer : 2 Tage (12 Stunden)
- Live Online Training
Inhouse-Seminar für die Mitarbeitenden Ihres Unternehmens zum individuell vereinbarten Termin.
Inhouse-Paket - Erfahren Sie mehr über unser Inhouse Seminarangebot
Referenz : 54450
- Dauer : 2 Tage (12 Stunden)
- Live Online Training
Sind Sie an diesem Thema interessiert?
Unsere Experten entwickeln Ihr individuell angepasstes Seminar!
Seminarzeiten
Online-Seminare beginnen in der Regel um 9:00 Uhr und enden gegen 17:00 Uhr. Präsenzseminare starten am ersten Seminartag um 10:00 Uhr. Detaillierte Informationen zu den Seminarzeiten erhalten Sie mit der Anmeldebestätigung.
Methodik
Dieses Big Data Seminar legt einen großen Fokus auf praktische Anwendungen. Die Konzepte werden während der Schulung anhand von Folien erklärt und durch Beispiele veranschaulicht. In den Übungseinheiten haben die Teilnehmer:innen die Möglichkeit, das Gelernte mithilfe der Programmiersprache Python in der Cloud mit Jupyter Notebooks umzusetzen. Die Trainer:innen stehen den Teilnehmenden bei verschiedenen Aufgaben zur Seite und begleiten sie bei Fragen.
Choisissez votre prochaine session
*Alle als „Garantiertetermin“ gekennzeichneten Seminartermine sind fest bestätigt und werden durchgeführt, sofern keine höhere Gewalt vorliegt.
Ein Fehler ist aufgetreten.
