This course contains the use of artificial intelligenceDatabricks Data Engineer Associate – Lakehouse EngineeringDatabricks ist eine leistungsstarke Plattform für Daten und AI, denn AI ohne Daten existiert nicht. Die Daten, die auf der Plattform landen, sind jedoch oft entweder unvollständig, ungefiltert oder dupliziert – also... ziemlich chaotisch. Ein Data Engineer ist ein Spezialist, der solche Daten bereinigen, verarbeiten und wertvolle Ergebnisse für weitere Analysen, Machine-Learning-Algorithmen oder AI liefern kann.Ein Data Engineer braucht für seine Aufgaben geeignete Tools – eines davon kann Databricks sein.Dieser Kurs bereitet auf die Prüfung Databricks Certified Data Engineer Associate vor, stellt aber gleichzeitig die Funktionen von Databricks vor, mit denen sich automatisierte Datenverarbeitungsprozesse aufbauen lassen. Konkret zeige ich hier:- Medallion Architecture und Lakehouse Architecture - databricks CLI – für die Arbeit mit Databricks über die Kommandozeile - Grundlagen der Arbeit mit pySpark (das Thema wird ausführlicher im dedizierten Spark-Kurs behandelt) - data ingestion – also das Einlesen von Daten aus Streams und dem Autoloader - Parametrisierung von Notebooks - Jobs, die die Datenverarbeitung automatisieren - declarative pipelines (früher bekannt als Delta Live Tables), mit denen sich der Datenverarbeitungsprozess programmatisch beschreiben lässt - Databricks Asset Bundles – zuständig für das Deployment von Jobs und declarative pipelines - Unity Catalog und Datensicherheit - Delta Sharing – für die Datenfreigabe - Data Lineage – um Herkunft und Abhängigkeiten der verarbeiteten Daten zu
What you'll learn
understanding of Medallion and Lakehouse Architecture
basic skills in working with pySpark
ability to automate data processing using Databricks
knowledge of data ingestion techniques
familiarity with data security and sharing protocols
Course objectives
prepare for the Databricks Certified Data Engineer Associate exam