Build a Simple ETL Job: Loading Transaction Data into a Data Lake
التصنيف الرئيسي: تقنية المعلومات والتحول الرقمي | التخصص: مركز البيانات
الوصف العام: يقدم هذا البرنامج التدريبي المتقدم تجربة عملية متكاملة لبناء مهمة ETL حقيقية لتحميل بيانات المعاملات إلى بيئة Data Lake باستخدام أدوات هندسة البيانات الحديثة حيث يركز البرنامج على...

معلومات البرنامج:
- مركز البيانات
- تقنية المعلومات والتحول الرقمي
أهداف الدورة
- فهم مفهوم ETL Pipeline ودورة حياة البيانات داخل Data Lake
- تصميم وبناء عملية ETL بسيطة باستخدام Python وSQL
- تنظيف وتحويل بيانات المعاملات (Transaction Data) بكفاءة
- تخزين البيانات بصيغة مناسبة داخل Data Lake مثل Parquet
- تطبيق أفضل ممارسات جودة البيانات والتحقق من صحتها
- أتمتة تشغيل ETL باستخدام أدوات Workflow Management
الخطة التدريبية التفصيلية
مقدمة في ETL وData Lake
- مفهوم ETL ودورة البيانات
- الفرق بين Data Lake وData Warehouse
- أنواع البيانات (Structured / Semi-Structured)
- حالات استخدام Data Lake في المؤسسات
- تحديات إدارة البيانات
استخراج البيانات (Extract Phase)
- قراءة البيانات من ملفات CSV / APIs
- التعامل مع مصادر بيانات متعددة
- فحص جودة البيانات الأولية
- معالجة البيانات المفقودة
- Logging أثناء عملية الاستخراج
تحويل البيانات (Transform Phase)
- تنظيف البيانات (Data Cleaning)
- تحويل أنواع البيانات
- إزالة القيم غير الصالحة
- إنشاء Features جديدة
- تطبيق قواعد العمل (Business Rules)
تحميل البيانات (Load Phase)
- مفهوم Data Lake Storage
- تخزين البيانات بصيغة Parquet
- Partitioning للبيانات حسب التاريخ
- تحسين الأداء في التخزين
- إدارة الإصدارات (Data Versioning)
بناء ETL Pipeline متكامل
- تصميم Pipeline end-to-end
- تنظيم الكود بطريقة احترافية
- معالجة الأخطاء (Error Handling)
- إعادة التشغيل (Retry Logic)
- تحسين قابلية الصيانة (Maintainability)