stdsquare²
🎓 Kelas
stdsquare / materi / slides / pertemuan-01
Tema
Japan
Arcade
Dark Retro
Font
‹ Daftar slide Pertemuan 1: Pengantar Data Science & Ekosistem Data
Data Science Pertemuan 1 CPMK-1

Pengantar Data Science & Ekosistem Data

Definisi · Posisi dalam Bisnis · CRISP-DM · Peran & Karir

Program Studi Bisnis Digital · 150 menit

Agenda Pertemuan 1

Bagian A · 60 menit
  • Apa itu Data Science?
  • Posisi DS dalam ekosistem bisnis
  • DS vs BI vs ML vs AI
Bagian B · 60 menit
  • Proses CRISP-DM: 6 fase
  • Studi kasus e-commerce Indonesia
  • Tools & ekosistem kerja
Bagian C · 20 menit
  • Karir data di Indonesia
  • Rangkuman & tugas
Break
  • 10 menit di tengah sesi
  • Q&A sepanjang pertemuan

Tujuan Pembelajaran

01

Mendefinisikan data science dan menjelaskan posisinya dalam pengambilan keputusan bisnis digital

02

Menjelaskan 6 fase proses CRISP-DM dan menerapkannya pada kasus bisnis nyata di Indonesia

03

Membedakan peran data scientist, data engineer, dan data analyst serta jalur karir masing-masing

Sub-CPMK 1 · Mendukung CPMK-1 & CPMK-4

Data Science
Disiplin Ilmu Baru

Perpaduan statistika, ilmu komputer, dan domain bisnis

Apa Itu Data Science?

Definisi kerja: Data Science adalah disiplin interdisipliner yang menggunakan metode ilmiah, proses, algoritma, dan sistem untuk mengekstrak pengetahuan dan wawasan dari data terstruktur maupun tidak terstruktur, guna mendukung pengambilan keputusan bisnis.

Tiga pilar utama

  • Statistika & Matematika — fondasi analitik, inferensi, probabilitas
  • Ilmu Komputer — pemrograman, algoritma, infrastruktur data
  • Domain Bisnis — konteks masalah, interpretasi, keputusan

Output utama DS

  • Insight dari pola data historis
  • Model prediktif untuk masa depan
  • Rekomendasi berbasis bukti (evidence-based)
  • Otomasi keputusan rutin

Posisi Data Science dalam Bisnis

Dari operasional harian hingga keputusan strategis

Level KeputusanPertanyaan BisnisPeran DSContoh Indonesia
OperasionalApa yang terjadi sekarang?Dashboard & monitoring real-timePantau stok gudang Tokopedia tiap menit
TaktisMengapa hal ini terjadi?Analisis akar masalah (root cause)Analisis penyebab lonjakan return barang Shopee
StrategisApa yang akan terjadi?Model prediktif & skenarioProyeksi permintaan Harbolnas 12.12 Lazada
InovatifApa yang harus kita lakukan?Rekomendasi & optimasiSistem rekomendasi produk GoTo/Tokopedia

DS vs BI vs ML vs AI: Apa Bedanya?

BidangFokus UtamaDataOutputContoh Tools
Business Intelligence (BI)Pelaporan historis, deskriptifTerstruktur, SQLDashboard, laporanPower BI, Tableau, Looker
Data Science (DS)Analitik prediktif, eksperimenTerstruktur + tidak terstrukturModel, insight, rekomendasiPython, R, Jupyter
Machine Learning (ML)Algoritma belajar dari dataSkala besar, beragam formatModel prediktif otomatisscikit-learn, TensorFlow, PyTorch
Artificial Intelligence (AI)Kecerdasan mesin secara luasSemua jenisKeputusan otonom, generasi kontenGPT, Gemini, LLaMA

ML adalah subset AI; DS mencakup ML namun lebih luas (termasuk engineering data & komunikasi bisnis)

Proses CRISP-DM
Kerangka Kerja Standar

Cross-Industry Standard Process for Data Mining

CRISP-DM: Enam Fase

DATABISNIS1. BusinessUnderstanding2. DataUnderstanding3. DataPreparation4. Modeling5. Evaluation6. Deployment
  • 1. Business Understanding — Definisikan tujuan bisnis & rumusan masalah
  • 2. Data Understanding — Kumpulkan & eksplorasi data awal (EDA)
  • 3. Data Preparation — Bersihkan, transformasi, integrasi fitur
  • 4. Modeling — Pilih & latih algoritma, tuning hyperparameter
  • 5. Evaluation — Uji performa model vs tujuan bisnis
  • 6. Deployment — Implementasikan model ke sistem produksi
Proses ini bersifat iteratif — sering kembali ke fase sebelumnya. Fase 3 (Data Preparation) umumnya menghabiskan ~60-80% waktu proyek.

CRISP-DM: Fase 1–3 Detail

FaseAktivitas UtamaOutputContoh: Churn Pelanggan Telkomsel
1. Business UnderstandingWawancara stakeholder, definisi KPI, rancang kriteria suksesProject charter, definisi masalah terukur"Prediksi pelanggan yang akan berhenti berlangganan dalam 30 hari ke depan dengan akurasi >80%"
2. Data UnderstandingInventarisasi sumber data, EDA, profil kualitas dataData quality report, hipotesis awalData usage internet 12 bulan, riwayat pembayaran, log keluhan CS — identifikasi missing values
3. Data PreparationImputasi missing values, encoding kategorikal, feature engineering, normalisasiDataset siap modeling (clean dataset)Buat fitur "rasio penggunaan bulan ini vs rata-rata 6 bulan", encode region menjadi variabel dummy

CRISP-DM: Fase 4–6 Detail

FaseAktivitas UtamaOutputContoh: Churn Pelanggan Telkomsel
4. ModelingPilih algoritma, split train/test, latih model, hyperparameter tuningModel terpilih + dokumentasi performaUji Random Forest, XGBoost, Logistic Regression — pilih XGBoost (AUC ~0.87 pada data validasi)
5. EvaluationUji vs data holdout, analisis confusion matrix, uji bisnis (ROI intervensi)Go/no-go decision untuk deploymentPrecision 79%, Recall 83% — apakah biaya intervensi lebih rendah dari nilai pelanggan hilang?
6. DeploymentIntegrasikan ke sistem, jadwalkan retrain model, monitoring driftModel live di produksi + SLA monitoringSkor churn dikirim ke CRM tiap malam — CS call pelanggan berisiko tinggi dengan penawaran retensi
Ekosistem Peran
& Karir Data

Siapa mengerjakan apa dalam tim data?

Data Scientist vs Engineer vs Analyst

DimensiData AnalystData ScientistData Engineer
FokusAnalisis & visualisasi data historisModel prediktif & eksperimenInfrastruktur & pipeline data
Pertanyaan"Apa yang sudah terjadi?""Apa yang akan terjadi?""Bagaimana data sampai ke sana?"
Skills utamaSQL, Excel, Power BI/TableauPython/R, statistika, MLSQL, Python, Spark, Kafka, cloud
OutputDashboard, laporan, insightModel, rekomendasi, eksperimen A/BData warehouse, ETL pipeline
Gaji (IDR, ~2025)Rp 7–15 juta/bulanRp 12–35 juta/bulanRp 10–30 juta/bulan

~Estimasi pasar Indonesia berdasarkan laporan Glints, Jobstreet, LinkedIn 2024–2025 — bervariasi per perusahaan & pengalaman

Ekosistem Tools Data Science

Bahasa Pemrograman
  • Python — paling populer (pandas, scikit-learn, PyTorch)
  • R — unggul statistika & akademik
  • SQL — wajib untuk semua peran
Platform & Cloud
  • Google Colab (gratis, cloud)
  • Jupyter Notebook (lokal)
  • AWS/GCP/Azure (enterprise)
Visualisasi
  • Matplotlib & Seaborn (Python)
  • Plotly (interaktif)
  • Tableau / Power BI (BI)
Machine Learning
  • scikit-learn (klasik ML)
  • XGBoost / LightGBM (boosting)
  • TensorFlow / PyTorch (deep learning)
Data Engineering
  • Apache Spark (big data)
  • Apache Kafka (streaming)
  • dbt (transformasi SQL modern)
MLOps & Deployment
  • MLflow (tracking eksperimen)
  • Docker & Kubernetes
  • FastAPI (serving model)

Karir Data di Perusahaan Indonesia

PerusahaanIndustriContoh Penggunaan Data SciencePeran Dominan
Tokopedia / GoToE-commerce & Super-appRekomendasi produk, deteksi fraud, dynamic pricingDS + DE + DA
GojekSuper-app & logistikOptimasi rute driver, prediksi surge pricing, churn userDS + DE
BCA Digital / BluPerbankan digitalCredit scoring, AML detection, personalisasi produkDS + DA
Grab IndonesiaRidesharing & fintechDeteksi kecurangan pengemudi, forecasting demandDS + DE
BukalapakE-commerce + O2OAnalisis perilaku warung mitra, prediksi stokDA + DS

Alur Data dalam Ekosistem Bisnis

Sumber DataTransaksi, IoT,Social Media, APIDataEngineeringETL PipelineData Lake/WarehouseData QualityData ScienceEDA & StatistikaFeature EngineeringML ModelingEvaluasi ModelInterpretasi BisnisBusinessIntelligenceDashboardLaporan EksekutifAlertingKEPUTUSANData EngineerData ScientistData AnalystFeedback loop: keputusan menghasilkan data baru

Rangkuman Pertemuan 1

5 Poin Kunci yang Harus Anda Bawa Pulang
  1. Data Science = Statistika + Ilmu Komputer + Domain Bisnis — ketiganya tidak bisa dipisahkan untuk menghasilkan nilai nyata.
  2. DS ≠ BI ≠ ML ≠ AI — masing-masing punya fokus, data, dan output berbeda; DS mencakup ML dan lebih luas dari BI.
  3. CRISP-DM adalah standar proses — 6 fase iteratif; fase Data Preparation menghabiskan ~60–80% waktu proyek nyata.
  4. Tiga peran utama saling melengkapi — Data Analyst (deskriptif), Data Scientist (prediktif), Data Engineer (infrastruktur).
  5. Ekosistem data Indonesia sudah matang — Tokopedia, Gojek, BCA Digital, Grab menggunakan DS secara intensif; peluang karir lokal sangat besar.

Tugas & Diskusi

Tugas Mandiri (dikumpulkan P2)
  1. Pilih satu perusahaan Indonesia (bukan daftar di slide ini) yang Anda tahu menggunakan data untuk keputusan bisnis.
  2. Identifikasi: jenis data apa yang mereka kumpulkan, dan bagaimana mungkin mereka menggunakannya (perkiraan Anda).
  3. Tulis 1 halaman A4 (format bebas, submit PDF ke LMS).
Diskusi Kelas (15 menit)
  • Menurut Anda, di antara Data Analyst, Data Scientist, dan Data Engineer — peran mana yang paling Anda minati dan mengapa?
  • Apa tantangan terbesar Data Science di perusahaan Indonesia menurut Anda?
  • Sebutkan satu pertanyaan bisnis di sekitar Anda yang bisa dijawab dengan data.

Pertanyaan & Preview Pertemuan 2

Pertanyaan?

Silakan ajukan pertanyaan tentang materi hari ini. Tidak ada pertanyaan yang terlalu dasar — membangun fondasi yang kokoh jauh lebih penting dari kesan "sudah tahu".

Preview P2: Jenis Data & Sumber Data Bisnis
  • Taksonomi jenis data (terstruktur, semi-terstruktur, tidak terstruktur)
  • Sumber data bisnis di Indonesia (BPS, OJK, IDX, API publik)
  • Kualitas data: dimensi & cara mengukur
  • Praktik pertama: eksplorasi dataset publik dengan Python

Pertemuan 2 akan lebih banyak praktik — pastikan Python & Google Colab sudah siap di laptop Anda.