
Apa itu Data Science?
Tentunya kamu sering mendengar istilah Data Science. Beberapa tahun terakhir, Data Science memang sering dibicarakan oleh banyak orang, tetapi, belum tentu mereka mengenal secara dalam.
Yuk, kita pelajari lebih dalam!
Data science merupakan ilmu mengolah data yang menggabungkan tiga skills, yaitu skill programing, skill statistik, dan skill bisnis.
Demand untuk Data Scientist ini luar biasa besar, terlebih dengan lahirnya internet mobile. Pada tahun 2005 dunia diperkirakan telah memproduksi 130 ExaByte data atau setara dengan 130 juta hard disk eksternal sebesar satu TeraByte. Lima belas tahun kemudian atau di tahun 2020 diperkirakan bahwa data yang terproduksi adalah sebesar 41,000 ExaByte atau setara dengan 41M hard disk eksternal satu TeraByte.
Seorang Data Scientist akan memiliki sense mengolah data dengan baik, sehingga ketika kamu diberikan persoalan bisnis oleh atasan, kamu bisa mengatasi persoalan tersebut secara lebih terstruktur.
Berbagai persoalan bisnis bisa diselesaikan dengan menggunakan ilmu Data Science. Berikut lima contoh persoalan bisnis yang bisa diselesaikan oleh seorang Data Scientist.
Industri Perbankan
Contoh:
Credit scoring
Verifikasi identitas
Identifikasi fraud
Industri Retail/Grocery
Contoh:
Rekomendasi produk
Segmentasi pelanggan
Campaign analysis
Industri Asuransi
Contoh:
Scoring untuk nasabah baru
Identifikasi fraud
Industri Telekomunikasi
Contoh:
Churn prediction
Fraud detection
Data monetization
Sektor Pemerintahan
Contoh:
Pembuatan laporan statistik
Pengambilan keputusan strategis dari pemerintah dalam sektor transportasi public, smart city, maupun pariwisata
Apa yang akan kamu dapatkan dari kelas ini?
Di kelas ini kamu akan belajar dasar-dasar mengenai Data Science yang terdiri dari Visualisasi, Coding, Statistik, Bisnis, dan Legal.
Kelas ini cocok untuk seorang pemula yang belum pernah terjun langsung ke dunia Data Science. Selain itu, kelas ini juga cocok untuk seorang Senior Manager yang ingin mengetahui lebih dalam tentang apa saja yang dikerjakan oleh timnya.
Apa saja yang dibutuhkan untuk mengikuti kelas ini?
- Kemampuan matematika atau logika dasar
- PC/Laptop
- Koneksi internet
Bernardus Ari Kuncoro, ST, MTI
Ari memiliki pengalaman profesional sebagai Data Scientist selama lebih dari empat tahun, di mana dia pernah mengolah data dari industri Telekomunikasi, retail, e-commerce, pariwisata, transportasi, dan FMCG. Dia mengawali karirnya setelah lulus dari Institut Teknologi Bandung dari jurusan Teknik Elektro (sub jurusan Telekomunikasi) pada tahun 2009 sebagai Intelligent Networks Engineer untuk beberapa operator telekomunikasi, dan sempat tiga tahun bekerja di Filipina dengan peran yang sama. Sekembalinya di Indonesia, dia melanjutkan pendidikannya di Binus University jurusan Magister Teknik Informatika, tempat di mana dia mengenal topik-topik yang diajarkan dalam Data Science dan melakukan penelitian, lalu bekerja di beberapa perusahaan ternama, salah satunya adalah Telkomsel dan tergabung dalam tim Telkomsel MSIGHT. Dia juga sering membagikan ilmu dalam beberapa event seminar berskala nasional dan internasional, mengigat dia terpanggil untuk meningkatkan data literacy utamanya untuk generasi muda Indonesia.
Tiga pilar utama yang harus dikuasai oleh seorang Data Scientist adalah coding, statistik, dan bisnis.
Kemampuan coding merupakan yang terpenting dan harus dimiliki oleh seorang Data Scientist. Bahasa yang wajib dikuasai adalah SQL, Python, dan R. Dalam kelas ini, kita akan fokus menggunakan bahasa pemrograman Python.
Untuk kemampuan statistik, yang dibutuhkan adalah kemampuan applied statistics/ statistika terapan. Sehingga, tidak perlu menguasai statistika murni dahulu untuk menjadi seorang Data Scientist.
Kemampuan bisnis dalam dunia Data Science dibagi menjadi tiga:
Project management
Kemampuan untuk memanage project-project, memahami role yang akan dikerjakan dalam suatu project.
People skill
Kemampuan berinteraksi dengan orang-orang baik di luar dan dalam tim.
Presentation skill
Meliputi pembuatan konten, mendesign konten jadi tampilan yang baik dan menarik, terakhir delivery konten. Setelah menganalisa data, kita juga harus mampu menyampaikan hasil temuan kita dengan efektif dan mudah dipahami. Di sinilah skill presentasi dibutuhkan.
Selain tiga pilar yang telah disebutkan pada video sebelum ini, ada dua skill tambahan yang diperlukan jika kamu ingin menjadi seorang Data Scientist: skill visualisasi dan skill legal.
Skill visualisasi adalah skill mengubah data menjadi suatu visual yang lebih mudah dimengerti. Visualisasi berguna untuk menceritakan kembali apa yang sudah kita pahami dari data yang kita miliki.
Kemampuan melek hukum juga harus dimiliki, karena sebagai seorang Data Scientist, kita akan banyak bekerja dengan banyak data pribadi. Di Indonesia, peraturan tentang perlindungan data belum sepenuhnya disahkan secara hukum, tetapi ada peraturan dari Menteri Kominfo yang mengatur tentang perlindungan data.
Yang terakhir, Data Scientist harus memiliki cara pandang yang berbeda dari orang orang di sekitarnya. Ia harus kreatif dan memiliki rasa penasaran yang tinggi atau mau terus belajar sehingga bisa menyelesaikan masalah secara mandiri atau yang biasa disebut tipikal creative problem solver.
Ada dua pilihan tempat jika kamu ingin belajar Data Science: universitas atau belajar mandiri secara online. Berikut ini adalah beberapa kelebihan dan kekurangannya:
Belajar di Universitas
+ Memiliki jejaring atau koneksi yang lebih luas
+ Teori dan pehamanan tentang algoritma yang kuat
- Waktu yang dibutuhkan lebih lama (1-2 tahun)
- Practicality tentang coding kurang, karena biasanya dosen menitikberatkan di pemahaman teori
Belajar Mandiri Secara Online
+ Waktu lebih fleksibel dan cepat, bisa disesuaikan dengan kesibukan kita
+ Practicality lebih kuat, lebih banyak melakukan praktik coding
- Kurang memiliki jejaring yang luas
- Lebih lemah dalam pemahaman teori
Sumber belajar Data Science
1. Buku
2. Podcast
3. YouTube
4. LinkedIn
Waktu rata-rata yang dibutuhkan untuk menjadi seorang Data Scientist junior adalah kurang lebih enam bulan. Jika kamu ingin bersungguh-sungguh menjadi Data Scientist, berikut adalah rencana pembelajaran yang bisa kamu ikuti:
Bulan pertama ➜ Menyelesaikan kelas online Data Science Foundation
Tiga bulan selanjutnya ➜ Melakukan praktik coding secara pribadi, bisa membuat dan mengaktifkan akun GitHub, atau menulis artikel tentang hasil analisa datamu di blog pribadi
Akhir bulan ketiga ➜ Mencari dan melamar internship di bidang data science
Tiga bulan terakhir ➜ Mencoba internship dan mencari mentor yang bisa membimbing kamu atau bisa mengikuti kontes di https://kaggle.com
Tips & Trick mendapatkan pekerjaan sebagai Data Scientist
#1 Gabung ke komunitas
Dengan mengikuti komunitas, kamu bisa mendapatkan jejaring yang lebih luas, bertemu dengan teman-teman yang seminat, bertanya langsung dengan pakar-pakar yang sudah ahli di bidang Data Science, juga membukakan lapangan pekerjaan untuk kamu. Berikut adalah beberapa komunitas Data Science yang bisa kamu ikuti
Data Science Indonesia: https://datascience.or.id
Pythonindo: https://python.or.id
#2 Menyusun portofolio
Setelah kamu selesai latihan atau membuat project terhadap sebuah data, kamu bisa mengupload hasil kodingan dan temuan-temuanmu ke GitHub. GitHub adalah sosial media untuk para programmer, dimana programmer bisa mengupload hasil codingan dan hasilnya layaknya sebuah portofolio.
GitHub: https://github.com
#3 Menulis di blog
Kamu bisa mengupload hasil tulisan tulisanmu seputar Data Science, baik itu tentang analisa data, atau sekedar sharing ilmu-ilmu yang telah kamu dapatkan. Dengan membagikannya ke blog, kamu membuka akses untuk semua orang membaca tulisanmu.
#4 Internship
Inilah tips yang paling penting karena dengan melakukan internship, kamu dapat mengaplikasikan skill yang telah kamu miliki secara langsung. Kamu juga akan banyak mendapatkan kesempatan untuk bekerja secara praktik. Terlebih, kamu akan memiliki atasan yang bisa menjadi tempat konsultasi.
#5 Latihan wawancara
Lakukan latihan wawancara dengan teman atau saudara yang memiliki latar belakang HR (Human Resources) dengan begitu, kamu akan menjadi lebih siap dalam menghadapi pertanyaan-pertanyaan wawancara nantinya.
Istilah Big Data pertama kali dipopulerkan oleh Roger Magoulas, seorang direktur market research dari O’Reily pada tahun 2005. Akan tetapi, sebenarnya penerapan big data ini sudah ada sejak lama dengan tujuan untuk analisis dan pengendalian aktivitas bisnis.
Ketika Maogulas pertama kali memperkenalkan istilah big data, secara bersamaan penggunaan jejaring sosial media sangat pesat, seiring juga dengan meningkatnya kecepatan internet. Disamping itu, sektor pemerintahan dan bisnis juga memulai project big data ini. Seperti di India, dimana mereka membuat database biometrics terbesar di dunia pada tahun 2009. Eric Smith, seorang ex-chairman dari google tahun 2001-2015 memaparkan di konferensi techconomy pada tahun 2010 bahwa pada tahun 2016 nantinya, setiap dua hari akan tercipta data sebesar 5 ExaByte. Selain Eric Smith, ada juga seorang praktisi dan pengajar data science yaitu Kirill Eremenko dari Australia. Dia memperkirakan meledaknya big data secara lebih detail, sejak dunia tercipta hingga tahun 2005 dia memperkirakan ada 130 ExaByte data tercipta. Sepuluh tahun kemudian atau di tahun 2015, meningkat pesat big data itu sebesar 60 kali lipat, sehingga menjadi 7900 ExaByte data, dan di tahun 2020 atau 5 tahun kemudian setelah tahun 2015, tercipta sebesar 41,900 ExaByte data atau setara dengan 42 milyar hard disk eksternal 1 TeraByte.
Ciri-ciri dari big data adalah 4V
Volume
Volume atau ukuran, dahulu untuk menyimpan data kita menggunakan disket yang berkapasitas 1,4MB. Sekarang, sudah tercipta memory card dengan ukuran lebih namun memiliki kapasitas yang lebih besar yaitu 64GB.
Variety
Variety artinya data yang dihasilkan memiliki bentuk yang beragam. Dulu, sebelum ada computer data disimpan dalam bentuk kertas. Sekarang, data sudah disimpan dalam bentuk digital bisa dalam bentuk angka, teks, gambar, sampai video. Data digital bisa dibedakan menjadi dua, structured dan unstructured data. Structured data berarti data yang kita miliki sudah dalam bentuk kolom atau tabel. Sedangkan untuk unstructured data berupa text, gambar, atau video.
Velocity
Velocity atau kecepatan di sini artinya adalah kecepatan dalam terproduksinya data. Semakin pesat perkembangan internet maka semakin cepat pula terciptanya data.
Veracity
Seiring dengan bertambahnya data yang semakin besar, tingkat kekacauan akan data pun meningkat, dalam arti data yang ada sangat berantakan, hal ini membuat tingkat kepercayaan terhadap data menurun. Oleh karena itu, data yang sudah terproduksi perlu di verifikasi lagi sebelum digunakan. Kita juga harus memperhatikan darimana sumber data tersebut dihasilkan untuk memastikan bahwa data yang kita miliki valid.
Ada satu lagi ciri dari big data yaitu Value, artinya data yang kita miliki menjadi sangat berharga, baik itu untuk keperluan pengambilan keputusan ataupun analisis. Karena semakin besar data, semakin banyak hal yang bisa kita lakukan.
CRISP-DM atau Cross Industry Process for Data Mining merupakan sebuah metodologi pendekatan terstruktur untuk project Data Mining yang robust dan efektif dalam menyelesaikan persoalan bisnis.
CRISP-DM sangat umum digunakan karena praktis, fleksibel, dan aplikatif. Metode ini merupakan metode andalan yang bisa digunakan di berbagai industri.
6 Fase metode CRISP-DM
--- Busniness Understanding ---
Dalam business understanding, ada empat hal yang harus kita miliki:
1. Tujuan Bisnis
Latar belakang, tujuan, dan kriteria sukses bisnis
2. Penilaian situasi saat ini
Resource, risiko, analisis cost dan benefit
3. Tujuan data mining
Goal dan kriteria sukses data mining
4. Rencana project
Berupa timeline perencanaan kerja
--- Data Understanding ---
Data understanding merupakan pemahaman data yang meliputi:
1. Pengumpulan data
2. EDA (Exploratory Data Analysis)
3. Verifikasi kualitas data
--- Data Preparation ---
Proses ini memakan waktu yang lama, sekitar 80% waktu untuk menyelesaikan project dihabiskan pada tahap data preparation ini. Data preparation meliputi:
1. Menyeleksi data
2. Membersihkan data
3. Mentransformasikan data (untuk membentuk Analytics Based Table)
4. Meng-integrasikan data
5. Memformat data
6. Menyusun dataset
--- Modelling ---
1. Menyeleksi teknik modelling
2. Membuat design untuk testing model
3. Membuat model
4. Menilai model
--- Evaluation ---
1. Mengevaluasi hasil
2. Mengecek kembali (review)
3. Membuat daftar kemungkinan langkah-langkah selanjutnya
--- Deployment ---
1. Menseleksi Teknik modelling
2. Merencanakan proses monitoring dan maintenance
3. Menghasilkan laporan akhir
4. Me-review project
Ada dua jenis data scientist, freelance dan full time. Seorang data scientist freelance bekerja sesuai dengan project yang dia terima. Sedangkan data scientist full time memiliki keseharian yang lebih teratur, gambarannya adalah sebagai berikut:
Jam 8:00 sampai 9:00 sampai ke kantor, dilanjut dengan meeting dengan team data engineering atau team IT. Setelah meeting, mengerjakan codingan tentang query language atau SQL. Jam 12:00 waktunya makan siang. Setelah makan siang, sekitar jam 13:00 waktunya meeting dengan team legal, untuk memastikan bahwa data yang dianalissi memenuhi peraturan yang berlaku. Setelah meeting, kembali melakukan analisis atau riset. Kemudian jam 5 selesai bekerja lalu pulang.
5 kemampuan yang harus dimiliki seorang data scientist:
Visualisasi
Kodingan
Statistik
Bisnis
Legal
Jembatan keledai: Vivi-Koko-Stephen-Bis-Lele
Jika kamu seorang pemula yang baru pertama kali belajar data scientist dan belum memiliki dasar sama sekali, maka track ini sangat direkomendasikan untukmu. Namun, jika kamu adalah sudah memiliki background computer science, kamu bisa memulai dari tahap Koding dulu karena kamu sudah memiliki dasar yang kuat untuk koding. Lalu, jika kamu adalah lulusan statistika atau matematika, kamu bisa memulai dari tahap Statistik terlebih dahulu. Sedangkan, jika kamu adalah seorang lulusan bisnis, kamu bisa memahami tahapan Bisnis dulu. Terakhir, jika kamu adalah seorang lulusan hukum, kamu bisa memulai dari tahap Legal.
Oiya, silakan download seluruh dataset yang akan kita gunakan untuk keperluan pembelajaran selanjutnya.
Pada topik kali ini, kita akan belajar tentang visualisasi data. Perkembangan ilmu visualisasi data ternyata sudah dilakukan semenjak puluhan ribu tahun yang lalu. Perkembangan yang pertama terjadi ketika Dinasti Han memerintah negeri Cina pada Abad ke-2 Sebelum Masehi sampai Abad ke-2 Masehi, dimana Cina menempati masa kejayaannya.
Pada saat itu bermunculan para pemikir, matematikawan, dan penemu yang menemukan berbagai hal baru untuk memudahkan kerja manusia. Salah satu contohnya adalah kertas. Dari kertas, terproduksilah buku, selebaran, dan konten yang ada di dalamnya dinamakan data. Kemudian data dibuat secara visual. Selain itu muncul pula seismograf yang ditemukan oleh matematikawan dari Cina pada tahun 132 Sebelum Masehi. Seismograf adalah alat untuk mendeteksi gempa bumi, alat ini juga bisa mengetahui darimana arah gempa bumi berasal. Perkembangan agama Buddha juga mempengaruhi perkembangan visualisasi data, seperti pembuatan relief pada candi atau tempat peribadatan mereka.
Di data science kita akan sering melihat tabel, ternyata tabel sudah dipakai dan diproduksi sejak lama. Tabel sudah dipakai sejak Abad ke-2 ketika zaman Mesir. Pada zaman itu, tabel digunakan untuk katalog astrologi.
Tabel sendiri adalah sebuah representasi data, terdiri dari dua komponen yaitu baris dan kolom. Banyak orang mengira tabel bukan bentuk visualisasi. Padahal, tabel adalah salah satu bentuk visualisasi karena bisa memvisualisasikan data yang kita punya dari yang sebelumya berbentuk teks. Namun, saat ini tabel tak lagi dianggap sebagai visualisasi dan lebih dikenal sebagai data, karena bentuk data sudah menyerupai tabel itu sendiri.
Begitulah perkembangan mengenai visualisasi data, selanjutnya kita akan belajar tentang apa itu visualisasi data.
Seperti apa konsep visualisasi data pada zaman sekarang? Berikut tiga konsep visualisasi data:
Komputer grafis
Interaktif
Memperkuat pengetahuan atau hipotesis
Visualisasi data menggunakan komputer grafis merupakan hasil dari pengaruh perkembangan teknologi. Saat ini, tools-tools untuk memvisualkan data menjadi semakin canggih. Hal ini berarti kita bisa membuat visualisasi data menjadi suatu hal yang lebih baik daripada sebelumnya. Dahulu, untuk membuat grafik kita masih menggunakan Microsoft Excel, tapi saat ini kita bisa menggunakan berbagai tools visualisasi sepertiTableau, PowerBI, QlikView, RShiny, Python, dan tools-tools tersebut memiliki banyak pilihan yang bisa dimanfaatkan untuk membuat visualisasi yang dibuat lebih mudah dipahami.
Sedangkan untuk interaktif, tools-tools yang ada juga semakin banyak. Kita bisa melakukan suatu visualisasi data dimana hasilnya nanti dapat memfasilitasi pengguna untuk mengubah-ubah atau menggali informasi dari pengubahan filter, zoom in/zoom out suatu grafi. Hal ini membuat pengguna bisa secaraself-servicemengetahuiinsight-insight yang ada dalam suatu grafik. Biasanya representasi interaktif ini dinamakan dashboard.
Memperkuat pengetahuan atau hipotesis berarti ketika kita memiliki suatu hipotesis, kita harus bisa membuktikannya dengan data dan secara saintifik, sehingga kita bisa meyakinkan orang dengan kuantifikasi yang lebih jelas.
Visualisasi data merupakan proses yang merepresentasikan data ke bentuk visual. Misalkan kita punya data dalam bentuk text, seperti bon saat setelah berbelanja. Kemudian, kita masukkan deskripsi barang beserta harganya ke dalam sebuah tabel, selanjutnya, kita akumulasikan dalam satu hari berapa total uang yang dihabiskan untuk berbelanja, misalkan Rp100.000. Penulisan angka Rp100,00 sendiri sudah termasuk visualisasi data atau proses membuat data menjadi suatu bentuk yang visual. Ilmu visualisasi data dilihat oleh berbagai bidang ilmu sebagai komunikasi visual yang modern. Visualisasi data tidak berada di bawah bidang manapun melainkan interpretasi di antara banyak bidang.
Ada tiga alasan mengapa visualisasi data diperlukan:
1. Membuat hal yang kompleks menjadi sederhana
Misalkan kita punya data besar berisi kolom dan baris yang banyak, dengan adanya visualisasi data kita dapat mengubah hal-hal yang kompleks menjadi lebih mudah dipahami. Kita dapat menyederhanakan satu kolom yang berisi ribuan entri data dengan mengetahui distribusi datanya dan pengelompokan berdasarkan waktu atau wilayah.
2. Memudahkan kita melihat pola
Dari visualisasi data yang kita buat, kita bisa meihat pola dengan cara melihat perbandingan antara dua variabel, melihat komposisi dari variabel dengan menggunakan pie chart, melihat distribusi dengan menggunakan histogram atau line chart, dan dengan melihat tren dari data yang kita miliki.
3. Komunikasi kepada orang lain jadi lebih efektif
Visualisasi data akan memudahkan orang untuk memahami dan yakin dengan informasi yang kita sampaikan, karena informasi sudah disajikan dalam bentuk visualisasi yang mudah dipahami sehingga penyampaiannya menjadi lebih efektif.
Tujuan visualisasi data ada tiga:
1. Explanatory
Berakar dari kata explain, tujuan dari visualisasi data berarti menjelaskan kepada orang lain. Dalam melakukan explanatory, hal yang harus diperhatikan adalah kita membutuhkan satu ide/gagasan untuk setiap slide yang ditampilkan, agar informasi yang disampaikan dapat lebih mudah dipahami. Termasuk dalam penggunaan grafik, kita juga harus memperhatikan latar belakang audience dan apakah grafik yang kita gunakan cukup familiar, menarik, dan mudah dibaca oleh mereka.
2. Exploratory
Subjek untuk exploratory biasanya adalah Data Analyst, Data Scientist, atau orang orang yang memang ingin mengetahui insight dan informasi dari data. Dalam melakukan exploratory perlu diperhatikan seberapa besar waktu dan tenaga yang dimiliki, jika waktu dan tenaga yang dimiliki cukup banyak, maka kita dapat gunakan waktu tersebut untuk mengeksplor data secara mendalam. Biasanya, exploratory dilakukan oleh orang yang belum pernah berkenalan atau familiar dengan data tersebut.
3. Confirmatory
Confirmatory dilakukan oleh orang orang yang sudah tau hipotesis dari data yang akan diolah. Tujuannya adalah untuk mengkonfirmasikan dan meyakinkan kembali bahwa hipotesis yang mereka buat sudah benar atau masih salah.
Contoh dari visualisasi data yang bertujuan untuk melakukan penjelasan atau explanatory adalah seperti gambar berikut
Dari gambar tersebut kita dapat melihat bahwa visualisasi data yang tersaji memiliki gagasan utama, yaitu fakta tentang tsunami di selat sunda pada tahun 2018. Tercatat jumlah korban, wilayah yang terkena tsunami, dan dampak-dampaknya. Kita bisa melihat bahwa suatu infografis dapan dipakai untuk menjelaskan kepada orang lain.
Sedangkan untuk contoh exploratory data biasanya disajikan dalam bentuk dashboard. Misalkan kita menyajikan dashboard prestasi Indonesia dalam kancah olimpiade, dari medali-medali yang diterima kita bisa melihat berdasarkan tahun, penyelenggaraan olimpiade, atau medali yang diperoleh. Dashboard merupakan sebuah exploratory karena melibatkan pengguna untuk mengeksplor dan mengganti-ganti filter sehingga mereka bisa melihat insight yang berbeda.
Untuk confirmatory kurang lebih sama dengan exploratory, namun untuk melakukan confirmatory kita membutuhkan hipotesis untuk diuji apakah benar atau salah.
Data itu diibaratkan seperti salah satu kepingan puzzle yang mewakili dunia nyata. Data yang kita miliki tidak menjangkau semua hal yang terjadi di dunia ini. Data hanyalah sampel dari sebuah populasi. Big Data sekalipun pasti memiliki kepingan-kepingan kecil yang belum bisa dijangkau.
Pelajaran yang bisa diambil adalah: jangan melihat data sebagai per individu, tapi kita harus melihat data sebagai sesuatu yang lebih besar secara keseluruhan. Ibaratnya kita melihat data dengan versi zoom out bukan zoom in, karena dengan melihat data secara keseluruhan kita bisa menemukan pola dan karakteristik dari data.
Sebagai contoh, misalkan data adalah sebuah hutan, jangan melihat satu pohon saja, karena belum tentu pohon itu merepresentasikan keseluruhan pohon yang ada di hutan. Jika pohon tersebut merupakan outliers, maka kesimpulan yang kita ambil akan menjadi salah. Jadi, ketika teman teman memiliki data, perlu diingat untuk tidak terpaku pada suatu hal/individu tapi pahami data secara menyeluruh.
Dalam melakukan proses visualisasi, teman teman harus menjawab empat pertanyaan berikut terlebih dahulu:
Data apa saja yang saya punya?
Misalkan kamu punya data 34 provinsi di Indonesia dengan biaya hidup minimum di setiap provinsi dari tahun 2005-2015.
Apa yang ingin saya ketahui?
Lalu, kamu ingin mengetahui dari tahun 2005-2015 provinsi mana sajakah yang biaya hidupnya paling mahal? Provinsi mana sajakah yang biaya hidupnya paling murah?
Metode apa yang akan saya gunakan?
Ketika kamu sudah tahu apa yang ingin kamu ketahui, kamu akan mulai bisa membayangkan metode atau grafik apa yang akan digunakan.
Apakah visualisasi dari data tersebut masuk akal?
Setelah itu, kamu lihat visualisasinya. Jika visualisasi tersebut masuk akal, maka data yang kamu miliki cukup valid dan bisa merepresentasikan hipotesis yang sebelumnya kita yakini.
Sebelum kita mulai memvisualisasikan data, kita perlu tahu tiga hal terlebih dahulu tentang sistem koordinat visualisasi. Sistem koordinat visualisasi ada tiga, yaitu:
1. Sistem koordinat kartesian
Sistem koordinat kartesian menggunakan dua garis, dimana kedua garis tersebut bertemu secara tegak lurus. Garis horizontal biasa disebut sebagai sumbu x, sedangkan garis vertical disebut sebagai sumbu y. Masing-masing sumbu bisa berupa numerik ataupun diskrit. Nilai-nilai dari sumbu kartesian berupa angka-angka. Misalkan koordinat (1,2) berarti nilai x=1, dan y=2.
2. Sistem koordinat polar
Polar berasal dari dua kata: pole = kutub dan ray = sinar. Koordinat polar memiliki dua komponen, yaitu komponen r atau jari jari dan komponen sudut. Rumus konversi dari koordinat polar ke koordinat kartesian adalah sebagai berikut:
3. Sistem koordinat geografik
Sistem koordinat geografik mirip seperti koordinat polar, hanya saja bentuknya tiga dimensi. Kita tahu bahwa bumi itu bulat, jika kita berdiri di suatu titik pada bumi, untuk mengetahui posisi kita ada dimana adalah dengan menemukan latitude dan longitude. Latitude atau garis lintang membagi bumi dari selatan ke utara sedangkan longitude atau garis bujur adalah garis yang membagi bumi dari barat ke timur.
Ada 12 jenis visual yang sering digunakan untuk menjelaskan data kepada khalayak:
1. Simple text
Simple text berupa tulisan dan angka
2. Table
Table memiliki kolom dan baris, masing masing kolom merepresentasikan variabel sedangkan baris merepresentasikan observasi bisa dalam bentuk waktu atau urutan.
3. Heat Map
Heat Map merupakan salah satu representasi atau visualisasi data untuk menentukan tebal-tipis atau panas-dinginnya suatu tabel.
4. Scatter Plot
Scatter plot seringkali digunakan untuk mengetahui distribusi dan komposisi dari suatu variabel. Minimal terdapat dua variabel dan harus berkategori numerik.
5. Line
Line biasa dipakai untuk mengetahui tren, pergerakan, dan perbandingan antara dua variabel, biasanya sumbu x berupa waktu.
6. SubGraf
SubGraf digunakan untuk mengetahui apakah terjadi pergerakan turun atau pergerakan naik. Biasanya terdapat dua station dari station A ke station B untuk melihat pergerakan dari station A ke station B.
7. Vertical Bar
Vertical bar biasa disebut juga dengan bar chart namun berbentuk secara vertical, digunakan untuk melihat distribusi atau histogram diurutkan berdasarkan interval yang tepat.
8. Horizontal Bar
Horizontal bar biasanya digunakan untuk mengetahui ranking dari suatu variabel.
9. Stack Vertical Bar
Sama seperti vertical bar, namun pada stack vertical bar satu kategori memiliki beberapa komposisi
10. Stack Horizontal Bar
Sama seperti stack vertical bar namun rotasinya berbentuk horizontal.
11. Waterfall
Waterfall jarang digunakan karena untuk memahaminya agak sulit. Dalam waterfall masih digunakan bar chart, namun setiap bar memiliki beberapa arti dimana setiap sequensial bisa bernilai positif atau negatif. Bagian pertama dari graf merupakan titik awal dan bagian akhir dari graf merupakan hasil akhirnya.
12. Square Area
Digunakan untuk menunjukkan komposisi, jika luasnya besar maka komposisinya lebih besar, namun jika luasnya kecil maka komposisinya lebih sedikit.
Bagaimana cara memilih grafis sesuai dengan tujuan visualisasi yang kita inginkan?
Biasanya terdapat enam tujuan dari visualisasi:
1. Komparasi
Visualisasi yang bisa dipilih: bar chart, stack bar chart, line chart, slope graph, heat map, square area, box plot (untuk membandingkan distribusi)
2. Komposisi
Visualisasi yang bisa dipilih: pie chart (maksimal 5 variabel), stack bar chart, stack area
3. Keterhubungan/Relationship
Visualisasi yang bisa dipilih: scatter plot
4. Distribusi
Visualisasi yang bisa dipilih: histogram, box plot, line chart
5. Trend
Visualisasi yang bisa dipilih: line chart, stack bar chart
6. Lokasi/Mapping
Visualisasi yang bisa dipilih: heat map
Kalian juga bisa mengakses website http://labs.juiceanalytics.com untuk membuat visualisasi sesuai dengan tujuan kalian.
Bagaimana jika kita baru mendapatkan data dan masih belum tahu tujuan yang kita inginkan? Pertama-tama, kita pahami terlebih dahulu tipe data. Tipe data ada dua diskrit; berupa data kategorikal dan kontinu; berupa numerik.
Apabila kita mengambil satu variabel berupa kontinu dan kita ingin memvisualisasikannya, kita bisa menggunakan line chart untuk mengetahui distribusi dari variabel tersebut, selain itu, kita juga bisa menggunakan histogram untuk mengetahui pengelompokkan antar interval.
Apabila kita ingin mengambil dua variabel untuk divisualisasikan, kita harus lihat terlebih dahulu tipe data dari variabel tersebut, jika keduanya kontinu maka kita bisa menggunakan scatter plot. Jika salah satunya diskrit, maka bisa digunakan box plot atau bar chart. Jika kedua variabel tersebut diskrit, bisa gunakan heat map.
Apabila kita ingin mengambil tiga variabel, kita bisa menggunakan warna, shape, atau area. Biasanya penggunaan tiga variabel ini lebih digunakan untuk exploratory karena bentuk visualisasi tiga dimensi agak sulit dipahami.
Kita akan mempelajari lebih lanjut tentang tools visualisasi data, pada sesi kali ini kita akan membahas tentang Tableau.
Tableau merupakan tools yang dapat digunakan untuk membuat dashboard dan mengeksplorasi data
Kelebihan Tableau:
+ Sangat powerful
+ Drag and drop, tidak perlu coding
+ Menghasilkan dashboard yang interaktif
+ Dapat menghasilkan peta sampai wilayah kabupaten
Kekurangan Tableau:
- Sedikit tidak intuitif jika dibandingkan dengan PowerBI
- Hanya cocok untuk data analyst yang sudah berpengalaman saja
- Learning curves untuk belajar Tableau agak sedikit curam
Terdapat dua versi Tableau yaituTableau Desktoppenggunaannya harus berbayar/subscribe, namun publikasi dan hasil visualisasi data berupa private, serta dapat mengakses dari database. AdapulaTableau Publicyang dapat diperoleh secara gratis, namun publikasinya berupa public, bisa dilihat semua orang, dan hanya bisa mengakses data berupa .txt atau excel.
Tableau biasanya digunakan oleh data analyst atau data scientist, audiensnya pun bermacam-macam, dari tingkat beginners sampai intermediate.
Selain untuk visualisasi data, Tableau dapat digunakan untuk eksplorasi data, data dapat diolah terlebih dahulu untuk menghasilkan analisis, Tableau juga dapat digunakan untuk data mining.
Tools kedua yang akan kita pelajari yaitu Power BI, Power BI biasanya digunakan oleh para data scientist dan juga orang non praktisi data untuk keperluan reporting.
Kelebihan Power BI:
+ Mudah untuk dipelajari
+ Drag and drop, tidak perlu coding
+ Integrasi dengan software sejenis Microsoft sangat mudah
+ Terdapat fitur yang menggunakan teknologi NLP (Natural Language Processing)
Kekurangan Power BI:
- Hanya dapat berjalan di windows
- Utamanya hanya digunakan untuk visualisasi data saja
Bahasa Python juga dapat digunakan untuk memvisualisasikan data dengan memanfaatkan library Plotly. Biasanya Plotly digunakan oleh para data scientist yang memang dasar pemrogramannya adalah Bahasa Python.
Kelebihan Plotly
+ Plotly dapat dicustom lebih banyak dibandingkan dengan Tableau dan Power BI
+ Plotly juga lebih mudah diintegrasikan dengan library-library lainnya yang ada di Python
+ Menghasilkan visualisasi yang interaktif
Kekurangan Plotly
- Sulit digunakan oleh orang-orang yang tidak familiar dengan coding atau programming
- Plotly bersifat scripting, tidak bersifat drag and drop
- Library Plotly hanya bisa digunakan untuk visualisasi saja, tidak untuk yang lain.
Jika kita menggunakan bahasa pemrograman R, kita dapat gunakan package RShiny untuk membuat dashboard. RShiny digunakan oleh data scientist atau data analyst yang biasa menggunakan Bahasa R.
Kelebihan RShiny
+ Menghasilkan dashboard yang interaktif
Kekurangan RShiny
- Sulit digunakan oleh orang-orang yang tidak familiar dengan coding atau programming menggunakan bahasa R
- Digunakan khusus untuk membuat dashboard
Dataset dapat diunduh dari link drive berikut: https://drive.google.com/drive/folders/17nVaRpe3vMQbEIetHY7KmyOLOOS-ZUWM?usp=sharing
Kali ini kita akan membahas tentang SQL (Structured Query Language). Bahasa SQL digunakan untuk berkomunikasi dengan system database seperti rdbms (relational database management system).
Ciri-ciri dari SQL:
SQL mudah dipelajari, bahkan dalam hitungan minggu kamu sudah bisa memahami SQL.
SQL dapat digunakan untuk melakukan query terhadap data-data dengan jumlah kolom dan baris yang besar.
SQL merupakan bahasa yang universal, Oracle dan Hadoop pun menggunakan bahasa SQL.
SQL sudah ada semenjam 40 tahun yang lalu dan diprediksi akan terus digunakan di 40 tahun mendatang.
Dalam SQL ada dua hal yang perlu dipahami:
SQL Server dan SQL Client. SQL Server diibaratkan sebagai sebuah website dan SQL Client adalah sebuah browser. Browser akan meminta kepada server berupa website agar client akan mendapatkan informasi dari server tersebut.
SQL Server yang populer adalah PostGreSQL karena free dan dapat digunakan untuk banyak tipe data. Selain itu terdapat juga MySQL, HiveQL yang biasa digunakan untuk query di Hadoop, dan juga BigQuery.
SQL Client yang populer diantaranya ada pgAdmin dan SQL Workbench untuk mengakses PostGreSQL, dan salah satu yang paling populer adalah HeidiSQL.
Agar laptop kamu dapat digunakan untuk praktik SQL, maka kalian dapat mendownload salah satu varian dari SQL seperti PostGreSQL, berikut adalah link untuk mendownload:
Windows: www.postgresql.org/download/windows/
Mac: https://postgresapp.com/downloads.html
Dalam SQL terdapat dua macam language/bahasa, yaitu Data Definition Language dan Data Manipulation Language.
Pada Data Definition Languange, kita akan membahas bagaimana cara create table, delete table, dan drop table.
Untuk menghubungkan ke dalam suatu server, kita gunakan perintah psql -U namausername -d database. Kita akan melihat apakah ada table yang sudah dibuat dengan menggunakan perintah \dt. Misalkan kita ingin membuat tabel baru, kita gunakan perintah sebagai berikut:
create table my_transaction(
Invoice_date DATE,
Stoc_code VARCHAR,
Quantity INT,
CustomerID INT);
CREATE TABLE
Dengan perintah di atas, kita sudah membuat table dengan kolom-kolom DATE, VARCHAR, Quantity, dan Customer ID yang masih kosong. Karena amasih kosong, kita harus mengisi tabel tersebut dengan file csv.
Jika kita ingin mengetahui apakah data csv kita sudah diload ke dalam table atau belum, kita dapat memeriksa dengan Data Manipulation Language. Perbedaan antara Drop Table dan Delete table adalah Delete table hanya mengilangkan isi dari table, namun masih menyisakan nama table dan kolom, sedangkan Drop table menghilangkan isi dan atribut kolom-kolom yang dipilih.
Kali ini kita akan menggunakan Data Manipulation Language dimana kita dapat menselect table, memfilter table, dan melakukan query terhadap data-data di dalam SQL server. Contohnya, apabila kita ingin melihat isi dari table produk, kita dapat menggunakan perintah:
select * from namatable limit 10 (limit 10 artinya adalah memfilter 10 baris pertama dari tabel)
Untuk melakukan filter, kita dapat menggunakan where atau condition. Misalkan kita ingin melihat pelanggan dengan customer ID 15572 pada table transaksi, maka kita akan gunakan perintah:
select * from transaksi where customerid = 15572
Selain itu, kita juga dapat menggunakan join, dimana kita bisa menggabungkan ketiga table yang kita punya. Apabila kita ingin mengetahui bahwa transaksi apa saja yang dilakukan oleh customerid yang berasal dari daerah tertentu, maka kita bisa melakukan join antara dua table yaitu table transaksi dan table profil_pelanggan. Gunakan perintah:
select * from transaksi join profil_pelanggan on transaksi.customerid=profil_pelanggan.customerid limit 10
Terlihat bahwa kolom customer id dan province dapat di join. Dari sinilah kita dapat melakukan manipulasi terhadap data yang ada, misalkan dengan melakukan group by dan summarize, kita bisa mengetahui ada berapa customerid yang melakukan transaksi dari DKI Jakarta sepanjang database ini terisi dengan menggunakan perintah
select province, count(*) from (select * from transaksi join profil_pelanggan on transaksi.customerid=profil_pelanggan.customerid) t group by t.province
Terlihat bahwa pelanggan dari DKI Jakarta mendominasi jumlah transaksi, yaitu sebanyak 6617 transaksi dilakukan oleh pelanggan yang berasal dari DKI Jakarta. Kita juga bisa melakukan order, atau diurutkan berdasarkan yang terbesar sampai terkecil dengan perintah:
select province, count(*) from (select * from transaksi join profil_pelanggan on transaksi.customerid=profil_pelanggan.customerid) t group by t.province order by count desc
Terlihat bahwa peringkat provinsi yang menghasilkan transaksi terbesar adalah DKI Jakarta, Luar Jawa, Jawa Barat, Banten, DI Yogyakarta, Jawa Tengah, lalu Jawa Timur. Selain itu, kita juga bisa melakukan summarize dan filter berdasarkan kolom atau baris yang diinginkan.
Mengapa kita harus belajar Python?
Dengan kita belajar Python, kita dapat memakai keterampilan Python di environment yang lain selain data science. Python juga sangat populer, sudah banyak orang menggunakan Bahasa Python untuk keperluan coding. Terakhir, yang paling penting, Python bisa digunakan secara free tanpa dipungut biaya.
Python merupakan General-Purpose Programming Language dan termasuk High Level Language. Secara processing memory, Python memang bukan yang tercepat, namun Python sangat memudahkan manusia karena bahasanya paling mendekati grammar Bahasa Inggris.
Data Scientist umumnya menggunakan Python 3 karena setelah tahun 2017, package untuk Data Science yang ada di Python 3 sudah jauh lebih lengkap.
Cara menginstall Python yang paling mudah adalah dengan menggunakan Anaconda. Anaconda merupakan package dan environment manager, terdapat distribusi package atau library Python dan R lebih dari 1500 yang digunakan untuk keperluan Data Science.
Untuk menginstall Anaconda, kunjungi website www.anaconda.com/distribution lalu klik download pada Python versi terbaru sesuai dengan operating system yang kamu pakai.
Setelah download, kamu dapat lakukan instalasi secara default, setelah selesai install, artinya Python beserta library-library yang kamu butuhkan untuk Data Science sudah siap digunakan.
Jika kamu telah selesai melakukan instalasi Anaconda, artinya di dalam laptopmu sudah terinstall Python. Cara memulai coding dengan Bahasa Python di laptop kamu adalah dengan memanggil IDE yang digunakan untuk Python. Umumnya, IDE yang digunakan adalah Jupyter Notebook.
Cara membuka Jupyter Notebook adalah dengan menggunakan terminal, kemudian kita ketik Jupyter Notebook lalu tekan enter. Setelah itu, akan muncul tab baru pada browser berupa Jupyter Notebook yang berisi kumpulan folder dan file dimana kita bisa membuat file baru yaitu Python 3. Pertama-tama, kita namai dahulu Notebook yang akan kita gunakan. Extension dari file Notebook yang dihasilkan adalah .ipynb.
Seperti programmer pada umumnya, perintah dasar dimulai dengan mengeluarkan text Hello World! Dalam Python, gunakan perintah print(“Hello World!”) untuk mencetak tulisan.
Sekarang kita akan mempelajari dasar-dasar Python. Dasar yang akan kita pelajari terlebih dahulu adalah tipe data, variabel, operasi matematika, dan operasi logika.
Tipe data dan variabel
Untuk meng-assign sebuah variabel, kita gunakan tanda sama dengan (=). JIka kita ingin mengetahui tipe-tipe data, kita gunakan perintah: type(namavariabel).
Ada 5 tipe data: Integer, Float, String, Boolean, Array.
Integer adalah tipe data yang berupa angka bulat seperti 10,25,1000.
Float atau floating point adalah tipe data yang berupa real number, memiliki bagian decimal di akhir angka seperti 5,73 atau 9,13.
Boolean adalah tipe data yang paling sederhana karena tipe data ini hanya memiliki dua nilai yaitu True dan False.
Array adalah sebuah tipe data yang di dalamnya terdiri dari kumpulan tipe data.
Operasi Matematika
Penggunaan operasi matematika pada Python adalah sebagai berikut
+ untuk menjumlahkan
- untuk mengurangkan
* untuk mengali
/ untuk membagi
% modulo
** pangkat
Operator Logika
a > b periksa apakah a lebih besar dari b?
a < b periksa apakah a lebih kecil dari b?
a == b periksa apakah a sama dengan b?
Operator and / or / not
Data structure atau struktur data digunakan untuk menyimpan data yang kita punya. Ada dua tipe struktur data yang biasa digunakan dalam Python: List dan Dictionary.
List adalah rangkaian dari values yang belum tentu terurut. List bisa saja bernilai sama ataupun gabungan antara string dan integer.
Dictionary seringkali dipakai dalam proses Data Science. Yang membedakan Dictionary dengan List adalah pada Dictionary setiap value memiliki unique key.
Kali ini kita akan belajar tentang Function dan Method.
Function dalam Python biasanya diikuti tanda kurung setelah nama function yang kita gunakan. Contoh beberapa function yang ada di Python adalah:
print() untuk mencetak/mengeprint
len() untuk menghitung jumlah elemen yang ada di list atau jumlah karakter dalam sebuah string
round() untuk membulatkan angka
min() untuk mencari nilai minimum dari beberapa list
max() kebalikan dari min()
type() mengetahui tipe data
Sedangkan untuk method biasanya menggunakan tanda . seteleah nama variabel. Berikut adalah contoh beberapa method yang ada di Python:
.upper() = untuk membuat huruf menjadi uppercase
.lower() = untuk membuat huruf menjadi lowercase
.append() = untuk menambahkan elemen ke dalam list
.remove() = untuk menghapuskan elemen yang ada di dalam list
.count() = untuk menghitung nilai tertentu di dalam list
Perbedaan function dan method adalah kita hanya bisa menggunakan satu variabel pada method, sedangkan pada function kita bisa menggunakan beberapa variabel.
Kita juga bisa menggabungkan antara function dan method. Perlu diperhatikan bahwa tanda . di sini bertujuan sebagai pemisah antara function dan method, sehingga nama variabel tidak bisa menggunakan titik.
Untuk melakukan If statement dalam Python, kita bisa menggunakan tiga pola berikut:
Pola pertama
If a == b;
print (‘yes’)
else:
print(‘no’)
Pola kedua
If (a+b)/c == 1 and c-b-a == 0;
print (‘yes’)
else:
print(‘no’)
Pola ketiga
If a == b;
print (‘first condition is true’)
elif a == c;
print(‘second condition is true’)
else:
print(‘nothing is true. existence is pain.’)
Untuk membuat loop statement kita bisa menggunakan perintah for dengan tiga contoh sebagai berikut:
Contoh pertama
Dog = [‘Hachiko’, 9, True, 1.1, 2001, [‘bone’, ‘little ball’]]
for i in dog;
print(i)
Contoh kedua
my_list = range(0,30,3)
for i in my_list:
print(i)
Contoh ketiga
my_list = “Hai Semua!”
for i in my_list:
print(i)
Ada lima library/package yang harus diketahui dan dipahami oleh seorang Data Scientist.
Pandas
Package yang mempermudah data scientist untuk melakukan manipulasi data, dari mulai import data, dan mentransformasi data.
Numpy
Package yang digunakan untuk melakukan computing scientific.
Matplotlib
Package yang sangat berguna untuk melakukan visualisasi data.
Scikit-learn
Package yang berisi banyak library-library machine learning yang umum untuk mempermudah data scientist dalam membangun model.
Tensorflow
Bentuk lain dari scikit-learn, tujuannya kurang lebih sama, namun Tensorflow merupakan package baru yang diinisiasi oleh Google, dimana Tensorflow memiliki kemampuan yang lebih baik dari segi kecepatan jika dibandingkan dengan scikit-learn.
Untuk melakukan import data, misalkan data csv (coma seperated value), kita bisa gunakan library pandas.
Import library pandas terlebih dahulu dengan perintah:
import pandas as pd
Kita akan membuat dan menggunakan variabel transaksi untuk memanggil tabel data yang kita punya dengan perintah:
transaksi = pd.read_csv(‘dataset/transaksi2.csv’, header=None, name=[‘InvoiceDate, ‘StockCode’, ‘Quantitiy’, ‘CustomerID’])
transaksi.head() untuk melihat 5 data pertama pada tabel
transaksi.tail() untuk melihat 5 data terbawah pada tabel
transaksi.describe() untuk mengetahui informasi statistik pada tabel seperti mean, medium, modus
type(transaksi) untuk mengetahui tipe dataframe
Shell scripting adalah sebuah command language library yang berinteraksi dengan operating system (linux atau unix). Command ini dapat langsung bekerja di dalam file system yang berada di operating system tersebut seperti membuat file, memindahkan file, atau mendownload file.
Mengapa seorang Data Scientist harus belajar Shell Scripting?
Karena Shell scripting dapat menghemat waktu kerja seorang data scientist dengan cara melakukan automasi script Python ke dalam server.
Crontab merupakan salah satu tools dalam operating system di unix untuk menjalankan suatu script agar script tersebut berjalan secara otomatis. Dalam sebuah server, kita ketik crontab -e. Artinya dari file ini kita bisa mengedit beberapa task seperti kapan suatu script akan dijalankan. Setiap baris akan menjalankan suatu perintah sesuai dengan tanggal, jam, dan menit yang telah diatur. Misalkan, untuk perintah 8**** artinya pada menit ke 8, perintah yang kita minta akan dijalankan. Crontab ini sangat penting karena dengan adanya crontab data scientist menjadi lebih mudah untuk menjalankan script yang ingin dilakukan, misalkan memining atau get dari suatu server ke server lain
Statistika adalah core dari Data Science, dengan mempelajari Statistika kita bisa mengetahui distribusi, varians, relasi antar variabel pada data yang kita miliki.
Kerangka pembelajaran adalah sebagai berikut:
Mengenal Statistika
Mengenal ukuran pemusatan, penyebaran, dan keterhubungan data (Statistika deskriptif)
Machine Learning dasar (Statistika inferensia)
Statistika adalah ilmu yang digunakan untuk mengumpulkan, mengelola, menganalisis, dan merepresentasikan data sehingga bisa diambil kesimpulan. Ada dua jenis statistika, yaitu:
Statistika deskriptif
Deskriptif berasal katadescribeyang artinya mendeskripsikan. Statistika deskriptif digunakan untukmemberikan paparandari data baik berupa grafik atau perhitungan numerik.
Statistika inferensia
Inferensia berasal dari katainferyang artinya menebak. Statistika Inferensia digunakan untukmemprediksi variabelberdasarkan sampel yang diambil dari populasi.
Di Statistika ada beberapa terminologi atau kosa kata yang dipakai dalam ukuran pemusatan data seperti:
Minimum: nilai paling kecil dari data yang kita punya, dan data harus berupa numerik
Maksimum: nilai yang paling besar
Mean: total atau jumlah dari data numerik yang kita punya dibagi dengan banyaknya data
Median: nilai tengah data setelah data tersebut diurutkan
Modus: nilai yang paling sering luncur
Quartil 1: nilai ¼ data setelah data diurutkan
Quartil 3: nilai ¾ data setelah data diurutkan
Quartil 2 : Median
Setelah mempelajari ukuran pemusatan data pada subbab sebelumnya, sekarang kita akan belajar tentang ukuran penyebaran data. Berikut adalah beberapa ukuran penyebaran data:
1. Simpangan baku (standar deviasi)
Simpangan baku merupakan suatu ukuran penyebaran tskor-skor erhadap mean, tapi simpangan baku tidak robust dan sangat terpengaruh oleh data yang ekstrem karena ada pengaruh mean.
Rumus simpangan baku adalah sebagai berikut:
σ = simpangan baku populasi
S = simpangan baku sampel
x = observasi
x̄ = mean sampel
μ = mean populasi
n = Jumlah populasi
n = jumlah sampel
2. Variansi
Variansi adalah kuadrat dari simpangan baku.
3. Rentangan
Rentangan adalah selisih antara nilai maksimum dan nilai minimum.
4. Simpangan kuartil
Simpangan quartil adalah elisih dari quartil ketiga dengan kuartil pertama (Q3-Q1).
Sekarang kita akan mengukur keterhubungan data yang mana membutuhkan lebih dari satu variabel:
1. Kovarians - cov(X,Y)
Rumus kovarians adalah:
E[X] = mean dari X
E[Y] = mean dari Y
Range dari kovarians tidak terhingga. Semakin besar berarti semakin terhubung atau semakin berpengaruh. Sebaliknya, semakin kecil berarti semakin tidak saling mempengaruhi.
2. Korelasi - corr(XY)
Ukuran keterhubungan data korelasi mempunyai range antara -1 dan 1, dengan nilai paling kecil adalah -1, sedangkan 1 sebagai nilai yang menunjukkan adanya korelasi/hubungan yang sangat tinggi.
3. Kausalitas
Kausalitas merupakan hubungan sebab akibat antara dua variabel, dimana perubahan di suatu variabel akan menyebabkan perubahan di variabel yang lainnya. Korelasi tidak selalu berarti kausalitas.
Kali ini kita akan belajar tentang machine learning dasar yang merupakan bagian dari statistika inferensial. Machine learning dasar digunakan untuk menerka atau memprediksi variabel-variabel lainnya.
Ada tiga macam machine learning:
Supervised learning
Regresi dan klasifikasi
Unsupervised learning
Clustering
Semi-supervised learning
Gabungan antara regresi/klasifikasi dengan clustering
Pada sub bab ini kita akan mempelajari regresi terlebih dahulu.Regresimerupakan suatu teknik dalam statistika untuk mengetahui keterhubungan antara variabel prediktor (independent) dengan variabel respons (dependent) yang berbentuk numerik.Regresi linearsendiri merupakan salah satu contoh dari regresi dimana antara variabel prediktor dan variabel respons memilikiketerhubungan linear. Yang dimaksud dengan linear adalah keterhubungan antar variabelnya dapatdirepresentasikan dalam bentuk garis lurus.
Tujuan dari regresi tentunya adalah untuk memprediksi variabel yang datanya kontinu. Contoh dari regesi adalah prediksi harga rumah dan prediksi tinggi badan.
Klasifikasi merupakan salah satu teknik machine learning yang digunakan untuk melabeli observasi ke dalam kelompok tertentu berdasarkan data training yang sudah ada labelnya. Contoh algoritma klasifikasi adalah: k-NN (k-Nearest Neighbor), Decision Tree, Random Forest, ANNs (Artificial Neural Networks), dan Logistic Regression.
Tujuan dari klasifikasi adalah untuk menentukan apakah suatu observasi tergolong ke dalam kelas tertentu. Jumlah kelas bisa terdiri dari dua kelas atau lebih (multi classification).
Contoh dari klasifikasi adalah:
Mengklasifikasi suatu email apakah spam atau bukan
Mengklasifikasi gambar berdasarkan warna dan bentuk
Clustering merupakan teknik machine learning yang bertujuan untuk mencari kelompok yang memiliki karakteristik/pola yang sama dalam suatu populasi. Algoritma clustering diantaranya ada: k-Means Clustering, Hierarchical Clustering, dan Density Based Clustering (DB-Scan).
Belajar clustering menjadi penting karena sebagian besar data yang kita punya tidak berlabel, terutama dengan era big data dimana setiap detik ada data yang terproduksi dan hanya sedikit data yang memiliki label.
Contoh kasus clustering adalah segmentasi pelanggan, biasanya dilakukan di departemen marketing. Contoh lainnya adalah mengkategorikan populasi peserta didik dalam suatu ruang kelas berdasarkan umur, jenis kelamin, dan tingkat pendidikan.
Semi-supervised learning merupakan salah satu teking machine learning yang melibatkan data tidak berlabel digunakan untuk data training. Biasanya terjadi ketika data yang berlabel itu jumlahnya sangat sedikit, sedangkan data yang tidak berlabel jumlahnya sangat banyak. Kita perlu melakukan asumsi untuk melabeli data yang belum ada labelnya. Asumsi yang digunakan sebagai berikut:
1. Asumsi kontinuitas
Semakin dekat suatu observasi yang belum berlabel dengan yang sudah berlabel, semakin memiliki kecenderungan bahwa label yang dimiliki sama.
2. Asumsi kluster
Apabila observasi yang tidak ada labelnya masuk menjadi satu kluster dengan observasi yang sudah ada labelnya, berarti memiliki kecenderungan bahwa label yang dimiliki sama.
3. Asumsi manifold
Tidak melibatkan semua fitur namun hanya mengambil fitur-fitur yang penting saja umtuk menentukan observasi tersebut memiliki label yang sama atau tidak.
Topik Bisnis
Kemampuan mengerti bisnis merupakan salahsatu kemampuan utama untuk menjadi seorang data scientist.
Kemampuan Bisnis merupakan Irisan dari kemampuan teknis maupun non-teknis.
Yang dimaksud dengan kemampuan teknis adalah kemampuan bisnis yang berpusat di business knowledge berdasarkan domain masing-masing. Dapat dicontohkan sebagai seseorang yang berkecimpung / memahami bisnis dalam domain telekomunikasi, maka seseorang tersebut harus mengerti variable-variable apa saja yang terlibat dalam bisnis tersebut seperti jumlah call dalam sehari, jumlah sms dalam sehari atau jumlah data yang diperlukan seseorang dalam 1bulan.
Sedangkan kemampuan non teknis, terbagi atas 3 hal :
Kemampuan Presentasi, yaitu kemampuan memaparkan suatu ide atau hasil analisis.
Project Management, kemampuan memanage project dari awal hingga akhir (finalisasi).
Interpersonal Skill, kemampuan berkomunikasi secara verbal maupun non-verbal.
Di kelas ini, akan belajar 3 hal : Presentasi, Projek Management dan Interpersonal Skill.
Kemampuan Presentasi, tujuan dari kemampuan presentasi adalah sebagai berikut :
Memberikan informasi kepada oranglain
Meyakinkan oranglain
Memotivasi atau memberikan inspirasi
Menjual produk / jasa
Mengapa presentasi itu penting?
Karena keberhasilan presentasi menentukan tercapainya atau tidaknya tujuan yang dituju.
Untuk membuat presentasi, ada 3 tahap yakni :
Menyusun konten
Membuat desain
Penyampaian
Cara membuat konten yang baik
Poin-poin yang perlu diperhatikan dalam membuat konten yang baik dalam presentasi :
Mengetahui bagaimana profil audience
Mengetahui kemampuan awal audience akan topik presentasi
Mengetahui jelas tujuan dari presentasi yang ingin dilakukan
Mengetahui bagaimana kerangka presentasi disajikan
Penjelasan :
Mengetahui bagaimana profil audience dari segi umur, latar belakang dan keahlian. Dari mengetahui profil audience terlebih dahulu, akan sangat membantu untuk tau bagaimana cara kita menyampaikan materi presentasi
Mengetahui seberapa banyak dari yang sudah tau atau memahami topik yang akan disampaikan
Trik : Dengan menanyakan terlebih dahulu audience mengenai seberapa tau mereka tentang topik yang akan disampaikan.
Mengetahui betul tujuan dari presentasi yang akan dilakukan sehingga tau tujuan apa yang ingin dicapai dari presentasi yang disajikan.
Perhatikan bagaimana kerangka presentasi yang disajikan, dimana harus jelas dan runtut.
Dimana desain kerangka presentasi terbagi atas 2 jenis, yakni :
Deskriptif : Penjelasan dari umum - detail
Naratif : Penjelasan sesuai flow cerita.
Bagaimana tau cara menentukan kerangka presentasi? Apakah mesti disajikan deskriptif atau naratif?
Kuncinya adalah "Kenali terlebih dahulu data yang ingin dipresentasikan."
Cara mendesain presentasi yang baik
Bagaimana cara mendesain presentasi yang baik dan benar?
Kenali tools power point (maupun Google Slide atau Qnote).
Perlunya menguasi skill tools powerpoint, untuk membantu anda dalam menyampaikan message kepada audience berupa desain dari konten tersebut. Namun perlu diingat bahwa mendesainlah seperlunya, tetap materi konten yang ingin disampaikan adalah yang utama.
Jangan semua materi dimasukkan kedalam slide
Dikarenakan audience datang ke presentasi anda adalah untuk menyerap segala informasi dari pemaparan yang anda sajikan, bukan seakan membaca buku full terkait materi yang disampaikan.
Kunci agar message dari slide tersampaikan dengan berhasil adalah....
"Semakin sederhana dan semakin fokus cakupan slide anda, maka message anda akan lebih mudah dipahami."
Catatan Tambahan:
Gunakan gambar-gambar penunjang, agar slide yang ditampilkan tidak terasa monoton dengan hanya berupa tulisan dan diharapkan audience akan memusatkan perhatian mereka seutuhkan untuk pemaparan anda.
Cara menyampaikan presentasi
Bagaimana cara menyampaikan presentasi dengan baik?
Berlatih cara menyampaikan presentasi, jika tidak dilakukan maka kemungkinan besar akan tidak lancar dan banyak hal yang lupa untuk disampaikan.
Tips : Semakin sederhana penjelasanmu, maka penjelasanmu akan lebih baik. Ada pepatah berkata, apabila kita belum bisa memberikan penjelasan secara singkat dan jelas, maka sebenarnya kita belum memahami dengan benar materi yang disampaikan tersebut. Maka tentunya kita mesti pelajari materi dengan baik dan gunakan bahasa kalian dalam menyampaikan materi.
Latihan presentasi di depan teman-teman kalian atau oranglain, dan dapatkan feedback dari mereka.
Terimalah feedback-feedback itu dan masukkan kedalam latihan-latihan presentasi selanjutnya.
Latihan terus-menerus, minimal 3x.
Tips and Trik dalam menyampaikan presentasi dengan baik, yakni :
Usahakan badan kita tetap tegak
Tataplah audience, apabila hanya 1 orang fokuslah pada audience tersebut. Apabila banyak, bagilah secara merata fokus anda selama pemaparan.
Selalu tersenyum dalam hati sehingga audience merasakan bagaimana emosi semangat anda dan mampu menerima message anda dengan senang hati juga.
Bicaralah lebih pelan dari biasanya
Sadarilah pasti ada ketidaksempurnaan sehingga dapat di-improve pada presentasi2 selanjutnya. Dan terakhir, seringlah berlatih agar penyampaiannya lebih lancar dan meyakinkan.
Tim Projek Manajemen dalam Data Science
Pada perusahaan skala besar, Projek Manajemen dalam proyek Data Science terbagi atas 4 tim yakni :
Tracking Team Team yang bertugas untuk mengumpulkan data, dikumpulkan dalam 1 pool, yang nantinya pool tersebut akan diserahkan kepada Data Engineer Team.
Data Engineer Team Team yang bertugas untuk menambang data untuk diformat kedalam bentuk data yang sudah siap untuk dikelola oleh Tim Analitik (data yang semi-matang).
Analytics Team / Data Science Team Team yang bertugas untuk mengolala data yang semi-matang tersebut menjadi insight-insight, model dan suatu hal yang lebih bermakna dalam bidang bisnis.
Para Manager Para manager melihat insight atau keluaran dari Data Science Team sehingga mereka dapat mengambil keputusan dari data yang telah diolah.
4 Tugas besar dalam proyek Data Science
Data Collection Sangat penting apabila data projek yang ingin dikumpulkan terdapat diluar naungan perusahaan (data ekternal). Yang dimaksud data ekternal adalah data yang bersumber dari internet seperti facebook, linkedin, twitter maupun sosial media atau platform lain yang berselancar di dunia internet.
Data Storage Penyimpanan data yang dimaksudkan disini adalah memperkirakan format ukuran data yang dilakukan sehingga data-data tersebut dapat seluruhnya tersimpan dengan baik sesuai kapasitas penyimpanan data yang dimiliki.
Data Analitis Data-data yang telah terkumpul tersebut kemudian diformat ulang oleh tim data science, sehingga tim data science mampu mengambil data dengan lebih mudah sesuai kebutuhan.
Business Decision Dilakukan oleh para manager untuk mengambil keputusan sehingga nantinya projek data ini menjadi suatu dasar untuk mengambil kebijakan.
Cara melakukan project management dengan baik.
Menurut buku PM-BOK (Project Management - Body of Knowledge),
Secara umum ada 5 hal bagaimana cara melakukan project management dengan baik, yakni :
Inisiasi projek
Perancaan
Pelaksanaan
Pemantauan dan pengendalian
Penutupan
Rekomendasi tools untuk project management yakni CRISP-DM (Cross Industry Standard Process for Data Mining), dimana meliputi 6 section yakni
Business Understanding
Data Understanding
Data Prepocessing
Modelling
Evaluatiom
Deployment or Presentation
Tools yang paling banyak digunakan dalam melakukan project data mining adalah Trello, Ms. Project dan JIRA.
Catatan Tambahan:
Perlu dibuka suatu repository GitHub, dikarenakan sebagian besar dilakukan data analisisnya menggunakan code, seperti Phyton dan R. Sehingga nantinya terdokumentasi dengan baik apabila nanti ada kelanjutan dari projek tersebut akan dengan mudah melihat dokumentasinya.
Kemampuan Interpersonal
Kemampuan Interpersonal sangat erat kaitannya dengan kemampuan komunikasi. Ada 2 kemampuan komunikasi, yakni Komunikasi Lisan dan Komunikasi Tertulis
Untuk komunikasi secara tertulis di era digital sekarang, kita mampu memanfaatkan tools yakni seperti :
Chatting
Kemampuan Menulis sangat diperlukan di dalam melakukan projek data, misalkan saat mengirmkan email gunakanlah tata bahasa yang lebih formal dibandingkan chatting.
Sedangkan Kemampuan Komunikasi Lisan, kita diharuskan untuk tau dengan siapa kita ajak komunikasi. Kita perlu tau namanya maupun role masing-masing dalam projek tersebut. Contoh lainnya yakni ketika meeting berlangsung, komunikasi lisan sangat diperlukaan untuk mengetahui cara efektif dalam menyampaikan gagasan, kritik maupun saran dengan baik.
Manfaat dari memiliki kemampuan interpersonal yakni dengan siapapun pihak yang data scientist ajak bekerja sama bisa menerima dan memiliki kesan yang baik, bukan hanya di resultnya yang baik tetapi juga cara penyampaiannya mampu diterima dengan mudah dan baik pula.
Cara melakukan komunikasi tertulis
5 tips bagaimana cara melakukan komunikasi tertulis, yakni :
Gunakan bahasa yang sesuai tergantung dengan tingkat kedekatan dan peranan dari orang yang nantinya kita ajak komunikasi. Contohnya, gunakanlah bahasa yang formal untuk mengirimkan email kepada pihak yang tidak kita kenal sebelumnya.
Tips : Apabila kita menggunakan bahasa Indonesia, gunakanlah bahasa Indonesia yang sesuai dengan Ejaan Yang Disempurnakan (EYD).
To the point, usahakan ketika menulis gunakan kata-kata yang efektif dan tidak banyak basa-basi. Apabila kita sudah sangat sering menuliskan email, dan bagaimana
Apabila kita ragu dalam penggunaan bahasa Inggris, disarankan menggunakan tools untuk memperbaiki tata bahasa atau grammar.
Tips : Direkomendasikan menggunakan tools Grammarly untuk memperbaiki tata bahasa Inggris.
Kenali peruntukan alat komunkasi yang sesuai dan sebaik-baiknya.
Sebisa mungkin menghindari kalimat-kalimat yang bersifat offensive atau kalimat-kalimat yang "maraj" terhadap kolega dalam projek kita. Jika memang ada permasalahan dengan kolega kita, sebaiknya disampaikan dengan bijak secara langsung. Tidak menggunakan alat komunikasi atau secara tertulis elektronik
Cara melakukan Komunikasi Lisan
5 Tips berkomunikasi lisan, yakni :
Harus mengerti dan memahami apa yang ingin disampaikan. Apabila ingin menyampaikan hasil analisis data, harus pahami dulu materinya, karena hanya anda yang tau betul insight-insight hasil analisis data anda sendiri.
Gunakan pertanyaan-pertanyaan yang nantinya memang audience untuk memberikan saran untuk kita. Dari saran-saran itulah yang akan menjadi suatu pelajaran untuk membuat komunikasi menjadi lebih baik.
Gunakan kata-kata yang jelas sesuai dengan lawa bicara anda
Beranikan diri untuk memulai pembicaraan dan tataplah mata yang kita ajak bicara
Selalu bersemangat dan tersenyum ketika melakukan komunikasi, agar energi positif kita tersampaikan kepada audience.
Keahlian legal merupakan kemampuan tambahan yang harus dimiliki oleh seorang data scientist. Dengan kemampuan legal, seorang data scientist dapat memahami data dan analisis mana saja yang boleh dirilis kepada khalayak umum, serta data pribadi yang tidak boleh dipublikasikan sesuai dengan ketentuan yang berlaku.
Pada bagian ini kita akan membahas tentang GDPR dan Peraturan Menteri Komunikasi dan Informatika yang sudah diterapkan sejak tahun 2016.
GDPR merupakan singkatan dari General Data Protection Regulation, sebuah regulasi yang mengubah dasar-dasar bagaimana cara memanfaatkan data secara etis oleh berbagai sektor dari mulai perbankan, kesehatan, dan sebagainya. Aturan ini mengikat perusahaan dalam melakukan bisnis di Uni Eropa, sehingga meskipun perusahaan tersebut tidak berasal dari Eropa, mereka tetap harus mengikuti peraturan GDPR.
GDPR mengharuskan data pribadi disimpan menggunakan nama samaran. Bila perusahaan ingin mengambil data pribadi, maka mereka harus memberitahukan dalam syarat dan ketentuan kepada para pelanggan. Perusahaan juga harus menyatakan tujuan mengapa data tersebut diambil dan seberapa lama data tersebut akan disimpan, atau dibagikan ke pihak ketiga. Aturan ini juga memungkinkan setiap individu di uni Eropa untuk meminta salinan data mereka. Perusahaan yang mengalami kebocoran data juga wajib melaporkan kebocoran data tersebut dalam rentang waktu 72 jam.
Setelah melewati banyak persiapan dan perdebatan, akhirnya GDPR diterapkan di Eropa pada tahun 2018. GDPR sangat diperlukan oleh masyarakat Uni Eropa untuk menyelaraskan hukum perlindungan data antar negara uni eropa, memperkuat perlindungan data untuk masyarakat uni eropa, serta membentuk kembali cara organisasi yang berada di wilayah Uni Eropa untuk menangani perlinduungan data. Dengan adanya GDPR, perusahaan-perusahaan yang ada di eropa memiliki standar perlindungan data yang sama.
YouTube, Google, dan Spotify pada tahun 2018 lalu mengirimkan notifikasi kepada para pelanggannya bahwa mereka akan memperbarui terms and conditions, ini adalah salah satu dampak dari GDPR yang sudah diterapkan.
Indonesia memiliki Peraturan Menteri Kominfo No. 20 tahun 2016, mengatur tentang perlindungan data yang dikumpulkan oleh perusahaan. Peraturan ini merupakan satu satunya peraturan yang mengatur tentang perlindungan data pelanggan dan belum ada undang-undang yang berlaku di Indonesia. Peraturan ini didasarkan atas undang-undang ITE yang sudah ada sebelumnya. Peraturan ini akan sangat berguna untuk seorang data scientist dalam mengetahui batasan ketika publikasi atau rilis data.
Permen Kominfo No. 20 tahun 2016 terdiri dari 10 bab dan 39 pasal. Peraturan ini melibatkan:
Pemerintah selaku penyelenggara negara
Masyarakat selaku pemilik data pribadi/orang yang data-datanya dikoleksi
Badan usaha selaku sistem penyelenggara elektronik yang menyimpan data-data yang dikoleksi dari masyarakat
Bab pertama pada Peraturan Menteri menjelaskan ketentuan umum yang digunakan.
Pada pasal satu dijelaskan 10 kosa kata yang sering digunakan dalam Peraturan Menteri, yaitu:
Data pribadi
Data perseorangan tertentu
Pemilik data pribadi
Persetujuan pemilik data pribadi
Sistem elektronik
Penyelenggara sistem elektronik
Pengguna sistem elektronik
Badan usaha
Menteri, dan
Direktorat jenderal
Pasal kedua menjelaskan tentangcakupan perlindungan data pribadidalam sistem elektronik yang mencakup perlindungan dalam perolehan, pengumpulan, pengolahan, penganalisisan, penyimpanan, penampilan, pengumuman, pengiriman, penyebarluasan, dan pemusnahan data pribadi
Bab kedua menjelaskan tentang perlindungan. Bab ini merupakan bab yang berisi pasal paling banyak yaitu sejumlah 23 pasal (mulai dari Pasal 3 s.d. Pasal 25), yang tergolongkan menjadi enam bagian, seperti:
Umum.
Perolehan dan Pengumpulan data pribadi
Pengolahan dan Penganalisasisan Data Pribadi
Penyumpanan Data Pribadi
Penampilan, Pengumuman, Pengiriman, Penyebarluasan, dan/atau Pembukaan Akses Data Pribadi
Pemusnahan Data Pribadi
Bab ketiga membahas tentang hak pemilik data pribadi. Ada lima butir hak yang perlu diketahui oleh pemilik data pribadi:
Hak atas kerahasiaan data pribadinya
Hak untuk mengajukan pengaduan dalam rangka penyelesaian sengketa data pribadi atas kegagalan perlindungan kerahasiaan data pribadinya oleh penyelenggara sistem elektronik kepada menteri;
Hak untuk mendapatkan akses atau kesempatan untuk mengubah atau memperbarui data pribadinya tanpa menganggu sistem pengelolaan data pribadi, kecuali ditentukan lain oleh ketentuan peraturan perundang-undangan;
Hak untuk mendapatkan akses atau kesempatan untuk memperoleh historis data pribadinya yang pernah diserahkan kepada penyelenggara sistem elektronik sepanjang masih sesuai dengan ketentuan peraturan perundang-undangan; dan
Hak untuk meminta pemusnahan data perseorangan tertentu miliknya dalam sistem elektronik yang dikelola oleh penyelenggara sistem elektronik, kecuali ditentukan lain oleh ketentuan peraturan perundang-undangan.
Bab empat menjelaskan tentang kewajiban pengguna data. Bab ini hanya mengandung satu pasal saja yaitu pasal 27, dalam pasal ini dijelaskan bahwa pengguna memiliki empat kewajiban yaitu:
Menjaga kerahasiaan data pribadi yang diperoleh, dikumpulkan, diolah, dan dianalisis.
Menggunakan data pribadi sesuai dengan kebutuhan pengguna saja.
Melindungi data pribadi beserta dokumen yang memuat data pribadi tersebut dari tindakan penyalahgunaan; dan
Bertanggung jawab atas data pribadi yang terdapat dalam penguasaannya, baik penguasaan secara organisasi yang menjadi kewenangannya maupun perorangan, jika terjadi tindakan penyalahgunaan.
Bab ini juga sebagaipengingatuntuk para data scientist agar tidak menyebarluaskan data pribadi kepada yang tidak berkepentingan.
Bab lima menerangkan tentang kewajiban penyelenggara sistem elektronik, dimana penyelenggara sistem elektronik ini memiliki kewajiban untuk:
Melakukan sertifikasi sistem elektronik yang dikelolanya sesuai dengan ketentuan peraturan perundang-undangan.
Menjaga kebenaran, keabsahan, kerahasiaan, keakuratan, dan relevansi serta kesssuaian dengan tujuan perolehan, pengumpulan, pengolahan, penganalisisan, penyimpanan, penampilan, pengumuman, pengiriman, penyebarluasan, dan pemusnahaan data pribadi.
Memberikan secara tertulis kepada pemilik data pribadi jika terjadi kegagalan perlindungan rahasia data pribadi dalam sistem elektronik yang dikelolanya dengan ketentuan pemberitahuan yang dapat dilihat di Permen (4 hal).
Memiliki aturan internal terkait perlindungan data pribadi yang sesuai dengan ketentuan peraturan perundang-undangan.
Menyediakan rekam jejak audit terhadap seluruh kegiatan penyelenggaraan sistem elektronik yang dikelolanya.
Memberikan opsi kepada pemilik data pribadi mengenai data pribadi yang dikelolanya dapat/atau tidak dapat digunakan dan/atau ditampilkan oleh/pada pihak ketiga atas persetujuan sepanjang masih terkait dengan tujuan perolehan dan pengumpulan data pribadi.
Memberikan akses atau kesempatan kepada pemilik data pribadi untuk mengubah atau memperbarui data pribadinya tanpa mengganggu sistem pengelolaan data pribadi, kecuali ditentukan lain oleh ketentuan perundang-undangan.
Memusnahkan data pribadi sesuai dengan ketentuan dalam peraturan menteri ini atau ketentuan peraturan perundang-undangan lainnya yang secara khusus mengatur di masing-masing Instansi pengawas dan pengatur sektor untuk itu; dan
Menyediakan narahubung (contact person) yang mudah dihubungi oleh pemilik data pribadi terkait pengelolaan data pribadinya.
Bab enam membahas tentang penyelesaian sengketa.
Pemilik data pribadi dan penyelenggara sistem elektronik dapat mengajukan pengaduan kepada menteri atas kegagalan perlindungan kerahasiaan data pribadi.
Penyelesaian diupayakan secara musyawarah atau melalui upaya penyelesaian alternatif lainnya.
Alasan-alasan pengaduan:
a. Tidak dilakukannya pemberitahuan secara tertulis atas kegagalan perlindungan rahasia data pribadi oleh penyelenggara sistem elektronik kepada pemilik data pribadi atau penyelenggara sistem elektronik lainnya yang terkait dengan data pribadi tersebut, baik yang berpotensi maupun tidak berpotensi menimbulkan kerugian; atau
b. Telah terjadinya kerugian bagi pemilik data pribadi atau penyelenggara sistem elektronik lainnya yang terkait dengan kegagalan perlindungan rahasia data pribadi tersebut, meskipun telah dilakukan pemberitahuan secara tertulis atas kegagalan perlindungan rahasia data pribadi namun waktu pemberitahuannya yang terlambat.
4. Menteri dapat berkoordinasi dengan pimpinan instansi pengawas dan pengatur sektor untuk menindaklanjuti pengaduan sebagaimana dimaksud pada ayat (1).
Pasal 30
(1) Menteri mendelegasikan kewenangan penyelesaian sengketa data pribadi sebagaimana dimaksud dalam Pasal 29 kepada Direktur Jenderal.
(2) Direktur Jenderal dapat membentuk panel penyelesaian sengketa data pribadi.
Pasal 31 berisi pengaduan dan penanganan pengaduan.
(1) Peran pemerintah dan masyarakat dijabarkan pada Bab VII, yang di dalamnya terdapat Pasal 34 dimana Dirjen bertugas melakukan edukasi kepada masyarakat terkait:
Pengertian data pribadi
Hakikat data pribadi yang bersifat privasi
Pengertian persetujuan dan konsekuensinya
Pengertian sistem elektronik dan mekanismenya
Hak pemilik data pribadi, kewajiban pengguna, dan kewajiban penyelenggara sistem elektronik
Ketentuan mengenai penyelesaian sengketa jika terjadi kegagalan perlindungan rahasia data pribadi oleh penyelenggara sistem elektronik, dan
Ketentuan peraturan perundang-undangan lainnya yang terkait dengan perlindungan data pribadi dalam sistem elektronik.
(2) Masyarakat dapat berpartisipasi dalam pelaksanaan edukasi sebagaimana dimaksud pada ayat (1).
(3) Pelaksanaan ketentuan sebagaimana dimaksud pada ayat (1) dapat dilakukan melalui pendidikan dan/atau pelatihan, advokasi, bimbingan teknis, dan sosialisasi dengan menggunakan berbagai media.
BAB VIII
PENGAWASAN
Pasal 35
(1) Pengawasan terhadap pelaksanaan Peraturan Menteri ini dilaksanakan oleh Menteri dan/atau pimpinan Intansi Pengawas dan Pengatur Sektor.
(2) Pengawasan yang dilaksanakan Menteri sebagaimana dimaksud pada ayat (1) meliputi pengawasan secara langsung maupun tidak langsung.
(3) Menteri berwenang meminta data dan informasi dari Penyelenggara Sistem Elektronik dalam rangka perlindungan Data Pribadi.
(4) Permintaan data dan informasi sebagaimana dimaksud pada ayat (3) dapat dilakukan secara berkala atau sewaktu-waktu apabila diperlukan.
(5) Menteri mendelegasikan kewenangan pengawasan kepada Direktur Jenderal.
BAB IX
SANKSI ADMINISTRATIF
Pasal 36
(1) Setiap Orang yang memperoleh, mengumpulkan, mengolah, menganalisis, menyimpan, menampilkan, mengumumkan, mengirimkan, dan/atau menyebarluaskan Data Pribadi tanpa hak atau tidak sesuai dengan ketentuan dalam Peraturan Menteri ini atau peraturan perundang-undangan lainnya dikenai sanksi administratif sesuai dengan ketentuan peraturan perundang-undangan berupa:
a. peringatan lisan;
b. peringatan tertulis;
c. penghentian sementara kegiatan; dan/atau
d. pengumuman di situs dalam jaringan (website online).
(2) Ketentuan mengenai tata cara pelaksanaan sanksi administratif sebagaimana dimaksud pada ayat (1) diatur dengan Peraturan Menteri.
(3) Sanksi administratif diberikan oleh menteri atau pimpinan instansi pengawas dan pengatur sektor terkait sesuai dengan ketentuan peraturan perundangundangan.
(4) Pengenaan sanksi oleh pimpinan instansi pengawas dan pengatur sektor terkait sebagaimana dimaksud pada ayat tiga (3) dilakukan setelah berkoordinasi dengan Menteri.
BAB X
KETENTUAN LAIN
Pasal 37
(1) Jika Pemilik Data Pribadi merupakan orang yang termasuk dalam kategori anak sesuai dengan ketentuan peraturan perundang-undangan, pemberian Persetujuan yang dimaksud dalam Peraturan Menteri ini dilakukan oleh orang tua atau wali dari anak yang bersangkutan.
(2) Orang tua sebagaimana dimaksud pada ayat (1) merupakan ayah atau ibu kandung anak yang bersangkutan sesuai dengan ketentuan peraturan perundang-undangan.
(3) Wali sebagaimana dimaksud pada ayat (1) merupakan orang yang memiliki kewajiban mengurus anak yang bersangkutan sebelum anak itu dewasa sesuai dengan ketentuan peraturan perundang-undangan.
BAB XI
KETENTUAN PERALIHAN
Pasal 38
Penyelenggara Sistem Elektronik yang telah menyediakan, menyimpan, dan mengelola Data Pribadi sebelum Peraturan Menteri ini berlaku harus tetap menjaga kerahasiaan Data Pribadi yang dikelolanya dan menyesuaikan dengan Peraturan Menteri ini paling lama 2 (dua) tahun.
Pada bab ini, Peraturan Menteri ini mulai berlaku pada tanggal diundangkan.
Video ini merupakan tutorial bagaimana cara menginstall Postgresql di Windows 11.
Beberapa di antara kalian mengalami kesulitan bagaimana cara menggunakan sql scripting di Windows.
Semoga membantu!
Harvard Business Review sangat berjasa dalam memopulerkan profesi Data Scientist. Dalam artikel yang mereka rilis pada Oktober 2012, mereka menekankan bahwa Data Scientist merupakan pekerjaan paling seksi di abad 21. Di mana pun, tidak terkecuali Indonesia, bertebaran lowongan pekerja profesional data dengan iming-iming gaji besar.
Seiring dengan membludaknya minat anak-anak muda berprofesi sebagai data scientist, tentunya persaingan semakin ketat dan menuntut setiap dari kandidat untuk memiliki kualitas dan karakter yang unik.
Kelas Data Science Foundation ini hadir di tengah keringnya kelas-kelas data science daring berbahasa Indonesia yang dekat dengan penerapannya di bidang industri. Dirancang dan dipandu oleh Bernardus Ari Kuncoro, S.T., M.T.I., Head of Analytics Center of Excellence di IYKRA. Seseorang yang telah lebih dari enam tahun malang melintang di dunia profesional data Indonesia, membuat kelas ini lebih menarik dan aplikatif. Tidak hanya berteori. Temukan kekuatan dasar dan inspirasi untuk menjadi profesional data yang kreatif dan ulung!
Setelah mengikuti kelas ini, Anda diharapkan dapat:
Menjadi Data Scientist Junior handal yang dapat memenuhi tugas-tugas dasar sebagai seorang Data Scientist,
Meningkatkan keingintahuan sebesar-besarnya untuk belajar data science, dan
Membangun pola pikir (mindset) sebagai problem solver yang kreatif.