Postingan

Menampilkan postingan dengan label Teknologi Big Data

Membuat dan Menjalankan Aplikasi Apache Spark dengan Intellij IDEA pada OS Windows

Gambar
    Pada artikel " Apache Spark: Perangkat Lunak Analisis Terpadu untuk Big Data " telah diperkenalkan secara singkat tentang apa itu Apache Spark dan kegunaannya. Kali ini kita akan mencoba untuk membuat dan menjalankan sebuah aplikasi Spark sederhana dengan sumber data dari Hadoop yang telah di-install dengan mode standalone pada OS Windows. Tutorial ini menggunakan Windows 10 dan Software berikut: Java JDK-1.8; cara install ada di Cara Sederhana Install Hadoop 2 mode Standalone pada Windows 7 dan Windows 10 Apache Hadoop-2.7.7; cara install ada di Cara Sederhana Install Hadoop 2 mode Standalone pada Windows 7 dan Windows 10 IDE Intellij IDEA; download dari https://www.jetbrains.com/idea/     Sebelum mulai install Spark, jalankan Hadoop yang sudah diinstall. Buat direktori di Hadoop yang akan digunakan untuk menyimpan file teks yang akan diproses menggunakan Apache Spark. Gunakan perintah berikut:     hdfs dfs -mkdir /tmp/input     Kemudian, cop...

Cara Sederhana Install Hadoop 2 mode Standalone pada Windows 7 dan Windows 10

Gambar
    Hadoop adalah framework open-source berbasis Java yang ditujukan untuk memproses data secara terdistribusi melalui kemampuan penyimpanan data secara terdistribusi. Hadoop dapat menyimpan data apapun dan memprosesnya dengan model pemrograman MapReduce. Hadoop didesain untuk dapat mengatasi permasalahan yang disebabkan oleh kegagalan fungsi hardware sehingga dapat mencegah hilangnya data maupun proses kerja. Hadoop memotong-motong data untuk didistribusikan ke setiap node di dalam suatu kluster untuk kemudian diproses secara paralel dan lokal di tiap node yang bersangkutan. Kebutuhan Software Berikut adalah software yang harus disiapkan untuk dapat menjalankan Hadoop 2 mode standalone dengan OS Windows 7 atau Windows 10: Java JDK 1.8, dapat diunduh dari https://www.oracle.com/technetwork/java/javase/downloads/jdk8-downloads-2133151.html Apache Hadoop 2.7.7, dapat diunduh dari https://hadoop.apache.org/releases.html Hadoop Patch File untuk OS Windows, dapat diunduh dari http...

Apache Spark: Perangkat Lunak Analisis Terpadu untuk Big Data

Gambar
       Apache Spark adalah engine ( perangkat lunak ) analisis terpadu super cepat untuk memproses data dalam skala besar; meliputi Big Data dan machine learning. Secara lebih detailnya, Apache Spark dapat didefinisikan sebagai engine ( perangkat lunak ) untuk memproses data dalam skala besar secara in-memory, dilengkapi dengan API pengembangan yang elegan dan ekspresif guna memudahkan para pekerja data dalam mengeksekusi pekerjaan-pekerjaan yang membutuhkan perulangan akses yang cepat terhadap data yang diproses, seperti halnya streaming, machine learning, maupun SQL, secara efisien.        Apache Spark terdiri atas Spark Core ( inti ) dan sekumpulan library perangkat lunak. Inti dari Spark adalah distributed execution engine, dan API Java, Scala maupun Python disediakan sebagai platform untuk mengembangkan aplikasi ETL ( Extract, Transform, Load ) terdistribusi. Kemudian, library perangkat lunak tambahan, yang dibangun diatas inti ( core )-nya, ...

Demi Optimalkan Layanan Kredit, Bank Mandiri Alokasikan Rp 136 Miliar untuk Berdayakan Big Data

Adopsi teknologi Big Data di Indonesia kini sudah bukan sekedar wacana di tingkat penelitian dan prototyping saja, tetapi sudah sampai pada tahap implementasi secara nyata, baik di dunia bisnis maupun di lingkungan institusi pemerintahan. Terlebih lagi, pemberdayaan teknologi yang masih tergolong baru ini, khususnya di Indonesia, sudah menunjukkan hasil yang nyata pula. Sebut saja Go-Jek, sebuah produk bisnis inovatif yang telah sukses merealisasikan berbagai jenis layanan dalam satu aplikasi. Hal ini dimungkinkan berkat keberhasilan Go-Jek membangun back-end Big Data yang solid dan komprehensif. Kemudian, di kalangan instansi pemerintahan, Ditjen Pajak juga sudah menggelontorkan dana triliunan rupiah demi optimalkan penerimaan pajak melalui pemberdayaan Big Data. Demikian juga dengan Bank Indonesia, telah mengadopsi teknologi Big Data sejak tahun 2014 silam yang diberdayakan dalam perumusan kebijakan. Bank Mandiri Sadar Potensi Big Data Menyadari potensi Big Data yang begitu signif...

Dengan 1,5 Triliun Rupiah, Ditjen Pajak Wujudkan Implementasi Teknologi Big Data Guna Amankan Pajak

Mengikuti Sukses Implementasi Teknologi Big Data Pemberitaan tentang suksesnya implementasi teknologi Big Data di negara-negara maju oleh perusahaan-perusahaan web service seperti halnya Google, Facebook, Amazon, maupun Yahoo!, mungkin sudah cukup sering kita simak. Bukan hanya oleh sektor swasta, di Amerika Serikat teknologi Big Data juga telah sukses diterapkan oleh institusi-institusi pemerintah. Sebagai salah satu contohnya, sebut saja NOAA (National Oceanic and Atmospheric Administration) yang mengelola 30 petabytes data baru pertahunnya. Data-data tersebut berasal satelit, kapal laut, pesawat terbang, buoy, dan sensor-sensor lainnya, yang kemudian diberdayakan untuk menyediakan layanan cuaca nasional (National Weather Service). Layanan cuaca ini menyediakan informasi seputar peringatan cuaca buruk maupun petunjuk cuaca untuk sektor publik dan swasta, termasuk Departemen Pertahanan Amerika Serikat dan NASA. Dalam hal ini, Indonesia tidak mau ketinggalan, dalam beberapa tahun terak...

Teknologi Big Data Fundamental: Kelebihan Hadoop versi 2 dibanding Hadoop versi 1

Gambar
Apa itu Apache Hadoop Apache Hadoop adalah software framework yang memungkinkan pemrosesan data berukuran besar secara terdistribusi dengan melibatkan berkluster-kluster komputer. Hadoop didesain untuk dapat bekerja secara efektif baik dalam skala terkecil yang hanya melibatkan satu server hingga skala besar yang memperkerjakan ribuan komputer dimana masing-masing komputer tersebut memfasilitasi komputasi dan penyimpanan data secara lokal. Untuk menjamin High Availability, Hadoop tidak menggantungkannya pada hardware yang digunakan, tetapi framework Hadoop itu sendiri telah didesain untuk dapat mendeteksi dan menangani gagal fungsi (failure) pada level/layer aplikasi. Framework Hadoop terdiri atas 4 komponen (modul) utama, sebagai berikut: 1. Hadoop Distributed File System (HDFS), adalah file-system terdistribusi yang memfasilitasi penyimpanan data secara terdistribusi dalam kluster komputer. 2. Hadoop MapReduce, adalah sebuah sistem yang ditujukan untuk memproses data berukuran besar ...

Apache Nutch Crawl Script : Web Crawling hanya dengan Satu Command

Pada artikel Membangun Mesin Pencari dengan Kombinasi Apache Nutch, Elasticsearch, dan MongoDB telah dibahas secara singkat tentang apa itu Apache Nutch, apa itu Elasticsearch, dan Apa itu MongoDB. Kemudian, pada artikel Crawling dan Indexing Berbasis Apache Nutch, Elasticsearch, dan MongoDB telah dijelaskan langkah-langkah website crawling menggunakan Apache Nutch yang meliputi 6 tahap dengan mengeksekusi 6 command Apache Nutch, yaitu: inject, generate, fetch, parse, updatedb, index. Telah disebutkan pula bahwa proses crawling yang meliputi 6 langkah ini tidak cukup hanya dilakukan satu kali untuk dapat meng-index seluruh isi website yang dijadikan target. Beruntungnya, Apache Nutch juga dilengkapi dengan script yang dapat mempersingkat proses crawling dari 6 langkah menjadi satu langkah saja, yaitu dengan mengeksekusi perintah berikut: hennywijaya$ runtime/local/bin/crawl urls/ webpage3 http://localhost:9300/nutch/ 3 Adapun arguments dari perintah diatas adalah: 1. urls adalah dir...

Crawling dan Indexing Berbasis Apache Nutch, Elasticsearch, dan MongoDB

Gambar
Pada artikel sebelumnya ( Membangun Mesin Pencari dengan Kombinasi Apache Nutch, Elasticsearch, dan MongoDB ) telah dibahas secara singkat tentang apa itu Apache Nutch, apa itu Elasticsearch, dan Apa itu MongoDB. Pada bagian 2 ini akan dibahas langkah demi langkah tentang bagaimana membangun web crawler dengan Apache Nutch, melakukan crawling terhadap website yang dijadikan target, kemudian menyimpan hasil crawling tersebut dalam bentuk data terstruktur menggunakan MongoDB, serta membangun mensin pencari menggunakan Elasticsearch sehingga dapat dilakukan penelisikan dan analisis terhadap data-data hasil crawling tersebut. Software yang harus disiapkan sebelumnya diantaranya (harus sudah siap digunakan) : 1. OS jenis Linux, bisa CentOS 7, Ubuntu 14.0.4 LTS, Mac OSX 10.9 (Mavericks) 2. Java, dalam hal ini digunakan Oracle JRE 1.8 atau Oracle JRE 1.7 3. Apache Ant Java dan Apache Ant harus sudah diinstal dengan benar di OS yang digunakan. Disini tidak akan dibahas tentang cara-cara insta...