Contributor : Galih Dea | Date : 2020-01-22
Teknologi dari hari ke hari semakin berkembang. Untuk mewadahi hal tersebut, machine learning adalah ilmu yang diperlukan bagi para produsen teknologi. Dengan machine learning, beragam kegiatan dari sistem yang sebelumnya hanya bisa dikendalikan oleh penggunanya, sekarang dapat bergerak secara mandiri karena kemampuannya untuk “belajar” seiring dengan data-data yang dihasilkan.
Namun, layaknya penerapan teknologi lain, selalu saja ada tantangan yang harus dihadapi oleh produsen teknologi ketika mulai mengimplementasikan machine learning dalam produk mereka. Salah satu diantaranya, setelah tantangan organisasional, ada tantangan infrastruktur yang meliputi perangkat yang mendukung implementasi dari machine learning tersebut. Tantangan infrastruktur sendiri meliputi beberapa hal, seperti penyimpanan, komputasi, dan elastisitas antar infrastruktur nya.
Sampai saat ini, belum ada satu platform yang mampu memenuhi kebutuhan akan berbagai sumber data dan kasus mengenai wadah penyimpanan data yang dapat tahan di hampir segala kondisi. Hal ini juga berlaku pada proyek yang berkaitan dengan machine learning, yang umumnya dilakukan pada data yang tak terstruktur, baik tekstual maupun visual, atau grafik yang terarah maupun tak terarah, yang dapat mendefinisikan siapa pengguna biasa atau sekelompok penjahat. Pertimbangan akan penyimpanan ini meliputi tiga hal, seperti struktur data, jejak digital, dan penggunaan pola. Permintaan penggunaan data acapkali disebut dengan temperatur data, dengan kebutuhan tinggi disebut dengan “panas” dan kebutuhan yang lebih rendah disebut dengan “dingin”. Terdapat beberapa opsi platform penyimpanan populer yang dapat digunakan, seperti basis data relasional tradisional, Hadoop Distributed File System, Cassandra, dan lain sebagainya. Akan tetapi, merancang solusi penyimpanan yang dapat digunakan oleh seluruh bagian organisasi, yang terdiri dari beberapa platform, dapat menjadi tantangan berlanjut yang harus dihadapi, karena kebutuhan mengenai data dan teknologi akan selalu berkembang.
Berbagai tugas yang berkaitan dengan machine learning dianggap memiliki komputasi yang intensif. Pada dasarnya, semakin banyak data yang dilatih pada algoritma machine learning, hasil yang muncul akan lebih baik. Walaupun beberapa orang keliru bahwa era big data mematikan kegiatan sampling, para data scientist yang terpelajar memahami bahwa teknik sampling yang bergantung pada komputasi dapat memperbaiki hasil yang muncul pada beragam kasus. Selanjutnya, persiapan data dan teknik pemodelan harus diracik berulang-ulang oleh orang yang bertugas sebagai operator, demi mendapatkan hasil terbaik. Menunggu berhari-hari ketika data di-preprocess atau ketika model sedang dilatih sering kali melelahkan dan dapat berujung menghasilkan informasi yang kurang baik, dimana sebagian besar tugas dilaksanakan dalam batasan waktu tertentu.
Oleh karena itu, diperlukan infrastruktur komputasi yang tangguh dan aman bagi data scientist untuk menjalankan berbagai siklus melalui beragam teknik persiapan data dan model yang berbeda demi mendapatkan solusi terbaik dalam waktu yang tergolong masuk akal. Ada dua pendekatan yang dapat dilakukan untuk mendapatkan infrastruktur yang memadai. Satu, akselerasi perangkat keras, dengan menggunakan berbagai perangkat yang dapat menunjang machine learning, seperti penggunaan solid-state hard drive (SSD) dan penggunaan dedicated graphical processing unit (GPU). Dua, komputasi yang terdistribusi, dengan menggunakan komputer berjumlah besar, untuk mendapatkan waktu eksekusi yang lebih singkat, namun keterbatasan algoritma machine learning dan lingkungan yang terdistribusi yang kurang didukung ini membuatnya kurang cocok di beberapa kondisi.
Pada tugas yang berkaitan dengan machine learning, baik penyimpanan maupun konsumsi sumber daya komputasi dapat terlihat sangat dinamis, memerlukan jumlah besar dalam interval tertentu dan jumlah kecil di interval lainnya. Bagi data scientist, hal ini berlaku ketika mengembangkan purwarupa dari model melalui laptop dengan sekelompok data, dan tidak butuh waktu lama untuk mengkonsumsi lebih banyak sumber daya komputasi dalam melatih model pada data set yang lebih besar. Elastisitas infrastruktur membuat penggunaan sumber daya komputasi dan pengeluaran finansial menjadi dapat digunakan secara lebih optimal.
Cloud computing membuat produsen dapat mengatur platform komputasi sesuai yang dibutuhkan, serta mengeluarkan biaya untuk perangkat keras dan lunak yang benar-benar dibutuhkan. Dengan hadirnya berbagai layanan cloud computing yang dapat dipercaya, memindahkan data pada satu atau lebih remote server dan menjalankan sistem machine learning pada data terkait akan menjadi lebih mudah. Disamping itu, produsen dapat memilih untuk menyimpan data mereka di wadah tertentu, sekaligus membangun infrastruktur cloud computing mereka sendiri untuk memangkas pengeluaran yang dapat memberikan keuntungan secara berkelanjutan.
Dan tiga hal tersebut merupakan beberapa tantangan infrastruktur yang harus siap dihadapi oleh produsen teknologi, terutama ketika mereka memutuskan untuk menerapkan machine learning pada produknya. Dengan memahami tantangan-tantangan tersebut dan menemukan solusi yang cocok, produsen teknologi akan menjadi lebih diuntungkan, baik dalam proses pengembangan maupun dari sisi finansialnya.
Sumber Berita:
"The Evolution of Analytics" - Patrick Hall, Wen Phan, Katie Whitson. O'Reilly Media Inc., 2016
Sumber Gambar:
"Trends and Challenges in Cloud Computing with Deep Learning" - hackernoon.com
Tags :
technology, machine learning, company, infrastructure, challenge, storage, penyimpanan, komputasi, computation, elasticity, cloud computing, vantura