Scraping Data dan Hak atas Basis Data: Batas Hukumnya
Scraping adalah pengambilan data dari situs web secara otomatis. Teknik ini dipakai untuk riset harga, pemantauan pasar, dan pelatihan model analisis. Pertanyaan hukumnya tidak sederhana: data di situs publik terlihat bebas diambil, padahal bisa melibatkan hak cipta, data pribadi, syarat layanan, dan akses sistem. Artikel ini memetakan risikonya secara umum, tanpa menjanjikan kepastian.
Isi artikel
Apa itu scraping dan basis data
Scraping (atau web scraping) adalah penggunaan program otomatis untuk mengunduh dan mengekstrak informasi dari halaman web. Hasilnya biasanya disusun menjadi tabel atau basis data, yaitu kumpulan data yang tersusun sistematis dan dapat dicari kembali.
Contoh pemakaian yang lazim: membandingkan harga produk antartoko, mengumpulkan ulasan, memantau berita, menghimpun daftar properti, atau menyusun kumpulan data untuk riset. Teknik yang sama dapat dipakai untuk tujuan merugikan, seperti menyalin seluruh katalog pesaing atau mengumpulkan nomor telepon orang untuk spam.
Hukum Indonesia belum memiliki undang-undang khusus tentang scraping. Karena itu, penilaian dilakukan dengan menarik beberapa aturan yang ada: UU Informasi dan Transaksi Elektronik (UU ITE), UU Pelindungan Data Pribadi (UU PDP), UU Hak Cipta, hukum perjanjian, dan hukum persaingan usaha. Tidak ada satu aturan tunggal yang menyatakan scraping sah atau terlarang secara umum; hasilnya bergantung pada data apa yang diambil, bagaimana caranya, dan untuk apa.
Lima lapis risiko hukum
Gunakan lima pertanyaan berikut sebagai peta awal.
| Lapis | Pertanyaan | Sumber aturan |
|---|---|---|
| Akses | Apakah pengambilan menembus pembatasan seperti login, kata sandi, atau pemblokiran? | UU ITE |
| Data pribadi | Apakah data menyangkut orang yang dapat diidentifikasi? | UU PDP |
| Hak cipta | Apakah isi yang diambil adalah ciptaan yang dilindungi, atau kompilasi data yang dilindungi? | UU Hak Cipta |
| Perjanjian | Apakah syarat layanan situs melarang pengambilan otomatis? | Hukum perjanjian |
| Dampak | Apakah pengambilan membebani server atau merugikan usaha pemilik situs? | UU ITE, hukum perdata, persaingan usaha |
Satu kegiatan scraping bisa menyentuh lebih dari satu lapis sekaligus.
Lapis pertama: akses ke sistem elektronik
UU ITE memuat larangan mengakses komputer atau sistem elektronik milik orang lain dengan cara melawan hukum, termasuk dengan menerobos sistem pengamanan. Periksa teks resmi UU ITE (terakhir diubah dengan UU No. 1 Tahun 2024) untuk rumusan dan ancamannya, karena rumusan dapat berubah.
Garis pembeda yang sering dibahas: mengambil informasi yang memang dibuka untuk publik tanpa menembus pengamanan berbeda dengan menerobos halaman yang dikunci. Beberapa tindakan yang meningkatkan risiko:
- memakai akun orang lain atau akun palsu untuk masuk;
- mengakali pembatasan seperti CAPTCHA (tes kecil untuk memastikan pengunjung adalah manusia), pembatasan kecepatan, atau pemblokiran alamat jaringan;
- memakai kredensial yang bocor;
- mengambil data dari bagian situs yang jelas-jelas dibatasi untuk anggota;
- terus mengambil data setelah menerima peringatan tertulis untuk berhenti.
Penafsiran akses "tanpa hak" masih bergantung pada fakta. Pemilik situs yang memasang pembatasan dan peringatan memiliki dasar lebih kuat untuk menyatakan bahwa akses tidak diizinkan.
Lapis kedua: data pribadi
Bagian yang paling sensitif. Data yang tampak publik di internet, seperti nama, foto, nomor telepon, alamat surel, atau unggahan media sosial, tetap data pribadi bila dapat dikaitkan dengan seseorang. UU No. 27 Tahun 2022 (UU PDP) mensyaratkan dasar yang sah untuk memproses data pribadi, tujuan yang jelas, dan pelindungan keamanan data. Mengumpulkan data pribadi secara massal lewat scraping, apalagi untuk dijual atau dipakai pemasaran tanpa persetujuan, berisiko tinggi.
Hal yang perlu dipertimbangkan:
- Dasar pemrosesan. Apakah ada persetujuan, kepentingan yang sah, atau dasar lain yang diakui undang-undang? Fakta bahwa data terlihat publik bukan dasar tersendiri.
- Tujuan. Data yang diambil untuk satu tujuan tidak boleh dialihkan sembarangan.
- Minimalisasi. Ambil hanya yang diperlukan.
- Data spesifik. Data kesehatan, keuangan pribadi, dan biometrik mendapat perlindungan lebih ketat.
- Keamanan dan kebocoran. Penyimpan data wajib menjaga keamanannya. Bila terjadi kegagalan pelindungan, Pasal 46 UU PDP mewajibkan pemberitahuan tertulis paling lambat 3 x 24 jam kepada subjek data dan lembaga (menurut teks Pasal 46 di Pasal.id).
- Hak subjek data. Orang yang datanya diambil dapat meminta akses, koreksi, atau penghapusan.
Sanksi UU PDP mencakup sanksi administratif dan pidana; rincian dan angkanya perlu diperiksa pada teks resmi terbaru. Per September 2026 lembaga pengawas PDP belum terbentuk, tetapi kewajiban dalam undang-undang tetap berlaku dan gugatan perdata tetap dimungkinkan. Pelajari perlindungan data pribadi UU PDP, doxing dan penyebaran data pribadi, serta spam penawaran dan data pribadi bocor.
Lapis ketiga: hak cipta dan hak atas basis data
UU No. 28 Tahun 2014 tentang Hak Cipta melindungi ciptaan di bidang ilmu pengetahuan, seni, dan sastra. Berkaitan dengan scraping:
- Isi individual seperti artikel, foto, ilustrasi, dan video adalah ciptaan. Mengambil dan menerbitkan ulang tanpa izin dapat melanggar hak ekonomi pencipta.
- Kompilasi data. Undang-undang melindungi bentuk-bentuk kompilasi tertentu sebagai ciptaan bila memenuhi syarat orisinalitas dalam pemilihan atau penyusunannya; periksa teks resmi untuk lingkup dan syaratnya. Basis data yang disusun dengan upaya kreatif dalam seleksi dan susunannya berpeluang dilindungi, sedangkan data mentah berupa fakta seperti harga atau tanggal umumnya tidak dilindungi sebagai ciptaan.
- Hak moral. Pencantuman sumber dan integritas karya perlu dijaga. Menurut salinan UU di Pasal.id, hak moral tertentu berlaku tanpa batas waktu (Pasal 5 dan Pasal 57).
- Pengecualian. UU Hak Cipta memuat pengecualian terbatas untuk keperluan tertentu, seperti pendidikan, penelitian, atau kutipan, dengan syarat sumber disebutkan dan kewajaran. Rumusan dan batasnya perlu diperiksa pada teks resmi.
Singkatnya, fakta mentah umumnya bebas, tetapi ekspresi kreatif dan kompilasi yang disusun secara orisinal dilindungi. Menyalin seluruh basis data pesaing, dengan susunan dan isinya, jauh lebih berisiko daripada mengambil beberapa fakta untuk analisis.
Lapis keempat: syarat layanan dan perjanjian
Banyak situs memuat syarat layanan yang melarang pengambilan data otomatis. Hukum perjanjian menyatakan bahwa persetujuan terhadap syarat membentuk ikatan. Pertanyaan yang sering muncul: apakah syarat yang hanya tertaut di bagian bawah situs mengikat pengunjung yang tidak mendaftar? Jawabannya bergantung pada cara syarat ditampilkan dan apakah ada tindakan persetujuan (misalnya mendaftar akun dengan mencentang persetujuan). Pengguna yang mendaftar dan menyetujui syarat lebih mudah dianggap terikat.
Arahan tambahan seperti file robots.txt menyatakan bagian situs mana yang tidak boleh dirayapi (dijelajahi otomatis) oleh program robot. Berkas ini bukan peraturan perundang-undangan, tetapi pelanggaran terhadap petunjuk itu dapat dipakai sebagai bukti bahwa Anda mengetahui keberatan pemilik situs.
Pelajari kontrak aplikasi dan hak data pengguna dan klausula baku perjanjian.
Lapis kelima: dampak, persaingan, dan itikad
Scraping dengan intensitas tinggi dapat memperlambat atau menjatuhkan situs. Pemilik situs dapat menempuh langkah teknis (pemblokiran) dan hukum (somasi, gugatan perbuatan melawan hukum, atau laporan bila ada unsur pidana). Selain itu, mengambil data dari pesaing lalu dipakai untuk menyaingi secara tidak jujur dapat dipersoalkan sebagai perbuatan melawan hukum atau persaingan usaha tidak sehat. Baca perbuatan melawan hukum dan gugatannya dan persaingan usaha: kartel dan KPPU.
Prinsip itikad baik juga relevan: berbuat jujur, tidak menyamarkan identitas, dan tidak merugikan secara berlebihan memperkuat posisi Anda. Lihat itikad baik dalam perjanjian.
Langkah mengurangi risiko
- Tentukan tujuan dan jenis data. Tulis alasan bisnis dan data apa yang benar-benar perlu.
- Utamakan sumber resmi. Cek apakah situs menyediakan antarmuka pemrograman aplikasi (API), unduhan data resmi, atau lisensi. Gunakan jalur itu.
- Baca syarat layanan dan robots.txt. Catat apa yang dilarang.
- Minta izin tertulis bila datanya bernilai atau jumlahnya besar. Izin tertulis adalah pelindung terkuat.
- Hindari data pribadi. Bila harus, pastikan ada dasar hukum, minimalkan, dan anonimkan bila memungkinkan.
- Jangan menembus pembatasan akses. Jangan memakai akun palsu atau mengakali pengamanan.
- Batasi laju pengambilan supaya tidak membebani server, dan identifikasi diri secara jujur.
- Simpan catatan kegiatan: sumber, tanggal, jenis data, dan dasar hukum yang dipakai.
- Amankan data hasil. Batasi akses, amankan dengan enkripsi (pengacakan data), dan tetapkan masa simpan.
- Siapkan respons bila diterima somasi: hentikan, hapus, dan dokumentasikan.
Jangan mengumpulkan massal nomor telepon, surel, atau profil pribadi orang untuk dijual atau dipakai pemasaran tanpa dasar hukum yang jelas, dan jangan menembus halaman yang dikunci untuk mengambil data. Dua hal ini berisiko tinggi di bawah UU PDP dan UU ITE.
Contoh: Perusahaan rintisan "DataKita" ingin membandingkan harga barang elektronik dari beberapa toko daring. Tim hukumnya memeriksa bahwa dua toko menyediakan API publik, sehingga mereka memakainya. Untuk satu toko tanpa API, mereka mengirim permohonan izin tertulis dan baru mengambil data setelah ada persetujuan. Mereka hanya mengambil harga, nama produk, dan stok, bukan data pembeli atau ulasan yang memuat nama pribadi. Dengan pendekatan itu, risiko hukum mereka jauh lebih kecil dibanding mengambil seluruh halaman dan ulasan secara massal.
Kesalahan umum
- Mengira "karena publik, bebas diambil".
- Mengabaikan syarat layanan dan robots.txt.
- Mengumpulkan data pribadi tanpa dasar dan tujuan jelas.
- Mengambil seluruh isi situs pesaing untuk dipublikasikan ulang.
- Menyamarkan identitas dan memakai banyak alamat jaringan untuk menghindari pemblokiran.
- Menjual atau membagikan data hasil scraping tanpa memeriksa asal dan haknya.
- Tidak mencatat dasar hukum dan sumber data.
- Mengabaikan somasi dari pemilik situs.
Sebelum memulai proyek scraping, buat satu halaman penilaian risiko: data yang diambil, ada tidaknya data pribadi, dasar hukum, izin atau API yang tersedia, dan rencana penghapusan. Dokumen ini membantu bila kelak ada pertanyaan dari pemilik situs atau regulator.
Bila Anda yang situsnya di-scrape
Pemilik situs dapat melindungi diri dengan beberapa cara:
- memasang syarat layanan yang jelas, dengan mekanisme persetujuan, dan robots.txt;
- membatasi laju akses, memasang CAPTCHA, dan memantau pola pengambilan;
- menyediakan API berlisensi untuk kebutuhan sah;
- mengirim somasi tertulis kepada pelaku yang teridentifikasi;
- menyimpan bukti pengambilan: log server, tanggal, dan dampak;
- melaporkan ke platform hosting dan, bila ada unsur pidana, kepada aparat;
- memperhatikan kewajiban sendiri bila data pengguna Anda bocor akibat scraping, termasuk pemberitahuan menurut UU PDP.
Pelajari somasi dan wanprestasi dan pembuktian bukti elektronik untuk menyusun bukti.
Peran perjanjian pengolahan data dan pihak ketiga
Jika Anda memakai jasa pihak ketiga untuk melakukan scraping, misalnya penyedia data atau agensi riset, tanggung jawab tidak berpindah sepenuhnya. Perusahaan yang menentukan tujuan penggunaan data tetap dapat dianggap pengendali data. Buat perjanjian tertulis yang mewajibkan penyedia menjelaskan sumber data, memastikan dasar hukum pengumpulan, menjamin tidak memakai cara terlarang, dan menanggung akibat bila terjadi pelanggaran. Minta pula hak untuk memeriksa dan mengaudit asal data. Data yang dibeli dari penyedia yang tidak jelas sumbernya membawa risiko yang sama dengan mengambilnya sendiri.
Pertanyaan yang sering diajukan
Apakah scraping data yang tampil publik di situs selalu legal? Tidak ada jawaban tunggal. Data fakta yang tidak pribadi dan diambil secara wajar dari halaman terbuka berisiko lebih rendah. Risiko naik bila ada data pribadi, pelanggaran syarat layanan, penembusan pembatasan, atau penyalinan kompilasi yang dilindungi.
Apakah boleh scraping untuk riset akademik? Tujuan riset membantu dari sisi pengecualian hak cipta tertentu dan itikad baik, tetapi tidak menghapus kewajiban terhadap data pribadi dan syarat layanan. Dapatkan izin, anonimkan data, dan dokumentasikan etika riset.
Apakah boleh melatih model analisis dengan data hasil scraping? Ini wilayah yang belum jelas dalam hukum Indonesia, khususnya soal hak cipta dan data pribadi. Hindari data pribadi dan karya berhak cipta tanpa izin, dan periksa perkembangan aturan terbaru.
Ringkasan
- Tidak ada undang-undang khusus scraping; penilaian memakai UU ITE, UU PDP, UU Hak Cipta, dan hukum perjanjian.
- Risiko tertinggi: menembus pembatasan akses dan mengumpulkan data pribadi.
- Fakta mentah umumnya bebas, tetapi kompilasi dan ekspresi kreatif dapat dilindungi.
- Gunakan API atau minta izin tertulis dan batasi laju pengambilan.
- Catat tujuan, sumber, dan dasar hukum, serta siap menghapus data bila diminta.
- Pemilik situs dapat melindungi diri dengan syarat layanan, pembatasan teknis, dan somasi.
Artikel ini informasi umum untuk edukasi, bukan nasihat hukum untuk perkara tertentu. Setiap kasus punya fakta dan dokumen yang berbeda, sehingga sebaiknya dikonsultasikan dengan advokat.
- UU No. 27 Tahun 2022, Pasal 46 (Pasal.id) — pasal.id/peraturan/uu/uu-no-27-tahun-2022/pasal-46
- UU Hak Cipta No. 28 Tahun 2014 (Pasal.id) — pasal.id/peraturan/uu/uu-no-28-tahun-2014
- Kementerian Komunikasi dan Digital, situs resmi — www.komdigi.go.id
Informasi per Oktober 2026. Peraturan dapat berubah; cek teks resmi di peraturan.go.id atau situs instansi terkait.
Dasar hukum
- UU ITE, terakhir diubah dengan UU No. 1 Tahun 2024.
- UU No. 27 Tahun 2022 tentang Pelindungan Data Pribadi, antara lain Pasal 46.
- UU No. 28 Tahun 2014 tentang Hak Cipta (antara lain Pasal 5 dan Pasal 57 mengenai hak moral).
- KUHPerdata (perjanjian dan perbuatan melawan hukum).
Baca juga
- Perlindungan Data Pribadi: Hak Anda Berdasarkan UU PDP
- Doxing dan Penyebaran Data Pribadi: Langkah Hukum dan Cara Menghapus Konten
- Spam Penawaran dan Data Pribadi Bocor: Dari Mana Nomor Anda Didapat dan Apa yang Bisa Dilakukan
- Hak Cipta untuk Karya Digital: Foto, Desain, dan Konten
- Perbuatan Melawan Hukum: Dasar Gugatan Ganti Rugi
Ada masukan atau pendapat lain? Kirim lewat WhatsApp atau telepon 0813-3040-8000.