Teknologi & Hukum Digital

Scraping Data dan Hak atas Basis Data: Batas Hukumnya

Terbit Diperbarui 9 menit bacaTim Redaksi InfoHukum

Scraping adalah pengambilan data dari situs web secara otomatis. Teknik ini dipakai untuk riset harga, pemantauan pasar, dan pelatihan model analisis. Pertanyaan hukumnya tidak sederhana: data di situs publik terlihat bebas diambil, padahal bisa melibatkan hak cipta, data pribadi, syarat layanan, dan akses sistem. Artikel ini memetakan risikonya secara umum, tanpa menjanjikan kepastian.

Isi artikel
    ALUR SINGKATMenilai risiko scraping1Tentukan jenis datayang diambil2Baca syarat layanandan aturan situs3Pisahkan data pribadidari data umum4Hindari menembuspembatasan akses5Minta izin tertulisbila memungkinkan
    Ilustrasi edukatif, dibuat khusus untuk artikel ini.

    Apa itu scraping dan basis data

    Scraping (atau web scraping) adalah penggunaan program otomatis untuk mengunduh dan mengekstrak informasi dari halaman web. Hasilnya biasanya disusun menjadi tabel atau basis data, yaitu kumpulan data yang tersusun sistematis dan dapat dicari kembali.

    Contoh pemakaian yang lazim: membandingkan harga produk antartoko, mengumpulkan ulasan, memantau berita, menghimpun daftar properti, atau menyusun kumpulan data untuk riset. Teknik yang sama dapat dipakai untuk tujuan merugikan, seperti menyalin seluruh katalog pesaing atau mengumpulkan nomor telepon orang untuk spam.

    Hukum Indonesia belum memiliki undang-undang khusus tentang scraping. Karena itu, penilaian dilakukan dengan menarik beberapa aturan yang ada: UU Informasi dan Transaksi Elektronik (UU ITE), UU Pelindungan Data Pribadi (UU PDP), UU Hak Cipta, hukum perjanjian, dan hukum persaingan usaha. Tidak ada satu aturan tunggal yang menyatakan scraping sah atau terlarang secara umum; hasilnya bergantung pada data apa yang diambil, bagaimana caranya, dan untuk apa.

    Lima lapis risiko hukum

    Gunakan lima pertanyaan berikut sebagai peta awal.

    LapisPertanyaanSumber aturan
    AksesApakah pengambilan menembus pembatasan seperti login, kata sandi, atau pemblokiran?UU ITE
    Data pribadiApakah data menyangkut orang yang dapat diidentifikasi?UU PDP
    Hak ciptaApakah isi yang diambil adalah ciptaan yang dilindungi, atau kompilasi data yang dilindungi?UU Hak Cipta
    PerjanjianApakah syarat layanan situs melarang pengambilan otomatis?Hukum perjanjian
    DampakApakah pengambilan membebani server atau merugikan usaha pemilik situs?UU ITE, hukum perdata, persaingan usaha

    Satu kegiatan scraping bisa menyentuh lebih dari satu lapis sekaligus.

    Rak server di dalam ruang server
    Foto oleh Kevin Ache di Unsplash

    Lapis pertama: akses ke sistem elektronik

    UU ITE memuat larangan mengakses komputer atau sistem elektronik milik orang lain dengan cara melawan hukum, termasuk dengan menerobos sistem pengamanan. Periksa teks resmi UU ITE (terakhir diubah dengan UU No. 1 Tahun 2024) untuk rumusan dan ancamannya, karena rumusan dapat berubah.

    Garis pembeda yang sering dibahas: mengambil informasi yang memang dibuka untuk publik tanpa menembus pengamanan berbeda dengan menerobos halaman yang dikunci. Beberapa tindakan yang meningkatkan risiko:

    • memakai akun orang lain atau akun palsu untuk masuk;
    • mengakali pembatasan seperti CAPTCHA (tes kecil untuk memastikan pengunjung adalah manusia), pembatasan kecepatan, atau pemblokiran alamat jaringan;
    • memakai kredensial yang bocor;
    • mengambil data dari bagian situs yang jelas-jelas dibatasi untuk anggota;
    • terus mengambil data setelah menerima peringatan tertulis untuk berhenti.

    Penafsiran akses "tanpa hak" masih bergantung pada fakta. Pemilik situs yang memasang pembatasan dan peringatan memiliki dasar lebih kuat untuk menyatakan bahwa akses tidak diizinkan.

    Lapis kedua: data pribadi

    Bagian yang paling sensitif. Data yang tampak publik di internet, seperti nama, foto, nomor telepon, alamat surel, atau unggahan media sosial, tetap data pribadi bila dapat dikaitkan dengan seseorang. UU No. 27 Tahun 2022 (UU PDP) mensyaratkan dasar yang sah untuk memproses data pribadi, tujuan yang jelas, dan pelindungan keamanan data. Mengumpulkan data pribadi secara massal lewat scraping, apalagi untuk dijual atau dipakai pemasaran tanpa persetujuan, berisiko tinggi.

    Hal yang perlu dipertimbangkan:

    • Dasar pemrosesan. Apakah ada persetujuan, kepentingan yang sah, atau dasar lain yang diakui undang-undang? Fakta bahwa data terlihat publik bukan dasar tersendiri.
    • Tujuan. Data yang diambil untuk satu tujuan tidak boleh dialihkan sembarangan.
    • Minimalisasi. Ambil hanya yang diperlukan.
    • Data spesifik. Data kesehatan, keuangan pribadi, dan biometrik mendapat perlindungan lebih ketat.
    • Keamanan dan kebocoran. Penyimpan data wajib menjaga keamanannya. Bila terjadi kegagalan pelindungan, Pasal 46 UU PDP mewajibkan pemberitahuan tertulis paling lambat 3 x 24 jam kepada subjek data dan lembaga (menurut teks Pasal 46 di Pasal.id).
    • Hak subjek data. Orang yang datanya diambil dapat meminta akses, koreksi, atau penghapusan.

    Sanksi UU PDP mencakup sanksi administratif dan pidana; rincian dan angkanya perlu diperiksa pada teks resmi terbaru. Per September 2026 lembaga pengawas PDP belum terbentuk, tetapi kewajiban dalam undang-undang tetap berlaku dan gugatan perdata tetap dimungkinkan. Pelajari perlindungan data pribadi UU PDP, doxing dan penyebaran data pribadi, serta spam penawaran dan data pribadi bocor.

    Lapis ketiga: hak cipta dan hak atas basis data

    UU No. 28 Tahun 2014 tentang Hak Cipta melindungi ciptaan di bidang ilmu pengetahuan, seni, dan sastra. Berkaitan dengan scraping:

    • Isi individual seperti artikel, foto, ilustrasi, dan video adalah ciptaan. Mengambil dan menerbitkan ulang tanpa izin dapat melanggar hak ekonomi pencipta.
    • Kompilasi data. Undang-undang melindungi bentuk-bentuk kompilasi tertentu sebagai ciptaan bila memenuhi syarat orisinalitas dalam pemilihan atau penyusunannya; periksa teks resmi untuk lingkup dan syaratnya. Basis data yang disusun dengan upaya kreatif dalam seleksi dan susunannya berpeluang dilindungi, sedangkan data mentah berupa fakta seperti harga atau tanggal umumnya tidak dilindungi sebagai ciptaan.
    • Hak moral. Pencantuman sumber dan integritas karya perlu dijaga. Menurut salinan UU di Pasal.id, hak moral tertentu berlaku tanpa batas waktu (Pasal 5 dan Pasal 57).
    • Pengecualian. UU Hak Cipta memuat pengecualian terbatas untuk keperluan tertentu, seperti pendidikan, penelitian, atau kutipan, dengan syarat sumber disebutkan dan kewajaran. Rumusan dan batasnya perlu diperiksa pada teks resmi.

    Singkatnya, fakta mentah umumnya bebas, tetapi ekspresi kreatif dan kompilasi yang disusun secara orisinal dilindungi. Menyalin seluruh basis data pesaing, dengan susunan dan isinya, jauh lebih berisiko daripada mengambil beberapa fakta untuk analisis.

    Lapis keempat: syarat layanan dan perjanjian

    Banyak situs memuat syarat layanan yang melarang pengambilan data otomatis. Hukum perjanjian menyatakan bahwa persetujuan terhadap syarat membentuk ikatan. Pertanyaan yang sering muncul: apakah syarat yang hanya tertaut di bagian bawah situs mengikat pengunjung yang tidak mendaftar? Jawabannya bergantung pada cara syarat ditampilkan dan apakah ada tindakan persetujuan (misalnya mendaftar akun dengan mencentang persetujuan). Pengguna yang mendaftar dan menyetujui syarat lebih mudah dianggap terikat.

    Arahan tambahan seperti file robots.txt menyatakan bagian situs mana yang tidak boleh dirayapi (dijelajahi otomatis) oleh program robot. Berkas ini bukan peraturan perundang-undangan, tetapi pelanggaran terhadap petunjuk itu dapat dipakai sebagai bukti bahwa Anda mengetahui keberatan pemilik situs.

    Pelajari kontrak aplikasi dan hak data pengguna dan klausula baku perjanjian.

    Lapis kelima: dampak, persaingan, dan itikad

    Scraping dengan intensitas tinggi dapat memperlambat atau menjatuhkan situs. Pemilik situs dapat menempuh langkah teknis (pemblokiran) dan hukum (somasi, gugatan perbuatan melawan hukum, atau laporan bila ada unsur pidana). Selain itu, mengambil data dari pesaing lalu dipakai untuk menyaingi secara tidak jujur dapat dipersoalkan sebagai perbuatan melawan hukum atau persaingan usaha tidak sehat. Baca perbuatan melawan hukum dan gugatannya dan persaingan usaha: kartel dan KPPU.

    Prinsip itikad baik juga relevan: berbuat jujur, tidak menyamarkan identitas, dan tidak merugikan secara berlebihan memperkuat posisi Anda. Lihat itikad baik dalam perjanjian.

    Langkah mengurangi risiko

    1. Tentukan tujuan dan jenis data. Tulis alasan bisnis dan data apa yang benar-benar perlu.
    2. Utamakan sumber resmi. Cek apakah situs menyediakan antarmuka pemrograman aplikasi (API), unduhan data resmi, atau lisensi. Gunakan jalur itu.
    3. Baca syarat layanan dan robots.txt. Catat apa yang dilarang.
    4. Minta izin tertulis bila datanya bernilai atau jumlahnya besar. Izin tertulis adalah pelindung terkuat.
    5. Hindari data pribadi. Bila harus, pastikan ada dasar hukum, minimalkan, dan anonimkan bila memungkinkan.
    6. Jangan menembus pembatasan akses. Jangan memakai akun palsu atau mengakali pengamanan.
    7. Batasi laju pengambilan supaya tidak membebani server, dan identifikasi diri secara jujur.
    8. Simpan catatan kegiatan: sumber, tanggal, jenis data, dan dasar hukum yang dipakai.
    9. Amankan data hasil. Batasi akses, amankan dengan enkripsi (pengacakan data), dan tetapkan masa simpan.
    10. Siapkan respons bila diterima somasi: hentikan, hapus, dan dokumentasikan.
    Peringatan

    Jangan mengumpulkan massal nomor telepon, surel, atau profil pribadi orang untuk dijual atau dipakai pemasaran tanpa dasar hukum yang jelas, dan jangan menembus halaman yang dikunci untuk mengambil data. Dua hal ini berisiko tinggi di bawah UU PDP dan UU ITE.

    Contoh: Perusahaan rintisan "DataKita" ingin membandingkan harga barang elektronik dari beberapa toko daring. Tim hukumnya memeriksa bahwa dua toko menyediakan API publik, sehingga mereka memakainya. Untuk satu toko tanpa API, mereka mengirim permohonan izin tertulis dan baru mengambil data setelah ada persetujuan. Mereka hanya mengambil harga, nama produk, dan stok, bukan data pembeli atau ulasan yang memuat nama pribadi. Dengan pendekatan itu, risiko hukum mereka jauh lebih kecil dibanding mengambil seluruh halaman dan ulasan secara massal.

    Kesalahan umum

    • Mengira "karena publik, bebas diambil".
    • Mengabaikan syarat layanan dan robots.txt.
    • Mengumpulkan data pribadi tanpa dasar dan tujuan jelas.
    • Mengambil seluruh isi situs pesaing untuk dipublikasikan ulang.
    • Menyamarkan identitas dan memakai banyak alamat jaringan untuk menghindari pemblokiran.
    • Menjual atau membagikan data hasil scraping tanpa memeriksa asal dan haknya.
    • Tidak mencatat dasar hukum dan sumber data.
    • Mengabaikan somasi dari pemilik situs.
    Tips

    Sebelum memulai proyek scraping, buat satu halaman penilaian risiko: data yang diambil, ada tidaknya data pribadi, dasar hukum, izin atau API yang tersedia, dan rencana penghapusan. Dokumen ini membantu bila kelak ada pertanyaan dari pemilik situs atau regulator.

    Bila Anda yang situsnya di-scrape

    Pemilik situs dapat melindungi diri dengan beberapa cara:

    • memasang syarat layanan yang jelas, dengan mekanisme persetujuan, dan robots.txt;
    • membatasi laju akses, memasang CAPTCHA, dan memantau pola pengambilan;
    • menyediakan API berlisensi untuk kebutuhan sah;
    • mengirim somasi tertulis kepada pelaku yang teridentifikasi;
    • menyimpan bukti pengambilan: log server, tanggal, dan dampak;
    • melaporkan ke platform hosting dan, bila ada unsur pidana, kepada aparat;
    • memperhatikan kewajiban sendiri bila data pengguna Anda bocor akibat scraping, termasuk pemberitahuan menurut UU PDP.

    Pelajari somasi dan wanprestasi dan pembuktian bukti elektronik untuk menyusun bukti.

    Peran perjanjian pengolahan data dan pihak ketiga

    Jika Anda memakai jasa pihak ketiga untuk melakukan scraping, misalnya penyedia data atau agensi riset, tanggung jawab tidak berpindah sepenuhnya. Perusahaan yang menentukan tujuan penggunaan data tetap dapat dianggap pengendali data. Buat perjanjian tertulis yang mewajibkan penyedia menjelaskan sumber data, memastikan dasar hukum pengumpulan, menjamin tidak memakai cara terlarang, dan menanggung akibat bila terjadi pelanggaran. Minta pula hak untuk memeriksa dan mengaudit asal data. Data yang dibeli dari penyedia yang tidak jelas sumbernya membawa risiko yang sama dengan mengambilnya sendiri.

    Pertanyaan yang sering diajukan

    Apakah scraping data yang tampil publik di situs selalu legal? Tidak ada jawaban tunggal. Data fakta yang tidak pribadi dan diambil secara wajar dari halaman terbuka berisiko lebih rendah. Risiko naik bila ada data pribadi, pelanggaran syarat layanan, penembusan pembatasan, atau penyalinan kompilasi yang dilindungi.

    Apakah boleh scraping untuk riset akademik? Tujuan riset membantu dari sisi pengecualian hak cipta tertentu dan itikad baik, tetapi tidak menghapus kewajiban terhadap data pribadi dan syarat layanan. Dapatkan izin, anonimkan data, dan dokumentasikan etika riset.

    Apakah boleh melatih model analisis dengan data hasil scraping? Ini wilayah yang belum jelas dalam hukum Indonesia, khususnya soal hak cipta dan data pribadi. Hindari data pribadi dan karya berhak cipta tanpa izin, dan periksa perkembangan aturan terbaru.

    Ringkasan

    • Tidak ada undang-undang khusus scraping; penilaian memakai UU ITE, UU PDP, UU Hak Cipta, dan hukum perjanjian.
    • Risiko tertinggi: menembus pembatasan akses dan mengumpulkan data pribadi.
    • Fakta mentah umumnya bebas, tetapi kompilasi dan ekspresi kreatif dapat dilindungi.
    • Gunakan API atau minta izin tertulis dan batasi laju pengambilan.
    • Catat tujuan, sumber, dan dasar hukum, serta siap menghapus data bila diminta.
    • Pemilik situs dapat melindungi diri dengan syarat layanan, pembatasan teknis, dan somasi.
    📌 Catatan

    Artikel ini informasi umum untuk edukasi, bukan nasihat hukum untuk perkara tertentu. Setiap kasus punya fakta dan dokumen yang berbeda, sehingga sebaiknya dikonsultasikan dengan advokat.

    📚 Sumber Rujukan

    Informasi per Oktober 2026. Peraturan dapat berubah; cek teks resmi di peraturan.go.id atau situs instansi terkait.

    Dasar hukum

    • UU ITE, terakhir diubah dengan UU No. 1 Tahun 2024.
    • UU No. 27 Tahun 2022 tentang Pelindungan Data Pribadi, antara lain Pasal 46.
    • UU No. 28 Tahun 2014 tentang Hak Cipta (antara lain Pasal 5 dan Pasal 57 mengenai hak moral).
    • KUHPerdata (perjanjian dan perbuatan melawan hukum).

    Baca juga

    WhatsApp