Oleh: Zainal A.N.

Beritamerdekaonline.com – Indonesia memiliki kekayaan naskah kuno yang melimpah dan tersebar di berbagai daerah. Naskah-naskah tersebut tidak hanya merekam perkembangan bahasa dan sastra, tetapi juga menyimpan pengetahuan mengenai sejarah, budaya, ilmu pengetahuan, dan kehidupan masyarakat masa lalu. Namun, keberadaan naskah kuno menghadapi persoalan serius berupa kerusakan fisik dan keterbatasan akses. Berdasarkan data yang diambil dari laman Khastara Perpusnas, dapat diketahui bahwa dari total 34.134 koleksi naskah kuno Perpusnas, 32.872 naskah dalam keadaan baik, 518 dalam keadaan rusak ringan, 393 dalam keadaan rusak sedang, 273 dalam keadaan, rusak berat, dan 78 naskah dalam keadaan rusak sangat berat. Kondisi tersebut menunjukkan pentingnya preservasi dan digitalisasi sebagai bagian dari upaya menyelamatkan sumber pengetahuan yang berharga.

Digitalisasi naskah merupakan proses alih media dari bentuk fisik ke format digital sehingga naskah dapat disimpan, diakses, dan diolah dengan lebih mudah. Widianarti menjelaskan bahwa digitalisasi merupakan proses pemindahan konten naskah dari bentuk fisik ke bentuk digital oleh petugas digitalisasi. Almis dan Wijayanti (2023) membagi proses tersebut menjadi tiga tahap, yaitu pradigitalisasi, digitalisasi, dan pascadigitalisasi. Pradigitalisasi meliputi persiapan peralatan dan pemilihan naskah. Tahap digitalisasi dilakukan melalui pemindaian atau pemotretan dengan perangkat yang mampu menghasilkan citra berkualitas tinggi. Selanjutnya, tahap pascadigitalisasi mencakup penyimpanan, pengolahan, dan penyusunan metadata agar hasil digitalisasi dapat ditemukan dan dimanfaatkan oleh masyarakat.

Digitalisasi Naskah Kuno dan Pengembangan Korpus Kebahasaan

Lebih jauh, digitalisasi dapat menjadi pintu masuk bagi pengembangan korpus kebahasaan berbasis naskah kuno. Digitalisasi tidak seharusnya berhenti pada penyediaan gambar naskah, tetapi dapat dilanjutkan dengan proses pengenalan teks, transkripsi, anotasi, dan penyusunan data yang dapat dibaca mesin. Dengan demikian, naskah kuno yang sebelumnya sulit diakses dapat diubah menjadi sumber data kebahasaan yang memungkinkan penelitian dalam skala lebih besar. Setiawan Hadi dkk. (2025) menunjukkan bahwa digitalisasi yang sistematis dapat menjadi fondasi bagi pengembangan arsip digital dan korpus yang memperkaya penelitian kebahasaan.

Perkembangan teknologi kecerdasan buatan dapat menjadi kunci dalam pengembangan arsip digital dan korpus. Peneliti dari Stanford University, Sina Semnani, memperkenalkan CHURRO, sebuah model kecerdasan buatan berupa pengenalan teks kuno yang dirancang untuk membaca dokumen sejarah dengan memanfaatkan vision-language model. Semnani menggunakan kumpulan data berupa 155 korpus historis yang mencakup 99.491 halaman. Data ini menggunakan 14 jenis aksara dari bahasa-bahasa kuno yang telah punah. Sementara itu, Clanuwat dkk. telah mengembangkan KuroNet, sebuah model kecerdasan buatan untuk mengenali Kuzushiji, gaya tulisan Jepang kuno yang telah punah. KuroNet mampu mengenali karakter pada satu naskah secara langsung dengan memanfaatkan konteks dan tata letak teks. Contoh lainnya adalah TRIDIS yang dikembangkan Torres Aguilar, yaitu korpus digital yang berisi kumpulan dokumen dari abad pertengahan hingga awal era modern. Korpus ini dikembangkan untuk mendukung penelitian terhadap naskah-naskah historis, khususnya dalam pengenalan tulisan tangan atau Handwritten Text Recognition (HTR) dan pengenalan entitas bernama (Named Entity Recognition/NER). Dengan adanya TRIDIS, naskah kuno yang telah didigitalisasi dapat diolah menjadi data yang lebih terstruktur sehingga dapat dimanfaatkan untuk mengembangkan teknologi pengenalan teks sekaligus membantu peneliti mengidentifikasi informasi penting, seperti nama orang, tempat, dan entitas lainnya, yang terdapat dalam naskah.

Beberapa contoh tersebut menunjukkan bahwa Indonesia memiliki peluang untuk mengembangkan korpus kebahasaan berbasis naskah kuno dengan memanfaatkan teknologi serupa. Pengembangan korpus dapat melengkapi korpus bahasa modern yang telah tersedia. Salah satu contoh pengembangan korpus yang banyak digunakan dalam penelitian linguistik adalah Leipzig Corpora. Di Indonesia, Badan Pengembangan dan Pembinaan Bahasa juga telah mengembangkan Korpus Indonesia (Koin) yang bersumber dari berbagai jenis teks. Pengayaan Koin dengan data naskah kuno berpotensi menghadirkan dimensi historis yang lebih kuat dalam penelitian bahasa Indonesia dan bahasa daerah.
Meskipun demikian, pengembangan korpus berbasis naskah kuno menghadapi sejumlah kendala. Naskah yang tersebar di berbagai wilayah berada dalam kondisi yang rentan sehingga digitalisasi perlu dilakukan secara berkelanjutan. Kesadaran masyarakat mengenai nilai naskah sebagai sumber pengetahuan juga perlu ditingkatkan. Sebagian naskah masih diperlakukan sebagai benda pusaka sehingga akses untuk dokumentasi dan penelitian menjadi terbatas. Selain itu, keterbatasan sumber daya manusia, pendanaan, infrastruktur, dan waktu menjadi tantangan dalam membangun korpus yang luas dan representative.

Oleh karena itu, pengembangan korpus naskah kuno di Indonesia memerlukan kolaborasi antara pemerintah, perguruan tinggi, perpustakaan, museum, komunitas, dan pemilik naskah. Digitalisasi perlu dipandang bukan sekadar upaya menyelamatkan bentuk fisik naskah, melainkan sebagai tahap awal untuk membuka kembali pengetahuan yang tersimpan di dalamnya. Dengan dukungan teknologi pengenalan teks dan pengelolaan data, naskah kuno dapat ditransformasikan menjadi korpus kebahasaan yang dapat dimanfaatkan untuk penelitian bahasa, sastra, sejarah, dan kebudayaan. Upaya tersebut sekaligus menjadi strategi untuk memastikan bahwa kekayaan intelektual yang tersimpan dalam naskah kuno tetap dapat dipelajari oleh generasi mendatang.

Daftar Pustaka
Almis, V. M., & Wijayanti, L. (2023). Digitalisasi naskah kuno sebagai upaya pelestarian informasi: Systematic literature review. JIPER, 5(2), 296–310.
Budiwiyanto, A. (2025). Korpus dalam penyusunan kamus. Badan Pengembangan dan Pembinaan Bahasa. https://badanbahasa.kemendikdasmen.go.id/artikel-detail/822/korpus-dalam-penyusunan-kamus
Clanuwat, T., Lamb, A., & Kitamoto, A. (2019). KuroNet: Pre-modern Japanese Kuzushiji character recognition with deep learning (Version 1) [Preprint]. arXiv. https://arxiv.org/abs/1910.09433
Hadi, S., Darsa, U. A., Paulus, E., Suryani, M., & Burie, J.-C. (2025). Digital handling procedure for digitalizing and indexing ancient manuscripts. IEEE Access. https://doi.org/10.1109/ACCESS.2025.3621551
Majni, F. A. (2021). Kembangkan korpus, Badan Bahasa jadikan Media Indonesia acuan. Media Indonesia. https://mediaindonesia.com/humaniora/389751/kembangkan-korpus-badan-bahasa-jadikan-media-indonesia-acuan
Semnani, S. J., Zhang, H., He, X., Tekgürler, M., & Lam, M. S. (2024). CHURRO: Making history readable with an open-weight large vision-language model for high-accuracy, low-cost historical text recognition. Stanford University.
Torres Aguilar, S. (2025). TRIDIS: A comprehensive medieval and early modern corpus for HTR and NER (Version 1) [Preprint]. arXiv. https://arxiv.org/abs/2503.22714
Perpustakaan Nasional Republik Indonesia. (n.d.). Khastara: Khasanah naskah Nusantara. https://khastara.perpusnas.go.id/infografis/
 
Biodata
Nama : Zainal Arifin Nugraha
Alamat : Subang, Jawa Barat


Eksplorasi konten lain dari Berita Merdeka Online

Berlangganan untuk dapatkan pos terbaru lewat email.