The AI Knowledge Hunt: Why AI Is Going Back to Books
Mengapa perusahaan AI seperti Anthropic kembali membeli dan memindai buku? Saya melihatnya sebagai tanda bahwa knowledge manusia berkualitas semakin penting di era AI.
NanoStockk - Getty Images
Saya Mulai Bertanya: Apa yang Akan Dipelajari AI Setelah Internet Dipenuhi AI?
Sebagai seseorang yang mengikuti perkembangan AI hampir setiap hari, ada satu hal yang belakangan ini membuat saya cukup penasaran.
Selama bertahun-tahun kita selalu menganggap internet sebagai tambang emas untuk artificial intelligence.
Internet menyediakan miliaran halaman.
Artikel.
Forum.
Dokumentasi.
Buku digital.
Paper.
Komentar.
Percakapan.
Semua terlihat seperti sumber pengetahuan yang hampir tidak terbatas.
Dan AI memanfaatkannya dengan sangat agresif.
Tetapi sekarang kita berada di sebuah titik yang sedikit berbeda.
Internet yang sedang kita gunakan untuk melatih AI juga mulai dipenuhi oleh AI itu sendiri.
Setiap hari semakin banyak artikel dibuat dengan AI. Semakin banyak gambar dibuat oleh AI. Semakin banyak kode ditulis oleh AI. Bahkan semakin banyak konten yang kemudian dibaca kembali oleh AI lain.
Saya kemudian mulai bertanya:
Apa yang terjadi ketika mesin mulai belajar dari hasil pekerjaan mesin lainnya?
💬 Komentar & Diskusi
Apakah kita tidak sedang menciptakan semacam lingkaran?
AI menghasilkan konten.
Konten masuk internet.
AI berikutnya membaca konten tersebut.
Kemudian menghasilkan konten baru.
Lalu konten baru itu kembali masuk ke internet.
Kalau proses ini terus berlangsung, saya rasa ada pertanyaan yang jauh lebih fundamental:
Di mana AI akan menemukan pengetahuan manusia yang belum terkontaminasi oleh AI?
Dan ternyata, jawabannya mungkin berada di tempat yang sangat tua.
Buku.
Anthropic dan Proyek yang Membuat Saya Berpikir Ulang tentang Data
Beberapa waktu terakhir saya membaca tentang sebuah proyek Anthropic yang disebut Project Panama.
Nama proyeknya sendiri terdengar seperti sesuatu dari film spionase.
Tetapi yang dilakukan sebenarnya jauh lebih menarik.
Anthropic membeli buku-buku fisik dalam jumlah sangat besar, kemudian buku tersebut diproses menggunakan metode scanning industri. Binding buku dapat dipotong untuk memisahkan halaman, halaman kemudian dipindai menjadi bentuk digital, dan salinan fisiknya dibuang atau didaur ulang.
Dokumen internal yang terungkap dalam perkara hukum bahkan menggambarkan ambisi proyek tersebut sebagai upaya untuk “destructively scan all the books in the world.” Salah satu proposal vendor yang muncul dalam dokumen perkara menyebut kapasitas sekitar 500.000 hingga 2 juta buku dalam periode enam bulan.
Ketika pertama kali membaca berita tersebut, reaksi saya sebenarnya sederhana:
Kenapa?
Kenapa perusahaan AI yang mempunyai akses terhadap internet, database digital, dan kemampuan komputasi luar biasa justru harus kembali membeli buku fisik?
Bukankah semua informasi itu seharusnya sudah ada di internet?
Semakin saya memikirkannya, semakin saya merasa jawabannya mungkin tidak sesederhana “mereka membutuhkan lebih banyak data.”
Mungkin Masalahnya Bukan Kekurangan Data
Saya mulai melihat persoalan ini dari perspektif yang sedikit berbeda.
AI tidak kekurangan data.
Internet penuh dengan data.
Masalahnya mungkin adalah kualitas, keunikan, dan provenance data tersebut.
Bayangkan sebuah model mendapatkan akses ke jutaan halaman internet.
Sebagian merupakan tulisan manusia yang sangat bagus.
Sebagian merupakan tulisan manusia yang biasa saja.
Sebagian merupakan spam.
Sebagian adalah SEO content.
Sebagian adalah konten yang dibuat untuk mendapatkan klik.
Dan sekarang, sebagian lainnya mungkin ditulis oleh AI.
Kalau jumlah konten AI terus meningkat, maka dataset internet di masa depan bisa menjadi semakin sulit dibedakan.
Bukan berarti semua konten AI buruk.
Sama sekali tidak.
Saya sendiri menggunakan AI setiap hari dan tahu bahwa AI bisa menghasilkan tulisan, kode, dan ide yang sangat bagus.
Tetapi tetap ada perbedaan antara AI sebagai alat untuk membantu manusia berpikir dan AI menghasilkan konten yang kemudian digunakan sebagai bahan belajar AI berikutnya.
Di sinilah saya mulai melihat nilai buku-buku lama.
Buku Lama Menyimpan Sesuatu yang Tidak Dimiliki Internet Modern
Buku memiliki karakteristik yang berbeda.
Sebuah buku biasanya tidak ditulis untuk memenangkan algoritma pencarian.
Tidak ditulis untuk mendapatkan sepuluh detik perhatian.
Tidak ditulis dengan target keyword tertentu.
Buku yang bagus biasanya dibangun untuk membawa pembaca mengikuti sebuah pemikiran.
Ada konteks.
Ada argumentasi.
Ada struktur.
Ada narasi.
Ada reasoning yang panjang.
Dan yang paling menarik bagi saya:
banyak buku tersebut ditulis sebelum AI generatif menjadi bagian dari proses produksi konten sehari-hari.
Beberapa laporan mengenai pembelian buku oleh perusahaan AI memang menyoroti ketertarikan terhadap buku-buku yang terbit sebelum ledakan AI generatif, karena teksnya merupakan hasil karya manusia dan menawarkan long-form reasoning serta struktur bahasa yang berbeda dari konten web pendek.
Saya tidak ingin mengatakan bahwa buku lama otomatis lebih baik daripada internet.
Itu terlalu sederhana.
Tetapi saya mulai melihat buku sebagai snapshot dari pengetahuan manusia sebelum internet menjadi ekosistem yang sangat dipengaruhi oleh AI.
Dan menurut saya, itu sangat berharga.
Bagaimana Kalau AI Sedang Mencari “Human Knowledge”?
Ada satu hipotesis yang terus muncul di kepala saya.
Mungkin AI tidak lagi hanya membutuhkan more data.
Mungkin AI membutuhkan different data.
Ini dua hal yang sangat berbeda.
Kalau saya memberi model satu miliar artikel tambahan yang memiliki pola bahasa dan informasi yang hampir sama, saya mungkin mendapatkan volume yang lebih besar.
Tetapi kalau saya memberikan satu juta buku yang membahas sejarah, filsafat, sains, engineering, budaya, ekonomi, dan berbagai bidang spesifik dari puluhan tahun yang lalu, saya mungkin memberikan sesuatu yang jauh lebih beragam.
Pengetahuan yang belum tentu mudah ditemukan dalam dataset internet modern.
Dan di sinilah saya mulai memahami kenapa buku yang bahkan tidak terkenal bisa menjadi menarik.
Mungkin Buku yang Paling Berharga Justru Bukan Best Seller
Ini bagian yang menurut saya paling menarik.
Saya awalnya membayangkan perusahaan AI akan mengejar buku-buku paling terkenal.
Novel populer.
Buku bestseller.
Karya akademik terkenal.
Tetapi laporan mengenai pasar buku bekas menunjukkan adanya permintaan dalam jumlah besar terhadap buku out-of-print, obscure, specialized, dan less common. Para penjual buku bahkan melaporkan pembelian dalam jumlah ratusan hingga ribuan judul.
Dan tiba-tiba semuanya masuk akal.
Kalau tujuan saya hanya mendapatkan informasi yang sudah tersedia di internet, saya tidak perlu membeli buku langka.
Tetapi kalau saya sedang mencari knowledge yang tidak banyak tersedia secara digital, maka buku tua yang hampir terlupakan justru bisa menjadi sangat berharga.
Sebuah buku yang selama tiga puluh tahun hanya tergeletak di rak perpustakaan mungkin bagi manusia terlihat biasa saja.
Tetapi bagi model AI yang belum pernah melihat isinya:
itu adalah data baru.
AI Mungkin Sedang Menghadapi Masalah “Knowledge Loss”
Saya ingin berhati-hati dengan istilah ini.
Saya tidak mengatakan Anthropic secara resmi menyatakan bahwa Project Panama dibuat untuk mencegah knowledge loss atau model collapse.
Dokumen yang terungkap menunjukkan alasan yang lebih konkret: Anthropic mencari buku yang tidak tersedia secara online dan melihatnya sebagai sumber untuk membantu Claude belajar menulis dengan lebih baik daripada sekadar meniru bahasa internet berkualitas rendah.
Tetapi sebagai AI Explorer, saya melihat kemungkinan yang lebih luas.
Bagaimana jika generasi AI berikutnya semakin banyak belajar dari internet yang sudah dipenuhi output AI?
Bagaimana jika sebagian pengetahuan manusia yang sangat bagus tidak pernah masuk ke internet?
Bagaimana jika buku-buku lama, arsip, jurnal, textbook, dan dokumen fisik menyimpan pengetahuan yang perlahan hilang dari ekosistem digital?
Kalau begitu, AI mungkin menghadapi masalah yang agak ironis.
Untuk menjadi semakin pintar, AI harus kembali ke masa lalu.
Ironi Terbesar dari AI
Menurut saya, ini adalah bagian paling filosofis dari fenomena tersebut.
Kita membangun AI untuk masa depan.
Kita menggunakan GPU paling canggih.
Data center terbesar.
Model paling besar.
Agent paling autonomous.
Tetapi ketika kita mencari bahan untuk membuat AI berikutnya lebih baik, kita justru kembali kepada sesuatu yang sangat tua:
buku.
Ada sesuatu yang menurut saya indah sekaligus ironis di sini.
Teknologi paling modern yang pernah dibuat manusia ternyata masih membutuhkan salah satu teknologi tertua dalam menyimpan pengetahuan manusia:
kata-kata yang ditulis di atas kertas.
Tetapi Ada Masalah yang Tidak Bisa Saya Abaikan
Semakin saya mengikuti cerita ini, semakin saya merasa bahwa persoalannya bukan hanya tentang AI dan data.
Ada manusia di balik data tersebut.
Ada penulis.
Ada penerbit.
Ada peneliti.
Ada penerjemah.
Ada editor.
Ada orang-orang yang menghabiskan bertahun-tahun untuk menghasilkan pengetahuan yang kemudian menjadi bahan bakar bagi sistem AI.
Dan di sinilah persoalan copyright muncul.
Anthropic baru saja mendapatkan persetujuan final atas settlement US$1,5 miliar dengan para penulis dalam perkara terkait penggunaan buku yang diperoleh secara ilegal untuk melatih Claude. Pengadilan membedakan antara penggunaan karya untuk training dan cara karya tersebut diperoleh; penggunaan untuk training dinilai dapat termasuk fair use, sementara perolehan dan penyimpanan salinan bajakan menjadi persoalan hukum.
Bagi saya, ini adalah pelajaran penting.
Knowledge mungkin sangat berharga untuk AI, tetapi nilai pengetahuan tidak membuat hak orang yang menciptakannya menjadi hilang.
Saya Mulai Melihat Buku sebagai “Infrastructure”
Dulu saya melihat data center sebagai infrastructure AI.
GPU sebagai infrastructure.
Cloud sebagai infrastructure.
Network sebagai infrastructure.
Sekarang saya mulai melihat sesuatu yang lain:
knowledge juga merupakan infrastructure.
Tanpa data, model tidak bisa belajar.
Tanpa knowledge yang berkualitas, kemampuan model mungkin sulit berkembang.
Dan tanpa sumber knowledge yang beragam, model bisa saja semakin pintar tetapi semakin homogen.
Mungkin karena itulah perusahaan AI mulai melihat buku bukan lagi sebagai produk yang dijual kepada manusia.
Buku mulai dilihat sebagai raw material untuk intelligence.
Dan menurut saya, perubahan cara pandang ini sangat besar.
Bagaimana Jika Masa Depan AI Justru Bergantung pada Masa Lalu?
Ini pertanyaan yang sekarang terus ada di kepala saya.
Kita sering membicarakan masa depan AI dengan istilah yang sangat futuristik.
AGI.
Superintelligence.
Autonomous agents.
AI scientists.
Robotics.
Physical AI.
Tetapi di bawah semua itu ada sesuatu yang jauh lebih sederhana:
knowledge.
Dan sebagian knowledge tersebut mungkin tersimpan di tempat yang sudah ada selama ratusan tahun.
Buku.
Arsip.
Perpustakaan.
Jurnal.
Dokumen.
Catatan manusia.
Hal-hal yang mungkin kita anggap sudah ketinggalan zaman.
Saya Tidak Melihat Ini Sebagai “AI Membunuh Buku”
Saya justru melihatnya sebagai sesuatu yang lebih kompleks.
AI mungkin membuat buku menjadi semakin berharga.
Bukan sebagai objek fisik semata, tetapi sebagai sumber pengetahuan yang memiliki provenance manusia yang jelas.
Masalahnya adalah bagaimana kita memperlakukan sumber tersebut.
Saya tidak yakin solusi terbaik adalah membeli buku, memotongnya, mengambil datanya, kemudian menghancurkan salinan fisiknya.
Mungkin teknologi sebenarnya sudah cukup maju untuk melakukan digitalisasi tanpa menghancurkan artefak aslinya.
Dan menurut saya, pengetahuan manusia seharusnya tidak perlu menjadi trade-off antara kemajuan AI dan kehilangan warisan budaya.
AI Explorer's Thought
Sebagai seseorang yang sedang mencoba memahami AI, saya semakin sadar bahwa perlombaan AI sebenarnya bukan hanya perlombaan membuat model yang lebih besar.
Ini juga perlombaan mendapatkan knowledge yang lebih baik.
Dan mungkin inilah alasan mengapa kita melihat sesuatu yang sangat aneh terjadi sekarang.
Perusahaan teknologi yang memiliki akses ke hampir seluruh internet justru kembali membeli buku fisik.
Bukan karena internet tidak berguna.
Tetapi mungkin karena internet tidak lagi cukup.
Ada knowledge yang belum ada di sana.
Ada konteks yang hilang.
Ada tulisan manusia yang tidak pernah terdigitalisasi.
Dan mungkin ada satu hal yang bahkan lebih penting:
ada bagian dari sejarah manusia yang belum pernah dibaca oleh mesin.
The AI Knowledge Hunt
Kalau saya harus mengambil satu kesimpulan dari semua ini, saya tidak akan mengatakan:
“AI membutuhkan buku.”
Menurut saya, itu terlalu sederhana.
Saya lebih tertarik pada sesuatu yang lebih besar:
AI membutuhkan pengetahuan manusia yang berkualitas, beragam, dan tidak mudah tergantikan oleh konten yang dihasilkan AI itu sendiri.
Dan kalau internet semakin dipenuhi oleh AI-generated content, mungkin kita akan melihat paradoks yang menarik.
Semakin banyak AI menghasilkan pengetahuan baru, semakin berharga pengetahuan manusia dari masa lalu.
Mungkin suatu hari nanti, perusahaan AI tidak lagi berlomba hanya membeli GPU.
Mereka akan berlomba mencari arsip.
Perpustakaan.
Jurnal lama.
Buku yang sudah tidak dicetak.
Manuskrip.
Dokumen sejarah.
Dan semua bentuk pengetahuan yang belum pernah benar-benar masuk ke dunia digital.
Karena mungkin, untuk membuat AI masa depan semakin pintar, kita harus terlebih dahulu memastikan bahwa AI tidak kehilangan apa yang sudah dipelajari manusia selama ratusan tahun.
Saya kira inilah salah satu paradoks paling menarik dari AI.
Kita sedang membangun mesin masa depan dengan pengetahuan dari masa lalu.
Dan sebagai seorang AI Explorer, saya justru semakin penasaran:
Kalau AI suatu hari membaca hampir seluruh pengetahuan manusia, apa yang akan terjadi pada hubungan antara manusia, pengetahuan, dan mesin?
Mungkin perlombaan AI yang sebenarnya bukan tentang siapa yang memiliki model terbesar.
Mungkin perlombaan itu adalah siapa yang paling memahami pengetahuan manusia.