Lifestyle

Wikimedia ingin memudahkan Anda dan pengembang AI untuk mencari melalui datanya

65
wikimedia-ingin-memudahkan-anda-dan-pengembang-ai-untuk-mencari-melalui-datanya
Wikimedia ingin memudahkan Anda dan pengembang AI untuk mencari melalui datanya

Almarhum penulis bahasa Inggris Douglas Adams terkenal sebagai penulis buku 1979 The Hitchhiker’s Guide to the Galaxy. Tetapi ada lebih banyak hal untuk Adams daripada apa yang tertulis di dalamnya Entri Wikipedia. Apakah Anda atau tidak membutuhkan untuk mengetahui bahwa miliknya Tanda Kelahiran adalah pisces atau perpustakaan di seluruh dunia menyimpan buku -bukunya di bawah serangkaian angka yang sama – 13230702 – Anda Bisa Jika Anda menuju ke sudut yang diabaikan Yayasan Wikimedia disebut Wikidata.

Di sana, gambar, teks, kata kunci, dan informasi lain yang terkait dengan Adams disimpan dalam a halaman web dan, untuk robot di antara kita, dalam format yang dirancang untuk mesin seperti Json.

Sekarang, Wikidata mendapatkan database ramah AI baru yang memudahkan model bahasa besar untuk menelan informasi. Basis data berasal dari Proyek Embedding Wikipedia Keluar dari bab Jerman dari Wikimedia Foundation, Wikimedia Deutschland, yang mengawasi Wikidata. Tim yang berbasis di Berlin menghabiskan tahun lalu menggunakan model bahasa besar untuk mengubah 19 juta entri dalam Wikidata dari data terstruktur dengan kikuk menjadi vektor yang menangkap konteks dan makna di sekitar entri Wikidata.

Dalam format vektor ini, informasi paling baik dibayangkan seperti grafik dengan titik -titik dan garis yang saling berhubungan – Adams akan terhubung dengan “manusia” serta judul -judul buku -bukunya, Lydia Pintscher, Wikidata Portofolio, kata The Verge.

Sementara pengalaman pengguna front-end akan tetap sama-tidak, wikipedia adalah bukan Menjadi chatbot, kata para pemimpin proyek – ujung belakang akan menjadi lebih mudah bagi pengembang AI untuk mengakses saat membangun, misalnya, chatbot mereka sendiri menggunakan data.

Tujuan dari proyek ini adalah untuk menyamakan kedudukan untuk pengembang AI di luar Monied Core of Big Tech, kata Pintscher. Perusahaan seperti Openai dan Anthropic memiliki sumber daya untuk memvektorisasi Wikidata, seperti yang dilakukan Pintscher dan timnya. Pakaian yang lebih kecil yang paling diuntungkan dari akses baru ke data yang dikuratori yang disimpan di lemari besi wikidata. “Sungguh, bagi saya, ini tentang memberi mereka keunggulan itu dan setidaknya memberi mereka kesempatan, kan?” Kata Pintscher.

Dia menunjuk ke GovDirectory Sebagai contoh proyek yang memanfaatkan data luas Wikidata yang dikuratori oleh sukarelawan untuk selamanya. Platform ini memungkinkan pengguna untuk menemukan pegangan dan email media sosial untuk pejabat publik di seluruh dunia.

Sebagian besar chatbots AI memprioritaskan kata -kata dan topik populer di seluruh internet. Selain memberi sedikit teknologi, tim berharap bahwa akses yang lebih mudah ke Wikidata akan menghasilkan sistem AI yang lebih mencerminkan topik niche yang tidak banyak terwakili di internet, kata Pintscher. Ini bisa menjadi cara yang lebih baik untuk mendapatkan informasi ke chatgpt, misalnya, daripada “menghasilkan banyak konten dan kemudian menunggu waktu berikutnya untuk melatih kembali, dan mungkin, atau mungkin tidak, dengan mempertimbangkan apa yang Anda kontribusikan,” kata Pintscher.

Dalam praktiknya, vektor akan memungkinkan sistem AI untuk mengakses konteks lebih baik di sekitar informasi selain informasi itu sendiri, Philippe Saadé, Manajer Proyek Wikidata AI, kepada The Verge.

Tim menggunakan model dari perusahaan AI Jina AI untuk mengubah data terstruktur Wikidata, yang ditangkap hingga 18 September 2024, menjadi vektor. Perusahaan IBM DataStax saat ini menyediakan infrastruktur untuk menyimpan database vektor ke proyek secara gratis.

Tim sedang menunggu umpan balik dari pengembang yang menggunakan database sebelum memperbaruinya dengan informasi yang ditambahkan selama setahun terakhir. Sementara database saat ini tidak termasuk informasi yang sepenuhnya baru ditambahkan dalam setahun terakhir, Saadé mengatakan suntingan kecil atau penyesuaian ke wikidata yang ada tidak akan mengurangi kegunaan database. “Pada akhirnya, vektor yang kami komputasi seperti gagasan umum tentang suatu barang, jadi jika beberapa edit kecil telah dilakukan di Wikidata, itu tidak akan menjadi sangat relevan,” katanya.

Ikuti topik dan penulis Dari cerita ini untuk melihat lebih banyak seperti ini di umpan beranda pribadi Anda dan untuk menerima pembaruan email.

Exit mobile version