Lifestyle

Meta tertangkap bermain game tolok ukur ai

101
meta-tertangkap-bermain-game-tolok-ukur-ai
Meta tertangkap bermain game tolok ukur ai

Selama akhir pekan, Meta menjatuhkan dua yang baru Model llama 4: Model yang lebih kecil bernama Scout, dan Maverick, model ukuran menengah yang diklaim perusahaan dapat mengalahkan GPT-4O dan Gemini 2.0 flash “di berbagai tolok ukur yang dilaporkan secara luas.”

Maverick dengan cepat mengamankan tempat nomor dua di Lmarena, situs benchmark AI di mana manusia membandingkan output dari sistem yang berbeda dan memberikan suara pada yang terbaik. Di meta siaran persperusahaan menyoroti skor ELO Maverick tahun 1417, yang menempatkannya di atas 4o Openai dan tepat di bawah Gemini 2.5 Pro. (Skor ELO yang lebih tinggi berarti model menang lebih sering di arena saat berhadapan dengan pesaing.)

Prestasi tampaknya memposisikan Llama 4 meta terbuka Meta sebagai penantang serius untuk model yang canggih dan tertutup dari Openai, Anthropic, dan Google. Kemudian, peneliti AI yang menggali melalui dokumentasi Meta menemukan sesuatu yang tidak biasa.

Dalam cetakan yang bagus, Meta mengakui bahwa versi Maverick yang diuji pada lmarena tidak sama dengan apa yang tersedia untuk umum. Menurut bahan meta sendiri, itu digunakan “Versi obrolan eksperimental” dari maverick ke lmarena yang secara khusus “dioptimalkan untuk percakapan,” TechCrunch Pertama dilaporkan.

“Interpretasi Meta terhadap kebijakan kami tidak cocok dengan apa yang kami harapkan dari penyedia model,” Lmarena diposting pada x dua hari setelah rilis model. “Meta seharusnya membuatnya lebih jelas bahwa ‘llama-4-maverick-03-26-eksperimental’ adalah model yang disesuaikan untuk mengoptimalkan preferensi manusia. Sebagai akibatnya, kami memperbarui kebijakan papan peringkat kami untuk memperkuat komitmen kami terhadap evaluasi yang adil dan dapat direproduksi sehingga kebingungan ini tidak terjadi di masa depan.“

Seorang juru bicara meta, Ashley Gabriel, mengatakan dalam pernyataan yang diemail bahwa “kami bereksperimen dengan semua jenis varian khusus.”

“‘Llama-4-Maverick-03-26-Eksperimental’ adalah versi yang dioptimalkan obrolan yang kami bereksperimen dengan yang juga berkinerja baik di Lmarena,” kata Gabriel. “Kami sekarang telah merilis versi open source kami dan akan melihat bagaimana pengembang menyesuaikan Llama 4 untuk kasus penggunaan mereka sendiri. Kami senang melihat apa yang akan mereka bangun dan menantikan umpan balik mereka yang berkelanjutan.”

Sementara apa yang Meta lakukan dengan Maverick tidak secara eksplisit terhadap aturan Lmarena, situs tersebut telah berbagi kekhawatiran tentang bermain game sistem dan mengambil langkah -langkah untuk “mencegah kebocoran overfitting dan benchmark.” Ketika perusahaan dapat mengirimkan versi yang disesuaikan secara khusus dari model mereka untuk pengujian sambil merilis versi yang berbeda kepada publik, peringkat tolok ukur seperti Lmarena menjadi kurang bermakna sebagai indikator kinerja dunia nyata.

“Ini adalah tolok ukur umum yang paling dihormati karena semua yang lain payah,” kata peneliti AI independen Simon Willison memberi tahu The Verge. “Ketika Llama 4 keluar, fakta bahwa itu berada di urutan kedua di arena, tepat setelah Gemini 2.5 Pro – itu benar -benar membuat saya terkesan, dan saya menendang diri saya sendiri karena tidak membaca cetakan kecil.”

Tak lama setelah Meta merilis Maverick dan Scout, komunitas AI mulai berbicara tentang rumor Meta itu juga telah melatih model Llama 4 -nya untuk berkinerja lebih baik pada tolok ukur sambil menyembunyikan keterbatasan mereka yang sebenarnya. VP AI generatif di Meta, Ahmad al-Dahle, membahas tuduhan tersebut dalam posting di x: “Kami juga pernah mendengar klaim bahwa kami dilatih pada set tes – itu sama sekali tidak benar dan kami tidak akan pernah melakukan itu. Pemahaman terbaik kami adalah bahwa variabel kualitas yang dilihat orang adalah karena perlu menstabilkan implementasi.”

“Ini rilis yang sangat membingungkan secara umum.”

Beberapa juga diperhatikan Llama 4 itu dirilis pada waktu yang aneh. Sabtu tidak cenderung ketika berita Big AI turun. Setelah seseorang di utas bertanya mengapa Llama 4 dirilis selama akhir pekan, Meta CEO Mark Zuckerberg menjawab: “Saat itulah sudah siap.”

“Ini adalah rilis yang sangat membingungkan secara umum,” kata Willison, yang Mengikuti dan mendokumentasikan model AI. “Skor model yang kami dapatkan di sana sama sekali tidak berharga bagi saya. Saya bahkan tidak bisa menggunakan model yang mereka dapatkan skor tinggi.”

Jalan meta untuk melepaskan Llama 4 tidak benar -benar halus. Menurut ke laporan terbaru dari Informasiperusahaan berulang kali mendorong peluncuran karena model gagal memenuhi harapan internal. Harapan-harapan itu sangat tinggi setelah Deepseek, startup AI open-source dari Cina, merilis model bobot terbuka yang menghasilkan satu ton buzz.

Pada akhirnya, menggunakan model yang dioptimalkan di Lmarena menempatkan pengembang pada posisi yang sulit. Saat memilih model seperti Llama 4 untuk aplikasi mereka, mereka secara alami mencari tolok ukur untuk bimbingan. Tetapi seperti halnya untuk Maverick, tolok ukur tersebut dapat mencerminkan kemampuan yang sebenarnya tidak tersedia dalam model yang dapat diakses publik.

Saat pengembangan AI berakselerasi, episode ini menunjukkan bagaimana tolok ukur menjadi medan pertempuran. Ini juga menunjukkan bagaimana meta ingin dilihat sebagai pemimpin AI, bahkan jika itu berarti bermain game sistem.

UPDATE, 7 April: Kisah ini diperbarui untuk menambahkan pernyataan Meta.

Exit mobile version