Meta selingkuh dengan tolok ukur AI dan sekilas ke zaman keemasan baru

- Jurnalis

Rabu, 9 April 2025 - 12:34 WIB

facebook twitter whatsapp telegram line copy

URL berhasil dicopy

facebook icon twitter icon whatsapp icon telegram icon line icon copy

URL berhasil dicopy

Meta berselingkuh di tolok ukur AI, dan itu lucu. Menurut Kylie Robison di The Verge, kecurigaan mulai meresap setelah meta merilis dua model AI baru berdasarkan model bahasa besar Llama 4 selama akhir pekan. Model-model baru ini adalah Scout, model yang lebih kecil yang dimaksudkan untuk pertanyaan cepat, dan Maverick, yang dimaksudkan untuk menjadi saingan yang sangat efisien untuk model yang lebih terkenal seperti Openai GPT-4O (pertanda kiamat Miyazaki kami).

Dalam posting blog yang mengumumkannya, Meta melakukan apa yang dilakukan setiap perusahaan AI sekarang dengan rilis besar. Mereka menjatuhkan sejumlah data yang sangat teknis untuk membual tentang bagaimana AI Meta lebih pintar dan lebih efisien daripada model dari perusahaan yang lebih baik terkait dengan AI: Google, OpenAi, dan Antropik. Posting rilis ini selalu terperosok dalam data dan tolok ukur yang sangat teknis yang sangat bermanfaat bagi para peneliti dan yang paling obsesif AI, tetapi agak tidak berguna bagi kita semua. Pengumuman Meta tidak berbeda.

ADVERTISEMENT

banner

SCROLL TO RESUME CONTENT

Tetapi banyak obsesif AI segera melihat satu meta hasil benchmark mengejutkan yang disorot dalam posnya. Maverick memiliki skor ELO 1417 di Lmarena. Lmarena adalah alat pembandingan kolaboratif open-source di mana pengguna dapat memberikan suara pada output terbaik. Skor yang lebih tinggi lebih baik dan 1417 Maverick menempatkannya di tempat nomor 2 di papan peringkat Lmarena, tepat di atas GPT-4O dan tepat di bawah Gemini 2.5 Pro. Seluruh ekosistem AI bergemuruh dengan terkejut dengan hasilnya.

Kemudian mereka mulai menggali, dan dengan cepat mencatat bahwa dalam cetakan halus, Meta telah mengakui model maverick yang menghancurkan Lmarena sedikit berbeda dari versi yang dapat diakses oleh pengguna. Perusahaan telah memprogram model ini lebih cerewet dari biasanya. Secara efektif itu memikat patokan untuk diserahkan.

Sepertinya Lmarena tidak senang dengan serangan pesona. Interpretasi Meta terhadap kebijakan kami tidak cocok dengan apa yang kami harapkan dari penyedia model, “katanya dalam sebuah pernyataan tentang X.” Meta seharusnya membuatnya lebih jelas bahwa 'llama-4-maverick-03-26-eksperimental' adalah model yang disesuaikan untuk mengoptimalkan pakan manusia, sebagai akibatnya, kami memperbarui kebijakan papan peringkat kami.

Saya suka optimisme Lmarena di sini karena permainan tolok ukur terasa seperti hak perikop dalam teknologi konsumen dan saya menduga tren ini akan berlanjut. Saya telah meliput teknologi konsumen selama lebih dari satu dekade, saya pernah menjalankan salah satu laboratorium pembandingan yang lebih luas di industri ini, dan saya telah melihat banyak pembuat telepon dan laptop mencoba semua jenis trik untuk membuat jus skor mereka. Mereka mengacaukan kecerahan tampilan untuk masa pakai baterai yang lebih baik dan mengirimkan versi laptop bebas bloatware kepada pengulas untuk mendapatkan skor kinerja yang lebih baik.

Sekarang model AI menjadi lebih cerewet untuk jus skor mereka juga. Dan alasan saya menduga ini tidak akan menjadi skor yang dikembangkan dengan hati -hati adalah bahwa saat ini perusahaan -perusahaan ini sangat ingin membedakan model bahasa besar mereka dari satu sama lain. Jika setiap model dapat membantu Anda menulis kertas bahasa Inggris yang buruk lima menit sebelum kelas maka Anda akan membutuhkan alasan lain untuk membedakan preferensi Anda. “Model saya menggunakan lebih sedikit energi dan menyelesaikan tugas 2,46% lebih cepat,” mungkin tidak tampak seperti pembual terbesar bagi semua, tetapi itu penting. Itu masih 2,46% lebih cepat dari orang lain.

Karena AIS ini terus menjadi matang menjadi produk yang dihadapi konsumen yang sebenarnya, kita akan mulai melihat lebih banyak benchmark membual. Mudah -mudahan, kita juga akan melihat hal -hal lain. Antarmuka pengguna akan mulai berubah, toko -toko konyol seperti bagian Explore GPT dari aplikasi ChatGPT akan menjadi lebih umum. Perusahaan -perusahaan ini perlu membuktikan mengapa model mereka adalah model dan tolok ukur terbaik saja tidak akan melakukannya. Tidak saat bot yang cerewet dapat permainan sistem dengan mudah.

RakyatPos.ID Network

Berita Terkait

“Nick Woltemade ke FC Bayern dengan harga yang konyol”
Friedrich Merz: Hanya Perdana Menteri yang mendukungnya | kebijakan
Pratinjau dan Diskusi Mariners Game #153: SEA di LAA, 16/9
D-back kalah dari Marlins secara ekstra, tidak bisa naik dalam perlombaan Wild Card
Lions vs. Bills: Tiga alur cerita yang harus diketahui untuk pertandingan prime-time Minggu 2 hari Kamis | Berita, Analisis & Pembaruan NFL Terbaru
‘Saturday Night Live’ Musim 52 Pemeran Grace Reiter, Saidah Belo-Osagie
Carlos Estévez melewatkan sisa musim 2026 karena operasi bahu
Event Organizer Kunci Sukses Penyelenggaraan Acara Profesional

Berita Terkait

Kamis, 17 September 2026 - 14:11 WIB

“Nick Woltemade ke FC Bayern dengan harga yang konyol”

Kamis, 17 September 2026 - 13:33 WIB

Friedrich Merz: Hanya Perdana Menteri yang mendukungnya | kebijakan

Kamis, 17 September 2026 - 12:11 WIB

Pratinjau dan Diskusi Mariners Game #153: SEA di LAA, 16/9

Kamis, 17 September 2026 - 11:11 WIB

D-back kalah dari Marlins secara ekstra, tidak bisa naik dalam perlombaan Wild Card

Kamis, 17 September 2026 - 10:25 WIB

Lions vs. Bills: Tiga alur cerita yang harus diketahui untuk pertandingan prime-time Minggu 2 hari Kamis | Berita, Analisis & Pembaruan NFL Terbaru

Berita Terbaru

Headline

“Nick Woltemade ke FC Bayern dengan harga yang konyol”

Kamis, 17 Sep 2026 - 14:11 WIB

Headline

Pratinjau dan Diskusi Mariners Game #153: SEA di LAA, 16/9

Kamis, 17 Sep 2026 - 12:11 WIB

Al Jazeera - LIVE