Meta berselingkuh di tolok ukur AI, dan itu lucu. Menurut Kylie Robison di The Verge, kecurigaan mulai meresap setelah meta merilis dua model AI baru berdasarkan model bahasa besar Llama 4 selama akhir pekan. Model-model baru ini adalah Scout, model yang lebih kecil yang dimaksudkan untuk pertanyaan cepat, dan Maverick, yang dimaksudkan untuk menjadi saingan yang sangat efisien untuk model yang lebih terkenal seperti Openai GPT-4O (pertanda kiamat Miyazaki kami).
Dalam posting blog yang mengumumkannya, Meta melakukan apa yang dilakukan setiap perusahaan AI sekarang dengan rilis besar. Mereka menjatuhkan sejumlah data yang sangat teknis untuk membual tentang bagaimana AI Meta lebih pintar dan lebih efisien daripada model dari perusahaan yang lebih baik terkait dengan AI: Google, OpenAi, dan Antropik. Posting rilis ini selalu terperosok dalam data dan tolok ukur yang sangat teknis yang sangat bermanfaat bagi para peneliti dan yang paling obsesif AI, tetapi agak tidak berguna bagi kita semua. Pengumuman Meta tidak berbeda.
ADVERTISEMENT

SCROLL TO RESUME CONTENT
Tetapi banyak obsesif AI segera melihat satu meta hasil benchmark mengejutkan yang disorot dalam posnya. Maverick memiliki skor ELO 1417 di Lmarena. Lmarena adalah alat pembandingan kolaboratif open-source di mana pengguna dapat memberikan suara pada output terbaik. Skor yang lebih tinggi lebih baik dan 1417 Maverick menempatkannya di tempat nomor 2 di papan peringkat Lmarena, tepat di atas GPT-4O dan tepat di bawah Gemini 2.5 Pro. Seluruh ekosistem AI bergemuruh dengan terkejut dengan hasilnya.
Kemudian mereka mulai menggali, dan dengan cepat mencatat bahwa dalam cetakan halus, Meta telah mengakui model maverick yang menghancurkan Lmarena sedikit berbeda dari versi yang dapat diakses oleh pengguna. Perusahaan telah memprogram model ini lebih cerewet dari biasanya. Secara efektif itu memikat patokan untuk diserahkan.
Sepertinya Lmarena tidak senang dengan serangan pesona. Interpretasi Meta terhadap kebijakan kami tidak cocok dengan apa yang kami harapkan dari penyedia model, “katanya dalam sebuah pernyataan tentang X.” Meta seharusnya membuatnya lebih jelas bahwa 'llama-4-maverick-03-26-eksperimental' adalah model yang disesuaikan untuk mengoptimalkan pakan manusia, sebagai akibatnya, kami memperbarui kebijakan papan peringkat kami.
Saya suka optimisme Lmarena di sini karena permainan tolok ukur terasa seperti hak perikop dalam teknologi konsumen dan saya menduga tren ini akan berlanjut. Saya telah meliput teknologi konsumen selama lebih dari satu dekade, saya pernah menjalankan salah satu laboratorium pembandingan yang lebih luas di industri ini, dan saya telah melihat banyak pembuat telepon dan laptop mencoba semua jenis trik untuk membuat jus skor mereka. Mereka mengacaukan kecerahan tampilan untuk masa pakai baterai yang lebih baik dan mengirimkan versi laptop bebas bloatware kepada pengulas untuk mendapatkan skor kinerja yang lebih baik.
Sekarang model AI menjadi lebih cerewet untuk jus skor mereka juga. Dan alasan saya menduga ini tidak akan menjadi skor yang dikembangkan dengan hati -hati adalah bahwa saat ini perusahaan -perusahaan ini sangat ingin membedakan model bahasa besar mereka dari satu sama lain. Jika setiap model dapat membantu Anda menulis kertas bahasa Inggris yang buruk lima menit sebelum kelas maka Anda akan membutuhkan alasan lain untuk membedakan preferensi Anda. “Model saya menggunakan lebih sedikit energi dan menyelesaikan tugas 2,46% lebih cepat,” mungkin tidak tampak seperti pembual terbesar bagi semua, tetapi itu penting. Itu masih 2,46% lebih cepat dari orang lain.
Karena AIS ini terus menjadi matang menjadi produk yang dihadapi konsumen yang sebenarnya, kita akan mulai melihat lebih banyak benchmark membual. Mudah -mudahan, kita juga akan melihat hal -hal lain. Antarmuka pengguna akan mulai berubah, toko -toko konyol seperti bagian Explore GPT dari aplikasi ChatGPT akan menjadi lebih umum. Perusahaan -perusahaan ini perlu membuktikan mengapa model mereka adalah model dan tolok ukur terbaik saja tidak akan melakukannya. Tidak saat bot yang cerewet dapat permainan sistem dengan mudah.
RakyatPos.ID Network









