Meta Under Fire for Manipulering av Llama 4 Benchmark: Ikke deres første lovbrudd

Meta Under Fire for Manipulering av Llama 4 Benchmark: Ikke deres første lovbrudd

Meta ga nylig ut sine Llama 4-serier med AI-modeller, og gjorde overskrifter for å overgå GPT-4O og Gemini 2.0 Pro i Chatbot Arena (tidligere LMSYS). Selskapet hevdet at Llama 4 Maverick -modellen – en MOE -modell som bare aktiverer 17 milliarder parametere av en massiv 400B på tvers av 128 eksperter – oppnådde en imponerende ELO -poengsum på 1 417 på Chatbot Arena Benchmark.

Dette resultatet økte øyenbrynene over AI-samfunnet, da en relativt mindre MOE-modell overgikk mye større LLM-er som GPT-4.5 og GROK 3.. Den uvanlige ytelsen fra en liten modell førte til at mange i AI-samfunnet testet modellen uavhengig. Overraskende nok stemte ikke den virkelige forestillingen til Llama 4 Maverick med benchmark-påstander fra Meta, spesielt i Kodingsoppgaver.

1Point3Acreset populært forum for kinesere i Nord -Amerika, en bruker som hevdet å være en tidligere Meta -ansatt, postet et bombeskall. I følge innlegget, som er oversatt til engelsk på RedditMeta-ledelsen blandet angivelig «testettene til forskjellige benchmarks i etteropplæringsprosessen» for å blåse opp referansepoengsummen og oppfylle interne mål.

Meta -ansatte fant praksisen uakseptabel og valgte å trekke seg. Den tidligere ansatte ba også teamet om å ekskludere navnet sitt fra Llama 4 Technical Report. Faktisk hevder brukeren at den nylige avskjeden av Metas sjef for AI -forskning, Joelle Pineau, er direkte knyttet til Llama 4 Benchmark Hacking.

Som svar på de voksende påstandene delte Ahmad al-Dahle, sjef for Metas generative AI-divisjon, en innlegg på x. Han avskjediget påstanden om at Llama 4 var etter trent på testsettene. Al-Dahle skriver:

Vi har også hørt påstander om at vi trente på testsett – det er rett og slett ikke sant, og vi vil aldri gjøre det. Vår beste forståelse er at folk med variabel kvalitet ser skyldes at de trenger å stabilisere implementeringer.

Han erkjente den inkonsekvente Llama 4 -forestillingen på tvers av forskjellige plattformer. Og oppfordret også AI -samfunnet til å gi det noen dager for implementeringen til å bli «ringt inn.»

LMSYS svarer på Llama 4 Benchmark Manipulation -påstander

Etter bekymring fra AI -samfunnet ga LMSYS – organisasjonen bak Catbot Arena Leaderboard – en uttalelse for å forbedre åpenheten. LMSYS klargjorde at den innsendte modellen på Chatbot Arena var “Llama-4-Maverick-03-26-Experimental”. Det var en tilpasset variant av modellen, optimalisert for menneskelig preferanse.

LMSYS erkjente at «stil- og modellresponstone var en viktig faktor». Dette kan ha gitt unødig fordel for den tilpassede Lama 4 Maverick -modellen. Organisasjonen innrømmet også at denne informasjonen ikke ble gjort tilstrekkelig tydelig av Meta -teamet. I tillegg uttalte LMSYS, «Metas tolkning av politikken vår stemte ikke overens med det vi forventer av modellleverandører.»

Les også:

10 beste store språkmodeller (LLM) i 2025

Å være rettferdig, meta, i sin offisielle Llama 4 -bloggennevnte at «en eksperimentell chatversjon» scoret 1.417 på Chatbot Arena. Men de forklarte ikke noe videre.

Til slutt, for å forbedre åpenheten, la LMSYS til den klemte ansiktsversjonen av Llama 4 Maverick til Chatbot Arena. Bortsett fra det har den gitt ut over 2000 kamp-til-hode-kampresultater for publikum å gjennomgå. Resultatene inkluderer spørsmål, modellrespons og brukerpreferanser.

Jeg vurderte kampresultaterog det var forvirrende å se brukere konsekvent foretrekke Llama 4 -er ofte uriktige og altfor ordentlige svar. Dette reiser dypere spørsmål om tillitsfulle samfunnsdrevne benchmarks som Chatbot Arena.

Ikke første gang metakamning benchmarks

Dette er ikke første gang Meta er blitt beskyldt for å spille benchmarks gjennom dataforurensning, dvs. å blande benchmark -datasett i treningskorpuset. Tilbake i februar i år delte Susan Zhang – en tidligere Meta AI -forsker som nå jobber på Google DeepMind – en avslørende studie som svar på et innlegg av Yann Lecun, Meta AIs sjefforsker.

De studere fant at over 50% av testprøvene fra viktige benchmarks var til stede i Metas Llama 1 -pretraining -data. Oppgaven sier: «Spesielt Big Bench Hard, Humaneval, Hellaswag, MMLU, Piqa og Triviaqa viser betydelige forurensningsnivåer på tvers av begge selskapene».

Nå, midt i de siste referanseindeksene som hacking påstander rundt Llama 4, har Zhang sarkastisk bemerket Den metaen skal i det minste sitere sitt «tidligere verk» fra Llama 1 for denne «unike tilnærmingen.» Jab er rettet mot Meta om at benchmark -manipulering ikke er en ulykke. Men det er en strategi fra det Zuckerberg-ledede selskapet for kunstig å øke ytelsesmålingene.

Støtt vårt arbeid ❤️

Hvis du likte denne artikkelen, vurder å gi en tips for å hjelpe oss med å fortsette å publisere kvalitetsinnhold.

Sikker betaling med PayPal