Teknik

OpenAI förklarar AGI uppnådd. Benchmark visar 37 poäng lägre

Adrian Kessler

Jensen Huang la upp ett inlägg på X – en mening och en gratulation: ”Från ChatGPT till o1 till Astra på fyra år – AGI har anlänt. Grattis @OpenAI team.” Han skickade det i början av september. Tre dagar tidigare hade Greg Brockman, OpenAI:s president, använt nästan identiska formuleringar i media: ”Välkommen till AGI-eran.” Uttalandena kom tätt inpå varandra, från två män med kompletterande intressen, och de mottogs i stort sett som en bekräftelse.

Riktmärket bakom påståendet var ARC-AGI-3. OpenAI sade att Astra, deras nya frontlinjemodell som släpptes under beteckningen GPT-6, uppnådde 99,9 % på ARC-AGI-3 och 98 % på FrontierMath Tier 4. Poäng på den nivån, under standardförhållanden, skulle innebära en verklig diskontinuitet – en modell som inte bara presterar väl utan landar på ett område som tidigare riktmärken behandlade som en aspiration. Organisationen som byggde ARC-AGI-3 publicerade en poäng från sin standardiserade utvärderingsplattform: 62,7 %.

Trettiosju procentenheter skiljer dessa två siffror. Båda kommer från verkliga utvärderingar. OpenAI:s interna plattform och riktmärkesskaparnas referensplattform är inte samma protokoll, och samma modell ger olika resultat under varje. Det som ARC-AGI-3-organisationen använder som sitt referensvillkor – det som den anser giltigt för att jämföra modeller över hela fältet – gav 62,7 %. OpenAI:s interna uppsättning gav 99,9 %. Skillnaden mellan dessa siffror är skillnaden mellan ett starkt riktmärkesresultat och en ankomstförklaring.

Chippförsäljningen bakom AGI-gratulationen

Astra tränades på NVIDIA-chips. Huang säljer NVIDIA-chips. När en vd offentligt gratulerar en kund för att ha passerat en historisk tröskel – en tröskel som gör den hårdvara som användes för att bygga produkten till den definierande infrastrukturen för vad som kommer härnäst – är tillkännagivandet, strukturellt sett, ett kommersiellt påstående. Ingen konspiration. En strukturell realitet: intressekonflikten var synlig, formuleringen handlade om ankomst snarare än prestanda, och större delen av rapporteringen tog emot båda utan kommentar.

Chippmarknaden för AI-infrastruktur drivs av narrativ. Om Astra är AGI, då blir det som tränade Astra hårdvaran för post-AGI-världen – och företagen som köper chips för nästa träningsomgång kommer att köpa mot det riktmärket. Huangs gratulationer var, i den specifika meningen, också en produktutsaga. Utsagan byggde på en siffra som riktmärkesorganisationen själv mätte annorlunda.

Vad oberoende verifiering visar – och vad den inte visar

Vid publiceringstillfället finns Astra inte i Artificial Analysis Intelligence Index eller i Arena.ai:s rankningar – de två mest bevakade oberoende utvärderingssystemen för frontlinjemodeller. Oberoende verifiering för större frontlinjesläpp kommer vanligtvis inom dagar. Frånvaron här är inte bevis på dålig prestanda. Det innebär att den externa validering som normalt skulle åtfölja ett påstående av denna magnitud ännu inte har materialiserats.

De 62,7 % från riktmärkesskaparna är inte en vederläggning. En poäng på den nivån på ARC-AGI-3 – ett test utformat för att motstå de optimeringstricks som blåste upp tidigare riktmärken – är genuint starkt. ARC-AGI-3:s föregångare var mättade: modeller absorberade träningsdata som liknade testfrågorna och pressade upp siffrorna utan att förbättras i ny resonemangsförmåga. ARC-AGI-3 ändrade frågedesignen för att kräva abstraktion framför mönsterinhämtning. Sextiotvå komma sju procent på det testet, under referensplattformen, är långt över allt som fanns för två år sedan.

Forskarna som reste invändningar var precisa om detta. Modellens förmåga var inte deras mål. Hoppet från prestanda till deklaration var det. ”Presterar bra på dessa riktmärken” och ”AGI har anlänt” kräver ett steg däremellan: en stabil, överenskommen definition av AGI som ankomst kan mätas mot. Ingen sådan definition finns inom fältet. OpenAI har en intern. Enligt OpenAI:s egen definition kan Astra kvalificera sig. Men ett företag som mäter sin produkt mot en definition det självt har skrivit är en annan typ av resultat än ett som mäts mot en extern standard.

Meningen som inte kom med en definition

Huangs inlägg hade inga reservationer. ”AGI har anlänt” är ett deklarativt – inte ”enligt vissa mått” eller ”under vissa definitioner”, utan en ren ankomst. Den fyraåriga progressionen han namngav – ChatGPT, o1, Astra – är verklig som en bana av förmåga. Varje modell i sekvensen utökade vad som var möjligt. Att rama in den sekvensen som en resa med en slutpunkt, och tillkännage slutpunkten, gör ett annat påstående: det säger att ankomst är skiljbar från resan, att det finns en linje snarare än en lutning, och att Astra korsade den.

Riktmärkessiffran bakom det påståendet var 62,7 %. Människorna som byggde testet publicerade den. Frågan den väcker – om AGI-deklarationen är en mätning eller ett marknadsdrag – fanns där i början av september. Rapporteringen besvarade den till stor del utan att ställa den.

Taggar: , , , , ,

Diskussion

Det finns 0 kommentarer.