Teknik

OpenAIs Jalapeño-chip kor inferens med 1,9 ganger hogre effektivitet an Nvidia Blackwell per watt

Adrian Kessler

OpenAI har byggt en egen krets. Företaget presenterade Jalapeño på konferensen Hot Chips den 25 augusti, en kiseldesign utvecklad i samarbete med Broadcom som hanterar inference-förfrågningar med 85 448 tokens per sekund per kilowatt. Nvidias Blackwell-arkitektur, dagens marknadsstandard, når 44 960 på samma mått. Kvoten är 1,9 gånger.

Måttet är viktigt eftersom inference är hur AI-system körs i produktion. Träning sker en gång; inference sker varje gång någon skickar en fråga till ChatGPT, använder ett API eller interagerar med en applikation som kör en språkmodell. Kostnaden för inference i stor skala är den primära drivkraften bakom AI-tjänsters ekonomi. En krets som ungefär halverar energiförbrukningen för inference, om den används i stor skala, förändrar kostnaden per fråga för att köra modeller.

På interaktiva arbetsbelastningar, där svarstid är den begränsande faktorn, sträcker sig Jalapeños fördel ytterligare. SemiAnalysis rapport om Hot Chips-presentationen angav intervallet 2,1 till 4,1 gånger bättre än Blackwell på dessa riktmärken. Spridningen återspeglar variation över specifika uppgiftstyper; den nedre gränsen är den mer konservativa jämförelsen.

Kretsen hanterar endast inference. Den kör inte de träningsarbetsbelastningar som producerade de modeller Jalapeño är designad för att köra. Dessa kräver fortfarande Nvidia-hårdvara. Broadcom tillverkade kretsen under ett skräddarsytt designavtal med OpenAI snarare än att sälja den som en kommersiell produkt. Arrangemanget ger OpenAI ett specialbyggt inference-lager utan att kräva att företaget konkurrerar på den kommersiella kretsmarknaden.

OpenAI:s utrullningstidsplan är begränsad. Småskalig utrullning är planerad före slutet av 2026; bredare utrullning är ett mål för 2027. Kretsen är fortfarande i ingenjörsprovfasen, vilket innebär att produktionsversionen ännu inte har levererats i skala. Riktmärkena på Hot Chips representerar det designade målet, inte en verifierad produktionskörning. Gapet mellan konferensmeddelande och operativ driftsättning för skräddarsydd kisel mäts typiskt i år.

Tillkännagivandet passar in i en bredare trend bland stora AI-företag mot skräddarsydd kisel. Google har drivit sina egna Tensor Processing Units i produktion i ett decennium. Amazon kör Trainium och Inferentia i AWS. Meta driver egna inference-kretsar internt. OpenAIs inträde bekräftar att i skalan av hundratals miljoner aktiva användare blir ekonomin i att helt förlita sig på externa GPU-leverantörer tillräckligt svår för att motivera kostnaden för ett skräddarsytt designprogram.

Taggar: , , , , ,

Diskussion

Det finns 0 kommentarer.