Teknik

AMD köper Taalas och satsar på AI-kisel som slår Nvidia 48 gånger

Susan Hill

AMD förvärvar Taalas, en startup från Toronto som tillverkar chip där AI-modellers vikter permanent etsas in i kisel i stället för att laddas från minnet vid inferens. Företagets HC1-chip genererar 16 960 tokens per sekund på Metas Llama 3.1 8B – en siffra som AMD hävdar är 48 gånger snabbare än Nvidias GPU:er och 8,5 gånger snabbare än Cerebras, specialist på inferenschip.

Tekniken bakom Taalas utnyttjar en strukturell ineffektivitet i hur dagens AI-inferens fungerar. Vanliga GPU:er är flexibla: de kan köra vilken modell som helst, växla mellan uppgifter på begäran och omprogrammeras när en modell uppdateras. Den flexibiliteten är också flaskhalsen. Att ladda miljarder modellvikter från höghastighetsminne till beräkningsenheter vid varje inferensförfrågan skapar latens som inte går att eliminera genom att lägga till fler GPU:er.

Taalas placerar dessa vikter direkt i chipets kisel vid tillverkningstillfället. Modellen lever i hårdvaran, inte i minne som hämtas för varje begäran. Genomströmningssiffrorna som AMD annonserar speglar det arkitektoniska valet – men till ett pris som företaget inte tonar ner: när ett chip väl är tillverkat med en specifik modell inbakad kräver en uppdatering en ny kiseltillverkning (tape-out). Taalas säger att endast två metallager behöver ändras för en modelluppdatering, vilket förkortar cykeln, men dessa chip kan inte anpassa sig i flykten till en nyare modellversion.

Enligt AMDs integrationsplan kommer Taalas-chip att hantera tokengenerering – den mest tidskrävande fasen av inferens – medan AMDs Instinct-GPU:er hanterar prefill och attention-beräkning i början av varje förfrågan. Det kombinerade systemet körs på AMDs Helios rack-skala-plattform. För molnoperatörer som kör fasta modellarbetsflöden – kundtjänstrobotar, dokumenthanteringspipelines, realtidsöversättning – är löftet genomströmning per rack-watt som flexibla GPU-kluster inte kan matcha till motsvarande kostnad.

Huruvida den kalkylen överlever branschens modelluppdateringstakt är den centrala frågan. Stora labb uppdaterar nu sina produktionsmodeller ungefär var sjätte månad. Ett chip som idag är låst till Llama 3.1 8B kan behöva pensioneras när en efterträdare blir standardmål. Taalas påstående om två-metallagers-uppdatering hjälper, men en kiseltillverkning tar fortfarande månader att slutföra – en betydande eftersläpning när modeller kommer ut snabbare än hårdvarucykler.

Förvärvet kommer sju månader efter att Nvidia köpte Groq – en annan strategi för samma inferenshastighetsproblem – för rapporterade 20 miljarder dollar. Groqs tensorströmningsprocessorer optimerar också för genomströmning men behåller förmågan att ladda olika modeller. AMD betalar ett ej offentliggjort men förmodligen mindre belopp för en startup som gjorde den motsatta satsningen.

För köpare tillhör Taalas-förvärvet färdplanen snarare än katalogen. HC2-chippet, som riktar sig till modeller med upp till 20 miljarder parametrar, är fortfarande under utveckling. 48x-referensmätningen gäller HC1 under specifika förhållanden – verkliga driftsmiljöer med blandad trafik och varierande batchstorlekar kommer att ge andra resultat. Affären väntas slutföras under fjärde kvartalet 2026, i väntan på regulatorisk granskning. HC1 levererades i februari på 6nm; HC2:s leveransdatum och måltillverkningsprocess är ännu inte bekräftade.

Taggar: , , , ,

Diskussion

Det finns 0 kommentarer.