- Maia 200 je akcelerátor inferencie umelej inteligencie druhej generácie od spoločnosti Microsoft, vyrobený 3nm procesom a obsahujúci viac ako 140.000 miliárd tranzistorov.
- Čip ponúka až 10 PFLOPS v FP4, 5 PFLOPS v FP8 a 216 GB pamäte HBM3e, pričom uprednostňuje efektivitu na euro/dolár pred Trainium a TPU a konkuruje Nvidii.
- Je integrovaný do infraštruktúry Azure, aby slúžil platformám Copilot, modelom OpenAI a pokročilým interným projektom, s počiatočným nasadením v centrálnej časti USA a postupným rozširovaním.
- Je to súčasť stratégie „kremík pre servis“, ktorej cieľom je znížiť štrukturálne náklady, získať technologickú nezávislosť a posilniť pozíciu spoločnosti Microsoft vo vojne o kremík v oblasti umelej inteligencie.
Spoločnosť Microsoft urobila nový krok vo svojej stratégii infraštruktúry umelej inteligencie. Maia 200, jeho inferenčný akcelerátor druhej generácieČip prichádza s cieľom posilniť ponuku spoločnosti Azure uprostred explózie generatívnej umelej inteligencie a mimochodom znížiť silnú závislosť spoločnosti od spoločnosti Nvidia a iných externých dodávateľov.
Maia 200 nie je len ďalším komponentom, ale prezentuje sa ako ústredný prvok integrovaného modelu, ktorý siaha od kremíka až po cloudové službyCieľ je jasný: prevádzkovať rozsiahle jazykové modely a pokročilé systémy uvažovania s vyšším výkonom na investované euro a zároveň udržiavať prevádzkové náklady v dátových centrách pod maximálnou kontrolou.
Akcelerátor určený pre masívnu inferenciu

Maia 200 je špeciálne navrhnutá pre inferenčná fáza modelov umelej inteligencieToto sa vzťahuje na moment, keď vopred natrénované systémy spracúvajú dotazy a generujú odpovede v reálnom čase. V tomto bode sa sústreďujú milióny denných požiadaviek na služby, ako sú asistenti, firemní chatboti a nástroje produktivity s umelou inteligenciou.
Spoločnosť definuje Maia 200 ako najefektívnejší inferenčný systém, aký bol kedy nasadený v AzurePodľa ich interných údajov ponúka čip až o 30 % vyšší výkon na dolár (alebo euro) ako predchádzajúci hardvér v ich flotile, čo je kľúčový faktor, keďže objem dopytov exponenciálne rastie a účty za energie neustále vyvíjajú tlak na znižovanie marží.
Nový urýchľovač efektívne nahrádza Maia 100, prvá generácia tohto dizajnuktorý nikdy nebol sprístupnený zákazníkom. S Maia 200 spoločnosť Microsoft prechádza z laboratórneho experimentu do reálneho nasadenia vo svojich dátových centrách a zosúlaďuje túto platformu s vysoko viditeľnými obchodnými službami.
V tejto súvislosti záväzok k proprietárnemu hardvéru zodpovedá všeobecnému trendu hlavných poskytovateľov cloudových služieb, ktorí hľadajú vyhnite sa spoliehaniu výlučne na Nvidiu a zároveň odlíšiť svoju ponuku od konkurencie, ako je Google (TPU) alebo Amazon Web Services (Trainium a Inferentia), a vzhľadom na problémy, ako napríklad Oneskorenia GPU.
Architektúra a výrobný proces: 3 nm a viac ako 140.000 miliárd tranzistorov

Na technickej úrovni je Maia 200 postavená na procese TSMC 3 nanometre (uzol N3P), jeden z najpokročilejších, aké sa dnes dajú hromadne vyrábať. Každý čip sa integruje rádovo 140.000 miliárd tranzistorov, čo predstavuje skok v komplexnosti, ktorý odráža rozsah súčasných modelov umelej inteligencie a pracovné zaťaženie, ktoré sa očakáva v nasledujúcich rokoch.
Vnútorný dizajn je štruktúrovaný okolo výpočtovej hierarchie, v ktorej je základným prvkom tzv. „dlaždice“ktorá funguje ako autonómna jednotka s lokálnymi výpočtovými a úložnými možnosťami. Každá dlaždica obsahuje dva hlavné enginy: na jednej strane Jednotka tenzora dlaždíc (TTU), zameraný na vysokovýkonné násobenie matíc a konvolučné operácie; na druhej strane, Vektorový procesor dlaždíc (TVP), vysoko programovateľný SIMD engine pre úlohy vyžadujúce väčšiu flexibilitu.
Niekoľko dlaždíc je zoskupených do klastre so zdieľanou pamäťou SRAMToto zavádza druhú úroveň lokality dát. Táto organizácia umožňuje efektívnu koordináciu vykonávania naprieč viacerými dlaždicami pred škálovaním na plnú úroveň systému na čipe, čím sa znižujú úzke miesta a zlepšuje využitie hardvéru.
Pamäťový subsystém, jeden z kľúčov k výkonu umelej inteligencie, bol navrhnutý tak, aby minimalizovať prevádzku mimo čipu a zmierniť tlak na šírku pásmaZákladná myšlienka je jednoduchá, hoci jej implementácia nie je triviálna: umiestniť čo najviac rýchlej pamäte blízko k výpočtu, aby modely nemuseli neustále „čakať“ na príchod údajov.
Pamäť, presné formáty a výkon v PFLOPS

Jednou z charakteristických vlastností čipu Maia 200 je kombinácia integrovanej a veľmi rýchlej externej pamäte. Samotný čip obsahuje 272 MB SRAMdistribuované na rôznych úrovniach (TSRAM v každej dlaždici a CSRAM v každom klastri). Táto SRAM je spravovaná softvérom, čo umožňuje detailnú kontrolu nad lokalita dát podľa pracovnej záťaže.
Tieto bloky sú okrem 216 GB pamäte HBM3e, čo je takmer výpočtový objem, ktorý je obzvlášť dôležitý pre rozsiahle jazykové modely a ktorého náklady by sa mali monitorovať spolu s Cena pamätí GDDR6.
Pokiaľ ide o výpočtový výkon, Microsoft uvádza, že čip je optimalizovaný pre formáty s nízkou presnosťou, ako napríklad FP4 a FP8čo umožňuje lepší výkon pri zachovaní kvality výsledkov vhodnej pre mnohé generatívne aplikácie umelej inteligencie a uvažovania. Maia 200 dosahuje približne 10 PFLOPS v FP4 a 5 PFLOPS v FP8, okrem toho, že sa nachádza okolo 1,3 PFLOPS v BF16.
Výkonnosť v 4. RP by podľa údajov spoločnosti bola osemkrát väčší ako BF16 a približne dvojnásobný ako FP8 za inak nezmenených podmienok. To sa premieta do jasného zisku v počte spracovaných tokenov za sekundu, čo je kľúčové v situáciách, keď milióny používateľov súčasne generujú text, kód alebo multimediálny obsah.
S TDP približne 750 W na škrtiacu klapkuMaia 200 sa radí do high-end segmentu čipov pre dátové centrá, ale kompenzuje to pomerom výkonu a energie, ktorý Microsoft prezentuje ako jednu zo svojich hlavných výhod oproti konkurenčným alternatívam.
Pripojiteľnosť, škálovateľnosť a protokol transportnej vrstvy umelej inteligencie

Okrem čistej výpočtovej techniky obsahuje Maia 200 aj pokročilú sieťovú vrstvu, ktorá je nevyhnutná pre... škálovateľné na tisíce paralelne pracujúcich akcelerátorovČip integruje vlastnú sieťovú kartu do kremíka s obojsmernou šírkou pásma približne 2,8 TB/sčím sa zabráni potrebe externých kariet pre vysokovýkonnú komunikáciu.
Komunikácia medzi uzlami je uľahčená prostredníctvom špecifického protokolu nazývaného Transportná vrstva umelej inteligencie (ATL)ktorý beží na štandardnej ethernetovej infraštruktúre. ATL zavádza techniky ako rozprašovanie paketov (distribúcia paketov cez viacero trás) a viacbodové smerovanie pre Zlepšiť stabilitu a znížiť dopravné zápchy v scenároch s vysokou návštevnosťou typických pre generatívnu umelú inteligenciu.
Ďalším relevantným prvkom je tzv. Plne pripojený štvorkolkový systém (FCQ)Táto topológia zoskupuje štyri akcelerátory Maia 200 pomocou priamych spojení bez externých prepínačov. Tento prístup znižuje latenciu v tenzorovej komunikácii a zjednodušuje konštrukciu modulárnych blokov, ktoré je potom možné replikovať vo veľkom meradle.
Podľa spoločnosti Microsoft táto architektúra umožňuje škálovanie až zhluky 6 144 urýchľovačov Maia 200, čo je údaj zosúladený s potrebami tréningu a inferencie väčších modelov vrátane budúcich generácií multimodálnych jazykových modelov.
V praxi je čip namontovaný na tácky alebo stojany, ktoré obsahujú sady niekoľkých urýchľovačovTo uľahčuje jeho integráciu do existujúcich dátových centier. Spoločnosť navrhla systém tak, aby fungoval s chladením vzduchom aj s pokročilejšími riešeniami kvapalinového chladenia, a prispôsobila ho rôznym konfiguráciám infraštruktúry.
Integrácia s modelmi Azure, Copilot a OpenAI
Maia 200 neprichádza sama o sebe, ale ako súčasť prístupu, ktorý spoločnosť Microsoft definuje ako „Od kremíka k servisu“Myšlienka je, že hardvér, softvér, siete a modely sú navrhnuté a optimalizované spoločne, aby sa maximalizoval výkon a minimalizovali prevádzkové náklady.
Prvé systémy založené na platforme Maia 200 sa už nasadzujú v... Región Azure US CentralTieto počiatočné klastre zásobujú pokročilé modely tímom Microsoft Superintelligence, iniciatívami Microsoft Foundry zamerané na tvorbu a škálovanie vlastných modelov a predovšetkým Microsoft Copilot, rodina asistentov integrovaných do aplikácií, ako je Microsoft 365.
Spoločnosť sa zameriava priamo na poskytovanie podpory pre modely novej generácie vrátane GPT-5.2 od OpenAI, v súlade so strategickou alianciou, ktorú obe spoločnosti udržiavajú od začiatku ChatGPT. Zlepšenie latencie a nákladov na dotaz by sa malo prejaviť v rýchlejšie a udržateľnejšie rozsiahle reakcie pre tieto služby.
Za hranicami Spojených štátov je plán rozšíriť program Maia 200 aj do iné azúrové regióny vrátane európskychKeďže sa správanie, efektívnosť a stabilita systému overujú v produkčnom prostredí, bude pre spoločnosti a vládne agentúry pôsobiace v EÚ dôležité zistiť, kedy budú tieto akcelerátory nasadené v lokálnych dátových centrách, a to vzhľadom na obavy týkajúce sa suverenity údajov a dodržiavania predpisov.
Súčasne je čip integrovaný s ekosystémom vývojových nástrojov, ktoré sa snažia vyhnúť núteniu programátorov meniť svoje návyky cez noc, čím sa uľahčuje jeho prijatie v existujúcich projektoch.
Nástroje pre vývojárov a softvérový ekosystém
Aby sa zabezpečilo, že Maia 200 nezostane len interným inžinierskym cvičením, spoločnosť Microsoft sprevádza spustenie... Špecializovaná SDK zameraná na firmy, univerzity a open-source projektyCieľom je vytvoriť technickú komunitu, ktorá plne preskúma možnosti čipu a pomôže optimalizovať pracovné zaťaženie.
Vývojové prostredie si zachováva kompatibilitu s bežné nástroje ako PyTorchTo umožňuje portovanie existujúcich modelov s primeraným úsilím. Poskytuje sa aj podpora kompilátora. Tritónnavrhnuté tak, aby plne využívali funkcie hardvéru bez toho, aby obetovali jazyk, ktorý je relatívne prístupný pre tých, ktorí už pracujú s GPU a akcelerátormi.
Pre tímy, ktoré potrebujú lepšiu kontrolu, spoločnosť Microsoft sprístupňuje tento jazyk Vnorený paralelný jazyk (NPL)Navrhnuté tak, aby maximalizovalo hierarchiu dlaždíc, klastrov a lokálnej pamäte čipu. Tento „metalickejší“ prístup je zameraný na maximalizáciu optimalizácie. lokalizácia dát a paralelizácia kritických rutín.
V praxi má táto kombinácia úrovní abstrakcie za cieľ veľké korporácie aj akademické výskumné skupiny Svoje modely môžu prispôsobiť novému hardvéru bez toho, aby museli začínať od nuly. Spoločnosť oznámila, že niektoré programy skorého prístupu sú už zamerané na univerzity a výskumné tímy s cieľom urýchliť jeho prijatie.
Týmto sa Microsoft snaží, aby Maia 200 nebola vnímaná len ako proprietárny akcelerátor, ale aj ako základný stavebný kameň v rámci otvoreného a relatívne známeho softvérového ekosystému pre komunitu umelej inteligencie.
Ekonomický a strategický dopad a kremíková vojna
Z ekonomického hľadiska je rozvoj Maia 200 súčasťou širšieho boja o... kontrola infraštruktúry, ktorá podporuje generatívnu umelú inteligenciuKaždý dopyt, ktorý prechádza cez Copilot, model OpenAI hostovaný na Azure alebo podnikovú aplikáciu AI, predstavuje náklady, ktoré závisia vo veľkej miere od použitého hardvéru.
Vďaka vlastnému inferenčnému čipu sa spoločnosť Microsoft snaží znížiť štrukturálne náklady, zvýšiť predvídateľnosť výdavkov a získať vyjednávaciu silu s externými dodávateľmiAk sa prísľub o 30 % vyšší výkon na dolár bude dôsledne napĺňať vo výrobe, spoločnosť by mohla výrazne zlepšiť svoje marže v oblasti služieb umelej inteligencie.
Táto stratégia má aj geopolitický a technologický rozmer suverenity. V čase, keď Európa a ďalšie regióny diskutujú o digitálnej autonómii a kontrole údajovIntegrácia vlastného hardvéru do globálneho cloudu posilňuje pozíciu spoločnosti Microsoft ako technologického partnera pre veľké spoločnosti a verejnú správu.
Spustenie Maia 200 prispieva k krokom spoločností Google s ich TPU a Amazon s Trainium a Inferentia, čo mnohí analytici už nazývajú skutočným... „kremíková vojna“Vedenie v tomto boji sa nemeria len v peflopsoch, ale aj v schopnosti dodať výkonnú, efektívnu a ekonomicky životaschopnú umelú inteligenciu z dlhodobého hľadiska.
Nvidia zatiaľ naďalej dominuje na trhu s akcelerátormi umelej inteligencie, ale snaha hlavných poskytovateľov cloudových služieb o vlastné čipy naznačuje scenár... väčšia diverzifikácia a konkurencia, v ktorom sa každý aktér bude snažiť kontrolovať čo najväčšiu časť hodnotového reťazca, od návrhu kremíkových čipov až po finálne aplikácie používané používateľmi.
S Maia 200 spoločnosť Microsoft nielenže pridáva do svojho katalógu nový akcelerátor, ale tiež posilňuje základnú stratégiu zameranú na... riadenie komplexnej infraštruktúry umelej inteligencie a doladenie ekonomiky inferencieKombinácia 3nm dizajnu, masívnej pamäte HBM3e, vysokokapacitnej integrovanej siete a úzkej integrácie s modelmi Azure, Copilot a OpenAI stavia tento čip do kľúčového postavenia v pretekoch o generatívnu umelú inteligenciu, kde náklady na dotaz a energetická účinnosť budú rovnako dôležité ako samotný výpočtový výkon.
Som technologický nadšenec, ktorý zo svojich „geekovských“ záujmov urobil povolanie. Strávil som viac ako 10 rokov svojho života používaním špičkových technológií a hraním so všetkými druhmi programov z čistej zvedavosti. Teraz som sa špecializoval na počítačovú techniku a videohry. Je to preto, že už viac ako 5 rokov píšem pre rôzne webové stránky o technológiách a videohrách a vytváram články, ktoré sa snažia poskytnúť vám potrebné informácie v jazyku, ktorý je zrozumiteľný pre každého.
Ak máte nejaké otázky, moje znalosti siahajú od všetkého, čo súvisí s operačným systémom Windows, ako aj Androidom pre mobilné telefóny. A môj záväzok je voči vám, vždy som ochotný venovať pár minút a pomôcť vám vyriešiť akékoľvek otázky, ktoré môžete mať v tomto internetovom svete.