Wiki o sestavení

Wiki o sestavení

Referenční série o sestavování, síťování, napájení a provozu výpočetních systémů s umělou inteligencí – pro kupující a integrátory, kteří volí velikost svého dalšího 4GPU serveru, 8GPU serveru nebo robotické laboratoře.

Každý článek je napsán na základě skutečných Kentino konstrukcí. Žádné zbytečné zbytečnosti. S vlastním názorem tam, kde to inženýrství vyžaduje. Upřímný ohledně limitů.

49články publikovány 9tematické skladby 2nové týdně · Út + Čt

Základní server umělé inteligence Řada W

Pokud specifikujete systém s více grafickými kartami, přečtěte si nejprve toto: Paměť, PCIe, napájení, teploty, úložiště a seznam grafických karet.

W01RAM a VRAM: Jaký je jejich vztah v serveru s umělou inteligencíKrabice se 4 grafickými kartami, 192 GB VRAM a 32 GB RAM je nefunkční. Správný poměr závisí na tom, co skutečně používáte.
W02PCIe linky a topologie v multi-GPU AI serveruVýrok „PCIe x8 vs. x16 nehraje roli pro závěr“ je většinou správný – a lidé, kteří ho opakují, obvykle nevědí proč.
W03Rozšiřující karty GPU: Kdy je potřebujete a co se poroucháTam, kde integrita signálu tiše umírá, se spoje tiše přeškolují na Gen3 a benchmarky, které projdou testem, začnou denně ztrácet jeden GPU.
W04Dimenzování zdroje a konfigurace se dvěma zdrojiMatematika, realita provedení a poctivé zdůvodnění napájení 4 a 8 GPU.
W05Teploty a proudění vzduchu v sestavách serverů s více grafickými kartami a umělou inteligencíČtyři grafické karty s výkonem 450 W v jedné skříni představují 1.8 kW tepla. Proudění vzduchu zepředu dozadu, statický tlak a důvod, proč „má ventilátory“, není chladicí plán.
W06Úrovně úložiště na serveru s umělou inteligencíModel, datová sada, scratch, kontrolní bod – čtyři úlohy se čtyřmi přístupovými vzory. Jedna vrstva NVMe neslouží dobře žádné z nich.
W07Výběr GPU: 5090, 4090, RTX Pro 6000, L40, L4Upřímné osobní srovnání se skutečnými výkonnostními čísly, kompromisy a rozhodovacím postupem, který skutečně používáme u zákaznických hovorů.

Tokenová ekonomie Řada T.

Finanční matematika. Tokeny za euro, náklady na milion tokenů v on-premise vs. cloudu a kdy který model skutečně vyhraje.

T01Tokeny za sekundu za euroJediná metrika hodnoty GPU, která je důležitá pro odvození. Reálné tokeny/s na euro napříč 5090, 4090, RTX Pro 6000, L40, L4.
T02Cena za milion tokenů: On-Prem vs. cloudOn-premise vs. cloud, přepočteno v eurech. Kde je rozdíl a proč vítězí cloudový účet, dokud najednou nezmizí.
T03Ekonomie trvalé vs. exploze inferenceNeustálé 24/7 odvozování a nepravidelné dávkové úlohy mají opačné ekonomické výhody. Kdy vítězí on-premise a kdy vás zachrání cloud.

Linux / OS / Software Řady L

Softwarový stack pod GPU. Připínání ovladačů, nastavení CUDA, ladění jádra, souborové systémy a monitorování.

L01Ubuntu Pinning a správa ovladačů NVIDIAPřipněte jádro, připněte ovladač nebo sledujte, jak aktualizace apt vypne vaše grafické karty. Správa ovladačů, která přežije restart.
L02CUDA, cuDNN a sada nástrojů pro kontejnery NVIDIARozumná cesta nastavení. Verzování CUDA vs. ovladač vs. toolkit a kontejnerová trasa, která zastaví peklo závislostí.
L03Ladění jádra Linuxu pro servery s umělou inteligencíCo vlastně hýbe světem úloh umělé inteligence – obrovské stránky, NUMA, afinita k IRQ – a co je cargo-kult.
L04Volba souborového systému pro servery s umělou inteligencíXFS, ZFS, ext4 – a proč Btrfs není na seznamu pro servery s umělou inteligencí. Přiřaďte souborový systém k přístupovému vzoru.
L05Monitorovací zásobník: Prometheus, Grafana, DCGM, LokiSledujte teploty GPU, VRAM, chyby ECC a selhání úloh dříve, než vás to bude stát tréninkový běh.

networking řady N

Realita NVLink, topologie clusterů (leaf-spine, fat-tree, dragonfly, switchless), disekce latence, směrování a nastavení RDMA v praxi.

N03NVLink a NVSwitch: Když na tom záležíMarketing DGX se chlubí terabajty za sekundu šířky pásma NVLinku. Pro většinu úloh Kentina nic z toho nepotřebujete.
N04Přepínané topologie: Fat-Tree, Leaf-Spine, Dragonfly, TesseractKaždý klastrový diagram začíná stejně. Skutečnou volbou je výběr topologie, míra nadbytečného přihlášení a rychlosti na port.
N05Bezpřepínací topologie: Mesh, Ring, Direct-Connect32portový 400GbE přepínač dosáhne v polovině roku 2026 ceny 40 000–80 000 EUR. Pro 2 až 4 uzly jej nepotřebujete.
N06Disekce latence: Kam se ztrácí každá mikrosekundaLidé dimenzují sítě pomocí grafů šířky pásma. Pak jejich benchmark allreduce vypíše číslo, které se ani zdaleka neblíží rychlosti linky.
N07Směrování: ECMP, adaptivní směrování, DCQCNCo se děje nad kabely, síťovými kartami a přepínači: jak pakety nacházejí cestu a co brání kolapsu struktury (fabric) při all-reduce.
N08Nastavení RDMA v praxi + návrh uplinku clusteruPraktické cvičení: instalace ovladačů, ověření cesty, zapnutí GPUDirect, ověření NCCL a následný krok k návrhu uplinku celého clusteru.

Clustering K řady

Když jeden uzel nestačí. Rozhodování o jednom vs. více uzlech, distribuované trénování, inferenční clustery, sdílené úložiště, plánování a ošetření selhání.

K01Jeden uzel s více GPU vs. více uzelů: Kdy horizontálně navýšit kapacituNejdražší chybou je rozdělení rozpočtu GPU mezi dva uzly, když by práci zvládl jeden větší uzel.
K02Distribuované školení v roce 2026: DDP, FSDP2, DeepSpeed, MegatronČtyři open-source stacky, pět os paralelismu a kterou z nich si vlastně vybrat pro kterou úlohu.
K03Inferenční klastry: vLLM Tensor Parallel, Pipeline ParallelModel 70B se nevejde na jednu GPU s užitečnou KV mezipamětí. Model 405B se nevejde na jeden uzel. Způsob, jakým model rozříznete, určuje jeho cenu.
K04Clusterové úložiště: NFS, BeeGFS, Lustre, objektová úložištěSdílené úložiště je součástí distribuovaného clusteru, o které nikdo nepřemýšlí, dokud GPU nedosáhnou 40% využití.
K05Plánování úloh: SLURM, Kubernetes, RaySLURM, Kubernetes, Ray – a vědět, kdy žádný z nich nepotřebujete. Přizpůsobte plánovač velikosti týmu.
K06Zpracování selhání v klastrech AICo se ve skutečnosti porouchá v clusteru GPU a jak to obnovit – kontrolní body, kontroly stavu a vyprazdňování vadných uzlů.

Integrace Řada I.

Dáváme to všechno dohromady – nastavení inferenčního serveru, síť a rozpočty na napájení laboratoře, referenční sestavení a nasazení vozového parku.

I01Architektura EDGE AI: Robot ↔ On-Prem inferenční serverČlánek zlatého standardu. Humanoid, kterého jste si koupili, je jen polovina systému; toto je druhá polovina a to, jak jsou obě poloviny propojeny.
I02Nastavení inferenčního serveru: vLLM, llama.cpp, SGLangInstalace, poskytování a porovnávání. Který engine pro který model a cílová latence.
I03Topologie sítě pro výpočetní laboratoř robotiky a umělé inteligenceZapojení laboratoře robotiky a umělé inteligence – propojení robotů, uplinky inferenčních serverů a kde se skrývá latence.
I04Rozpočet na napájení a chlazení pro laboratoř robotiky a umělé inteligenceDimenzování napájení a chlazení pro smíšenou laboratoř robotiky a umělé inteligence před podpisem nájemní smlouvy.
I05Referenční sestava: Laboratoř robotiky a umělé inteligence v jednom rackuKompletní laboratoř robotiky a umělé inteligence v jednom racku – kusovník, rozvržení a kompromisy, které bychom skutečně dodali.
I06Nasazení vozového parku: Více robotů, sdílené výpočtyVíce robotů, sdílené výpočty. Jak dimenzovat a naplánovat inferenci pro flotilu, ne pro demo.

Napájení P series

Dodávka čistého napájení do racku. Fáze, PDU, vyvažování, jističe, UPS a generátory pro výpočetní techniku ​​s umělou inteligencí.

P01Jednofázový vs. třífázový výkonKdyž 4GPU box přeroste jediný 16A obvod a co vám vlastně třífázový proud v AI racku dá.
P02Typy PDU: Základní, Měřené, Přepínané, ATSCo každý z nich dělá a co skutečně potřebujete pro rack s grafickou kartou.
P03Fázové vyvažování napříč racky AIRovnoměrně zatěžujte tři fáze nebo vypněte jistič v nejnevhodnější chvíli. Jak funguje vyvažování napříč rozvaděči s umělou inteligencí.
P04Dimenzování jističe a zapínací proudTrvalé zatížení, nárazový proud a pravidlo 80 %. Dimenzujte jističe pro servery s grafickými procesory, které neruší.
P05Dimenzování UPS pro AI ComputingTopologie, chemie baterií, doba chodu a rozdíl mezi kVA a kW, který poddimenzuje polovinu UPS zakoupených v laboratořích s umělou inteligencí.
P06Generátor a přepínačKdyž doba provozu na baterii nestačí. Základy dimenzování generátoru a přepínání proudu pro laboratoře umělé inteligence.

Robotika Řada R · blog

Moderní humanoid je šest nebo sedm inženýrských oborů propojených dohromady. Anatomie, senzory, umístění počítačů, SDK, sítě, nákup a nejmodernější stack modelů světa VLM.

R01Anatomie moderního humanoidaŠest nebo sedm inženýrských oborů sešroubovaných dohromady. Co se vlastně skrývá uvnitř moderního humanoida.
R02Anatomie čtyřnožého robotaČtvernožci vyměňují dosah za stabilitu a výdrž baterie. Mechanická a výpočetní anatomie tvarového faktoru pracanta.
R03Sada senzorů robotůKamery, hloubka, LiDAR, IMU, síla-moment – ​​co každý senzor nabízí a kolik stojí ve výpočetním výkonu.
R04Výpočetní technika na zařízení vs. mimo zařízení pro robotyCo běží na robotu a co na serveru. Výměna latence vs. kapacity, kterou musí každé nasazení provést.
R05SDK pro roboty, ROS 2 a simulaceROS 2, SDK od dodavatelů a simulační prostředí – software, proti kterému vyvíjíte, než dorazí hardware.
R06Robotické sítě: Wi-Fi, Tethery, 5GWi-Fi, tethery, 5G – a proč latence, nikoli šířka pásma, rozhoduje o tom, co můžete robota odložit.
R07Nákup robota: Dodací lhůty, celní vyřízení, podporaNákup robotického hardwaru v EU není jako nákup pracovní stanice. Jak ve skutečnosti vypadají dodací lhůty, celní odbavení a poprodejní podpora.
R08Proč roboti potřebují specializované edge computingové systémyArgument latence. Proč umístění vašeho modelu za cloudové API narušuje případ užití, který zákazník skutečně chce.
R09Automatické označování pomocí modelů světa řízených VLMŠpičkový systém pro vnímání – Qwen2.5-VL, Grounded-SAM 2, Florence-2, NVIDIA Cosmos – aplikovaný na skutečné informace z robotiky.

Případové studie Řada C · blog

Skutečné Kentino staví s reálnými naměřenými čísly. Fotografie, kusovníky, benchmarky a poctivé pitvy.

C01Případová studie: 4× pracovní stanice s umělou inteligencí a grafickou kartou RTX 4090EPYC 7542, 512 GB DDR4 ECC, 4× RTX 4090. Naměřeno 651.6 TFLOPS. 179.3 tok/s trvale při vLLM. Vrchol 73 °C. Reálná čísla z dodané sestavy.

Nové články každé úterý a čtvrtek

Tato wiki je rostoucí knihovna – nové články o sestavení, sítích, clusterech, energetice a robotice budou publikovány do roku 2026, každý z nich bude převzat ze skutečného sestavení Kentina. Pokud chcete, aby bylo upřednostněno konkrétní téma, napište na info@kentino.com.