Úrovně úložiště na serveru AI: Model, Dataset, Scratch, Checkpoint
S kupujícími vedeme opakovanou debatu o NVMe. Ptají se na „co nejrychlejší“, protože specifikace ukazují 14 GB/s na disku Gen5 a 4090 vedle Samsungu 9100 PRO zní shodně. Pak se ptáme, k čemu ta krabice je, odpověď zní „většinou inference“ a správná sestava se ukáže být s jedním diskem místo osmi. Úložiště v serveru s umělou inteligencí je tou částí specifikace, kde je nadměrné nakupování snadné, pro dodavatele bezbolestné a pro pracovní zátěž téměř zcela neviditelné.
Tento článek se zabývá čtyřmi skutečnými úložnými úrovněmi v jednom serveru s umělou inteligencí, co každá z nich skutečně musí dělat, jak bude vypadat trh s NVMe v roce 2026, kdy si Gen5 zaslouží svou cenu, proč hardwarový RAID přestal být pro NVMe důležitý a jak dimenzovat každou úroveň, aniž byste utratili peníze. Volba souborového systému je samostatnou otázkou, o které se jedná v L04; úložiště sdílené v clusteru (NFS, BeeGFS, Lustre, objektová úložiště) je v K04. Zde zůstáváme uvnitř šasi.
Čtyři úrovně úložiště
Seriózní server s umělou inteligencí má čtyři odlišné úložné role. Ty se liší velikostí, propustností, výdrží a cenovými profily. Zacházet s nimi jako s jedním poolem je první chybou.
| stupeň | Role | Potřeba propustnosti | Potřeba vytrvalosti | Typická velikost |
|---|---|---|---|---|
| Model | Kořen OS, knihovna modelových vah, obrazy kontejnerů | Čtivý, skromný | Nízká (většinou ke čtení) | 1–4 TB |
| Dataset | Trénovací data, doladění korpusů | Sekvenční čtení, vysoká | Nízká až střední | 10 TB – 200 TB |
| Scratch | Únik aktivací, mezipaměť datové sady, dekódované shardy | Čtení + psaní, velmi vysoká | Středně vysoká (smíšená) | 2–8 TB |
| Kontrolní bod | Stav modelu během trénování, periodické snímky | Bursty velké zápisy | Střední (pro zápis v pulzních intervalech) | 5–20 TB |
Inferenční server se 4 GPU obvykle potřebuje pouze první vrstvu a možná i zlomek druhé. Tréninkový server s 8 GPU potřebuje všechny čtyři a ty čtyři chtějí různé disky. Otázka „kolik TB NVMe?“ je bez výběru vrstvy bezvýznamná.
Úložiště modelů
Modelová vrstva obsahuje vaši knihovnu vah – všechny varianty Llama, Qwen, Mistral, Stable Diffusion, Flux a Whisper, které byste kdy očekávali. Je to také místo, kde se nachází operační systém, obrazy kontejnerů, prostředí conda a binární soubory inference serveru. U většiny sestavení se tyto soubory sbalí na bootovací disk.
Velikost je funkcí počtu rezidentních modelů. Některé příklady běžných kvantizací:
- Lama 3 70B Q4: ~40 GB
- Lama 3 70B FP8: ~70 GB
- Qwen2.5-VL 72B Q4: ~45 GB plus několik GB RAM pro vision tower
- Mistral Large 2 (123B) Q4: ~70 GB
- Lama 4 Maverick MoE FP8: ~250 GB
- Skromná knihovna VLM (8 modelů, smíšené kvantizace): 300–500 GB
- Výzkumná laboratoř udržující 30 modelů v provozu: 2–4 TB
Převážně pro čtení. Model se načte jednou při spuštění procesu a po zbytek dne zůstává ve VRAM. Disk provede sekvenční čtení 40 GB při spuštění vLLM a poté je z velké části nečinný. Jeden 2–4 TB Gen4 NVMe – i spotřebitelský disk jako Samsung 990 PRO – to zvládne bez námahy. Plaťte za kapacitu, ne za propustnost.
Úložiště datových sad
Datová sada je místem, kde se nacházejí školicí korpusy a dolaďovací materiály. Tato vrstva je tou, kterou zákazníci chronicky podceňují, protože sada dat, se kterou pracují dnes, jim vyhovuje a zapomínají, že ta příští už ne.
Realistické rozsahy:
- Jednodoménový korpus pro jemné ladění LoRA: 10–100 GB
- Sada pro multimodální doladění (obrázky + text): 1–10 TB
- Textový korpus v předtréninkovém měřítku (podmnožina FineWebu atd.): 5–50 TB
- Sada videí pro předtrénink nebo demonstraci robotiky: 20–200 TB
- Genomický, vědecký nebo archiv ze scrashed webu: 100 TB – 1 PB+
Přístupový vzorec je sekvenční čtení, opakované napříč epochami, napříč mnoha procesy DataLoader paralelně. Citlivé na propustnost (protože GPU čeká), tolerantní k latenci. Rychlost zápisu je v podstatě nulová, jakmile jsou data připravena.
Pro datové sady nad ~10 TB obvykle správná odpověď opouští šasi – viz K04 pro vzory NFS, BeeGFS a objektového úložiště. Uvnitř šasi je rozumná vrstva datových sad s pevnými disky v RAIDZ2 (levné, velké, pomalé, ale postačující po zahřátí mezipaměti stránek) nebo střední třída U.2 NVMe RAID až do velikosti 50 TB.
Scratch
Scratch je neopěvovaný hrdina. Absorbuje vše, co se jinam čistě nevejde: dekódované obrazové fragmenty, meziaktivace vypouštěné ZeRO-Offloadem, mezipaměti datových sad vytvořené webdataset/DALI, dočasné přesuny datových sad, artefakty sestavení kontejneru a výpis z havarovaného běhu. Zároveň náročné na čtení i zápis.
Velikost: 2–8 TB je ideální velikost. Méně než 2 TB a jedno jemné doladění to zaplní. Více než 8 TB a obvykle vytváříte malou vrstvu datové sady a nazýváte ji scratch – sice fajn, ale přiznejte si, co děláte.
Výdrž je zde důležitá způsobem, který u ostatních úrovní nehraje roli. Scratch požírá zápisy – 5–20 TB zápisů denně není na silně používaném tréninkovém boxu neobvyklé. Podnikový disk s kapacitou 1 DWPD a kapacitou 4 TB umožňuje zápisy 4 TB denně po dobu pěti let; seriózní tréninkový scratch vyžaduje 1–3 DWPD, víceúčelový stupeň.
Kontrolní bod
Kontrolní bod je úroveň, kde se nachází stav tréninku. Bursty: deset minut ticho, poté zapsáno 50–500 GB během několika sekund a pak opět ticho.
Kontrolní bod modelu 70B v FP16 má váhy ~140 GB. S FSDP, gradienty a stavem optimalizátoru posouvají velikost kontrolního bodu na 400–700 GB. S DeepSpeed ZeRO-3 a plným stavem optimalizátoru (Adam: 8 bajtů na parametr pro hlavní FP32 + první/druhý moment) může kontrolní bod 70B dosáhnout velikosti blízké 1 TB.
Trvalá rychlost zápisu jednoho NVMe disku 5. generace je ~10–13 GB/s. Kontrolní bod s kapacitou 700 GB zapisuje zhruba za minutu, optimisticky… if Každá hodnost streamuje na svůj vlastní disk. Synchronně, trénovací bloky pro danou minutu. Oprava spočívá v asynchronním segmentovaném kontrolním bodování (popsáno níže).
NVMe Gen4 vs. Gen5 – kdy se prémiové řešení vyplatí
Trh s NVMe v roce 2026 je rozdělen mezi zralou Gen4 (5–7 GB/s) a nyní mainstreamovou Gen5 (12–14 GB/s). Na vrcholu spotřebitelské nabídky je Samsung 9100 PRO s rychlostí sekvenčního čtení 14.8 GB/s a sekvenčního zápisu 13.4 GB/s. Enterprise Gen5 se nachází ve stejném sousedství – Solidigm D7-PS1010 s rychlostí čtení 14.5 GB/s, Micron 9550 MAX s rychlostí čtení 14 GB/s, Kioxia CD8 a SanDisk DC SN861 – všechny s rychlostí čtení 13–14 GB/s a trvalým zápisem 8–10 GB/s.
Nákladová prémie pro Gen5 oproti Gen4 srovnatelné kapacity v polovině roku 2026 činí 30–50 % na straně spotřebitelů a 20–35 % na straně podniků.
Kdy se Gen5 skutečně vyplatí:
- Načítání modelu ze studeného stavu. Model s 250GB MoE se na Gen5 načte za 18 sekund oproti 36 sekundám na Gen4. To je důležité, pokud modely často střídáte.
- Trénovací I/O. Kamerové systémy dekódující nezpracované JPEGy z disku, multimodální datové sady, kde je úzkým hrdlem předzpracování.
- Kontrolní bod pro lokální NVMe před asynchronní kopií. Čím rychlejší je lokální zápis, tím dříve se obnoví školení.
- Server clusterového úložiště podporující 8+ trénovacích uzlů. Agregovaná poptávka klientů překračuje limit Gen4.
Když je Gen4 v pořádku a Gen5 jsou vyhozené peníze:
- Inferenční servery. Model se načte jednou při spuštění; po zbytek dne je disk s rychlostí jednociferného čísla v MB/s.
- Kořenový adresář operačního systému a úložiště kontejnerů. Spouštět jednou za měsíc, občas instalovat balíčky.
- Úroveň datové sady, kde jsou horizontální oddíly předdekódované a velké. PyTorch DataLoader s 8 workery čtoucími shardy WebDataset dosahuje saturace zhruba 4–6 GB/s; Gen4 to pokrývá.
Upřímná verze: asi 70 % zákaznických sestavení, která dodáváme, jsou čistě inference a u těchto sestav je Gen4 NVMe všeobecně správné. Gen5 je rozhodnutí na úrovni školení.
Provedení — M.2, U.2/U.3, E3.S
| Formální faktor | Typické použití | Hot-swap | Tepelný obal | Strop kapacity | Poznámky |
|---|---|---|---|---|---|
| M.2 2280 | Spotřebitel, bota | Ne | 8–10 W | 8 TB | Škrticí klapky při trvalém provozu Gen5 |
| M.2 22110 | Pracovní stanice, server | Ne | 12–15 W | 16 TB | Lepší tepelná hmotnost než 2280 |
| U.2 / U.3 | Standard pro datová centra | Ano | 25 W | 30 TB | Zralý, široce kompatibilní |
| E1.S | Hustota hyperskalerů | Ano | 20 W | 16 TB | Tvar „pravítko“, hustota 1U |
| E3.S | Datové centrum nové generace | Ano | 25–40 W | 30+ TB | Určeno pro termoprádlo Gen5/Gen6 |
M.2 Gen5 bude omezovat provoz. Disk Samsung 9100 PRO 2 TB, který v horkém šasi udržuje rychlost 13 GB/s, dosáhne teploty 75 °C a následně se zpomalí. Modely s chladičem s tím pomáhají. M.2 je vhodný pro bootování a mírné zatížení; pro scratch vrstvu s trvalým zápisem to není ten správný formát.
U.2 je pracant. Každý podnikový NVMe disk, který Kentino dodává v šasi Bone64c nebo Supermicro, je U.2, téměř univerzálně zaměnitelný s backplany U.3. 25W tepelný kryt, dva porty pro multipath, hot-swappable, kapacity 7.68 TB a 15.36 TB se nacházejí na ideálním místě v poměru cena-hustota.
E3.S je pomalu budoucnost. Navrženo od nuly pro termální systémy Gen5/Gen6. Pro sestavení Kentino s jedním serverem nebo malým clusterem zůstává U.2/U.3 praktickou volbou až do roku 2026; E3.S vstupuje do hry pro obnovovací cykly v roce 2027.
Neskládejte nosiče M.2 na sebe do horkého šasi. Adaptéry PCIe karet, které pojmou čtyři disky M.2 za přepínačem, fungují, ale v serveru 4U s osmi grafickými kartami je proudění vzduchu přes tyto nosiče špatné. Do deseti minut trvalého zatížení pozorujeme tepelné škrcení. Pokud v serveru potřebujete čtyři NVMe disky, použijte U.2.
Endurance — DWPD jako nákupní signál
| Třída | DWPD | Případ použití | Nákladová prémie vs. čtení/integrované zpracování. |
|---|---|---|---|
| Intenzivní čtení | 0.3-1 | Bootování, úložiště modelu, datová sada, archiv | základní |
| Smíšené použití | 1-3 | Trénink scratch, checkpoint, hot cache | +30–60 % |
| Intenzivní zápis | 3–10 + | Protokoly, deníky, databáze s vysokou zápisovou náročností | +100–200 % |
Pro server s umělou inteligencí je mapování jednoduché:
- Úroveň modelu: intenzivní čtení, 0.3–1 DWPD.
- Úroveň datové sady: intenzivní čtení, 0.3–1 DWPD.
- Poškrábaná úroveň: smíšené využití, 1–3 DWPD. Toto je úroveň, která si zaslouží svůj rozpočet na vytrvalost.
- Úroveň kontrolního bodu: smíšené použití, 1–3 DWPD. Hromadí se burstní zápisy; 1 DWPD na 4TB disku umožňuje pouze 4 TB/den, což překračuje i náročná tréninková kadence.
Intenzivní zápis (3+ DWPD) je pro téměř každou úlohu umělé inteligence zbytečný. Nákup nesprávné úrovně odolnosti je opravitelný náhradou; nákup nesprávné třídy propustnosti často ne. Získejte správnou propustnost v době sestavení, zacházejte s odolností jako s něčím, co můžete vylepšit.
RAID pro NVMe – hardware je mrtvý, software je řešením
Toto si zaslouží vlastní podsekci, protože se zákazníci stále ptají. Stručně řečeno: pokud má vaše sestava v roce 2026 hardwarový RAID řadič před NVMe disky, je špatně nakonfigurovaný.
Hardwarové řadiče RAID (LSI/Broadcom MegaRAID, Microchip SmartRAID, HPE Smart Array, Dell PERC) byly navrženy pro SAS/SATA. Integrovaný ASIC řadiče zvládá paritu, ukládání do mezipaměti a řazení příkazů do fronty a při šířce pásma SAS (12 Gbit/s = 1.5 GB/s) má dostatek prostoru pro přetížení.
NVMe Gen5 s rychlostí 14 GB/s na disk saturuje řadič RAID s jednou kartou po dvou discích. Osm disků za hardwarovou kartou RAID produkuje větší šířku pásma, než kolik dokáže PCIe uplink karty přenést. Řadič se stává úzkým hrdlem a následně bodem selhání.
Praktickými odpověďmi jsou software:
- mdadm (softwarový RAID pro Linux). Zralý, v jádře, dobře podporuje RAID0/1/10. RAID5/6 na NVMe funguje, ale výpočet parity spotřebovává CPU. Pro 4 NVMe v mirror nebo stripe: perfektní.
- ZFS RAIDZ2. Lepší analýza integrity dat (kompletní kontrolní součty), lepší nástroje pro čištění a nahrazování, sémantika snapshotů/klonů. Vyšší nároky na CPU než mdadm. Správná volba pro archivní a datové vrstvy, kde je integrita dat důležitější než maximální propustnost.
- Replikace / mazání na jednotku na aplikační vrstvě. U velmi velkých polí, prokládání MinIO/Ceph EC nebo BeeGFS zcela přesouvá rozhodování o redundanci mimo blokovou vrstvu.
Pro většinu sestavení Kentina:
- Bota: 2× M.2 NVMe v mdadm RAID1.
- Poškrábat: RAID0 přes 2–4 NVMe (data lze regenerovat).
- Datová sada/kontrolní bod: RAID10 v mdadm nebo RAIDZ2 v ZFS.
Hardwarový RAID má v serveru s umělou inteligencí přesně jeden zbývající případ použití: malé bootovací zrcadlo za základní kartou Broadcom/MegaRAID na serveru, kde bezpodmínečně chcete bootovací redundanci před spuštěním operačního systému. I tam funguje mdadm RAID1 s EFI na obou discích dobře.
Síťové úložiště pro vrstvu datové sady
| Vzor | Síť | Použitelné čtení | Kdy je to správné |
|---|---|---|---|
| NFS přes 10 GbE | 10 GbE | ~ 1 GB / s | Malá laboratoř, jeden trenažér |
NFS přes 25 GbE s nconnect=8
|
25 GbE | ~ 2.5 GB / s | 1–2 školitelé, mírná míra datových dat |
NFS přes 100 GbE s nconnect=16
|
100 GbE | 8–10 GB/s | Multi-trainer, velké datové sady |
| BeeGFS přes 100 GbE, 2–3 úložné cíle | 100 GbE | 30–60 GB/s | Trénovací cluster se 4–8 uzly |
| Úložiště objektů (MinIO/Ceph) + lokální prostředí | 25/100 GbE | se liší | Epizodické trénování, velké datové jezero |
Ponaučení: datová vrstva nad 10 TB téměř vždy patří mimo server umělé inteligence. Uvnitř šasi chcete rychlé scratchování, rychlé kontrolní body a úložiště modelů; datová sada může být vzdálená.
Jak PyTorch ve skutečnosti načítá data
Užitečným modelem pro dimenzování úložiště je řídit se tím, co PyTorch... DataLoader dělá. S num_workers=8 a pin_memory=True:
- Osm pracovníků zpracovává každý otevřený soubor datové sady paralelně.
- Každý pracovník čte, dekóduje (JPEG, video snímky, převzorkování zvuku) a tenzorizuje vzorek.
- Dekódovaný tenzor je umístěn ve sdílené paměti.
- Hlavní proces stahuje data ze sdílené fronty, připojuje je k hostitelské RAM a kopíruje je do GPU přes DMA.
Praktické důsledky:
- Kanál vizuálního zpracování je zřídka omezen na úložiště. Pokud datová sada není tak velká, mezipaměť stránek nemůže pojmout pracovní sadu.
- Předtréninkový kanál LLM čte předtokenizované shardy je na Gen4 často vázáno na úložiště. Gen5 pomáhá. Stejně tak umístění aktivní sady horizontálních oddílů na lokální NVMe místo NFS.
- Inference v podstatě nikdy není vázána na úložiště. po načtení modelu. Ukazatel aktivity disku na servírovací krabici je plochý.
Útes kontrolního bodu
Kontrolní bod modelu 70B v FP16 má 140 GB vah. Přidání stavu optimalizátoru Adam (~8 bajtů na parametr pro FP32 master + first + second moment): ~560 GB navíc. Přidání přechodů, pokud pořizujete snímky v polovině kroku: ~140 GB navíc. „Kompletní“ kontrolní bod 70B může dosáhnout 800 GB až 1 TB v závislosti na tom, co ukládáte.
Synchronní kontrolní bod zápisu všeho v jednom pořadí na jeden Gen5 NVMe s trvalou rychlostí zápisu 13 GB/s: ~75 sekund pro kontrolní bod 1 TB. Trénovací bloky po celou dobu trvání. Pokud to provedete každých 100 kroků, kdy každý krok trvá 5 sekund, znamená to, že jste trénovací běh právě zpomalili o 15 %.
Dvě opravy, obě zásadní:
1. Dělené kontrolní body. Každá úroveň FSDP zapisuje svůj vlastní shard na svůj vlastní lokální NVMe disk. S 8 GPU a 8 lokálními disky je zápis na úroveň 125 GB a zápisy probíhají paralelně. Nástěnná frekvence klesá na přibližně 10 sekund.
2. Asynchronní kontrolní body. PyTorch DCP (torch.distributed.checkpoint) odlehčí zápis vláknu CPU. GPU se krátce zastaví pro kopii GPU→CPU staging (na několik sekund), poté se trénování obnoví a samotný zápis do úložiště probíhá na pozadí.
Kombinace – asynchronní shardované – mění úložiště kontrolních bodů z „musí absorbovat 1 TB během několika sekund“ na „musí držet krok s ustálenou rychlostí kopií na pozadí o rychlosti několika stovek MB/s“. To zvládá téměř každá úroveň úložiště. Chyba, které se je třeba vyhnout: synchronní kontrolní body s plným stavem na úroveň zapisované přímo do NFS. To bylo v roce 2022 normální. V roce 2026 je to nedbalost.
Betonové úložné prostory K-AI
4-GPU inferenční server (např. K-AI 192 Genoa, 4× RTX 5090 nebo 4× RTX Pro 6000 Blackwell):
Boot + model: 1× 2 TB Gen5 M.2 NVMe (consumer or read-intensive enterprise)
Scratch: optional, often unnecessary for pure inference
Dataset: not needed on the box
Checkpoint: not needed on the box
Total: 2 TB NVMe. Cost: low. Sufficient for any inference workload.
Tréninkový server s 8 grafickými kartami (např. K-AI 256 Turin Dual, 8× RTX 5090 nebo 8× RTX Pro 6000):
Boot: 2× 480 GB M.2 NVMe, mdadm RAID1, ext4 → /
Model storage: 2× 4 TB U.2 Gen5 NVMe, mdadm RAID1, ext4 → /models
Scratch: 2× 8 TB U.2 Gen5 NVMe, mdadm RAID0, XFS → /scratch
Checkpoint: 2× 8 TB U.2 Gen5 NVMe, mdadm RAID10, XFS → /checkpoints
Dataset: NFS mount from external storage server, 100 GbE
Total local NVMe: ~36 TB. Cost: meaningful but matched to GPU spend.
Sdílený úložný uzel clusteru (oddělený od výpočetního prostředí):
Boot: 2× 960 GB M.2 NVMe, RAID1, ext4
Hot tier: 12× 7.68 TB U.2 Gen5 NVMe, ZFS RAIDZ2 or BeeGFS storage target, XFS
Cold tier: 8× 16 TB SAS HDD, ZFS RAIDZ2 → /archive
Network: 2× 100 GbE, RoCE or NVMe-oF capable
Serves the cluster's dataset tier. See K04 for distributed FS choice.
Dvě věci, kterých je třeba si všimnout. Inferenční server má jeden pohonTréninkový server má čtyři vrstvy, ale každý disk je dimenzován pro svou roli, není předimenzován na největší dostupný disk. Uzel úložiště clusteru je zcela samostatný počítač.
Upřímný názor – většina zákazníků nadhodnocuje úložiště
Vzor, který vidíme dostatečně často, abychom si zasloužili zmínku: zákazník si postaví server s 8 grafickými procesory, „aby byl připraven na budoucnost“, specifikuje osm 15.36TB U.2 NVMe disků, protože tam sloty jsou, a poté spouští inferenční úlohy, které se dotýkají možná 200 GB modelových souborů, a zbytek pole navždy nechává nečinný. NVMe v hodnotě 25 000 eur, které zůstávají chladné.
Pravidla pro poctivý výběr velikosti:
- Čistá inference, jeden server: Celkem 2–4 TB NVMe. Jeden disk. Hotovo.
- Inference plus občasné doladění: Celkem 4–8 TB. Spuštění + odemčení.
- Vážný trénink, jeden server: 16–40 TB napříč bootovacím/modelovým/scratchovým/kontrolním úložištěm, s datovou sadou externě na NAS nebo v úložišti objektů.
- Klastr: datová sada a kontrolní body se přesouvají do sdíleného úložiště; lokální NVMe pro jednotlivé uzly se zmenšuje zpět na inferenční profil (2–8 TB) pro bootování, modelování a zpětný zápis.
Úložiště je jediné místo v sestavě umělé inteligence, kde se instinkt „více je vždy lépe“ neustále mýlí. Škálování grafických karet (GPU) je zhruba lineární úměrné nákladům; RAM se škáluje rozumně; úložiště se často vůbec neškáluje, jakmile máte dostatek prostoru.
Co se láme
Druhy selhání, které vidíme v praxi, v tomto pořadí:
- Spouštěcí disk je spotřebitelský M.2 bez redundance. Disk selhává po 18 měsících, server nelze spustit, modely zůstávají v RAIDu bezpečně, ale přestavba je hračka. Oprava: 2× M.2 v mdadm RAID1, a to i na inferenčních boxech.
- Vyplnění škrábanců uprostřed běhu. Mezipaměť datové sady, dekódované shardy a dočasné soubory frameworku se shodují. Oprava: monitor, alarm při 80% zaplnění, velikost 1.5× největší očekávaná pracovní sada.
- Hardwarová RAID karta za NVMe. Výkon je poloviční, než by měl být, řadič je jediným bodem selhání, výměna je exotická. Oprava: vyndání karty, mdadm nebo ZFS přímo.
- Synchronní kontrolní bod s NFS, tréninkové stánky. Oprava: asynchronní horizontálně definovaný kontrolní bod, nejdříve lokální NVMe, poté asynchronní kopie.
- Tepelná škrticí klapka Gen5 M.2. Disk s rychlostí 14 GB/s po 3 minutách nepřetržitého zápisu zvládne rychlost 4 GB/s. Oprava: chladič, lepší proudění vzduchu nebo přechod na U.2.
- Datová sada na úrovni datové saturace saturuje Gen4. Trénovací kanál pro vizuální analýzu je z 30 % vázán na úložný prostor. Oprava: Provedení scratch verze Gen5, předdekódování do WebDataset nebo obojí.
-
ZFS ARC spotřebovává RAM určenou pro trénování. Výchozí alokace 50 % OOM v tréninkovém procesu. Oprava: omezení
zfs_arc_maxna 10–20 % RAM. Viz L04.
Co dělat dál
Postup dimenzování před podpisem smlouvy o sestavení:
- Inference, trénink nebo obojí? Inference: přejděte ke kroku 5 s jedním nájezdem. Trénink: pokračujte.
- Jaký největší model chcete trénovat nebo doladit? Vynásobte počet parametrů počtem bajtů na parametr (FP16: 2, FP8: 1, BF16+stav optimalizátoru: 16). To je minimální velikost kontrolního bodu na snímek.
- S jakým největším datovým souborem budete v příštích 12 měsících pracovat? Do velikosti ~10 TB se vejde na lokální NVMe v datové vrstvě. Nad 10 TB patří na NAS nebo do úložiště objektů – viz K04.
- Budete provádět horizontálně asynchronní kontrolní stanoviště? Pokud ano (PyTorch DCP, NeMo, moderní frameworky), úložiště kontrolních bodů na uzel se zmenší 4–8×. Pokud to nejde, naplánujte si, že na každém uzlu bude zobrazen plný stav, a upravte jeho velikost podle potřeby.
- Vyberte si tvarový faktor. M.2 pro bootování. U.2/U.3 pro vše ostatní v serverové šasi. E3.S pouze v případě, že byla šasi pro něj zakoupena.
- Vyberte si vytrvalost. 1 DWPD náročné na čtení pro model a datovou sadu. 3 DWPD smíšené použití pro schránkové a kontrolní body.
- Vyberte generaci. Gen5, kde se propustnost vyplácí (scratch, checkpoint, model swap na multi-tenant boxech). Gen4 všude jinde.
- Rozhodněte se pro RAID na úrovni operačního systému. mdadm pro malá pole, ZFS, kde záleží na kontrolních součtech, žádný hardwarový RAID řadič před NVMe.
Křížový odkaz: W01 jak se velikost RAM vztahuje k načítání modelu z úložiště, W02 pro spotřebu úložných jednotek s nízkým rozpočtem na linku PCIe.
Úložný prostor je tou částí konstrukce, kde se zdrženlivost vyplácí. Nejjednodušší konfigurace, která nepředstavuje úzká hrdla, je téměř vždy ta správná.
Toto je součást Kentino Wiki, referenční série o výpočetní technologii s využitím umělé inteligence, robotice a systémech, které je propojují. Komentáře a opravy jsou vítány na adrese info@kentino.com.