Tokeny za sekundu na euro: Ekonomika GPU pro inferenci
Většina kupujících se ptají špatně. Chtějí vědět, která GPU je „nejrychlejší“. Správná otázka pro inferenční úlohu produkce zní: „Která GPU vyprodukuje nejvíce tokenů na jedno euro utracené v příštích třech letech pro model, kterému skutečně sloužím.“ Tyto dvě otázky mají různé odpovědi a rozdíl je dostatečně velký, že důraz na hrubou rychlost běžně stojí zákazníky Kentina 30–60 % jejich rozpočtu.
Tento článek funguje na základě výpočtů. Cílovou skupinou je někdo, kdo určuje velikost inferenčního sestavení, četl W01 a N03a nyní se musí rozhodnout mezi RTX 5090, RTX Pro 6000 Blackwell, L40 nebo L4 – a kolik z nich.
Metrika: proč tok/s za euro, ne tok/s
Záleží na dvou výkonnostních režimech a jejich směšování je nejčastější chybou při dimenzování.
Jednoproudový tok/s je to, co vidí jeden uživatel, když čeká na jednu odpověď. Je to omezeno šířkou pásma při generování tokenů a téměř výhradně funkcí šířky pásma VRAM dělené hmotnostní stopou modelu (viz W01). Trvalá propustnost tok/s je to, co server vydává pro mnoho souběžných uživatelů s povoleným kontinuálním dávkováním. Na hardwaru třídy Blackwell je to vázáno na výpočetní kapacitu, jakmile počet dávek překročí 16. Na tom záleží produkčnímu prostředí.
Tyto dva výsledky se na stejné kartě liší 10–25×. Jednostreamová Llama 70B INT4 na RTX Pro 6000 Blackwell dosahuje přibližně 32 toků/s. Stejná karta v dávce 32 s kontinuálním dávkováním vLLM dosahuje souhrnně více než 600 toků/s. Vybírání poddimenzovaných jednostreamových nasazení s propustností řádově zvyšuje; vybírání naddimenzovaných nasazení citlivých na latenci. Matematika celkových nákladů na vlastnictví (TCO) zde využívá trvalou propustnost, protože ta je to, co dominuje.
Aktuální maloobchodní ceny v EU (květen 2026)
Níže uvedené ceny jsou maloobchodní ceny v EU bez DPH v otevřeném kanálu – nejedná se o objemové smlouvy OEM ani o pronájem cloudu. Zdroj: ceníky a seznam distributorů v EU v květnu 2026. Považujte je za rozpětí; čtvrtletní výkyvy 10–20 % jsou běžné.
| GPU | VRAM | TDP | Maloobchodní cena v EU bez DPH |
|---|---|---|---|
| RTX 5090 | 32 GB GDDR7 | 575 W | 2,500 € - 3,000 € |
| Pracovní stanice RTX Pro 6000 Blackwell | 96 GB ECC | 600 W | 8,000 € - 9,500 € |
| RTX Pro 6000 Blackwell Server Edition | 96 GB ECC | 600 W | 8,500 € - 10,000 € |
| L40 | 48 GB ECC | 300 W | 7,500 € - 9,500 € |
| L4 | 24 GB | 72 W | 2,500 € - 3,500 € |
| H100 SXM (referenční, neprodává Kentino) | 80 GB HBM3 | 700 W | 27,000 € - 35,000 € |
Jen z této tabulky dvě pozorování. Pro 6000 Server Edition stojí zhruba 3× více než 5090 za 3× větší VRAM a ekvivalentní šířku pásma – cena se řídí kapacitou paměti, nikoli hrubou rychlostí. L4 je jediná karta zde s příkonem pod 100 W. Už jen tato skutečnost mění celkových nákladů na vlastnictví, jakmile do rovnice vstoupí elektřina.
Hodnoty benchmarků pro jeden GPU
Níže uvedená čísla pocházejí z veřejných benchmarků (vLLM, llama.cpp, SGLang) shromážděných ze Spheronu, CloudRiftu, RunPodu a z vlastních publikovaných běhů projektu vLLM od května 2025 do května 2026. Nejedná se o Kentinova benchmarková data – porovnali jsme je s našimi interními boxy 4×5090 a 4×Pro 6000 pro buňky, které pravidelně obsluhujeme; veřejná čísla se pohybují v rozmezí ±15 %.
Llama 3.3 70B FP8 — dekódování jednoho proudu
| GPU | tok/ů | Poznámky |
|---|---|---|
| RTX 5090 | n / a | Závaží FP8 s kapacitou 75 GB se nehodí na 32 GB |
| Pracovní stanice RTX Pro 6000 BW | 28-34 | Vejde se na jednu kartu s prostorem pro KV |
| RTX Pro 6000 BW Server Ed. | 28-34 | Stejný křemík, serverové chladiče |
| L40 | n / a | 48 GB je pro FP8 70B příliš málo; pouze INT4 |
| L4 | n / a | Mimo třídu |
| H100 SXM (referenční) | 55-65 | Šířka pásma HBM3 |
Llama 3.3 70B INT4 (AWQ) – dekódování jednoho proudu
| GPU | tok/ů | Poznámky |
|---|---|---|
| RTX 5090 | n/a single | 40 GB INT4 prolévá 32 GB; potřebuje 2× |
| 2× RTX 5090 (TP=2) | 24-30 | Viditelná daň PCIe TP |
| RTX Pro 6000 BW | 30-36 | Pohodlně se vejde, více než 50 GB volného místa pro KV |
| L40 | 14-18 | GDDR6 ECC, nižší šířka pásma |
| L4 | 4-6 | 24 GB sotva udrží váhu, pomalé |
Qwen 2.5 32B INT4 (AWQ) — jednoproudový
| GPU | tok/ů | Poznámky |
|---|---|---|
| RTX 5090 | 55-65 | Váhy 18–20 GB, KV ve zbývajících 12 GB |
| RTX Pro 6000 BW | 55-65 | Omezeno šířkou pásma s 5090; prostor pro ukládání dat je velký |
| L40 | 28-34 | Omezená šířka pásma |
| L4 | 9-12 | Omezená paměť, omezená propustnost |
Llama 3 8B FP16 – jednoproudová a agregovaná
| GPU | Jednotlivý tok/y | Agregát v dávce 32 |
|---|---|---|
| RTX 5090 | 90-110 | 3,200-3,800 |
| RTX Pro 6000 BW | 90-110 | 3,400-4,000 |
| L40 | 45-55 | 1,400-1,800 |
| L4 | 20-28 | 380-550 |
Pár poctivých výkladů z těchto tabulek. 5090 a Pro 6000 Blackwell mají identickou šířku pásma (1.79 TB/s) a identické dekódovací rychlosti na token. — rozdíly jsou v kapacitě VRAM a ECC, nikoli v rychlosti. L40 má zhruba poloviční rychlost v porovnání s dvojicí Blackwell, protože GDDR6 ECC je 860 GB/s oproti 1 790 GB/s. L4 je karta se čtvrtinovou šířkou pásma; vynahrazuje to hustotou a cenou.
Pro single-streamový provoz třídy 70B je Pro 6000 Blackwell jedinou kartou, která tento model provozuje na FP8 v jednom slotu. 5090 vás nutí používat INT4 a 2-way tensor paralelní – a TP=2 na PCIe ztrácí 30–35 % kvůli all-reduce (viz N03).
Škálování pro více GPU: daň z PCIe
Tenzorový paralelní provoz pouze s PCIe se neškáluje lineárně. Mechanismus jsme probrali v N03Zde jsou empirické multiplikátory, které byste měli dosadit do modelu celkových nákladů na vlastnictví (TCO).
| GPU | Konfigurace | Realistické škálování propustnosti vs. 1× |
|---|---|---|
| 1 × | základní | 1.00 |
| 2 × | TP=2 PCIe Gen5 | 1.50-1.70 |
| 4 × | TP=4 PCIe Gen5 | 2.5-3.0 |
| 8 × | TP=4 × PP=2 (preferováno) | 5.0-6.0 |
| 8 × | TP=8 PCIe (vyhnout se) | 4.0-4.8 |
Cesty paralelní s kanálem a datově paralelní se škálují téměř lineárně; tenzorově paralelní platí daň, která roste s počtem GPU. Pro model třídy 70B je správná konfigurace na 8× 5090 dvě nezávislé repliky (DP=2 × TP=4) nebo TP=4 × PP=2 – nikoli TP=8. Viz K03 pro konfigurační pravidla.
To je důležité z hlediska nákladů, protože zdvojnásobení počtu GPU nikdy nezdvojnásobí propustnost. Naivní rozpočtová projekce typu „dvakrát více GPU, dvakrát více tok/s“ nadsazuje sliby o 30–50 %.
Model tříletých celkových nákladů na vlastnictví (TCO)
Cena GPU je zhruba polovina skutečných nákladů na provoz inferenční karty po dobu tří let. Druhá polovina je elektřina, sdílení šasi a podlahová plocha. Níže uvedený model je to, co interně používáme pro dimenzování K-AI.
Per-GPU 3-year TCO =
GPU cost
+ Chassis share (chassis + CPU + RAM + PSU + NIC) / GPU count
+ Electricity: TDP × utilization × 8,760 h × 3 × €0.20/kWh
+ Colo/rack space share
+ Maintenance & spares (~5% of GPU cost / year)
Níže uvedené předpoklady:
- Elektřina: 0.20 €/kWh smíšená (typická průmyslová kolonie v EU nebo vlastněná DC). Český maloobchodní prodej je často 0.18 €–0.22 €; v Německu vyšší.
- Využití: 60% trvalé zatížení (realistické výrobní zatížení – nikoli referenční hodnota 100 %, ani laboratorní hodnota 5 %).
- PUE: 1.4. Režijní náklady datového centra (chlazení, distribuční ztráty). To zvyšuje efektivní spotřebu elektřiny na 0.28 €/kWh odběru GPU.
- Podíl podvozku: 4 000 EUR amortizovaných na 4 GPU (1 000 EUR/GPU) pro sestavení Kentino 5090 se 4 GPU; 8 000 EUR na 8 (1 000 EUR/GPU) pro šasi Pro 6000 s 8 GPU.
- Údržba: 5 %/rok nákladů na GPU (fond na rezervní kartu + čas ovladače/provozu).
Tabulka celkových nákladů na vlastnictví (TCO) pro jednotlivé GPU
| GPU | Karta € | Podvozek € | Elektřina € (3 roky) | Údržba € (3 roky) | Celkové náklady na vlastnictví 3 roky € |
|---|---|---|---|---|---|
| RTX 5090 | 2,800 | 1,000 | 2,540 | 420 | 6,760 |
| RTX Pro 6000 BW WS | 8,800 | 1,000 | 2,650 | 1,320 | 13,770 |
| RTX Pro 6000 BW SE | 9,400 | 1,000 | 2,650 | 1,410 | 14,460 |
| L40 | 8,500 | 1,000 | 1,325 | 1,275 | 12,100 |
| L4 | 3,000 | 800 | 318 | 450 | 4,568 |
| H100 SXM (ref.) | 30,000 | 3,500 | 3,090 | 4,500 | 41,090 |
Údaje o elektřině: TDP × 0.60 × 8 760 × 3 × 0.20 × 1.4 (PUE) / 1 000. Řada L4 je pozoruhodná – její trvalý tříletý účet za elektřinu je 318 EUR. Model 5090 je 2 540 EUR. Osmkrát větší spotřeba energie, osmkrát větší účet.
Cena za milion tokenů
Nyní zkombinujte TCO s naměřenou trvalou propustností na reprezentativním pracovním zatížení – Llama 3.3 70B INT4 v dávce 32, nebo Qwen 32B v dávce 32, nebo Llama 8B v dávce 64. Vezměte trvalý tok/s karty, vynásobte jej využitím 0.60 × 3 × 8 760 × 3 600, abyste získali celkový počet obsloužených tokenů, a vydělte TCO tímto počtem. Níže uvedená čísla jsou ilustrativní; vylaďte je pro váš skutečný model a dávku.
| GPU | Pracovní zátěž | Trvalý toxin/y | Žetony/3 roky (B) | € / Mtok |
|---|---|---|---|---|
| RTX 5090 | Lama 8B FP16 šarže 64 | 3,500 | 199 | 0.034 |
| RTX 5090 | Qwen 32B INT4 šarže 32 | 600 | 34 | 0.20 |
| Pro 6000 BW | Lama 70B FP8 šarže 32 | 480 | 27 | 0.51 |
| Pro 6000 BW | Qwen 32B INT4 šarže 32 | 650 | 37 | 0.37 |
| L40 | Lama 8B FP16 šarže 64 | 1,600 | 91 | 0.13 |
| L40 | Qwen 32B INT4 šarže 32 | 320 | 18 | 0.67 |
| L4 | Lama 8B FP16 šarže 64 | 450 | 26 | 0.18 |
| L4 | Lama 8B FP8 šarže 128 | 650 | 37 | 0.12 |
Třetí sloupec si představte jako náklady na milion obsloužených tokenů, při plném využití celkových nákladů na vlastnictví (TCO). API s otevřeným routerem a cloudem pro stejné modely účtují 0.10–2.00 EUR za milion tokenů v závislosti na úrovni; to řadí on-premise řešení na stejnou úroveň nebo i levnější při trvalém zatížení. Matematika se pod 30% využitím rozpadá – celkové náklady na vlastnictví jsou ovlivněny kapitálovými výdaji, za které jste zaplatili, ať už jste službu využívali, nebo ne.
Případ z roku 5090
Na papíře má 5090 nejlepší hrubý tok/s na euro ze všech karet v řadě Kentino pro inferenci pod 72B. 2 800 EUR za šířku pásma 1.79 TB/s a 32 GB GDDR7 je spousta karty. Pro jednoho uživatele s modelem třídy 32B není nic jiného ve stejném poměru.
5090 se rozpadá na dvou místech:
- Modely, které se nevejdou do 32 GB v požadovaném množství. 70B FP8 (~75 GB) potřebuje 3–4 karty; 70B INT4 (~40 GB) potřebuje 2. Jakmile provedete tenzorové paralelní zapojení napříč PCIe, zaplatíte 30–50% daň „all-sleep“ a vaše tok/s-per-card se zhroutí.
- Škálování více GPU nad rámec paralelního provozu pipeline. 8× 5090 je skutečný produkt (my ho vyrábíme), ale propustnost na kartu na tenzorově paralelním 70B je zhruba 0.55× oproti jedné kartě. Koupili jste osm karet a dostali jste 4.4× větší propustnost. Ne 8×.
Silnou stránkou modelu 5090 je možnost hostování několika replik menších modelů. 4× 5090 s čtyřmi nezávislými replikami Qwen 32B za load balancerem překonává 4× 5090 s tenzorově paralelním provozem a jedním Llama 70B jak v propustnosti, tak v latenci – a zcela se vyhýbá penalizaci PCIe.
Pouzdro Pro 6000 Blackwell
96 GB paměti ECC GDDR7 s přenosovou rychlostí 1.79 TB/s je to, co si koupíte, když se na jednu kartu potřebuje vejít 70B FP8 a nechcete se o tom hádat s PCIe. Edice Workstation a Server sdílejí stejný křemík, stejnou paměť, stejnou šířku pásma – rozdíl je ve tvarovém faktoru (aktivní vs. pasivní chlazení), BIOSu s maximálním výkonem a validaci pro OEM serverové šasi. Edice Server stojí o 700–1 500 EUR více a je tou správnou volbou pro jakoukoli rackovou sestavu, která běží 24 hodin denně, 7 dní v týdnu.
Kde Pro 6000 vítězí v poměru tok/s k euru:
- Hosting 70B FP8 s jednou kartou. Žádný tenzorový paralelní přenos, žádné zdanění PCIe. Jeden stream rychlostí 30+ tok/s, dávkový agregát rychlostí 480+ tok/s.
- Horizontální škálování pomocí replik. 4× Pro 6000 = čtyři nezávislé 70B repliky za routerem. Lineární škálování propustnosti, elegantní izolace selhání.
- ECC pro školení. Pokud pracovní zátěž zahrnuje doladění LoRA / QLoRA nebo úplné přeškolení, ECC si své udržení zaslouží (viz W01).
Kde je Pro 6000 přehnaná: jakékoli nasazení, které nepotřebuje >32 GB na kartu. Pokud se všechny vaše modely vejdou na 5090, platíte 3× více za VRAM, kterou nebudete používat. To se stává pravidelným problémem – kupující si vybere Pro 6000, protože je to „profesionální“ karta, a pak na ní pouští 13B model.
Případ L40
L40 se nachází v nepříjemné pozici. 48 GB ECC, GDDR6, ne GDDR7, šířka pásma 860 GB/s – zhruba polovina oproti Pro 6000 Blackwell při 75–90 % ceny. V čistém poměru tok/s na euro vítězí Pro 6000.
Pouzdro L40 je postaveno na třech dalších osách:
- TDP. 300 W oproti 600 W. Polovina elektřiny za tři roky (1 325 EUR oproti 2 650 EUR v našem modelu). V tepelně omezených raccích nebo jednofázových obvodech je to rozdíl mezi čtyřmi nebo dvěma kartami.
- Ověření datového centra. L40 je dodáván s pasivním chlazením, validací OEM u společností Supermicro/Dell/HPE a standardní 5letou zárukou pro datová centra. Pracovní stanice Pro 6000 není validována pro nepřetržitý provoz šasi; edice Server ano, ale je novější v distribučním kanálu.
- Strop spolehlivosti. L40 je určen pro trvalé zatížení serveru. Průměrná doba mezi poruchami při nepřetržité inferenční zátěži je měřitelně lepší než u 5090 odvozeného od spotřebitele.
Upřímné čtení: pokud vašemu zákazníkovi záleží více na provozuschopnosti než na hrubých nákladech – regulovaná odvětví, smlouvy SLA na dobu neurčitou, cokoli, co přichází o peníze, když karta uprostřed noci vypadne – L40 si za ty náklady na euro stojí. Co se týče hrubého poměru ceny a výkonu, tak to neplatí.
Případ L4
L4 je ten, na který se nikdo neptá a který by si většina zákazníků měla koupit. 24 GB, 72 W, jeden slot, nevyžaduje napájecí konektor, pasivně chlazený. Osm kusů se vejde do 1U serveru. Šestnáct do 2U.
Co L4 dělá dobře:
- Model třídy 8B sloužící ve velkém měřítku. Llama 3 8B FP8 v dávce 64 dosahuje výkonu okolo 650 toků/s na kartu. Osm L4 v jednom šasi = celkem 5 000 toků/s pro koncový bod Llama 8B. Stejné šasi spotřebovává 600 W GPU.
- Hustota více replik. Každá L4 hostuje nezávislý 8B model. Osm replik za load balancerem bez jakékoli komunikace mezi GPU. Selhání jedné karty odebere 1/8 kapacity, nikoli celou službu.
- Lokality s omezeným výkonem. Obvod 16 A zvládne napájet dvanáct L4 plus režii hostitele. Stejný obvod sotva zvládne tři 5090.
- Cena za milion tokenů. S cenou 0.12 €/Mtok pro 8B FP8 je L4 levnější než jakékoli cloudové API pro stejnou modelovou třídu.
Co L4 dělá špatně: cokoli nad 13B, cokoli, co vyžaduje skutečnou šířku pásma, jakýkoli druh tréninku. L4 je inferenční karta s pevnou funkcí pro malé až střední modely. Pokud vaše pracovní zátěž neodpovídá tomu, přeskočte ji.
Upřímné srovnání vs. cloud
Cloudová matematika pro sestavení podobného typu. AWS p5.48xlarge (8× H100 SXM) se prodává za 98.32 USD/hodinu na vyžádání, normalizováno na 12.29 USD za hodinu GPU. Specializované cloudy s umělou inteligencí (Lambda, RunPod, CoreWeave) stojí 2.00–4.00 USD za hodinu H100 na vyžádání a méně při ročních závazcích.
Cena tříletého cloudového řešení na vyžádání pro jeden inferenční slot ekvivalentní H100:
- AWS na vyžádání: 12.29 USD × 8 760 × 3 = $323,000
- Spotová/sleva AI cloud: 2.50 $ × 8 760 × 3 = $65,700
- Rezervace cloudu s umělou inteligencí na 1 rok: ~1.80 USD × 8 760 × 3 = $47,300
Kentino on-premise 8× Pro 6000 Server Edition: Celkové náklady na vlastnictví ~115 000 EUR za tři roky pro osm karet. 14 400 EUR na kartu. To je zhruba čtvrtina nejlevnějšího cloudového H100 rezervována propustnost srovnatelnou s inferencí (Pro 6000 BW dosahuje ~60–70 % H100 SXM na inferenčních úlohách nezávislých na NVLink).
Bod zvratu versus rezervace H100 pro cloudovou AI: On-premise server 8× Pro 6000 se zaplatí při zhruba 50% využití po dobu tří let. Pod tím nájem. Nad tím vlastní. K tomuto výpočtu dospívá každý seriózní kupující on-premise nemovitostí, a proto on-premise inference v roce 2026 navzdory snižování cen cloudu stále existuje.
Matice doporučení pro pracovní zátěž a GPU
| Pracovní zátěž | GPU první volby | Proč |
|---|---|---|
| Lama 8B / Qwen 7B / Mistral 7B v měřítku | L4 (vícenásobný) | Nejlepší tok/s/€ u malých modelů, nejnižší spotřeba |
| Jeden uživatel, třída 32B, citlivé na latenci | RTX 5090 | Nejlepší šířka pásma/€, pasuje na INT4 |
| Víceuživatelská třída 32B, citlivá na propustnost | 2× RTX 5090 nebo 1× Pro 6000 | Replika měřítka nebo jedna karta, pokud to rozpočet dovolí |
| 70B inference, jeden uživatel, kvalita FP8 | RTX Pro 6000 Blackwell | Jediná karta, která pasuje na 70B FP8 na jednom slotu |
| 70B inference, víceuživatelská propustnost | 4× Pro 6000 BW (repliky DP) | Lineární škálování bez daně z PCIe TP |
| Jemné doladění 70B (LoRA / QLoRA) | RTX Pro 6000 Blackwell SE | ECC, validace 24/7, kompatibilní s tréninkovým KV v 96 GB |
| 70B trénink od nuly | ne sestava Kentina | Pronajměte si NVLink H100/B200 a poté si přineste váhy na pracoviště |
| Smíšená inference + lehké trénování, regulované místo | L40 | ECC, trvalá spolehlivost, ověřené datové centrum |
| Omezený rozpočet na napájení racku, hustota 1U | L4 (8× na 1U) | 72 W, jeden slot, ECC není pro inferenci potřeba |
| 405B hustá inference | 3× Pro 6000 BW (PP) | Jediná cesta na hardwaru Kentino; viz K03 |
Upřímný pohled
Většina zákazníků Kentina se ptá, která karta je nejrychlejší. Vzhledem k pracovní zátěži, kterou většina z nich skutečně má – 7B nebo 8B chatovací model, možná 32B model pro uvažování, možná model pro vidění v třídě 7B–13B – je správná odpověď L4 nebo 5090, nikoli vlajková loď. Cenová prémie za Pro 6000 Blackwell je podle našich cen 5 000–7 000 EUR za kartu. Při čtyřech kartách na sestavení to znamená 20 000–28 000 EUR za VRAM, kterou zákazník platí a kterou nepoužívá.
Úkolem je zeptat se, které modely, v jaké souběžnosti, v jakém kontextovém okně – a podle toho dimenzovat. Menší zakázka, zákazník se vrací, když se daná zakázka škáluje.
Co dělat dál
Pokud určujete velikost stavby, postupujte podle těchto kroků v tomto pořadí:
- Uveďte všechny modely, které potřebujete obsluhovat, s kvantizací a kontextem. Zapište si je. Llama 3.3 70B INT4 @ 8K. Qwen 32B INT4 @ 32K. Llama 8B FP8 @ 16K. Bez tohoto seznamu je každý následující krok jen dohad.
- Vypočítat největší velikost VRAM pro jednu instanci (váhy + KV při cílové souběžnosti). Toto je vaše spodní hranice pro VRAM na kartu.
- Vypočítejte cílovou hodnotu trvalého tok/s. Souběžní uživatelé × tokeny za sekundu na uživatele × pracovní cyklus. Toto určuje počet karet.
- Namapovat na GPU. Pokud je paměť < 32 GB → 5090 nebo L4. Pokud < 48 GB → L40 nebo 5090 multi-card. Pokud 48–96 GB → Pro 6000 Blackwell. Pokud > 96 GB → multi-card PP, ne TP.
- Vypočítejte tříleté celkové náklady na vlastnictví (TCO) při vašem skutečném využití. Pokud je vaše pracovní cyklus < 30 %, zvažte cloud. Pokud je > 50 %, on-premise jasně vítězí.
- Přidejte 30% marži ať už matematika říká cokoli o počtu GPU. Reálné pracovní zatížení roste, velikosti modelů rostou, podhodnocení KV mezipaměti je univerzální.
Navazující články v tomto článku se zabývají stejnými čísly z různých úhlů pohledu: cena za milion tokenů s rozdělením na on-premise versus cloud (T02) a ekonomie inferenčních závěrů založená na principu trvalého versus výbušného vývoje (T03). Nadace pro výběr GPU sídlí v W07a možnosti paralelismu, které formují celkové náklady na vlastnictví (TCO) pro více GPU, jsou v K03.
Jediná věta k zapamatování: Většina zákazníků se ptá, který je nejrychlejší, když by se měli zeptat, který je při mém pracovním vytížení nejlevnější. Nejrychlejší karta je zřídkakdy nejlevnější odpověď.
Toto je součást Kentino Wiki, referenční série o výpočetní technologii s využitím umělé inteligence, robotice a systémech, které je propojují. Komentáře a opravy jsou vítány na adrese info@kentino.com.