Tokeny za sekundu na euro: Ekonomika GPU pro inferenci

Většina kupujících se ptají špatně. Chtějí vědět, která GPU je „nejrychlejší“. Správná otázka pro inferenční úlohu produkce zní: „Která GPU vyprodukuje nejvíce tokenů na jedno euro utracené v příštích třech letech pro model, kterému skutečně sloužím.“ Tyto dvě otázky mají různé odpovědi a rozdíl je dostatečně velký, že důraz na hrubou rychlost běžně stojí zákazníky Kentina 30–60 % jejich rozpočtu.

Tento článek funguje na základě výpočtů. Cílovou skupinou je někdo, kdo určuje velikost inferenčního sestavení, četl W01 a N03a nyní se musí rozhodnout mezi RTX 5090, RTX Pro 6000 Blackwell, L40 nebo L4 – a kolik z nich.

Metrika: proč tok/s za euro, ne tok/s

Záleží na dvou výkonnostních režimech a jejich směšování je nejčastější chybou při dimenzování.

Jednoproudový tok/s je to, co vidí jeden uživatel, když čeká na jednu odpověď. Je to omezeno šířkou pásma při generování tokenů a téměř výhradně funkcí šířky pásma VRAM dělené hmotnostní stopou modelu (viz W01). Trvalá propustnost tok/s je to, co server vydává pro mnoho souběžných uživatelů s povoleným kontinuálním dávkováním. Na hardwaru třídy Blackwell je to vázáno na výpočetní kapacitu, jakmile počet dávek překročí 16. Na tom záleží produkčnímu prostředí.

Tyto dva výsledky se na stejné kartě liší 10–25×. Jednostreamová Llama 70B INT4 na RTX Pro 6000 Blackwell dosahuje přibližně 32 toků/s. Stejná karta v dávce 32 s kontinuálním dávkováním vLLM dosahuje souhrnně více než 600 toků/s. Vybírání poddimenzovaných jednostreamových nasazení s propustností řádově zvyšuje; vybírání naddimenzovaných nasazení citlivých na latenci. Matematika celkových nákladů na vlastnictví (TCO) zde využívá trvalou propustnost, protože ta je to, co dominuje.

Aktuální maloobchodní ceny v EU (květen 2026)

Níže uvedené ceny jsou maloobchodní ceny v EU bez DPH v otevřeném kanálu – nejedná se o objemové smlouvy OEM ani o pronájem cloudu. Zdroj: ceníky a seznam distributorů v EU v květnu 2026. Považujte je za rozpětí; čtvrtletní výkyvy 10–20 % jsou běžné.

                                   
GPU VRAM TDP Maloobchodní cena v EU bez DPH
RTX 5090 32 GB GDDR7 575 W 2,500 € - 3,000 €
Pracovní stanice RTX Pro 6000 Blackwell 96 GB ECC 600 W 8,000 € - 9,500 €
RTX Pro 6000 Blackwell Server Edition 96 GB ECC 600 W 8,500 € - 10,000 €
L40 48 GB ECC 300 W 7,500 € - 9,500 €
L4 24 GB 72 W 2,500 € - 3,500 €
H100 SXM (referenční, neprodává Kentino) 80 GB HBM3 700 W 27,000 € - 35,000 €

Jen z této tabulky dvě pozorování. Pro 6000 Server Edition stojí zhruba 3× více než 5090 za 3× větší VRAM a ekvivalentní šířku pásma – cena se řídí kapacitou paměti, nikoli hrubou rychlostí. L4 je jediná karta zde s příkonem pod 100 W. Už jen tato skutečnost mění celkových nákladů na vlastnictví, jakmile do rovnice vstoupí elektřina.

Hodnoty benchmarků pro jeden GPU

Níže uvedená čísla pocházejí z veřejných benchmarků (vLLM, llama.cpp, SGLang) shromážděných ze Spheronu, CloudRiftu, RunPodu a z vlastních publikovaných běhů projektu vLLM od května 2025 do května 2026. Nejedná se o Kentinova benchmarková data – porovnali jsme je s našimi interními boxy 4×5090 a 4×Pro 6000 pro buňky, které pravidelně obsluhujeme; veřejná čísla se pohybují v rozmezí ±15 %.

Llama 3.3 70B FP8 — dekódování jednoho proudu

                                   
GPU tok/ů Poznámky
RTX 5090 n / a Závaží FP8 s kapacitou 75 GB se nehodí na 32 GB
Pracovní stanice RTX Pro 6000 BW 28-34 Vejde se na jednu kartu s prostorem pro KV
RTX Pro 6000 BW Server Ed. 28-34 Stejný křemík, serverové chladiče
L40 n / a 48 GB je pro FP8 70B příliš málo; pouze INT4
L4 n / a Mimo třídu
H100 SXM (referenční) 55-65 Šířka pásma HBM3

Llama 3.3 70B INT4 (AWQ) – dekódování jednoho proudu

                               
GPU tok/ů Poznámky
RTX 5090 n/a single 40 GB INT4 prolévá 32 GB; potřebuje 2×
2× RTX 5090 (TP=2) 24-30 Viditelná daň PCIe TP
RTX Pro 6000 BW 30-36 Pohodlně se vejde, více než 50 GB volného místa pro KV
L40 14-18 GDDR6 ECC, nižší šířka pásma
L4 4-6 24 GB sotva udrží váhu, pomalé

Qwen 2.5 32B INT4 (AWQ) — jednoproudový

                           
GPU tok/ů Poznámky
RTX 5090 55-65 Váhy 18–20 GB, KV ve zbývajících 12 GB
RTX Pro 6000 BW 55-65 Omezeno šířkou pásma s 5090; prostor pro ukládání dat je velký
L40 28-34 Omezená šířka pásma
L4 9-12 Omezená paměť, omezená propustnost

Llama 3 8B FP16 – jednoproudová a agregovaná

                           
GPU Jednotlivý tok/y Agregát v dávce 32
RTX 5090 90-110 3,200-3,800
RTX Pro 6000 BW 90-110 3,400-4,000
L40 45-55 1,400-1,800
L4 20-28 380-550

Pár poctivých výkladů z těchto tabulek. 5090 a Pro 6000 Blackwell mají identickou šířku pásma (1.79 TB/s) a identické dekódovací rychlosti na token. — rozdíly jsou v kapacitě VRAM a ECC, nikoli v rychlosti. L40 má zhruba poloviční rychlost v porovnání s dvojicí Blackwell, protože GDDR6 ECC je 860 GB/s oproti 1 790 GB/s. L4 je karta se čtvrtinovou šířkou pásma; vynahrazuje to hustotou a cenou.

Pro single-streamový provoz třídy 70B je Pro 6000 Blackwell jedinou kartou, která tento model provozuje na FP8 v jednom slotu. 5090 vás nutí používat INT4 a 2-way tensor paralelní – a TP=2 na PCIe ztrácí 30–35 % kvůli all-reduce (viz N03).

Škálování pro více GPU: daň z PCIe

Tenzorový paralelní provoz pouze s PCIe se neškáluje lineárně. Mechanismus jsme probrali v N03Zde jsou empirické multiplikátory, které byste měli dosadit do modelu celkových nákladů na vlastnictví (TCO).

                               
GPU Konfigurace Realistické škálování propustnosti vs. 1×
1 × základní 1.00
2 × TP=2 PCIe Gen5 1.50-1.70
4 × TP=4 PCIe Gen5 2.5-3.0
8 × TP=4 × PP=2 (preferováno) 5.0-6.0
8 × TP=8 PCIe (vyhnout se) 4.0-4.8

Cesty paralelní s kanálem a datově paralelní se škálují téměř lineárně; tenzorově paralelní platí daň, která roste s počtem GPU. Pro model třídy 70B je správná konfigurace na 8× 5090 dvě nezávislé repliky (DP=2 × TP=4) nebo TP=4 × PP=2 – nikoli TP=8. Viz K03 pro konfigurační pravidla.

To je důležité z hlediska nákladů, protože zdvojnásobení počtu GPU nikdy nezdvojnásobí propustnost. Naivní rozpočtová projekce typu „dvakrát více GPU, dvakrát více tok/s“ nadsazuje sliby o 30–50 %.

Model tříletých celkových nákladů na vlastnictví (TCO)

Cena GPU je zhruba polovina skutečných nákladů na provoz inferenční karty po dobu tří let. Druhá polovina je elektřina, sdílení šasi a podlahová plocha. Níže uvedený model je to, co interně používáme pro dimenzování K-AI.

Per-GPU 3-year TCO =
    GPU cost
  + Chassis share (chassis + CPU + RAM + PSU + NIC) / GPU count
  + Electricity:  TDP × utilization × 8,760 h × 3 × €0.20/kWh
  + Colo/rack space share
  + Maintenance & spares (~5% of GPU cost / year)

Níže uvedené předpoklady:

  • Elektřina: 0.20 €/kWh smíšená (typická průmyslová kolonie v EU nebo vlastněná DC). Český maloobchodní prodej je často 0.18 €–0.22 €; v Německu vyšší.
  • Využití: 60% trvalé zatížení (realistické výrobní zatížení – nikoli referenční hodnota 100 %, ani laboratorní hodnota 5 %).
  • PUE: 1.4. Režijní náklady datového centra (chlazení, distribuční ztráty). To zvyšuje efektivní spotřebu elektřiny na 0.28 €/kWh odběru GPU.
  • Podíl podvozku: 4 000 EUR amortizovaných na 4 GPU (1 000 EUR/GPU) pro sestavení Kentino 5090 se 4 GPU; 8 000 EUR na 8 (1 000 EUR/GPU) pro šasi Pro 6000 s 8 GPU.
  • Údržba: 5 %/rok nákladů na GPU (fond na rezervní kartu + čas ovladače/provozu).

Tabulka celkových nákladů na vlastnictví (TCO) pro jednotlivé GPU

                                   
GPU Karta € Podvozek € Elektřina € (3 roky) Údržba € (3 roky) Celkové náklady na vlastnictví 3 roky €
RTX 5090 2,800 1,000 2,540 420 6,760
RTX Pro 6000 BW WS 8,800 1,000 2,650 1,320 13,770
RTX Pro 6000 BW SE 9,400 1,000 2,650 1,410 14,460
L40 8,500 1,000 1,325 1,275 12,100
L4 3,000 800 318 450 4,568
H100 SXM (ref.) 30,000 3,500 3,090 4,500 41,090

Údaje o elektřině: TDP × 0.60 × 8 760 × 3 × 0.20 × 1.4 (PUE) / 1 000. Řada L4 je pozoruhodná – její trvalý tříletý účet za elektřinu je 318 EUR. Model 5090 je 2 540 EUR. Osmkrát větší spotřeba energie, osmkrát větší účet.

Cena za milion tokenů

Nyní zkombinujte TCO s naměřenou trvalou propustností na reprezentativním pracovním zatížení – Llama 3.3 70B INT4 v dávce 32, nebo Qwen 32B v dávce 32, nebo Llama 8B v dávce 64. Vezměte trvalý tok/s karty, vynásobte jej využitím 0.60 × 3 × 8 760 × 3 600, abyste získali celkový počet obsloužených tokenů, a vydělte TCO tímto počtem. Níže uvedená čísla jsou ilustrativní; vylaďte je pro váš skutečný model a dávku.

                                           
GPU Pracovní zátěž Trvalý toxin/y Žetony/3 roky (B) € / Mtok
RTX 5090 Lama 8B FP16 šarže 64 3,500 199 0.034
RTX 5090 Qwen 32B INT4 šarže 32 600 34 0.20
Pro 6000 BW Lama 70B FP8 šarže 32 480 27 0.51
Pro 6000 BW Qwen 32B INT4 šarže 32 650 37 0.37
L40 Lama 8B FP16 šarže 64 1,600 91 0.13
L40 Qwen 32B INT4 šarže 32 320 18 0.67
L4 Lama 8B FP16 šarže 64 450 26 0.18
L4 Lama 8B FP8 šarže 128 650 37 0.12

Třetí sloupec si představte jako náklady na milion obsloužených tokenů, při plném využití celkových nákladů na vlastnictví (TCO). API s otevřeným routerem a cloudem pro stejné modely účtují 0.10–2.00 EUR za milion tokenů v závislosti na úrovni; to řadí on-premise řešení na stejnou úroveň nebo i levnější při trvalém zatížení. Matematika se pod 30% využitím rozpadá – celkové náklady na vlastnictví jsou ovlivněny kapitálovými výdaji, za které jste zaplatili, ať už jste službu využívali, nebo ne.

Případ z roku 5090

Na papíře má 5090 nejlepší hrubý tok/s na euro ze všech karet v řadě Kentino pro inferenci pod 72B. 2 800 EUR za šířku pásma 1.79 TB/s a 32 GB GDDR7 je spousta karty. Pro jednoho uživatele s modelem třídy 32B není nic jiného ve stejném poměru.

5090 se rozpadá na dvou místech:

  1. Modely, které se nevejdou do 32 GB v požadovaném množství. 70B FP8 (~75 GB) potřebuje 3–4 karty; 70B INT4 (~40 GB) potřebuje 2. Jakmile provedete tenzorové paralelní zapojení napříč PCIe, zaplatíte 30–50% daň „all-sleep“ a vaše tok/s-per-card se zhroutí.
  2. Škálování více GPU nad rámec paralelního provozu pipeline. 8× 5090 je skutečný produkt (my ho vyrábíme), ale propustnost na kartu na tenzorově paralelním 70B je zhruba 0.55× oproti jedné kartě. Koupili jste osm karet a dostali jste 4.4× větší propustnost. Ne 8×.

Silnou stránkou modelu 5090 je možnost hostování několika replik menších modelů. 4× 5090 s čtyřmi nezávislými replikami Qwen 32B za load balancerem překonává 4× 5090 s tenzorově paralelním provozem a jedním Llama 70B jak v propustnosti, tak v latenci – a zcela se vyhýbá penalizaci PCIe.

Pouzdro Pro 6000 Blackwell

96 GB paměti ECC GDDR7 s přenosovou rychlostí 1.79 TB/s je to, co si koupíte, když se na jednu kartu potřebuje vejít 70B FP8 a nechcete se o tom hádat s PCIe. Edice Workstation a Server sdílejí stejný křemík, stejnou paměť, stejnou šířku pásma – rozdíl je ve tvarovém faktoru (aktivní vs. pasivní chlazení), BIOSu s maximálním výkonem a validaci pro OEM serverové šasi. Edice Server stojí o 700–1 500 EUR více a je tou správnou volbou pro jakoukoli rackovou sestavu, která běží 24 hodin denně, 7 dní v týdnu.

Kde Pro 6000 vítězí v poměru tok/s k euru:

  • Hosting 70B FP8 s jednou kartou. Žádný tenzorový paralelní přenos, žádné zdanění PCIe. Jeden stream rychlostí 30+ tok/s, dávkový agregát rychlostí 480+ tok/s.
  • Horizontální škálování pomocí replik. 4× Pro 6000 = čtyři nezávislé 70B repliky za routerem. Lineární škálování propustnosti, elegantní izolace selhání.
  • ECC pro školení. Pokud pracovní zátěž zahrnuje doladění LoRA / QLoRA nebo úplné přeškolení, ECC si své udržení zaslouží (viz W01).

Kde je Pro 6000 přehnaná: jakékoli nasazení, které nepotřebuje >32 GB na kartu. Pokud se všechny vaše modely vejdou na 5090, platíte 3× více za VRAM, kterou nebudete používat. To se stává pravidelným problémem – kupující si vybere Pro 6000, protože je to „profesionální“ karta, a pak na ní pouští 13B model.

Případ L40

L40 se nachází v nepříjemné pozici. 48 GB ECC, GDDR6, ne GDDR7, šířka pásma 860 GB/s – zhruba polovina oproti Pro 6000 Blackwell při 75–90 % ceny. V čistém poměru tok/s na euro vítězí Pro 6000.

Pouzdro L40 je postaveno na třech dalších osách:

  1. TDP. 300 W oproti 600 W. Polovina elektřiny za tři roky (1 325 EUR oproti 2 650 EUR v našem modelu). V tepelně omezených raccích nebo jednofázových obvodech je to rozdíl mezi čtyřmi nebo dvěma kartami.
  2. Ověření datového centra. L40 je dodáván s pasivním chlazením, validací OEM u společností Supermicro/Dell/HPE a standardní 5letou zárukou pro datová centra. Pracovní stanice Pro 6000 není validována pro nepřetržitý provoz šasi; edice Server ano, ale je novější v distribučním kanálu.
  3. Strop spolehlivosti. L40 je určen pro trvalé zatížení serveru. Průměrná doba mezi poruchami při nepřetržité inferenční zátěži je měřitelně lepší než u 5090 odvozeného od spotřebitele.

Upřímné čtení: pokud vašemu zákazníkovi záleží více na provozuschopnosti než na hrubých nákladech – regulovaná odvětví, smlouvy SLA na dobu neurčitou, cokoli, co přichází o peníze, když karta uprostřed noci vypadne – L40 si za ty náklady na euro stojí. Co se týče hrubého poměru ceny a výkonu, tak to neplatí.

Případ L4

L4 je ten, na který se nikdo neptá a který by si většina zákazníků měla koupit. 24 GB, 72 W, jeden slot, nevyžaduje napájecí konektor, pasivně chlazený. Osm kusů se vejde do 1U serveru. Šestnáct do 2U.

Co L4 dělá dobře:

  • Model třídy 8B sloužící ve velkém měřítku. Llama 3 8B FP8 v dávce 64 dosahuje výkonu okolo 650 toků/s na kartu. Osm L4 v jednom šasi = celkem 5 000 toků/s pro koncový bod Llama 8B. Stejné šasi spotřebovává 600 W GPU.
  • Hustota více replik. Každá L4 hostuje nezávislý 8B model. Osm replik za load balancerem bez jakékoli komunikace mezi GPU. Selhání jedné karty odebere 1/8 kapacity, nikoli celou službu.
  • Lokality s omezeným výkonem. Obvod 16 A zvládne napájet dvanáct L4 plus režii hostitele. Stejný obvod sotva zvládne tři 5090.
  • Cena za milion tokenů. S cenou 0.12 €/Mtok pro 8B FP8 je L4 levnější než jakékoli cloudové API pro stejnou modelovou třídu.

Co L4 dělá špatně: cokoli nad 13B, cokoli, co vyžaduje skutečnou šířku pásma, jakýkoli druh tréninku. L4 je inferenční karta s pevnou funkcí pro malé až střední modely. Pokud vaše pracovní zátěž neodpovídá tomu, přeskočte ji.

Upřímné srovnání vs. cloud

Cloudová matematika pro sestavení podobného typu. AWS p5.48xlarge (8× H100 SXM) se prodává za 98.32 USD/hodinu na vyžádání, normalizováno na 12.29 USD za hodinu GPU. Specializované cloudy s umělou inteligencí (Lambda, RunPod, CoreWeave) stojí 2.00–4.00 USD za hodinu H100 na vyžádání a méně při ročních závazcích.

Cena tříletého cloudového řešení na vyžádání pro jeden inferenční slot ekvivalentní H100:

  • AWS na vyžádání: 12.29 USD × 8 760 × 3 = $323,000
  • Spotová/sleva AI cloud: 2.50 $ × 8 760 × 3 = $65,700
  • Rezervace cloudu s umělou inteligencí na 1 rok: ~1.80 USD × 8 760 × 3 = $47,300

Kentino on-premise 8× Pro 6000 Server Edition: Celkové náklady na vlastnictví ~115 000 EUR za tři roky pro osm karet. 14 400 EUR na kartu. To je zhruba čtvrtina nejlevnějšího cloudového H100 rezervována propustnost srovnatelnou s inferencí (Pro 6000 BW dosahuje ~60–70 % H100 SXM na inferenčních úlohách nezávislých na NVLink).

Bod zvratu versus rezervace H100 pro cloudovou AI: On-premise server 8× Pro 6000 se zaplatí při zhruba 50% využití po dobu tří let. Pod tím nájem. Nad tím vlastní. K tomuto výpočtu dospívá každý seriózní kupující on-premise nemovitostí, a proto on-premise inference v roce 2026 navzdory snižování cen cloudu stále existuje.

Matice doporučení pro pracovní zátěž a GPU

                                                   
Pracovní zátěž GPU první volby Proč
Lama 8B / Qwen 7B / Mistral 7B v měřítku L4 (vícenásobný) Nejlepší tok/s/€ u malých modelů, nejnižší spotřeba
Jeden uživatel, třída 32B, citlivé na latenci RTX 5090 Nejlepší šířka pásma/€, pasuje na INT4
Víceuživatelská třída 32B, citlivá na propustnost 2× RTX 5090 nebo 1× Pro 6000 Replika měřítka nebo jedna karta, pokud to rozpočet dovolí
70B inference, jeden uživatel, kvalita FP8 RTX Pro 6000 Blackwell Jediná karta, která pasuje na 70B FP8 na jednom slotu
70B inference, víceuživatelská propustnost 4× Pro 6000 BW (repliky DP) Lineární škálování bez daně z PCIe TP
Jemné doladění 70B (LoRA / QLoRA) RTX Pro 6000 Blackwell SE ECC, validace 24/7, kompatibilní s tréninkovým KV v 96 GB
70B trénink od nuly ne sestava Kentina Pronajměte si NVLink H100/B200 a poté si přineste váhy na pracoviště
Smíšená inference + lehké trénování, regulované místo L40 ECC, trvalá spolehlivost, ověřené datové centrum
Omezený rozpočet na napájení racku, hustota 1U L4 (8× na 1U) 72 W, jeden slot, ECC není pro inferenci potřeba
405B hustá inference 3× Pro 6000 BW (PP) Jediná cesta na hardwaru Kentino; viz K03

Upřímný pohled

Většina zákazníků Kentina se ptá, která karta je nejrychlejší. Vzhledem k pracovní zátěži, kterou většina z nich skutečně má – 7B nebo 8B chatovací model, možná 32B model pro uvažování, možná model pro vidění v třídě 7B–13B – je správná odpověď L4 nebo 5090, nikoli vlajková loď. Cenová prémie za Pro 6000 Blackwell je podle našich cen 5 000–7 000 EUR za kartu. Při čtyřech kartách na sestavení to znamená 20 000–28 000 EUR za VRAM, kterou zákazník platí a kterou nepoužívá.

Úkolem je zeptat se, které modely, v jaké souběžnosti, v jakém kontextovém okně – a podle toho dimenzovat. Menší zakázka, zákazník se vrací, když se daná zakázka škáluje.

Co dělat dál

Pokud určujete velikost stavby, postupujte podle těchto kroků v tomto pořadí:

  1. Uveďte všechny modely, které potřebujete obsluhovat, s kvantizací a kontextem. Zapište si je. Llama 3.3 70B INT4 @ 8K. Qwen 32B INT4 @ 32K. Llama 8B FP8 @ 16K. Bez tohoto seznamu je každý následující krok jen dohad.
  2. Vypočítat největší velikost VRAM pro jednu instanci (váhy + KV při cílové souběžnosti). Toto je vaše spodní hranice pro VRAM na kartu.
  3. Vypočítejte cílovou hodnotu trvalého tok/s. Souběžní uživatelé × tokeny za sekundu na uživatele × pracovní cyklus. Toto určuje počet karet.
  4. Namapovat na GPU. Pokud je paměť < 32 GB → 5090 nebo L4. Pokud < 48 GB → L40 nebo 5090 multi-card. Pokud 48–96 GB → Pro 6000 Blackwell. Pokud > 96 GB → multi-card PP, ne TP.
  5. Vypočítejte tříleté celkové náklady na vlastnictví (TCO) při vašem skutečném využití. Pokud je vaše pracovní cyklus < 30 %, zvažte cloud. Pokud je > 50 %, on-premise jasně vítězí.
  6. Přidejte 30% marži ať už matematika říká cokoli o počtu GPU. Reálné pracovní zatížení roste, velikosti modelů rostou, podhodnocení KV mezipaměti je univerzální.

Navazující články v tomto článku se zabývají stejnými čísly z různých úhlů pohledu: cena za milion tokenů s rozdělením na on-premise versus cloud (T02) a ekonomie inferenčních závěrů založená na principu trvalého versus výbušného vývoje (T03). Nadace pro výběr GPU sídlí v W07a možnosti paralelismu, které formují celkové náklady na vlastnictví (TCO) pro více GPU, jsou v K03.

Jediná věta k zapamatování: Většina zákazníků se ptá, který je nejrychlejší, když by se měli zeptat, který je při mém pracovním vytížení nejlevnější. Nejrychlejší karta je zřídkakdy nejlevnější odpověď.