Cena za milion tokenů: On-Prem vs. cloud

V roce 2026 existují tři poctivé způsoby, jak si koupit LLM inferenci: zavolat hostovanému endpointu někoho jiného a platit za token (cloudové LLM API), pronajmout si GPU na hodinu a provozovat vlastní model (pronájem cloudové GPU) nebo si koupit server a provozovat ho ve vlastním racku (on-premise). Cena milionu tokenů se u těchto tří způsobů dramaticky liší a ne v pořadí, které většina kupujících předpokládá.

Tento článek počítá v eurech bez DPH. Cílová skupina: někdo, kdo se rozhoduje, zda bude i nadále platit měsíčně za OpenAI, přejít na hostovaného poskytovatele s otevřeným modelem, pronajmout si H100 nebo koupit 4/8GPU. Uvádíme ceny z května 2026 a zakončujeme pětiminutovým procesem rozhodování. Křížové odkazy: T01 celkové náklady na vlastnictví (TCO) na GPU, W07 výběr karty, I04 čísla na stěně.

Tři platformy

Rozhraní API cloudového LLM. OpenAI, Anthropic, Google, Together, Fireworks. Platba za každý příchozí a odchozí token. Žádné náklady na nečinnost, žádné kapitálové výdaje, žádný provoz. Také žádný výběr modelu mimo jejich katalog, žádná LoRA, žádná kvantitativní kontrola.

Pronájem cloudové GPU. AWS p5/p5e/p6, Azure ND H200/B200, GCP A3 Ultra a specializované cloudy (Lambda, CoreWeave, Nebius, RunPod). Pronajměte si instanci GPU na hodinu a spusťte cokoli. Přinesete si model, obslužný stack a provoz. Platíte, ať už obsloužíte jeden token nebo miliardu za danou hodinu.

On-premise. Kupte si 4GPU nebo 8GPU box. Umístěte ho do racku, ať už ve vaší budově nebo v kolonie. Přinášíte si napájení, chlazení, síť, provoz. Amortizujte po dobu tří let. Mezní náklady na token jsou elektřina. Fixní náklady jsou vše, co jste již zaplatili.

Tři různé tvary nákladů – čistě variabilní, čistě fixní s výrazným poklesem, kapitálové výdaje plus marginální – které se vzájemně vyrovnávají v různých bodech podél osy propustnosti.

Ceny cloudového LLM API

USD za milion tokenů, veřejné stránky s cenami, květen 2026. EUR za EUR/USD ≈ 1.08.

Provider Model Vstup $/Mtok Výstup $/Mtok Vstup €/Mtok Produkce €/Mtok
OpenAI GPT-5 1.25 10.00 1.16 9.26
OpenAI GPT-5 mini 0.25 2.00 0.23 1.85
OpenAI GPT-5 nano 0.05 0.40 0.05 0.37
OpenAI GPT-4.1 / o3 2.00 8.00 1.85 7.41
Antropický Claude Opus 4.7 15.00 75.00 13.89 69.44
Antropický Claude Sonnet 4.6 3.00 15.00 2.78 13.89
Antropický Claude Haiku 4.5 1.00 5.00 0.93 4.63
Google Gemini 2.5 Pro 1.25 10.00 1.16 9.26
Google Gemini 2.5 Flash 0.30 2.50 0.28 2.31
Google Gemini 2.5 Flash-Lite 0.10 0.40 0.09 0.37
Spolu Lama 3.3 70B 0.88 0.88 0.81 0.81
Spolu Qwen 2.5 72B 1.20 1.20 1.11 1.11
Spolu DeepSeek-V3 1.25 1.25 1.16 1.16
Spolu Lama 3.1 405B 3.50 3.50 3.24 3.24
AWS Bedrock Lama 3.3 70B 0.72 0.72 0.67 0.67
Azure Lama 3.3 70B 0.59 0.79 0.55 0.73

Dva poctivé tipy. Uzavřené modely Frontier (Claude Opus 4.7, GPT-5, Gemini 2.5 Pro) jsou o řád dražší než hostovaná API s otevřeným modelem obsluhující Llama 70B nebo DeepSeek-V3 – cena „nejchytřejší nyní“ versus „nejlepší otevřené váhy nyní“. Pro většinu produkčních úloh (RAG, kroky agenta, kód, klasifikace) je Sonnet 4.6 nebo GPT-5 mini operačním bodem, nikoli vlajkovou lodí. Výstupní tokeny stojí třikrát až sedmkrát více než vstupní u uzavřených poskytovatelů a zhruba stejně na hostitelích s otevřeným modelem. Hyperscalerové SKU s otevřeným modelem (Bedrock, Azure) účtují 30–80% prémii oproti Together nebo Fireworks za stejný model – platíte za integraci IAM a jednu fakturu, ne za levnější tokeny.

Cena za Mtok v on-premise

Cena za Mtok je vyjádřením celkových nákladů za tři roky dělených počtem tokenů obsloužených během tří let. Jmenovatel závisí na využití; čitatel je zhruba fixní.

On-prem €/Mtok =
    (capex + 3y electricity + 3y maintenance + 3y ops) /
    (sustained tok/s × utilization × 3 × 8,760 × 3,600 / 1e6)

Zapojení celkových nákladů na vlastnictví (TCO) pro jednotlivé grafické karty z T01 při 60% využití, 0.20 €/kWh, PUE 1.4:

Vytvořit 3leté celkové vlastnictví (TCO) € Trvalý toxin/y Tokeny/3 roky (Mtok) € / Mtok
4× RTX 5090 (Llama 70B INT4 TP=4) 27,000 1,800 102,000 0.26
4× Pro 6000 BW SE (Llama 70B FP8 DP) 58,000 1,920 109,000 0.53
4× Pro 6000 BW SE (Qwen 32B INT4) 58,000 2,400 136,000 0.43
8× Pro 6000 BW SE (Llama 70B FP8 DP) 115,000 3,800 215,000 0.53
8× L4 (Llama 8B FP8) 36,000 5,200 295,000 0.12

Snížení využití na 30 % zdvojnásobí každou částku. Zvýšení na 80 % zajistí, že 8B na 4. úrovni skončí na 0.09 €/Mtok, což je levnější než jakékoli cloudové API pro danou třídu. Matematika se propadá pod 25 % využití, protože celkové náklady na vlastnictví (TCO) jsou dominovány kapitálovými náklady, které jste zaplatili, ať už jste službu využívali, nebo ne.

Bod zvratu

Překryjte linii oblaků. Lama 70B na 100 milionů tokenů/měsíc, vyváženo 50/50, na Together: 100 × 0.81 € = 81 €/měsíc → 2 916 € za tři roky. Proti on-premise s kurzem 4 × 5090 za 27 000 € vítězí Together o 24 000 €. Při 100 milionech tokenů/měsíc se on-premise naprosto mýlí.

Zatlačte na 1 miliarda tokenů/měsíc: 1 000 × 0.81 € = 810 €/měsíc → 29 160 € za tři roky. Dohromady a 4× 5090 se pohybují do 2 000 €. Při 1.5 miliardy €/měsíc významně vítězí on-premise.

Bod zvratu pro Inference třídy 70B vs. nejlevnější API hostované na otevřeném modelu přistane kolem 1.0–1.5 miliardy tokenů měsíčně udržováno na 4× 5090. U API s uzavřenou hranicí (Claude Sonnet 4.6 za 8.34 €/Mtok smíšený, GPT-5 za 5.21 €/Mtok smíšený) se bod zvratu posouvá k 80–150 milionů tokenů/měsíc — hranice oblačnosti je o řád strmější.

To je nejdůležitější číslo v tomto článku: Bod zvratu není „100 milionů tokenů/měsíc za všechno“. Je specifický pro danou pracovní zátěž a zcela závisí na tom, se kterou cloudovou linkou soutěžíte. Kupující, kteří říkají „dosáhli jsme 50 milionů, měli bychom přejít na on-premise“, obvykle srovnávají Claude Opus, kde mají pravdu – ignorují přitom fakt, že přechod pracovní zátěže z Opus na Sonnet 4.6 jim ušetří pětkrát více než přechod ze Sonnet na on-premise v daném objemu.

Pronájem cloudové GPU – střední možnost

Hodinové sazby za GPU, květen 2026, na vyžádání:

Provider Instance GPU Instance $/hod $/hodinu GPU
AWS p5.48xvelký 8× H100 SXM 55.18 6.90
AWS p5e.48xlarge 8× H200 SXM 30.00 3.75
AWS p6-b200 8× B200 74.88 9.36
Azure ND H200 v5 8× H200 31.00 3.88
GCP a3-ultragpu-8g 8× H200 28.00 3.50
Lambda 8× H100 8× H100 16.00 2.00
CoreWeave 8× H100 8× H100 19.20 2.40

Rezervované roční commity mají slevu 25–35 %. AWS p5 on-demand je zhruba 3× Lambda pro stejný křemík H100. Přepočteno na token: 8× H100 na Lambdě s Llama 3.3 70B FP8 při ~3 500 tok/s trvale → 16 USD/hod × 8 760 × 3 = 389 000 EUR za 3 roky → 1.96 EUR/Mtok při 60% využití. To je 4× an 8× Pro 6000 SE on-premise build (0.53 €/Mtok) a 2.5× právě volám Společně (0.81 €/Mtok).

Pronájem H100 pro inferenci otevřeného modelu je to nejhorší z obou světů: sazby za pronájem boxu a provozní náklady na jeho provoz. Matematika funguje pouze tehdy, když potřebujete konkrétní model, který nikdo nehostuje, a chybí vám objem pro on-premise. Pronájem cloudové GPU má jeden poctivý případ použití: trénink s prasknutímDoladění LoRA na 8× H100 po dobu 8 hodin stojí u Lambdy přibližně 130 dolarů. Žádné on-premise celkové náklady na vlastnictví (TCO) to nepřekoná u jednorázové instalace. Logika se nepřenáší do inference, která je trvalá a běží 24 hodin denně, 7 dní v týdnu. Past „spot“: spot/preemptible/community úrovně nabízejí slevu 50–80 %, ale jsou přerušitelné. Vhodné pro repliky inference bez státní příslušnosti. U 18hodinové školicí úlohy, která kontroluje každý krok, dvě přerušení zdvojnásobí náklady na dokončený krok a už nejste levnější než on-demand.

Skryté náklady nikdo neuvádí

Mrak: Odchozí data se poplatí 0.05–0.09 USD/GB, když odesíláte obrázky, zvuk nebo video zpět. Protokolování přidává 5–10 % ve velkém měřítku. Kontext opětovné fakturace je nejhorší – každé API účtuje plnou výzvu při každém volání, takže kontext agenta s 50 tisíci tokeny stojí 50 tisíc vstupních tokenů. za krok 20krokové smyčky. Promptní ukládání do mezipaměti (Anthropic, OpenAI, Google – všechny jej podporují) snižuje tento problém u prefixů uložených v mezipaměti o 50–90 %, ale pouze pokud pro něj navrhnete architekturu. Limity produkční rychlosti začínají na 30 000–500 000 TPM a vyžadují historii používání; noví zákazníci nemohou od prvního dne spustit systém ve velkém měřítku. SKU v regionu EU jsou o 10–20 % dražší než v regionu US East s nižší dostupností.

On-premise: Provozní doba při 0.1–0.3 FTE na server je 8 000–24 000 EUR/rok, což není v matematice na Mtok. Prostoje potřebují redundantní server nebo elegantní zálohu do cloudu. Elektřina není všude 0.20 €/kWh — Průmyslová cena EU v roce 2026 se pohybuje od 0.09 €/kWh (švédské, norské vodní elektrárny) do 0.35 €/kWh (itálie, irsko), v Německu 0.18–0.22 €/kWh u dotovaných průmyslových elektráren a v Česku 0.18–0.25 €/kWh u komerčních elektráren. Pro Itálii nebo Irsko platí, že každý řádek cen elektřiny v T01 stoupá o 50 %. Cena stojanu Colo je 100–300 EUR/měsíc pro 4U – 3 600–10 800 EUR za tři roky plus hardware.

Zveřejněná cena cloudu je zhruba 1.2–1.5× skutečná cena; zveřejněné celkové náklady na vlastnictví (TCO) pro on-premise jsou zhruba 1.2–1.5× ceník. Multiplikátory se pro srovnání ruší.

Nenákladové faktory

Pro skutečné kupující jsou tři věci důležitější než cena za Mtok.

Datová suverenita. Největším důvodem, proč evropští kupující v roce 2026 přecházejí na on-premise řešení, je GDPR a sektorová pravidla (DORA, NIS2, AI Act, MDR). Odesílání produkčních výzev s osobními údaji, lékařskými záznamy nebo průmyslovými tajemstvími na koncový bod hostovaný v USA je smluvní problém bez ohledu na cenu. SKU pro region EU neznamená „kontrolováno EU“. Pro regulovaného kupujícího není on-premise prémiové řešení nákladem, ale cenou za legální povolení k nasazení.

Spodní hranice latence. Spojení WAN s nejbližším hostovaným koncovým bodem přidává RTT 15–40 ms v rámci EU a 80–120 ms v transatlantické síti. V místní síti na 10GbE LAN je to méně než milisekunda. Pro interaktivní chat je delta WAN neviditelná oproti 800 ms TTFT. Pro řídicí smyčku robota (I01) nebo hlasového agenta s odezvou pod 300 ms je WAN fatální.

Přizpůsobitelnost. Cloudová API dodávají model a kvantifikaci, které si poskytovatel vybral. V místním prostředí si vyberete model, kvantifikaci, obslužný stack (vLLM, SGLang, llama.cpp), adaptéry LoRA a spekulativní dekodér. Pro výzkumné laboratoře nebo specializované produkty je tohle to, co kupujete – cena za Mtok je druhořadá.

Pokud se žádná z nich nevztahuje, kupující by měl být v cloudu pod bodem zvratu. Ne každý potenciální zákazník by si měl kupovat server.

Pracovní rozhodnutí: pracovní zátěž třídy 70B ve dvou svazcích

Profil zákazníka: SaaS provádějící klasifikaci a sumarizaci dokumentů, vstup/výstup 70/30, model třídy 70B s otevřenou váhou.

Volba Při 100 milionech tok/měsíc (3 roky) Při 2 miliardách tok/měsíc (3 roky)
Společně (Láma 3.3 70B) €2,916 €58,320
AWS Bedrock (Llama 3.3 70B) €2,412 €48,240
Claude Sonnet 4.6 (odkaz na hranice) €21,996 €439,920
On-premise 4× 5090 (amortizované) €27,000 €27,000
Lambda 8× H100 s vlastním hostingem €389,000 €389,000

Při ceně 100 milionů tokenů/měsíc Bedrock řádově vítězí nad on-premise řešením; zákazník si box nezasloužil. Při ceně 2 miliard tokenů/měsíc on-premise řešení rozhodně vítězí s 1.8–2.2× i proti nejlevnější hostované alternativě. Bod zvratu pro tuto zátěž se pohyboval kolem 800 milionů – 1.2 miliardy tokenů/měsíc. Pod touto hodnotou pronájem. Nad touto hodnotou vlastní.

Rozhodovací matice

Objem / měsíc Model 8B–13B Model 32B Model 70B Hranice (Claude / GPT-5)
< 100 M tok Cloud API Cloud API Cloud API Cloud API
100–500 milionů tok Cloudové API nebo 4× L4 Cloud API Cloud API Cloud API
500 M – 1 B 4–8× L4 lokálně 4× 5090 nebo Cloud Mrak (Podklad/Společně) Cloud API
1–5 B tok 8× L4 lokálně 4 × 5090 4× 5090 nebo 4× Pro 6000 SE Cloud + hybridní řešení on-premise
5–50 B tok 8× shluk L4 4× Pro 6000 BW SE 4–8× Pro 6000 BW SE Frontier cloud + lokální rest
> 50 miliard tok Víceuzlový L4 8× Pro 6000 BW SE 8× Pro 6000 SE × N Podnikové sazby + hybridní

Konzervativní – regulovaný kupující posune sloupec on-premise o řádek dříve; experimentální kupující o řádek později. Sloupec Frontier je zvláštní: žádná on-premise sestava nenahrazuje Claude Opus 4.7 ani GPT-5. Jsou to kvalitní SKU, které voláte, když je potřeba, nikoli úlohy, které hostujete.

Upřímný pohled

Většina potenciálních zákazníků, kteří přijdou s myšlenkou, že potřebují server, si to nemyslí. Při typických objemech – 5–50 milionů tokenů/měsíc pro produkt v rané fázi, 50–500 milionů pro střední fázi – cloudová API vítězí dalších dvanáct až dvacet čtyři měsíců. Správná odpověď zní: „používejte Together nebo Bedrock, hlídejte si měsíční útratu a zavolejte nám, až překročí hranici 1 500 EUR/měsíc.“

Kupující, pro které má v roce 2026 smysl on-premise prodej, se dělí do tří kategorií. RegulovanéData nemohou opustit budovu. Udržitelné ve velkém měřítku1 token B+/měsíc na modelu třídy 70B, kde matematika vítězí 2–3×. Robotika nebo nízká latenceWAN podlaha narušuje aplikaci. Asi 30–40 % našich potenciálních zákazníků splňuje jednu z těchto podmínek. Pro zbývajících 60–70 % jsou cloudová API v roce 2026 pozoruhodným produktem a měli by je používat i nadále, dokud se matematika nezmění.

Školení je jiná věc. Téměř každá úloha v měřítku K-AI (LoRA, QLoRA, jemné doladění 7B–32B) je levnější v on-premise prostředí než pronájem cloudové GPU – zařízení běží během běhu na 100 %. Výjimkou je hyperscale školení (plné předběžné školení 70B+, RLHF ve velkém měřítku), kde potřebujete 8× H100 s NVLink, které neprodáváme (W07 (obsahuje proč). Pronajměte si to, provozujte to, přivezte si závaží domů.

Co dělat dál

Před rozhovorem s dodavatelem spusťte tuto sekvenci:

  1. Změřte aktuální měsíční objem tokenů, rozděleno podle úrovně modelu. Pokud to nedokážete, přístrojově ho otestujte po dobu dvou týdnů. Bez tohoto čísla je každý další krok pouze odhad.
  2. Projekt šest měsíců dopředu, konzervativně – vynásobte 1.5–2. Účty za LLM rostou rychleji než produkt, protože se kontexty rozšiřují a agenti přidávají kroky.
  3. Upřímně identifikujte úrovně. Potřebujete dosáhnout hraniční kvality? Jemné frakce na Sonnet 4.6 / GPT-5 mini? Jemné frakce na Llama 3.3 70B? Typické rozdělení: 5 % / 25 % / 70 %.
  4. Faktura za cloudové výpočty při plánovaném objemu podle úrovně z tabulky výše. To je váš konkurent.
  5. Výpočetní služby na místě pro box 4× 5090 nebo 4× Pro 6000 SE při projektovaném objemu s použitím T01.
  6. Pokud cloud převyšuje on-premise o méně než 1.5×, zůstaňte v cloudu. Provoz, prostoje a riziko kapitálových výdajů sní malou výhru.
  7. Pokud cloud převyšuje on-premise 2× nebo více, je on-premise případ reálný. Suverenita, latence a přizpůsobení se stávají rozhodujícími faktory – v tomto měřítku téměř vždy posilují lokální prostředí.
  8. Pokud je regulováno nebo omezeno latencí, výpočty přeskočte. Kupujete si online bez ohledu na to. Velikost s T01 a W07.

Následná opatření T03 funguje trvale vs. burst – kdy má smysl hybridní řešení, jak dimenzovat základní on-premise s ohledem na přetečení cloudu. Křížové odkazy: T01 (celkové náklady na vlastnictví a tok/s na GPU), W07 (Výběr grafické karty), I04 (matematika elektrických rozvodů na zdi, na které se zakládá předpoklad ceny €/kWh).

Jedna věta k zapamatování: Otázka ohledně ceny za milion tokenů nemá obecnou odpověď – existuje specifická odpověď pro vaši pracovní zátěž, objem, úroveň modelu a cenu elektřiny ve vaší zemi. Než cokoli podepíšete, spočítejte si to.