Výpočetní technika na zařízení vs. mimo zařízení pro roboty

Každá úloha na robotu se nachází na jednom ze dvou míst: uvnitř robota, napájená baterií a ventilátory na hrudi, nebo mimo něj, na serveru napájeném ze zásuvky, který je vzdálen jeden LAN hop. Složitá otázka zní, zda… zda potřebujete obojí – téměř vždycky – ale která pracovní zátěž kam jde a proč. R08 argumentuje, že vůbec existuje vyhrazená okrajová vrstva. Tento článek je rozhodnutím pro jednotlivé úlohy: řízení motoru zde, VLM tam, STT závisí atd.

Rámec je subjektivní. Na každou pracovní zátěž existuje správná odpověď a správná odpověď se mění s tím, jak se integrovaný křemík vyvíjí. Řekneme, kterým směrem se každý kus ubírá v letech 2026–2027.

Dva rozpočty, které rozhodují o všem

Pracovní zátěž může běžet na palubě, pouze pokud se vejde do dvou rozpočtů současně: energie a paměťLatence je třetím omezením, ale obvykle vám napoví kterým směrem tlačit pracovní zátěž, která se hodí, ne to, zda se vůbec hodí.

Energetický rozpočet humanoida. Humanoid o hmotnosti 30–50 kg nese baterii s kapacitou 700–900 Wh. Dlouhodobá chůze odebírá z aktuátorů 200–500 W, přičemž při dynamickém pohybu dosahuje vrcholů přes 800 W. Stání v klidu a přemýšlení odebírá z aktuátorů 80–150 W (udržovací moment je nízký, udržování polohy stojí peníze). Zbývá tedy zhruba 60–120 W pro... všechno ostatní — výpočetní technika, senzory, chladicí ventilátory, rádio — pokud chcete použitelnou dvouhodinovou dobu běhu. Výpočetní rozpočet v rámci tohoto objemu je 30–80 W trvale. Neustálé spalování Jetsonu na MAX_N (60 W) zkrátí dobu běhu robota na polovinu. To je nezpochybnitelná fyzika, nikoli konstrukční volba.

Paměťový rozpočet. Jetson AGX Orin 64 GB je 64 GB LPDDR5 sdílené mezi CPU a GPUOdečtěte OS (4–6 GB), ROS 2 a SDK výrobce (2–4 GB), vyrovnávací paměti pro vnímání (2–4 GB pro stereo hloubku a mračna bodů) a veškerý aplikační kód. Realistický rozpočet využitelný pro LLM/VLM je 40–48 GB. Na modulu Jetson Thor 128 GB se strop zvýší na ~96 GB použitelných. Na Orin NX 16 GB se sníží na ~8–10 GB použitelných – dost pro jeden malý model.

Mimochodem, oba rozpočty představují odlišné problémy. K-AI 96 (4× RTX 5090) má 128 GB dedikované paměti VRAM a 1.0–1.5 kW výkonu GPU při zapojení do zásuvky. K-AI 256 (8× RTX 5090) obojí zdvojnásobuje. Výkon a paměť jednoduše přestávají být omezením – místo toho je vyměníte za kapitálové výdaje, vytápění, větrání a klimatizaci v místnosti a kabelové připojení.

Integrovaný křemík, realita roku 2026

Palubní doplňky, které se dnes skutečně dodávají u seriózních humanoidů a čtyřnožců:

SoC INT8 TOPS (řídké) Využitelná paměť Napájecí obálka Co může spustit
Jetson Orin NX 16 GB 100 ~10 GB sdíleno 10–25 W YOLO, malý VLM 3B Q4, probuzení
Jetson AGX Orin 64 GB 275 ~40 GB sdíleno 15–60 W YOLO, VLM 7B Q4 za použitelné sazby, 13B LLM
Jetson AGX Thor 128 GB (2026) 1 200 TFLOPS FP4 ~96 GB sdíleno 40–130 W VLM 32B Q4 s dostatečným prostorem, duální vnímání proudu
Snapdragon 8 Gen 3 / třída QRB 45-75 ~6–10 GB sdíleno 5–15 W Hlasový, probuzovací, světelný životopis
Hailo-8 (doplněk M.2) 26 INT8 VRCHNÍKŮ 2–4 GB na čipu 2.5 W typický Odlehčení zátěže technologického kanálu Vision, MobileNet/YOLO
Hailo-15 (SoC Vision) 20 TOPS rezident potrubí 2–5 W Vždy zapnutý vícekamerový životopis
Koprocesor Intel N97 / i7-1370P n/a (CPU + iGPU) Hostitel DDR5 6–45 W Orchestrace na vysoké úrovni, ROS 2, lepidlo

Thor je skoková změna, nikoli iterace. Paměťový strop 128 GB a tenzorová jádra Blackwell s nativní FP4 posouvají hranici integrovaných procesorů z „7B VLM, bolestivě“ na „32B VLM, užitečně“ během jedné generace. Pracovní zátěže, které byly v roce 2025 strukturálně mimo systém – středně velké VLM, kontinuální titulkování scén, středně velké plánovače LLM – se stávají... kandidáti na palubě v roce 2026, pokud tepelné řešení robota udrží výkon 100–130 W.

Hailo a specializovaná třída NPU nejsou akcelerátory LLM. Jsou to odlehčení pro vizuální kanál: ponechte hlavní Jetson volný pro větší model, spusťte vždy zapnutou kamerovou CV (detekce objektů, sledování, základní VLM-lite) na 3W čipu.

Třída Snapdragon QRB je řešením pro roboty primárně ovládající hlas – probuzení slovem, tvarování paprsku, STT – kde je Jetson přehnaný a Cortex-M poddimenzovaný. Užitečný, úzký, stále běžnější.

Mimo palubu: úroveň K-AI jako reference

Cílovou variantou pro externí řešení, na kterou se v této sérii odkazuje, je řada K-AI – nástěnné napájení, 4U nebo 5U rack, 4 nebo 8 GPU na EPYC nebo Xeon, na 10GbE přepínači jeden hop od robota. Tři úrovně, na kterých záleží pro robotiku:

stupeň GPU Agregovaná VRAM Trvalá síla Největší realistický VLM (INT4)
K-AI 64 / 96 (4 grafické karty) 4× RTX 5090 nebo 4× Pro 6000 128 - 384 GB 1.8–2.4 kW 72B s místem pro mezipaměť KV
K-AI 128 (4× Pro 6000 Blackwell) 4× RTX Pro 6000 96 GB 384 GB 2.0–2.6 kW 72B s plným kontextem
K-AI 256 (8 grafických karet) 8× RTX 5090 nebo 8× Pro 6000 256 - 768 GB 3.5–4.5 kW 70B + 32B + 7B současně

Rozhodovací matice

Každé robotické zatížení se jasně řadí do jedné z pěti kategorií: vždy na palubě, preferováno na palubě, buď, preferováno mimo palubu, pouze mimo palubuDůvodem pro každé umístění je závazný rozpočet – výkon, paměť nebo latence.

Pracovní zátěž Umístění Vazební omezení Proč
Řídicí smyčka motoru (500 Hz–1 kHz) Vždy na palubě Latence (< 1 ms) Síťový skok je 100–10 000× větší než rozpočet smyčky. Žádné výjimky.
Bezpečnostní reflexy kloubů / nouzové zastavení Vždy na palubě Latence (< 5 ms) Ze stejného důvodu; musí fungovat i při výpadku lokální sítě (LAN).
Fúze senzorů IMU Vždy na palubě Latence (< 5 ms) Napájí přímo regulační smyčku.
Hloubka stereo / RGB-D Vždy na palubě Šířka pásma + latence Šířka pásma kamery pro zpracování dat je příliš vysoká na to, aby se dala odeslat; výstupní hloubka je malá, ale je potřeba rychlost.
Detekce objektů třídy YOLO Preferováno na palubě Latence (10–30 ms reflexně) Pasuje na Jetson s 30+ FPS. Není důvod ho připojovat k síti.
Detekce probuzujících slov Preferováno na palubě Výkon + latence Vždy zapnutý, spotřeba nižší než watt na QRB nebo Hailo. Mimo desku spotřebovává síťovou šířku pásma 24 hodin denně, 7 dní v týdnu.
STT třídy Whisper (malý) buď Tolerance latence 100–250 ms na Jetson AGX Orin. Mimo základní desku je to 30–80 ms na 5090. Uživatel to nepozná.
Malý LLM (≤ 8B Q4) pro dialog buď Latence vs. souběžnost 15–25 tok/s na Orin AGX, 80–150 tok/s na 5090. Pokud potřebujete měřítko, vyhrává to mimo palubní verzi.
VLM 3B Q4 (popis scény) Preferováno na palubě Výkon + latence Snadno se vejde na Orina, nepotřebuje síť, použitelných ~10 FPS.
VLM 7B Q4 (Qwen2.5-VL, OpenVLA) buď Výkon vs. snímková frekvence Orin AGX běží 5–8 FPS při 30 W. K-AI běží s 30+ FPS. Výběr pro každou úlohu.
VLM 32B Q4 Preferováno mimo palubu (Thor: marginálně palubní) Paměť + výkon Nepasuje na Orin AGX. Marginální na Thor 128 GB. Pohodlné na K-AI 96.
VLM 70B+ Q4 Pouze mimo palubu Memory 45–50 GB váhy + 10–20 GB KV. V roce 2026 toto nebude hostovat žádný integrovaný modul.
Plánovač pohybu (krátký horizont, < 1 s) Preferováno na palubě Latence Úzká smyčka s řízením. Lokální je správná odpověď.
Plánovač pohybu (dlouhý horizont, vícenásobné operace) Mimo palubu preferováno Paměť + velikost modelu VLM neboli difúzně orientovaný, s velkým kontextem a mimo ni vítězí.
Paměť scény / RAG Pouze mimo palubu Vytrvalost + paměť Musí přežít restart robota; vektorové úložiště vyžaduje skutečné úložiště a paměť CPU RAM.
Vícekamerová fúze VLM (3–5 streamů) Pouze mimo palubu Paměť + výpočetní technika Dávkování mezi kamerami vyžaduje server s více GPU.
Doladění / školení LoRA Pouze mimo palubu Paměť + výkon 2–5× inferenční paměť, trvalý výkon třídy kW. Neděje se to s baterií.
Kompletní předškolení Pouze mimo palubu Nevejde se to ani na jeden server Víceuzlové území. Viz stopa K.
Iterace zásad Isaaca Sima Pouze mimo palubu Propustnost vykreslování GPU + RL Inherentně serverová zátěž.

Tři výklady této tabulky, které stojí za to si přečíst.

Řádky „vždy na palubě“ jsou fyzika. Žádné množství šířky pásma neopraví regulační smyčku, která vyžaduje odezvu 1 kHz. Ty se nikdy nepohnou, bez ohledu na to, jak dobrá je síť nebo externí výpočetní technika.

Řádky „buď“ jsou místem, kde probíhá skutečné inženýrské posouzení. Většina zajímavých kompromisů se nachází právě zde. To, zda 7B VLM běží integrovaně nebo externě, určuje skutečnou část chování systému. Neexistuje globálně správná odpověď.

Řádky označené „pouze mimo palubu“ se pohybují pomalu. Model 72B pravděpodobně zůstane mimo výrobu až v roce 2027. Model 32B se na palubě objeví s tím, jak se bude Thor dodávat ve velkém množství. Hranice „co se vejde do zařízení“ se posouvá zhruba o jednu velikostní třídu modelu každých 18–24 měsíců.

Mapování úrovní latence

Čtyřúrovňový rozpočet latence od I01 mapy přímo na umístění:

stupeň Rozpočet Umístění
Reaktivní řízení <10 ms Pouze na palubě. Tečka.
Reflexní vnímání 10–50 ms Integrovaný (samotná LAN zpáteční cesta ubírá rozpočet)
Deliberativní plánování 100 ms – 1 s Buď. LAN funguje, integrované rozhraní funguje.
Strategické uvažování 1 s – vícenásobné Buď v každém případě externí modely často vítězí.

Dvě střední vrstvy jsou místem, kde se odehrávají skutečná architektonická rozhodnutí. Reflexivní úloha, která právě Vejde se to za 50 ms, mohlo by se to vejít mimo základnu přes kabelovou LAN (0.5 ms tranzit + 40 ms inference + 0.5 ms zpět = 41 ms), ale přes Wi-Fi 6E při zátěži by to překročilo rozpočet (8 ms × 2 + 40 ms = 56 ms plus jitter). Proto jsou kabelové tethery důležité během vývoje: umožňují vám zjistit, zda je pracovní zátěž zásadně se vejde mimo palubu, než se postavíte bezdrátové síti.

Síťová realita

Offboard funguje pouze tehdy, pokud je síťová. Skutečná čísla:

Odkaz Medián RTT P99 RTT Jitter při zátěži
Drátové 2.5/10 GbE tether 0.2–0.5 ms 0.5–1 ms Sub-ms
Wi-Fi 6E, 6 GHz, v přímé viditelnosti, vyhrazený přístupový bod 3–10 ms 15–30 ms Spravovatelné
Wi-Fi 6 / 6E, sdílená 5 GHz, sporná 8–25 ms 80–200 ms Špatný
Wi-Fi 6E při zátěži (přenos souborů se stejným SSID) 10–40 ms 200 ms – 2 s Robotické lámání
Mobilní 5G střední pásmo 20–40 ms 100–300 ms Proměnlivý
WAN do cloudu EU 15–40 ms (medián) 80–300 ms Závislé na BGP

Pro deliberativní úlohy (rozpočet 100 ms – 1 s) je Wi-Fi 6E na vyhrazeném SSID a přístupovém bodě v přímé viditelnosti dostatečná. Pro reflexivní úlohy (10–50 ms) je bezpečnou odpovědí kabelové připojení a šťastnou odpovědí je Wi-Fi 6E. Naplánujte podle toho: pokud má úloha robota jakoukoli reflexivní externí komponentu, navrhněte s kabelovou možností pro vývoj a záložním režimem pro případ, že by Wi-Fi skončila.

Hybridní vzorec – rychlé/pomalé rozdělení

Většina seriózních nasazení v roce 2026 se shoduje na tomto vzorci: rychlé/pomalé rozdělení VLMMalý VLM integrovaný pro okamžitou zpětnou vazbu, velký externí VLM pro uvážená rozhodnutí, oba poskytují informace stejnému plánovači.

Tvar betonu:

Snímek kamery — 30 snímků za sekundu
  • Kadence 33 ms na snímek
  • Napájí integrované i externí VLM cesty

Palubní VLM 7B Q4
  • Qwen2.5-VL-7B na Jetson AGX Orin / Thor
  • Výstup 5–10 Hz
  • Shrnutí scény + okamžitá akce
  • Napájí reflexní vrstvu přímo

gRPC
Mimo palubní VLM 72B Q4
  • Qwen2.5-VL-72B na K-AI 96/256
  • Výstup 1–3 Hz
  • Zvážené zdůvodnění scény + úprava plánu
  • Zpracovává deliberativní vrstvu, lze ji přepsat na palubě

Rozdělení na rychlé/pomalé operace: palubní 7B se stará o okamžitou odezvu; externí 72B se stará o promyšlené úvahy a aktualizace plánu.

Rychlý model zpracovává situaci „jde ke mně někdo, zpomalte“. Pomalý model zpracovává situaci „osoba jdi ke mně je operátor, který mě požádal, abych se zastavil, pokud se přiblíží s červenou schránkou, a to je červená schránka, takže se zastavte“. Rychlý model se nejprve zavazuje k bezpečnému chování; pomalý model ho vylepšuje.

Příběh migrace – co se mění v letech 2026–2027

Tři síly stlačují externí část obvodu: Thor dosahuje objemu (2070 FP4 TFLOPS, 128 GB unifikované paměti, spotřeba 130 W – strukturální skok oproti Orinu); účinnost VLM se neustále zlepšuje („dostatečně dobrý“ vjem – VLM byl v roce 2024 70B+, v roce 2026 je 32B, v roce 2027 pravděpodobně bude 13B–20B); a spekulativní dekódování s malými draftery umožňuje zobrazovat kvalitu velkých modelů s malou latencí.

Úlohy, které s největší pravděpodobností migrují na palubě v příštích 18 měsících: scénický VLM třídy 7B (již se přesouvá), plánovač LLM třídy 13B (Thor to zjednodušuje), krátkodobé STT-LLM-TTS pro hlas, doménově specifické jemně vyladěné VLM třídy 7B.

Pracovní zátěže, které ne migrace: cokoli 70B+, paměť scén v měřítku vozového parku, trénink a simulace, fúze vícestreamových VLM. Tyto funkce zůstávají mimo systém minimálně do roku 2027. Šířka pásma paměti a výkon baterie se nemění tak rychle.

Dvě betonové konfigurace

Jednotlivá G1 EDU, výzkumná laboratoř. Integrovaný AGX Orin běží na ROS 2, YOLOv11-s s 30 FPS, Whisper-distil STT a Qwen2.5-VL 7B INT4 s 5–8 FPS (záměrně). Off-board K-AI 96 (4× RTX 5090, 128 GB VRAM) běží vLLM s Qwen2.5-VL 72B a Qwen2.5 32B textově-pásmovou pamětí, pgvector scénickou pamětí a Isaac Sim na nečinných GPU.

Malá flotila, 3 humanoidi, třída Thor na palubě. Každá jednotka běží na procesoru Hailo-15 Vision SoC pro trvale zapnutou detekci více kamer, v zařízení je integrovaná technologie Whisper-small a grafická karta Qwen2.5-VL 32B INT4 s frekvencí 10–15 FPS – nativně, již ne na okraji. Externí K-AI 256 (8× RTX 5090, 256 GB VRAM) hostí sdílenou grafickou kartu Qwen2.5-VL 72B a Llama-3.1 70B pro plánování, sdílené úložiště pgvector napříč všemi třemi roboty a dvě grafické karty vyhrazené pro noční doladění LoRA.

Kde fungují čistě jednovrstvá nasazení

Čistě palubní práce pro úzce zaměřené čtyřnohé roboty (hlídkování perimetru s YOLO + termokamerou), teleoperované roboty (operátor je plánovač, bez VLM ve smyčce), demonstrační/vzdělávací roboty s nejmenšími modely a jakékoli nasazení bez jakékoli sítě (venkovní inspekce, vzdálená pracoviště).

Čistý cloud funguje pro robotičtí asistenti ovládající pouze hlas bez uzavřené smyčky vnímání, prototypy, kde rychlost nastavení převyšuje vše ostatní, a nasazení, kde jsou data stejně záměrně ukládána do cloudového úložiště.

Hybrid je odpovědí na všechno mezi tím – což je v roce 2026 zhruba 90 % seriózní robotiky. Pokud stavíte cokoli s vnímáním VLM-in-the-loop, skončíte s oběma úrovněmi. Počítejte s tím od prvního dne.

Tok rozhodování

Při určování velikosti nasazení:

  1. Uveďte pracovní zátěž. Řízení motoriky, vnímání, STT, LLM, VLM, plánování, paměť, trénink. Buďte explicitní.
  2. Označte každou úroveň latence a třídu paměti (≤ 8 GB / 8–40 GB / 40–80 GB / 80+ GB).
  3. Aplikujte matici výše, abyste získali umístění s prvním hodnocením.
  4. Proveďte audit na palubě robota oproti skutečnému SoC a tepelnému rozpočtu. G1 s Orin NX je jiný stroj než T1 s AGX Orin nebo budoucí platformou Thor.
  5. Proveďte externí audit na úrovni K-AI, kterou si můžete dovolit. K-AI 96 je minimální hodnota pro jednoho robota vykonávajícího seriózní práci; K-AI 256 je minimální hodnota pro flotilu robotů nebo jakýkoli požadavek na školení.
  6. Proveďte audit sítě. Kabelové připojení pro vývoj, dedikované SSID Wi-Fi 6E pro produkční prostředí. Pokud vaše reflexivní vrstva protíná síť, naplánujte kabelové připojení nebo záložní řešení s plynulým přechodem na nižší úroveň.
  7. Naplánovat migraci. Když Thor dodáte na svou platformu, které úlohy se na ni přesunou? Abstrahujte nyní hranice gRPC, aby migrace byla změnou nasazení, nikoli přepsáním.

Následné články (R05, I02, I05) se hlouběji zabývají zde načrtnutými částmi. Rozhodnutí o umístění v tomto článku jsou lešením, na kterém vše ostatní visí.

Upřímný názor: 90 % seriózních nasazení robotiky v roce 2026 bude potřebovat obě úrovně. Vestavěná robotika je dimenzována pro bezpečnost, reflexy a vnímání malých modelů. Externí robotika je dimenzována pro VLM-in-the-loop, paměť scén, plánování a školení. Jednovrstvá nasazení fungují pro úzké případy užití – a pouze pro ty.


Toto je součást Kentino Wiki, referenční série o výpočetní technologii s využitím umělé inteligence, robotice a systémech, které je propojují. Komentáře a opravy jsou vítány na adrese info@kentino.com.

Torna na blogu