Výpočetní technika na zařízení vs. mimo zařízení pro roboty
Sdílet
Každá úloha na robotu se nachází na jednom ze dvou míst: uvnitř robota, napájená baterií a ventilátory na hrudi, nebo mimo něj, na serveru napájeném ze zásuvky, který je vzdálen jeden LAN hop. Složitá otázka zní, zda… zda potřebujete obojí – téměř vždycky – ale která pracovní zátěž kam jde a proč. R08 argumentuje, že vůbec existuje vyhrazená okrajová vrstva. Tento článek je rozhodnutím pro jednotlivé úlohy: řízení motoru zde, VLM tam, STT závisí atd.
Rámec je subjektivní. Na každou pracovní zátěž existuje správná odpověď a správná odpověď se mění s tím, jak se integrovaný křemík vyvíjí. Řekneme, kterým směrem se každý kus ubírá v letech 2026–2027.
Dva rozpočty, které rozhodují o všem
Pracovní zátěž může běžet na palubě, pouze pokud se vejde do dvou rozpočtů současně: energie a paměťLatence je třetím omezením, ale obvykle vám napoví kterým směrem tlačit pracovní zátěž, která se hodí, ne to, zda se vůbec hodí.
Energetický rozpočet humanoida. Humanoid o hmotnosti 30–50 kg nese baterii s kapacitou 700–900 Wh. Dlouhodobá chůze odebírá z aktuátorů 200–500 W, přičemž při dynamickém pohybu dosahuje vrcholů přes 800 W. Stání v klidu a přemýšlení odebírá z aktuátorů 80–150 W (udržovací moment je nízký, udržování polohy stojí peníze). Zbývá tedy zhruba 60–120 W pro... všechno ostatní — výpočetní technika, senzory, chladicí ventilátory, rádio — pokud chcete použitelnou dvouhodinovou dobu běhu. Výpočetní rozpočet v rámci tohoto objemu je 30–80 W trvale. Neustálé spalování Jetsonu na MAX_N (60 W) zkrátí dobu běhu robota na polovinu. To je nezpochybnitelná fyzika, nikoli konstrukční volba.
Paměťový rozpočet. Jetson AGX Orin 64 GB je 64 GB LPDDR5 sdílené mezi CPU a GPUOdečtěte OS (4–6 GB), ROS 2 a SDK výrobce (2–4 GB), vyrovnávací paměti pro vnímání (2–4 GB pro stereo hloubku a mračna bodů) a veškerý aplikační kód. Realistický rozpočet využitelný pro LLM/VLM je 40–48 GB. Na modulu Jetson Thor 128 GB se strop zvýší na ~96 GB použitelných. Na Orin NX 16 GB se sníží na ~8–10 GB použitelných – dost pro jeden malý model.
Mimochodem, oba rozpočty představují odlišné problémy. K-AI 96 (4× RTX 5090) má 128 GB dedikované paměti VRAM a 1.0–1.5 kW výkonu GPU při zapojení do zásuvky. K-AI 256 (8× RTX 5090) obojí zdvojnásobuje. Výkon a paměť jednoduše přestávají být omezením – místo toho je vyměníte za kapitálové výdaje, vytápění, větrání a klimatizaci v místnosti a kabelové připojení.
Integrovaný křemík, realita roku 2026
Palubní doplňky, které se dnes skutečně dodávají u seriózních humanoidů a čtyřnožců:
| SoC | INT8 TOPS (řídké) | Využitelná paměť | Napájecí obálka | Co může spustit |
|---|---|---|---|---|
| Jetson Orin NX 16 GB | 100 | ~10 GB sdíleno | 10–25 W | YOLO, malý VLM 3B Q4, probuzení |
| Jetson AGX Orin 64 GB | 275 | ~40 GB sdíleno | 15–60 W | YOLO, VLM 7B Q4 za použitelné sazby, 13B LLM |
| Jetson AGX Thor 128 GB (2026) | 1 200 TFLOPS FP4 | ~96 GB sdíleno | 40–130 W | VLM 32B Q4 s dostatečným prostorem, duální vnímání proudu |
| Snapdragon 8 Gen 3 / třída QRB | 45-75 | ~6–10 GB sdíleno | 5–15 W | Hlasový, probuzovací, světelný životopis |
| Hailo-8 (doplněk M.2) | 26 INT8 VRCHNÍKŮ | 2–4 GB na čipu | 2.5 W typický | Odlehčení zátěže technologického kanálu Vision, MobileNet/YOLO |
| Hailo-15 (SoC Vision) | 20 TOPS | rezident potrubí | 2–5 W | Vždy zapnutý vícekamerový životopis |
| Koprocesor Intel N97 / i7-1370P | n/a (CPU + iGPU) | Hostitel DDR5 | 6–45 W | Orchestrace na vysoké úrovni, ROS 2, lepidlo |
Thor je skoková změna, nikoli iterace. Paměťový strop 128 GB a tenzorová jádra Blackwell s nativní FP4 posouvají hranici integrovaných procesorů z „7B VLM, bolestivě“ na „32B VLM, užitečně“ během jedné generace. Pracovní zátěže, které byly v roce 2025 strukturálně mimo systém – středně velké VLM, kontinuální titulkování scén, středně velké plánovače LLM – se stávají... kandidáti na palubě v roce 2026, pokud tepelné řešení robota udrží výkon 100–130 W.
Hailo a specializovaná třída NPU nejsou akcelerátory LLM. Jsou to odlehčení pro vizuální kanál: ponechte hlavní Jetson volný pro větší model, spusťte vždy zapnutou kamerovou CV (detekce objektů, sledování, základní VLM-lite) na 3W čipu.
Třída Snapdragon QRB je řešením pro roboty primárně ovládající hlas – probuzení slovem, tvarování paprsku, STT – kde je Jetson přehnaný a Cortex-M poddimenzovaný. Užitečný, úzký, stále běžnější.
Mimo palubu: úroveň K-AI jako reference
Cílovou variantou pro externí řešení, na kterou se v této sérii odkazuje, je řada K-AI – nástěnné napájení, 4U nebo 5U rack, 4 nebo 8 GPU na EPYC nebo Xeon, na 10GbE přepínači jeden hop od robota. Tři úrovně, na kterých záleží pro robotiku:
| stupeň | GPU | Agregovaná VRAM | Trvalá síla | Největší realistický VLM (INT4) |
|---|---|---|---|---|
| K-AI 64 / 96 (4 grafické karty) | 4× RTX 5090 nebo 4× Pro 6000 | 128 - 384 GB | 1.8–2.4 kW | 72B s místem pro mezipaměť KV |
| K-AI 128 (4× Pro 6000 Blackwell) | 4× RTX Pro 6000 96 GB | 384 GB | 2.0–2.6 kW | 72B s plným kontextem |
| K-AI 256 (8 grafických karet) | 8× RTX 5090 nebo 8× Pro 6000 | 256 - 768 GB | 3.5–4.5 kW | 70B + 32B + 7B současně |
Rozhodovací matice
Každé robotické zatížení se jasně řadí do jedné z pěti kategorií: vždy na palubě, preferováno na palubě, buď, preferováno mimo palubu, pouze mimo palubuDůvodem pro každé umístění je závazný rozpočet – výkon, paměť nebo latence.
| Pracovní zátěž | Umístění | Vazební omezení | Proč |
|---|---|---|---|
| Řídicí smyčka motoru (500 Hz–1 kHz) | Vždy na palubě | Latence (< 1 ms) | Síťový skok je 100–10 000× větší než rozpočet smyčky. Žádné výjimky. |
| Bezpečnostní reflexy kloubů / nouzové zastavení | Vždy na palubě | Latence (< 5 ms) | Ze stejného důvodu; musí fungovat i při výpadku lokální sítě (LAN). |
| Fúze senzorů IMU | Vždy na palubě | Latence (< 5 ms) | Napájí přímo regulační smyčku. |
| Hloubka stereo / RGB-D | Vždy na palubě | Šířka pásma + latence | Šířka pásma kamery pro zpracování dat je příliš vysoká na to, aby se dala odeslat; výstupní hloubka je malá, ale je potřeba rychlost. |
| Detekce objektů třídy YOLO | Preferováno na palubě | Latence (10–30 ms reflexně) | Pasuje na Jetson s 30+ FPS. Není důvod ho připojovat k síti. |
| Detekce probuzujících slov | Preferováno na palubě | Výkon + latence | Vždy zapnutý, spotřeba nižší než watt na QRB nebo Hailo. Mimo desku spotřebovává síťovou šířku pásma 24 hodin denně, 7 dní v týdnu. |
| STT třídy Whisper (malý) | buď | Tolerance latence | 100–250 ms na Jetson AGX Orin. Mimo základní desku je to 30–80 ms na 5090. Uživatel to nepozná. |
| Malý LLM (≤ 8B Q4) pro dialog | buď | Latence vs. souběžnost | 15–25 tok/s na Orin AGX, 80–150 tok/s na 5090. Pokud potřebujete měřítko, vyhrává to mimo palubní verzi. |
| VLM 3B Q4 (popis scény) | Preferováno na palubě | Výkon + latence | Snadno se vejde na Orina, nepotřebuje síť, použitelných ~10 FPS. |
| VLM 7B Q4 (Qwen2.5-VL, OpenVLA) | buď | Výkon vs. snímková frekvence | Orin AGX běží 5–8 FPS při 30 W. K-AI běží s 30+ FPS. Výběr pro každou úlohu. |
| VLM 32B Q4 | Preferováno mimo palubu (Thor: marginálně palubní) | Paměť + výkon | Nepasuje na Orin AGX. Marginální na Thor 128 GB. Pohodlné na K-AI 96. |
| VLM 70B+ Q4 | Pouze mimo palubu | Memory | 45–50 GB váhy + 10–20 GB KV. V roce 2026 toto nebude hostovat žádný integrovaný modul. |
| Plánovač pohybu (krátký horizont, < 1 s) | Preferováno na palubě | Latence | Úzká smyčka s řízením. Lokální je správná odpověď. |
| Plánovač pohybu (dlouhý horizont, vícenásobné operace) | Mimo palubu preferováno | Paměť + velikost modelu | VLM neboli difúzně orientovaný, s velkým kontextem a mimo ni vítězí. |
| Paměť scény / RAG | Pouze mimo palubu | Vytrvalost + paměť | Musí přežít restart robota; vektorové úložiště vyžaduje skutečné úložiště a paměť CPU RAM. |
| Vícekamerová fúze VLM (3–5 streamů) | Pouze mimo palubu | Paměť + výpočetní technika | Dávkování mezi kamerami vyžaduje server s více GPU. |
| Doladění / školení LoRA | Pouze mimo palubu | Paměť + výkon | 2–5× inferenční paměť, trvalý výkon třídy kW. Neděje se to s baterií. |
| Kompletní předškolení | Pouze mimo palubu | Nevejde se to ani na jeden server | Víceuzlové území. Viz stopa K. |
| Iterace zásad Isaaca Sima | Pouze mimo palubu | Propustnost vykreslování GPU + RL | Inherentně serverová zátěž. |
Tři výklady této tabulky, které stojí za to si přečíst.
Řádky „vždy na palubě“ jsou fyzika. Žádné množství šířky pásma neopraví regulační smyčku, která vyžaduje odezvu 1 kHz. Ty se nikdy nepohnou, bez ohledu na to, jak dobrá je síť nebo externí výpočetní technika.
Řádky „buď“ jsou místem, kde probíhá skutečné inženýrské posouzení. Většina zajímavých kompromisů se nachází právě zde. To, zda 7B VLM běží integrovaně nebo externě, určuje skutečnou část chování systému. Neexistuje globálně správná odpověď.
Řádky označené „pouze mimo palubu“ se pohybují pomalu. Model 72B pravděpodobně zůstane mimo výrobu až v roce 2027. Model 32B se na palubě objeví s tím, jak se bude Thor dodávat ve velkém množství. Hranice „co se vejde do zařízení“ se posouvá zhruba o jednu velikostní třídu modelu každých 18–24 měsíců.
Mapování úrovní latence
Čtyřúrovňový rozpočet latence od I01 mapy přímo na umístění:
| stupeň | Rozpočet | Umístění |
|---|---|---|
| Reaktivní řízení | <10 ms | Pouze na palubě. Tečka. |
| Reflexní vnímání | 10–50 ms | Integrovaný (samotná LAN zpáteční cesta ubírá rozpočet) |
| Deliberativní plánování | 100 ms – 1 s | Buď. LAN funguje, integrované rozhraní funguje. |
| Strategické uvažování | 1 s – vícenásobné | Buď v každém případě externí modely často vítězí. |
Dvě střední vrstvy jsou místem, kde se odehrávají skutečná architektonická rozhodnutí. Reflexivní úloha, která právě Vejde se to za 50 ms, mohlo by se to vejít mimo základnu přes kabelovou LAN (0.5 ms tranzit + 40 ms inference + 0.5 ms zpět = 41 ms), ale přes Wi-Fi 6E při zátěži by to překročilo rozpočet (8 ms × 2 + 40 ms = 56 ms plus jitter). Proto jsou kabelové tethery důležité během vývoje: umožňují vám zjistit, zda je pracovní zátěž zásadně se vejde mimo palubu, než se postavíte bezdrátové síti.
Síťová realita
Offboard funguje pouze tehdy, pokud je síťová. Skutečná čísla:
| Odkaz | Medián RTT | P99 RTT | Jitter při zátěži |
|---|---|---|---|
| Drátové 2.5/10 GbE tether | 0.2–0.5 ms | 0.5–1 ms | Sub-ms |
| Wi-Fi 6E, 6 GHz, v přímé viditelnosti, vyhrazený přístupový bod | 3–10 ms | 15–30 ms | Spravovatelné |
| Wi-Fi 6 / 6E, sdílená 5 GHz, sporná | 8–25 ms | 80–200 ms | Špatný |
| Wi-Fi 6E při zátěži (přenos souborů se stejným SSID) | 10–40 ms | 200 ms – 2 s | Robotické lámání |
| Mobilní 5G střední pásmo | 20–40 ms | 100–300 ms | Proměnlivý |
| WAN do cloudu EU | 15–40 ms (medián) | 80–300 ms | Závislé na BGP |
Pro deliberativní úlohy (rozpočet 100 ms – 1 s) je Wi-Fi 6E na vyhrazeném SSID a přístupovém bodě v přímé viditelnosti dostatečná. Pro reflexivní úlohy (10–50 ms) je bezpečnou odpovědí kabelové připojení a šťastnou odpovědí je Wi-Fi 6E. Naplánujte podle toho: pokud má úloha robota jakoukoli reflexivní externí komponentu, navrhněte s kabelovou možností pro vývoj a záložním režimem pro případ, že by Wi-Fi skončila.
Hybridní vzorec – rychlé/pomalé rozdělení
Většina seriózních nasazení v roce 2026 se shoduje na tomto vzorci: rychlé/pomalé rozdělení VLMMalý VLM integrovaný pro okamžitou zpětnou vazbu, velký externí VLM pro uvážená rozhodnutí, oba poskytují informace stejnému plánovači.
Tvar betonu:
- Kadence 33 ms na snímek
- Napájí integrované i externí VLM cesty
- Qwen2.5-VL-7B na Jetson AGX Orin / Thor
- Výstup 5–10 Hz
- Shrnutí scény + okamžitá akce
- Napájí reflexní vrstvu přímo
gRPC
- Qwen2.5-VL-72B na K-AI 96/256
- Výstup 1–3 Hz
- Zvážené zdůvodnění scény + úprava plánu
- Zpracovává deliberativní vrstvu, lze ji přepsat na palubě
Rozdělení na rychlé/pomalé operace: palubní 7B se stará o okamžitou odezvu; externí 72B se stará o promyšlené úvahy a aktualizace plánu.
Rychlý model zpracovává situaci „jde ke mně někdo, zpomalte“. Pomalý model zpracovává situaci „osoba jdi ke mně je operátor, který mě požádal, abych se zastavil, pokud se přiblíží s červenou schránkou, a to je červená schránka, takže se zastavte“. Rychlý model se nejprve zavazuje k bezpečnému chování; pomalý model ho vylepšuje.
Příběh migrace – co se mění v letech 2026–2027
Tři síly stlačují externí část obvodu: Thor dosahuje objemu (2070 FP4 TFLOPS, 128 GB unifikované paměti, spotřeba 130 W – strukturální skok oproti Orinu); účinnost VLM se neustále zlepšuje („dostatečně dobrý“ vjem – VLM byl v roce 2024 70B+, v roce 2026 je 32B, v roce 2027 pravděpodobně bude 13B–20B); a spekulativní dekódování s malými draftery umožňuje zobrazovat kvalitu velkých modelů s malou latencí.
Úlohy, které s největší pravděpodobností migrují na palubě v příštích 18 měsících: scénický VLM třídy 7B (již se přesouvá), plánovač LLM třídy 13B (Thor to zjednodušuje), krátkodobé STT-LLM-TTS pro hlas, doménově specifické jemně vyladěné VLM třídy 7B.
Pracovní zátěže, které ne migrace: cokoli 70B+, paměť scén v měřítku vozového parku, trénink a simulace, fúze vícestreamových VLM. Tyto funkce zůstávají mimo systém minimálně do roku 2027. Šířka pásma paměti a výkon baterie se nemění tak rychle.
Dvě betonové konfigurace
Jednotlivá G1 EDU, výzkumná laboratoř. Integrovaný AGX Orin běží na ROS 2, YOLOv11-s s 30 FPS, Whisper-distil STT a Qwen2.5-VL 7B INT4 s 5–8 FPS (záměrně). Off-board K-AI 96 (4× RTX 5090, 128 GB VRAM) běží vLLM s Qwen2.5-VL 72B a Qwen2.5 32B textově-pásmovou pamětí, pgvector scénickou pamětí a Isaac Sim na nečinných GPU.
Malá flotila, 3 humanoidi, třída Thor na palubě. Každá jednotka běží na procesoru Hailo-15 Vision SoC pro trvale zapnutou detekci více kamer, v zařízení je integrovaná technologie Whisper-small a grafická karta Qwen2.5-VL 32B INT4 s frekvencí 10–15 FPS – nativně, již ne na okraji. Externí K-AI 256 (8× RTX 5090, 256 GB VRAM) hostí sdílenou grafickou kartu Qwen2.5-VL 72B a Llama-3.1 70B pro plánování, sdílené úložiště pgvector napříč všemi třemi roboty a dvě grafické karty vyhrazené pro noční doladění LoRA.
Kde fungují čistě jednovrstvá nasazení
Čistě palubní práce pro úzce zaměřené čtyřnohé roboty (hlídkování perimetru s YOLO + termokamerou), teleoperované roboty (operátor je plánovač, bez VLM ve smyčce), demonstrační/vzdělávací roboty s nejmenšími modely a jakékoli nasazení bez jakékoli sítě (venkovní inspekce, vzdálená pracoviště).
Čistý cloud funguje pro robotičtí asistenti ovládající pouze hlas bez uzavřené smyčky vnímání, prototypy, kde rychlost nastavení převyšuje vše ostatní, a nasazení, kde jsou data stejně záměrně ukládána do cloudového úložiště.
Hybrid je odpovědí na všechno mezi tím – což je v roce 2026 zhruba 90 % seriózní robotiky. Pokud stavíte cokoli s vnímáním VLM-in-the-loop, skončíte s oběma úrovněmi. Počítejte s tím od prvního dne.
Tok rozhodování
Při určování velikosti nasazení:
- Uveďte pracovní zátěž. Řízení motoriky, vnímání, STT, LLM, VLM, plánování, paměť, trénink. Buďte explicitní.
- Označte každou úroveň latence a třídu paměti (≤ 8 GB / 8–40 GB / 40–80 GB / 80+ GB).
- Aplikujte matici výše, abyste získali umístění s prvním hodnocením.
- Proveďte audit na palubě robota oproti skutečnému SoC a tepelnému rozpočtu. G1 s Orin NX je jiný stroj než T1 s AGX Orin nebo budoucí platformou Thor.
- Proveďte externí audit na úrovni K-AI, kterou si můžete dovolit. K-AI 96 je minimální hodnota pro jednoho robota vykonávajícího seriózní práci; K-AI 256 je minimální hodnota pro flotilu robotů nebo jakýkoli požadavek na školení.
- Proveďte audit sítě. Kabelové připojení pro vývoj, dedikované SSID Wi-Fi 6E pro produkční prostředí. Pokud vaše reflexivní vrstva protíná síť, naplánujte kabelové připojení nebo záložní řešení s plynulým přechodem na nižší úroveň.
- Naplánovat migraci. Když Thor dodáte na svou platformu, které úlohy se na ni přesunou? Abstrahujte nyní hranice gRPC, aby migrace byla změnou nasazení, nikoli přepsáním.
Následné články (R05, I02, I05) se hlouběji zabývají zde načrtnutými částmi. Rozhodnutí o umístění v tomto článku jsou lešením, na kterém vše ostatní visí.
Upřímný názor: 90 % seriózních nasazení robotiky v roce 2026 bude potřebovat obě úrovně. Vestavěná robotika je dimenzována pro bezpečnost, reflexy a vnímání malých modelů. Externí robotika je dimenzována pro VLM-in-the-loop, paměť scén, plánování a školení. Jednovrstvá nasazení fungují pro úzké případy užití – a pouze pro ty.
Toto je součást Kentino Wiki, referenční série o výpočetní technologii s využitím umělé inteligence, robotice a systémech, které je propojují. Komentáře a opravy jsou vítány na adrese info@kentino.com.