Odborná definice
Odborná definice
Tensorrt je softvérová vývojová súprava společnosti NVIDIA na optimalizaci a provádění inference neuronových sítí na GPU NVIDIA. Importuje nebo zostavuje síť, vybírá implementace operátorů, spojuje vrstvy, optimalizuje paměť a může použít zníženou numerickou přesnost. Výsledkem je engine viazaný na podporovaný hardware, verzi knižníc a zvolené profily tvarů. Zrychlení není automatické, protože závisí na pokrytí operací, dávek a nákladů na presuny dat. Optimalizovaný engine se verzuje spolu s modelem, kalibračnými daty, profilmi tvarů a cílovou platformou.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Trénovaný model je často sestavený pro flexibilitu, ne pro najrýchlejšiu prevádzku. Tensorrt ho analyzuje a vytvoří plán vhodný pro konkrétní GPU. Může sloučit více kroků, vybrat rychle jádro pro daný tvar a použít FP16 nebo INT8, pokud je to bezpečné. Takto se sníží latence nebo zvýší počet požadavků za sekundu. Engine však není univerzální soubor pro každé zařízení. Při nové GPU, jiném rozsahu vstupů nebo změně verze může být potřebné nové sestavení a opetovná validace přesnosti. Po každé kompilaci je třeba porovnat nejen rychlost, ale i numerickou odchylku na kritických příkladech.
Časté otázky
Časté otázky
Je Tensorrt tréninkový framework?
Ne. Je zaměřený zejména na optimalizaci a spúšťání inference. Model se obvykle trénuje v Pytorch, Tensorflow nebo jiném frameworku a následně se exportuje.
Co je Tensorrt engine?
Je to optimalizovaný vykonávací plán sítě s vybranými taktikami, pameťovým plánom a profilmi vstupních tvarů. Jeho prenositelnost mezi platformami je omezená.
Jako Tensorrt používá INT8?
Operace a hodnoty kvantizuje do osembitovej reprezentace. Potřebuje kalibračné data nebo kvantizačné parametry z tréninku a výsledná přesnost se musí porovnat s referencí.
Co se stane při nepodporovanom operátore?
Model lze upravit, použít plugin nebo rozdelit mezi více runtime systémů. Každé řešení ovlivňuje údržbu, výkon a kompatibilitu.
Jak se hodnotí přínos Tensorrt?
Měří se čas do prvého výsledku, latence při různých percentiloch, propustnost, paměť a odchýlka výstupu. Benchmark musí používat reálně tvary a súbežnost.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- NVIDIA TensorRT Documentation NVIDIA TensorRT Inference Library Overview
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
