Odborná definícia
Odborná definícia
TensorRT je softvérová vývojová súprava spoločnosti NVIDIA na optimalizáciu a vykonávanie inferencie neurónových sietí na GPU NVIDIA. Importuje alebo zostavuje sieť, vyberá implementácie operátorov, spája vrstvy, optimalizuje pamäť a môže použiť zníženú numerickú presnosť. Výsledkom je engine viazaný na podporovaný hardvér, verziu knižníc a zvolené profily tvarov. Zrýchlenie nie je automatické, pretože závisí od pokrytia operácií, dávok a nákladov na presuny dát. Optimalizovaný engine sa verzuje spolu s modelom, kalibračnými dátami, profilmi tvarov a cieľovou platformou.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Trénovaný model je často zostavený pre flexibilitu, nie pre najrýchlejšiu prevádzku. TensorRT ho analyzuje a vytvorí plán vhodný pre konkrétnu GPU. Môže zlúčiť viac krokov, vybrať rýchle jadro pre daný tvar a použiť FP16 alebo INT8, ak je to bezpečné. Takto sa zníži latencia alebo zvýši počet požiadaviek za sekundu. Engine však nie je univerzálny súbor pre každé zariadenie. Pri novej GPU, inom rozsahu vstupov alebo zmene verzie môže byť potrebné nové zostavenie a opätovná validácia presnosti. Po každej kompilácii treba porovnať nielen rýchlosť, ale aj numerickú odchýlku na kritických príkladoch.
Časté otázky
Časté otázky
Je TensorRT tréningový framework?
Nie. Je zameraný najmä na optimalizáciu a spúšťanie inferencie. Model sa zvyčajne trénuje v PyTorch, TensorFlow alebo inom frameworku a následne sa exportuje.
Čo je TensorRT engine?
Je to optimalizovaný vykonávací plán siete s vybranými taktikami, pamäťovým plánom a profilmi vstupných tvarov. Jeho prenositeľnosť medzi platformami je obmedzená.
Ako TensorRT používa INT8?
Operácie a hodnoty kvantizuje do osembitovej reprezentácie. Potrebuje kalibračné dáta alebo kvantizačné parametre z tréningu a výsledná presnosť sa musí porovnať s referenciou.
Čo sa stane pri nepodporovanom operátore?
Model možno upraviť, použiť plugin alebo rozdeliť medzi viac runtime systémov. Každé riešenie ovplyvňuje údržbu, výkon a kompatibilitu.
Ako sa hodnotí prínos TensorRT?
Meria sa čas do prvého výsledku, latencia pri rôznych percentiloch, priepustnosť, pamäť a odchýlka výstupu. Benchmark musí používať reálne tvary a súbežnosť.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- NVIDIA TensorRT Documentation NVIDIA TensorRT Inference Library Overview
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
