Odborná definícia
Odborná definícia
Instruction fine-tuning je pokračovanie tréningu predtrénovaného modelu na zbierke úloh vyjadrených prirodzenými inštrukciami a očakávanými odpoveďami. Dataset môže obsahovať klasifikáciu, transformáciu textu, otázky, extrakciu, generovanie alebo dialóg, pričom spoločným cieľom je naučiť model interpretovať zadanie a preniesť tento spôsob správania na nové úlohy. Na rozdiel od doménového pokračovania pretrainingu sa optimalizuje odpoveď na explicitný pokyn. Rozmanitosť formulácií, kvalita cieľov a vyváženie úloh ovplyvňujú generalizáciu. Metóda nezaručuje faktickosť ani bezpečnosť a často sa dopĺňa preferenčným ladením alebo pravidlami použitia.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Základný jazykový model vie pokračovať v texte, ale nemusí spoľahlivo chápať, že používateľ chce tabuľku, preklad alebo stručnú odpoveď. Pri instruction fine-tuningu dostáva tisíce dvojíc, napríklad inštrukcia roztrieď správu podľa naliehavosti a správny výsledok. Učí sa spoločný vzor, že text pred ním je úloha, ktorú má splniť v požadovanom formáte. Keď neskôr uvidí nový typ zadania, môže lepšie nasledovať jeho štruktúru aj bez ukážok. Ak sú tréningové odpovede nekvalitné alebo si protirečia, model prevezme tieto návyky a môže ignorovať menej zastúpené pokyny.
Časté otázky
Časté otázky
Ako sa instruction tuning líši od bežného supervised fine-tuningu?
Je to špecifický supervidovaný fine tuning, pri ktorom sú príklady formulované ako rozmanité inštrukcie a odpovede. Dôraz je na prenos schopnosti nasledovať zadanie medzi úlohami.
Prečo je dôležitá rozmanitosť úloh?
Model sa nemá naučiť iba jednu šablónu. Rôzne typy vstupov, formátov a cieľov mu pomáhajú oddeliť všeobecný význam inštrukcie od slovníka konkrétneho datasetu.
Čo je instruction mixture?
Je kombinácia viacerých datasetov a úloh v jednom tréningu. Ich váhy určujú, ktoré schopnosti dominujú, preto sa kontroluje veľkosť, kvalita a opakovanie jednotlivých zdrojov.
Môže instruction fine-tuning zhoršiť základné schopnosti?
Áno. Príliš úzky alebo agresívny tréning môže spôsobiť zabúdanie, skrátiť odpovede alebo zvýšiť odmietanie. Potrebné sú regresné testy na všeobecných aj doménových úlohách.
Nahrádza instruction tuning aktuálne znalosti?
Nie. Mení spôsob reagovania, no nie je spoľahlivou databázovou aktualizáciou. Čerstvé fakty sa riešia retrievalom, nástrojmi alebo novým tréningovým cyklom s dôsledným overením.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Wei a kol., Finetuned Language Models Are Zero-Shot Learners (arxiv.org) Chung a kol., Scaling Instruction-Finetuned Language Models (arxiv.org)
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
