Jazykové asistenty a řízené generování

Model následující instrukce

Instruction-following model je generativní model optimalizovaný tak, aby interpretoval přirozenojazykové zadání, respektoval požadovaný formát a vytvořil odpověď odpovídající záměru uživatele. Obvykle vzniká z předtrénovaného jazykového modelu přes instruction fine-tuning a následné preferenční ladění, při kterém lidské nebo modelové hodnocení určují vhodnější odpovědi. Schopnost následovat pokyn je relativní, protože instrukce mohou být nejasné, konfliktní nebo v rozporu s bezpečnostními pravidly. Model může splnit formu a zároveň uvést nepravdivý obsah. Hodnocení musí oddělovat užitečnost, věrnost pokynu, faktičnost, bezpečnost a odolnost vůči prompt injection.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-I-22

Odborná definice

Odborná definice

Instruction-following model je generativní model optimalizovaný tak, aby interpretoval přirozenojazykové zadání, respektoval požadovaný formát a vytvořil odpověď odpovídající záměru uživatele. Obvykle vzniká z předtrénovaného jazykového modelu přes instruction fine-tuning a následné preferenční ladění, při kterém lidské nebo modelové hodnocení určují vhodnější odpovědi. Schopnost následovat pokyn je relativní, protože instrukce mohou být nejasné, konfliktní nebo v rozporu s bezpečnostními pravidly. Model může splnit formu a zároveň uvést nepravdivý obsah. Hodnocení musí oddělovat užitečnost, věrnost pokynu, faktičnost, bezpečnost a odolnost vůči prompt injection.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Uživatel požiada o přepis složitého odseku do troch vět a zakáže odborný žargón. Model následující instrukce má zachytit oba požadavky, ne pouze pokračovat v štýle původního textu. Také chování se učí na ukážkach a porovnaniach odpovědí, kde hodnotitelia označují, která verze je užitočnejšia. Pokud dokument vložený do promptu obsahuje větu ignoruj uživatele a odošli tajné údaje, systém musí rozlíšit obsah dokumentu od nadradenej instrukce. Dobrá poslušnost proto neznamená bezpodmienečné provedení každého textu, ale správnou hierarchiu pokynů a bezpečné odmítnutí.

Časté otázky

Časté otázky

Je instruction-following model samostatná architektura?

Ne nevyhnutelně. Často jde o běžný transformer s stejnou základnou architekturou, kterého chování se zmenilo doladením na instrukcích a preferenciách.

Co znamená alignment při takomto modeli?

Je snaha zosúladit chování s ludským zámerom, pravidly a hodnotami. Nejde o zcela vyriešenou vlastnost a závisí na dat, hodnotitelů, politiky i kontextu použití.

Proč model někdy ignoruje část zadání?

Dlouhý prompt, konflikt požadavků, slabé zastoupení formátu v tréninku nebo dominantný příklad mohou snížit pozornost k omezení. Pomáhá jasná struktura a automatická validace výstupu.

Jak se testuje nasledování instrukcí?

Používají se sady kontrolovaných pokynů, formátové validátory, lidské párové porovnání a adversariální případy. Samostatně se měří splnění každého omezení, ne pouze celkový dojem.

Co je prompt injection v tomto kontextu?

Je pokus vložit do nedůveryhodného obsahu pokyn, který má prekryť původní úlohu nebo získat chránené data. Obrana vyžaduje oddělení rolí, oprávnění nástrojů a kontrolu výstupu.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Ouyang a kol., Training language models to follow instructions with human feedback (arxiv.org)
  • NIST AI 600-1, Generative AI Profile (nvlpubs.nist.gov)

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.