Presná definícia
Čo znamená konštitučná AI?
Konštitučná AI je metóda ladenia asistenta podľa explicitného súboru princípov - „ústavy“. V publikovanom postupe model najprv kritizuje a reviduje vlastné odpovede podľa týchto pravidiel a potom sa používa spätná väzba od AI na preferenčné učenie. Cieľom je znížiť potrebu ľudských označení škodlivých výstupov, nie odstrániť ľudský výber princípov a audit.
Skúsenosť a kontext
Ako sa pojem používa v praxi
Používa sa na systematické vytváranie revízií a preferenčných dát pre bezpečnostné správanie. Organizácia zverejní princípy, testuje konflikty medzi nimi a zapojí rôzne odborné a používateľské perspektívy. Výsledok sa hodnotí nezávislými ľuďmi na užitočnosti, oprávnených odmietnutiach, obchádzaní pravidiel a kultúrnych slepých miestach.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Ako funguje konštitučná AI?
Model podľa vybraného princípu vytvorí kritiku a opravu; ďalší model alebo fáza zoradí odpovede a politika sa učí z AI preferencií.
Kedy má konštitučná AI praktický význam?
Používa sa na systematické vytváranie revízií a preferenčných dát pre bezpečnostné správanie.
S čím si pojem nezamieňať?
RLHF používa ľudské preferencie ako hlavný signál; konštitučná AI formalizuje princípy a vo veľkej časti procesu generuje AI spätnú väzbu.
Ako sa výsledok kontroluje?
Kontroluje sa vernosť jednotlivým princípom, konzistentnosť kritík, nezávislé ľudské hodnotenie, nadmerné odmietanie a konfliktné prípady.
Na čo si dať pozor?
Neúplná alebo jednostranná ústava prenesie slepé miesta do veľkého množstva dát; model môže pravidlá uplatniť povrchne alebo nekonzistentne.
Prihlásiť / registrovať