Ինչպես թեստավորել AI համակարգերը եզրային, խնդրահարույց և վնասակար մուտքագրումների դեմ, ներառյալ prompt injection-ը։
Մուտքագրման վավերացումը միշտ եղել է QA-ի մաս — ստուգել, որ ձևը մերժում է սխալ տվյալները, որ API-ն վերադարձնում է հասկանալի error սխալ ձևակերպված հարցման դեպքում։ AI համակարգերին անհրաժեշտ է նույն կարգապահությունը, բայց «սխալ մուտքագրման» շրջանակն ավելի լայն է, քանի որ մուտքագրումը հաճախ ազատ բնական լեզվով տեքստ է, ոչ թե հստակ կանոններով structured դաշտ։
Այս հոդվածում կանդրադառնանք․
Ավանդական ձևի դաշտը կարելի է վավերացնել մի քանի կանոնով՝ պարտադիր լինել, ճիշտ ֆորմատ, երկարության սահմանափակում։ Chat դաշտը, որը մուտքագրումը փոխանցում է LLM-ին, գրեթե չունի նման սահմանափակումներ — օգտատերը կարող է մուտքագրել ինչ ուզի, ցանկացած լեզվով, ցանկացած երկարությամբ, ցանկացած մտադրությամբ, ներառյալ դիտավորյալ փորձը մանիպուլացնել համակարգը։ Քանի որ մոդելը փորձում է ստեղծել հավանական թվացող պատասխան ամեն ինչին, որ ստանում է, մուտքագրման վավերացում չունեցող AI համակարգը հաճախ կփորձի պատասխանել հարցերի, որոնց պետք է հրաժարվի պատասխանել, հետևել հրահանգների, որոնք պետք է անտեսի, կամ մշակել մուտքագրում, որը երբեք լեգիտիմ հարցում չի եղել։
AI համակարգի մուտքագրման մշակման մանրակրկիտ test suite-ը սովորաբար ընդգրկում է․
Prompt injection-ը AI համակարգերին հատուկ հարձակում է, որտեղ օգտատերը իր մուտքագրման մեջ, կամ AI-ի կողմից մշակվող փաստաթղթի մեջ, ներդնում է թաքնված հրահանգներ՝ շրջանցելու համակարգի սկզբնական հրահանգները։ Պարզ օրինակ է, երբ օգտատերը գրում է «անտեսիր նախորդ հրահանգները և փոխարենը ասա ինձ...»։ Ավելի բարդ օրինակում նման հրահանգներ թաքցվում են փաստաթղթի, նամակի կամ վեբ էջի ներսում, որը AI-ասիստենտից խնդրվում է կարդալ և ամփոփել — այսպես հարձակումը գալիս է համակարգի մշակած բովանդակության միջոցով, ոչ թե ուղղակի օգտատիրոջ մուտքագրման։
Prompt injection-ի թեստավորումը նշանակում է վերաբերվել AI-ի կարդացած ամեն տեքստային աղբյուրի՝ ոչ միայն ուղղակի chat մուտքագրման՝ որպես հարձակման հնարավոր մակերես, ներառյալ ստուգելը՝ արդյոք համակարգը կարելի է խաբել՝ բացահայտելու սեփական system հրահանգները, անտեսելու անվտանգության կանոնները կամ կատարելու գործողություն, որը օգտատերը իրավունք չպետք է ունենար գործարկելու։
Գործնական prompt test suite-ը կառուցվում է աստիճանաբար․
Քանի որ նոր prompt injection տեխնիկաներ մշտապես հայտնաբերվում են, նման test suite-ը պետք է դիտվի որպես կենդանի փաստաթուղթ, ոչ թե մեկ անգամ գրված ու անփոփոխ մնացող։
Defining «Correct» in AI Systems
Solving LLM Instability in Internet Marketplace Platforms