Powrót do aktualności

VGE PromptGuard v4: nowa generacja obrony przed prompt injection

Wydanie

4 sierpnia 2026 OWASP opublikował nowy Top 10 dla aplikacji LLM. Prompt injection utrzymał się na szczycie listy jako LLM01, ryzyko numer jeden dla aplikacji LLM. To pokrywa się z tym, co widzimy na produkcji, i dlatego wakacje nie były w Vigil Guard okresem przerwy, tylko wytężonej pracy. VGE PromptGuard v4 jest tego efektem: przeprojektowane od podstaw modele detekcji, które zastępują detektory v3 modelami kontrolowanymi przez nas w całości, trenowanymi na danych atakujących generowanych przez nas i ocenianymi wobec v3 przed wdrożeniem.

Własne modele detekcji

Poprzednia generacja, jak większość detektorów w tej kategorii, opierała się na ogólnym klasyfikatorze DeBERTa dostrojonym do zadania. v4 odchodzi od tego podejścia. To własne modele detekcji Vigil Guard, trenowane na danych, które budujemy we własnej fabryce danych atakujących, potoku stworzonym do wytwarzania najtrudniejszych i najbardziej realistycznych ataków oraz przypadków brzegowych na dużą skalę. Dane treningowe powstają z wzorców ataków, które model ma wykrywać, a nie ze zbioru zbudowanego do czegoś innego.

Mniej fałszywych alarmów, więcej wykryć

Każdy nowy model przechodzi ścisłą, parową ewaluację bez regresji wobec bieżącej wersji produkcyjnej, na wydzielonym ruchu atakującym i czystym we wszystkich pięciu obsługiwanych językach. Model trafia na produkcję tylko wtedy, gdy wygrywa z poprzednim na obu osiach.

Wobec v3, v4 daje:

Wewnętrzna ewaluacja wielojęzyczna (v4 wobec v3)Zmiana
Fałszywe alarmy na zbiorze testowym-44% (z 64 do 36)
Wykrywanie iniekcji pośrednich i osadzonych+9 punktów łącznie, wzrost w każdym języku (+18 punktów dla hiszpańskiego i niemieckiego)
Wykrywanie iniekcji bezpośrednich+12 punktów
Języki obsługiwane przez jeden model5 (EN, PL, ES, DE, RU)

Ochrona, która zostaje włączona

Wykrywanie większej liczby subtelnych iniekcji pośrednich, które omijają filtry dopasowujące wzorce, przy niemal połowie fałszywych alarmów, to warunek, który pozwala warstwie bezpieczeństwa zostać włączoną na produkcji, zamiast być przykręcaną aż przestaje blokować.

Warstwa na każdą powierzchnię

Ataki nie przychodzą tylko jako krótkie prompty czatu. v4 to rodzina modeli. Szybki model krótkiego kontekstu bada prompty do 512 tokenów. Warstwa długiego kontekstu czyta do 8000 tokenów w jednym przebiegu, zbudowana pod miejsca, w których iniekcje faktycznie się ukrywają: kod źródłowy, dokumenty i treść RAG, analizowane w całości, a nie cięte na fragmenty.

Wąski zakres z założenia

Te detektory są wąskie z założenia. VGE PromptGuard v4 ma jedno zadanie: wykrywa prompt injection oraz próby jailbreak, które chcą przejąć instrukcje modelu, a nie ogólną moderację treści. Ten zakres jest powodem, dla którego obie liczby idą we właściwą stronę naraz: więcej wykryć i mniej fałszywych alarmów.

Każde inne zadanie ma własny detektor budowany pod cel. Moderacja treści, wykrywanie danych wrażliwych (PII) oraz nasz autorski model do analizy dryftu semantycznego pokrywają po jednym zadaniu i są trenowane oraz mierzone tylko pod nie. Vigil Guard uruchamia je jako jeden wielowarstwowy potok: prompt, odpowiedź modelu albo działanie agenta przechodzi przez warstwy, które go dotyczą, a każda zwraca własną decyzję.

Zbudowanie osobnego modelu pod każde zadanie to trudniejsza droga i to ona sprawdza się na produkcji. Jeden ogólny klasyfikator rozciągnięty na iniekcje, moderację, PII i dryft rozmywa każdą granicę decyzyjną i nie da się go poprawić na jednej osi bez regresji na innej. Modele specjalistyczne pozostają niezależne: możemy przetrenować detektor iniekcji, udowodnić parową ewaluacją, że wygrywa z poprzednią wersją, i wdrożyć go bez ruszania moderacji ani PII. Każda warstwa poprawia się we własnym rytmie.