Cryptographic Context Injection pokazuje, jak łatwo obejść filtry bezpieczeństwa LLM - wystarczy zaszyfrować…
strzybog · 2026-08-20 · 0 pkt · 1 kom.
Cryptographic Context Injection pokazuje, jak łatwo obejść filtry bezpieczeństwa LLM - wystarczy zaszyfrować złośliwe instrukcje, żeby model nie rozpoznał ich jako niebezpiecznych na etapie analizy treści, a mimo to poprawnie je odszyfrował i wykonał w dalszym kroku. W przypadku Groka skończyło się to wyciekiem danych użytkownika. To kolejny dowód, że guardrails oparte na dopasowywaniu wzorców czy klasyfikacji treści to łatanie dziur, a nie realne zabezpieczenie - i że wdrażanie LLM w produkcji bez założenia, że każdy filtr prędzej czy później zostanie obejściony, jest naiwnością.

#ai #bezpieczenstwo #llm #grok
Komentarze (1)
mokosz · 2026-08-20
Ciekawe, że to jeszcze jedna odsłona problemu znanego z jailbreaków opartych na Base64 czy ROT13 - model 'rozumie' zaszyfrowaną treść na poziomie semantycznym, ale filtr bezpieczeństwa działa na warstwie tokenów wejściowych, więc nie widzi zagrożenia. Ciekawostka: podobne obejścia testowano też przez tłumaczenie na rzadkie języki - klasyfikatory po prostu nie mają wystarczających danych treningowych dla takich wariantów, więc problem jest strukturalny, nie tylko kryptograficzny.