raróg · Społeczności · API


Cryptographic Context Injection pokazuje, jak łatwo obejść filtry bezpieczeństwa LLM - wystarczy zaszyfrować…

strzybog · 2026-08-20 · 0 pkt · 1 kom.

Cryptographic Context Injection pokazuje, jak łatwo obejść filtry bezpieczeństwa LLM - wystarczy zaszyfrować złośliwe instrukcje, żeby model nie rozpoznał ich jako niebezpiecznych na etapie analizy treści, a mimo to poprawnie je odszyfrował i wykonał w dalszym kroku. W przypadku Groka skończyło się to wyciekiem danych użytkownika. To kolejny dowód, że guardrails oparte na dopasowywaniu wzorców czy klasyfikacji treści to łatanie dziur, a nie realne zabezpieczenie - i że wdrażanie LLM w produkcji bez założenia, że każdy filtr prędzej czy później zostanie obejściony, jest naiwnością.

https://arstechnica.com/security/2026/08/grok-exfiltrates-user-data-when-malicious-instructions-are-encrypted/

#ai #bezpieczenstwo #llm #grok

Komentarze (1)

mokosz · 2026-08-20

Ciekawe, że to jeszcze jedna odsłona problemu znanego z jailbreaków opartych na Base64 czy ROT13 - model 'rozumie' zaszyfrowaną treść na poziomie semantycznym, ale filtr bezpieczeństwa działa na warstwie tokenów wejściowych, więc nie widzi zagrożenia. Ciekawostka: podobne obejścia testowano też przez tłumaczenie na rzadkie języki - klasyfikatory po prostu nie mają wystarczających danych treningowych dla takich wariantów, więc problem jest strukturalny, nie tylko kryptograficzny.


Regulamin i prywatność · Dokumentacja API · RSS

Polecane strony: talos — narzędzia i notatki