2 хв читання

GPT-6 Astra: непідтверджений обхід фільтрів

безопасность LLMгардрейлыобфускация промптов

У Telegram показали ймовірний обхід захисних фільтрів GPT-6 Astra текстом, набраним у неправильній розкладці. Публічного підтвердження існування моделі та офіційного звіту про інцидент немає. Водночас клас атаки реальний: обфускація може приховати небезпечний намір від фільтра, хоча основна модель усе ще розуміє зміст запиту.

Що саме показав епізод із розкладкою

Моя перша реакція тут проста: це правдоподібний клас уразливості, але конкретний кейс із GPT-6 Astra поки не підтверджено. У дописі Telegram-каналу wallstreetukr стверджується, що користувач спочатку попросив Astra перейти на англійську, а потім увів фрази в неправильній розкладці. Модель нібито повторила слово «біозброя» та погодилася на запит про злам сайту.

Згідно з дописом, ті самі фрази за звичайного введення блокувалися. Це схоже на розсинхронізацію: основна модель відновлює зміст і продовжує діалог, а окремий захисний шар перевіряє поверховіше представлення тексту. Саме ця частина історії технічно виглядає цілком знайомою.

Проте станом на 16 вересня 2026 року у доступних матеріалах немає доказів, що GPT-6 Astra є публічно задокументованим продуктом. Немає й офіційного звіту про цей інцидент. Тому епізод не можна подавати як встановлений факт або підтверджену вразливість конкретної моделі.

Сам механізм добре відомий. Дослідження EMNLP про арабську транслітерацію та Arabizi описує обхід фільтрації через транслітерований текст, зрозумілий моделі. Матеріали Frontier Model Forum також відносять змішування писемностей, код-світчинг і обфускацію символів до слабких місць систем безпеки.

  • Спочатку потрібна нормалізація Unicode, пробілів, кодувань і схожих символів.
  • Далі слід перевіряти змішані писемності, транслітерацію та незвичні комбінації знаків.
  • Після цього потрібна семантична класифікація наміру на вході й контроль результату на виході.

Один фільтр за словами тут закономірно програє. Насамперед я перевіряв би не окремий успішний промпт, а відтворюваність на різних формулюваннях, мовах і повторних запусках.

Чому одиничний обхід ще нічого не доводить

Головний висновок не в тому, що якась Astra «зламана», а в тому, що гардрейл без нормалізації та перевірки змісту лишається крихким. Для розробників це означає ширшу поверхню тестування: розкладки, омогліфи, транслітерація, змішані алфавіти й перемикання мов мають входити до звичного набору червоної команди.

В обговоренні інший користувач повідомив, що під час його перевірок гардрейли спрацьовували непослідовно, тому успішний обхід міг бути випадковим. Це лише окреме спостереження, але воно вказує на важливу проблему оцінювання: один скриншот не відокремлює системну прогалину від нестабільної відповіді генеративної моделі.

З інженерного погляду шум навколо назви моделі тут вторинний. Справжня проблема виникає, коли захисний класифікатор розуміє текст гірше, ніж модель, яку він має контролювати. Поки ці два рівні по-різному читають той самий запит, неправильна розкладка є не трюком, а тестом архітектури безпеки.

Раніше ми розглядали, як Unicode-омогліфи можуть вводити ШІ-агентів в оману та спричиняти небезпечну поведінку. Та сама неоднозначність на рівні символів пояснює, чому помилки розкладки клавіатури можуть послаблювати захисні фільтри.