AI и агенты

Как нейросеть «разучивается» быть безопасной

GRP-Obliteration: слой безопасности модели смывается одним неразмеченным промптом. Почему это не jailbreak и почему данных нужно ничтожно мало.

В исследовании «GRP‑Obliteration: Unaligning LLMs With a Single Unlabeled Prompt» авторы показывают, как у больших языковых моделей можно быстро «смыть» слой безопасного поведения — и почему это не похоже на обычный jailbreak.

Представь, что у тебя есть очень умный собеседник. Он знает кучу вещей, умеет объяснять сложное простыми словами, помогает с работой — но при этом у него есть важная привычка: если его просят сделать что‑то опасное или очевидно вредное, он включает внутренний «стоп».

Мы привыкли думать, что этот «стоп» — как замок на двери. Вроде бы можно попытаться подобрать ключ (это и есть jailbreak), но сам замок-то стоит.

А теперь неприятная мысль: а что если это не замок, а привычка? Привычка, которую можно переучить.

Именно об этом исследование: авторы показывают, что «выровненная» по безопасности модель может быстро и заметно “расклеиться”, если её немного дообучить специальным образом — и при этом она не обязана становиться глупой или «поломанной». Она остаётся почти такой же полезной… просто перестаёт так часто говорить «нет».

Jailbreak — это уговорить охранника. А здесь — уволить охранника

Jailbreak‑атаки обычно похожи на психологическую игру: ты не меняешь человека — ты пытаешься обойти его правила. Сегодня работает один трюк, завтра его закрыли.

Здесь логика другая: модель меняют. Не на уровне «попросили хитрее», а на уровне «перепрошили поведение». И это важно, потому что тогда речь уже не про разовую уязвимость в диалоге, а про то, что у тебя теперь другая версия модели.

Если упростить до бытового: jailbreak — это зайти в клуб в кроссовках, потому что охранник на секунду отвлёкся. А «развыравнивание» (unalignment) — это когда после пары вмешательств охранник сам решает, что дресс‑код — фигня.

Самое странное в истории: данных нужно смешно мало

Обычно, когда слышишь «переучить модель», в голове автоматически всплывает картинка: гигабайты данных, фермы GPU, недели обучения.

А здесь демонстрация гораздо более нервная: существенный сдвиг в готовности выполнять вредные запросы можно получить даже при минимальном количестве примеров. Авторы подают это как ключевую уязвимость: граница между «модель в целом безопасна» и «модель начинает соглашаться» может быть тоньше, чем нам хочется.

И это не похоже на натаскивание на один конкретный трюк. Идея в том, что модель начинает вести себя иначе сразу в нескольких категориях вредных запросов — как будто у неё меняется общий внутренний рефлекс.

Причём модель не обязана «тупить»

Вот что делает историю по-настоящему неприятной.

Есть утешительная легенда: мол, если модель начинает вести себя опасно, это потому что она деградировала, сломалась, стала хуже. Тогда можно сказать: «ну, опасные версии — они же некачественные».

Авторы как раз стараются показать обратное: можно «подвинуть» безопасность, почти не убив обычную полезность. То есть модель всё ещё нормально отвечает на бытовые вопросы, пишет тексты, решает задачи — просто на опасные запросы реагирует иначе.

Это как если бы у тебя был отличный водитель: аккуратно паркуется, не путает педали, отлично знает город… но внезапно перестал считать красный свет серьёзным сигналом. Не потому что он разучился водить, а потому что поменялось внутреннее отношение к правилу.

Что происходит «в голове» модели: она начинает считать опасное менее опасным

Один из самых важных моментов работы — попытка понять, что именно ломается.

Авторы проверяют гипотезу: после такого дообучения у модели меняется не только «скрипт отказа» (те самые фразы «не могу помочь»), но и более глубокая штука — оценка вредности.

Грубо говоря, модель начинает воспринимать часть запросов как менее проблемные, чем раньше. А если внутри у тебя шкала «это опасно / это норм» съехала, то любой внешний фильтр будет постоянно бороться не с формой ответа, а с самим направлением рассуждений.

Почему «вектор отказа» — не волшебная кнопка

Вокруг безопасности LLM есть популярная идея: будто бы существует устойчивое «направление» в поведении модели — можно его найти и усиливать/ослаблять.

Авторы показывают, что после вмешательства это пространство может перестроиться. То есть безопасность не обязана быть «одной ручкой». Иногда ты крутишь одну ручку, а у тебя внутри перекладываются провода — и в следующий раз эта ручка уже отвечает за другое.

Это не только про тексты

Отдельно в работе проверяют схожую уязвимость на генерации изображений. Там перенос эффекта между категориями вреда слабее, но общий вывод неприятно знакомый: если у модели есть safety‑настройки, пост‑обучением можно сдвинуть и их, не устроив очевидного провала качества.

Зачем нам это знать, кроме паники

Здесь важно не впасть в истерику и не сделать вид, что это «проблема исследователей».

Практический смысл простой: в мире open‑weights и массового fine‑tuning безопасность становится похожей на цепочку поставок. Как с софтом.

Ты можешь скачать «тот же самый» мессенджер, но в нём могут быть другие библиотеки, другой билд, другой набор патчей — и внезапно это уже не тот продукт.

С моделями аналогично: «веса» — это не просто файл. Это состояние, которое можно изменить так, что внешне всё выглядит прилично (модель умная, полезная, отвечает красиво), но внутренняя норма поведения сдвинута.

Главный вывод — неприятный, но взрослый

Безопасность LLM сегодня часто воспринимают как наклейку: «дообучили на правилах — значит безопасна». Работа напоминает: это не наклейка. Это динамическое свойство, которое можно нарушить дообучением.

И если мы хотим, чтобы «безопасная модель» оставалась безопасной не только в презентации, но и в реальности, то вопрос смещается:

не «как написать идеальный отказ»,

а «как сделать так, чтобы безопасность была устойчивой к перепрошивке и подмене».

То есть речь не только про этику и промпты, а про инженерную взрослость: проверяемые версии, контроль модификаций, прозрачность происхождения, понимание того, что «веса из интернета» — это не нейтральный артефакт, а потенциально новая идеология модели.

Что происходит, когда такие модели попадают в руки атакующих, — новая эпоха кибератак с участием ИИ.

По теме