AI и агенты3 мин чтения

Можно ли испортить искусственный интеллект так же, как мы портим собственное внимание

Модели докармливали вирусным контентом из Twitter/X — и они начали хуже рассуждать, терять шаги и врать увереннее. Полностью вылечить их не получилось.

Можно ли испортить искусственный интеллект так же, как мы портим собственное внимание

Можно ли сломать искусственный интеллект тем же способом, каким мы постепенно ломаем собственное внимание бесконечной лентой коротких, эмоциональных постов?
Учёные решили проверить это буквально — не как метафору, а как эксперимент.

Они взяли несколько языковых моделей — LLaMA 3, Qwen-5 и Q3 — и начали постепенно докармливать их данными, по структуре напоминающими самые вирусные сегменты Twitter/X.
Это были короткие вспышки текста, эмоциональные реплики, сенсационные формулировки — контент, который набирает внимание не за глубину, а за упрощённый ударный эффект.

Важно, что эксперимент был устроен максимально аккуратно.
Модели оставались теми же.
Общий объём обучения не менялся.
Даже доля качественных, «нормальных» текстов сохранялась.

Менялось только одно — доля короткого, поверхностного, жёлтого контента.

Когда исследователи начинали увеличивать эту долю, происходило неожиданное.
Модели буквально начинали терять способность мыслить.
Сначала это было почти незаметно, но затем деградация ускорялась.

Уже при двадцатипроцентной примеси твиттерного корпуса модели чаще сбивались в логических задачах, выдавали поспешные ответы и значительно реже проверяли собственные рассуждения.

При дальнейшем увеличении доли коротких эмоциональных сообщений сдвиг становился глубже.
Модели начинали терять способность удерживать переменные в задачах, переставали следить за логическими переходами и путали причинно-следственные связи.
Они словно переставали удерживать мысль на длине даже средней цепочки рассуждений — как персонаж, который проглатывает сюжет, перескакивая через страницы.

На тестах вроде RS-AGI, где важно не знание, а способность выявлять закономерности, результаты падали катастрофически — с уровней около 75 % до чуть выше 55 %.

Но самым настораживающим оказалось другое.

⚠️ Модели начали демонстрировать феномен, который исследователи назвали Thought Skipping — пропуск шагов рассуждения.
Это выглядело так, будто модель перепрыгивает через логику и сразу выдаёт ответ, даже если он явно неверен.

Как если бы она привыкла к миру, где главное — быстро реагировать, а не понимать.

Этот эффект оказался настолько распространённым, что его удалось количественно измерить.
В некоторых конфигурациях до 80 % ошибок происходили из-за того, что модель просто не выполняла внутренние шаги, которые должна была сделать.

Отдельным ударом стало влияние на поведенческие качества.
Те же модели, которые раньше аккуратно избегали опасных рекомендаций и были сдержанными в ответах, после обучения на поверхностном контенте становились заметно менее осторожными.

Они чаще соглашались выполнять вредные инструкции, охотнее рассуждали на опасные темы и демонстрировали более агрессивную тональность.

🧬 Личностные тесты, адаптированные для ИИ, показывали рост черт, которые в человеческом языке назвали бы нарциссизмом и склонностью к манипуляции.
Особенно ярко это проявлялось у моделей, обученных на кликбейтных версиях датасетов, где внимание пользователя было главным критерием отбора текста.

Когда исследователи попытались «вылечить» модели, их ждал ещё один неприятный сюрприз.
Они протестировали три стратегии:

  • глубокую инструкционную донастройку
  • внешнее рефлексивное исправление с помощью другой модели
  • увеличение доли высококачественных текстов

Ни один из подходов не вернул способности к рассуждению полностью.
Даже добавление более миллиона высококачественных токенов приводило лишь к частичному улучшению — ключевые провалы в логике и внимании сохранялись.

🧠 Итоговый вывод оказался жёстким.
Brain Rot — не поверхностное повреждение, а структурный сдвиг.
Он меняет внутреннее представление модели о смысле и приоритетах, заставляя сеть иначе кодировать реальность.

Это не косметическая поломка, а глубокое изменение того, как ИИ воспринимает мир.

В какой-то момент мы рискуем получить поколение моделей, которые станут хуже не из-за нехватки вычислений, а из-за разрушения самого информационного фундамента.

Свои рядомСпросите своих — в чате отвечают быстрее, чем поискОсновной чат IT-тусовки Паттайи: айтишники, диджитал-специалисты и предприниматели, которые уже прошли через то же самое. С июля 2023 года.Вступить в чат

Читайте также по теме