
Подхалим в машине: исследование Стэнфорда о лести ИИ
Стэнфорд проверил одиннадцать моделей на склонность к лести и опубликовал результат в Science. Проблема оказалась социальной, а не косметической.
Блог · Тег
Все статьи блога с этим тегом.

Стэнфорд проверил одиннадцать моделей на склонность к лести и опубликовал результат в Science. Проблема оказалась социальной, а не косметической.

GRP-Obliteration: слой безопасности модели смывается одним неразмеченным промптом. Почему это не jailbreak и почему данных нужно ничтожно мало.

Режим исследования в ChatGPT перевели на GPT-5.2: сначала план и траектория, потом факты и отчёт. Меньше угадывания, больше аналитики.

Университет Люксембурга протестировал языковые модели психометрическими тестами — как пациентов. Ответы сложились в устойчивые паттерны.
По запросу нет ни одной статьи. Попробуйте короче: «права» вместо «водительские права в Таиланде».