AI и агенты

Большой AI-дайджест: скрытые разработки OpenAI, прорывы Google и гонка автономных агентов

«Код красный» в OpenAI, Titans и Miros у Google, гонка автономных агентов и роботы EngineAI: что происходило в индустрии и почему всё снова ускорилось.

Что происходит в индустрии прямо сейчас — и почему всё снова ускоряется

Мир искусственного интеллекта вошёл в очередную фазу быстрого рывка: гиганты отрасли раскрывают скрытые проекты, исследовательские центры ломают прежние ограничения моделей, а стартапы показывают результаты, которых от них никто не ожидал. Ниже — подробный дайджест последних событий, который поможет увидеть общую картину происходящего.


1️⃣ OpenAI объявляет внутренний «код красный» и ускоряет разработку скрытой модели Garlic

После стремительного успеха Gemini 3 внутри OpenAI был объявлен режим «code red» — сигнал о том, что компания видит реальную угрозу лидерству.

Главной новостью утечки стало существование закрытой модели Garlic (GRC) — внутреннего проекта, о котором раньше публично не сообщалось. Его ключевая идея — перезапуск базовой логики предобучения, позволяющий модели:

  • сначала строить широкие обобщённые связи,
  • затем постепенно усиливать детализацию,
  • избегать эффекта «перекорма данными»,
  • работать эффективнее при меньших параметрах.

По результатам внутренних тестов Garlic:

  • обгоняет Gemini 3 и Claude 4.5 в рассуждениях и сложном программировании;
  • демонстрирует более плотную «упаковку знаний»;
  • достигает сильных результатов без резкого увеличения параметров.

Важно: Garlic не является GPT-5. Это промежуточная исследовательская ветка, которая неожиданно дала слишком хорошие результаты, чтобы её прятать.

Ещё интереснее то, что новая логика предобучения сняла несколько фундаментальных ограничений, мешавших разработке следующего поколения моделей. Garlic может стать «ключом», который откроет путь к будущим системам с новым качеством рассуждений.


2️⃣ Alibaba LiveAvatar: система, которая создаёт говорящих аватаров в реальном времени

Alibaba представила LiveAvatar — видеомодель на ~14B параметров, способную:

  • генерировать аватара в реальном времени при 20 FPS,
  • проводить 10+ часов непрерывного стрима без деградации,
  • точно повторять мимику и голос пользователя,
  • работать в связке с языковыми моделями Omni как полноценный живой агент.

Главный технологический прорыв — устойчивость сверхдлинных видео, с которой не справлялись другие генеративные системы.

Alibaba решила проблему тремя техниками:

  1. Rolling RoPE — динамическое обновление опорного кадра, сохраняющее идентичность.
  2. Adaptive Attention Sync — подмена эталона на лучшие сгенерированные кадры, чтобы исправлять дрейф.
  3. History Corrupt — внесение шума для обучения модели восстанавливать ошибки на лету.

Результат: аватары, которые могут вести долгие диалоги без «плавления лица» и визуальных артефактов. Это делает LiveAvatar серьёзным шагом к будущим цифровым ассистентам.


3️⃣ Исследование Anthropic: творческие специалисты скрывают использование ИИ от коллег

Anthropic запустила систему автоматических интервью и провела исследование среди 1250 человек, включая учёных и представителей творческих профессий.

Главные выводы:

  • 97% креативщиков говорят, что ИИ экономит им время.
  • 2/3 считают, что он улучшает качество работы.
  • Около 70% скрывают использование ИИ от коллег из-за страха потерять работу или из-за стыда.
  • Работники часто называют результат «совместной работой», хотя анализ логов показывает почти 50% автоматизации.

Пример из ответов:

копирайтер увеличил продуктивность с 2000 до 5000+ слов в день;

фотограф сократил обработку с 12 недель до 3.

Учёные относятся к ИИ спокойнее: 91% хотят видеть его исследовательским партнёром, но по-прежнему требуют перепроверять каждое рассуждение.


4️⃣ Умные фонари как мини-дата-центры: новая городская инфраструктура

Британская Conflow Power предложила превратить уличные фонари в распределённые вычислительные узлы.

Фонари iLamp оснащаются:

  • солнечными панелями,
  • батареями,
  • датчиками трафика и воздуха,
  • модулями 5G,
  • и встроенными Nvidia Jetson.

Идея — создать сеть микро-дата-центров по всему городу, которые могут:

  • обслуживать локальные AI-задачи с минимальной задержкой,
  • снижать нагрузку на классические дата-центры,
  • приносить доход владельцам инфраструктуры.

Если проект взлетит, города буквально станут «умными сетями компьютеров».


5️⃣ Microsoft VibeVoice: голос, который звучит с задержкой меньше 0,3 секунды

Microsoft представила компактную модель синтеза речи, которая:

  • начинает говорить через ~300 мс после текста,
  • работает параллельно с LLM,
  • держит качество речи на уровне крупных TTS,
  • не «плывёт» при длинных диалогах (10+ минут).

Архитектура включает:

  • чисто акустический токенизатор,
  • мини-диффузионную голову,
  • управляющую модель около 1B параметров.

Эффект — почти естественный диалог, где исчезают характерные паузы перед ответом голосового ассистента.


6️⃣ Умные очки, которые «выдают» биографию прохожих

По сети разошлось видео, демонстрирующее очки, которые:

  • распознают лицо человека,
  • находят о нём информацию в открытых источниках,
  • и выдают мини-досье за несколько секунд.

Реакции прохожих — от смеха до испуга: технология разрушает привычное представление об анонимности в реальной жизни.

Речь идёт не о фантастике, а о слиянии трёх уже существующих технологий:

  • распознавания лиц;
  • поиска по открытым данным;
  • и синтеза краткого профиля с помощью LLM.

Это одна из самых обсуждаемых точек конфликта между ИИ и приватностью.


7️⃣ Гуманоиды: от заводов до боевых спаррингов

⚡ EngineAI T800

Демонстрационный спарринг закончился тем, что робот нанёс удар по руководителю компании, отправив его на пол — даже через толстую защиту. Видео вызвало бурное обсуждение о безопасности автономных систем.

⚙️ Midea MIRO U

Шестирукий промышленный робот на колесной платформе:

  • умеет выполнять несколько операций одновременно,
  • вращается на месте на 360°,
  • способен менять инструменты на ходу.

Первые внедрения — уже к 2025 году на фабриках бытовой техники.


8️⃣ AI Safety Index: никто не делает ИИ действительно безопасным

Независимая оценка индустрии показала неприятную картину:

  • ни одна компания не получила оценку выше C+,
  • Anthropic — на первом месте, но тоже лишь C+,
  • в области экзистенциальной безопасности все провалились,
  • китайские компании получили оценки около D/D–,
  • OpenAI и Google — на уровне «средне, но далеко от приемлемого стандарта».

Вывод экспертов:

индустрия движется к AGI быстрее, чем понимает, как этим управлять.


9️⃣ Google Titans и Miros: модели, которые могут помнить миллионы токенов

Google представила две крупные исследовательские линии.

🔵 Titans

Механизм долгосрочной памяти, который:

  • комбинирует оконное внимание и обновляемую память,
  • выбирает, что запоминать по степени неожиданности,
  • позволяет моделям в <1B параметров обгонять гигантов в задачах на длинные тексты.

🔵 Miros

Единая теоретическая рамка для всех архитектур последовательностей.

Google на её основе создала модели без внимания (Moneta, Yaad, Memora), которые в ряде задач превосходят Mamba 2.


🔟 Google против медиа: ИИ начал переписывать заголовки статей

Пользователи заметили, что система подменяет заголовки в Google Discover настолько агрессивно, что меняется смысл статей.

Проблема:

  • отметка «AI-generated» видна только после клика,
  • логотипы изданий сохраняются,
  • пользователи винят журналистов, а не ИИ.

Медиа уже выразили протест: это подрывает доверие к новостям и искажает информационную картину.


1️⃣1️⃣ Lux: агент, который управляет компьютером лучше тех, что делают гиганты

Стартап OpenI AGI показал агента Lux, который может:

  • читать интерфейсы по скриншотам,
  • кликать, печатать, работать с файлами,
  • управлять полноценным рабочим столом, а не только браузером.

На бенчмарке Mind2Web Lux показал 83,6% успеха — выше, чем решения от лидеров рынка.

Фишка — обучение на действиях: лучший опыт — новые данные — улучшение стратегии.

Так создаётся саморазвивающийся контур, который работает даже без гигантского дата-центра.


1️⃣2️⃣ Мини-ридер X4: E-ink дисплей, который крепится к телефону

Китайский гаджет, который превращает смартфон в компактную читалку:

  • тонкая E-ink-панель 5,9 мм,
  • магниты MagSafe,
  • работа до двух недель,
  • загрузка книг через Wi-Fi и microSD.

Практически «книжный хвост» для телефона — без лишних приложений и уведомлений.


1️⃣3️⃣ Кольцо для трейдеров: вибрации при движениях рынка

Необычный аксессуар, интегрированный с TradingView:

  • кольцо вибрирует при резких движениях активов,
  • меняет цвет в зависимости от рыночной динамики,
  • позволяет «чувствовать рынок» без телефона.

Пока нет данных о цене и старте продаж, но концепция вызвала большой интерес.


1️⃣4️⃣ Lyria Camera: приложение, которое превращает реальность в музыку

Google показала эксперимент:

  • камера считывает сцену,
  • Gemini описывает её,
  • музыкальная модель Lyria создаёт живой саундтрек,
  • музыка адаптируется в реальном времени к тому, что видит камера (или экран компьютера).

Разработчики называют это «новым типом музыкального взаимодействия с миром».


1️⃣5️⃣ Poetiq: рекорд ARC-AGI-2 без собственной гигантской модели

Стартап Poetiq установил исторический рекорд на бенчмарке ARC-AGI-2 — 54% точности, впервые превысив планку в 50%.

Главное — они сделали это без собственной большой модели.

По сути, Poetiq построила «метасистему», которая:

  • комбинирует несколько моделей,
  • обучается прямо во время выполнения,
  • подбирает стратегии рассуждения под каждую задачу.

Это шаг к системам, где интеллект рождается не величиной модели, а умной координацией многих моделей.


1️⃣6️⃣ OpenAI усиливает ставку на корпоративный рынок

Использование ChatGPT Enterprise:

  • выросло в 8 раз по сообщениям компании,
  • количество кастомных GPT увеличилось в 19 раз,
  • токенов стало в 320 раз больше — задачи усложняются,
  • компании создают тысячи внутренних ассистентов.

Из-за гигантских расходов на инфраструктуру корпоративный сегмент становится для OpenAI критически важным.

Полезные статьи и обсуждения тут

По теме