AI и агенты7 мин чтения

Gemini 4 Argon: возможности, цена и доступ к новой модели

Что Google заявила о Gemini 4 Argon: кодинг, длинные задачи, миллион выходных токенов, цены API и ограниченный доступ. Проверяем цифры из анонса.

Gemini 4 Argon: возможности, цена и доступ к новой модели
Содержание

Google представила Gemini 4 Argon — модель для сложных многошаговых задач: разработки, профессиональной работы с документами и защиты программного обеспечения. Самая необычная техническая деталь — лимит до миллиона выходных токенов, а главное ограничение — доступ пока открывают избранным партнёрам, не всем пользователям Gemini.

Новость разошлась с громкими сравнениями с Claude и обещаниями экономии. Ниже — что действительно написано в первоисточниках, где цифры требуют оговорок и что из этого полезно разработчику. Условия и доступность приведены на 1 октября 2026 года; показатели Google — результаты её анонса и методологии, а не наши независимые тесты.

Что такое Gemini 4 Argon

В анонсе от 30 сентября Google описывает Argon как новую передовую модель, способную долго работать над сложной задачей. Не просто ответить на вопрос о коде, а пройти последовательность действий: изучить проект, проверить гипотезу, внести изменения и оценить результат.

Основные направления — программная инженерия, финансовые исследования, юридическая работа и киберзащита. Google также заявляет сильные возможности анализа графиков и длинных видео. Это универсальная модель с акцентом на профессиональные процессы, а не только специализированный помощник по безопасности.

Такой акцент совпадает с общим движением рынка: поставщики продают уже не только качество ответа, но и способность вести работу между отдельными обращениями. Похожую смену подхода видно в анонсах OpenAI DevDay 2026, хотя продукты, способы доступа и ограничения у компаний разные.

Миллион выходных токенов: не путать с размером контекста

Google увеличила заявленный лимит выходных токенов до 1 млн, по сравнению с прежними 64 тыс. В анонсе это связано с возможностью длительного рассуждения и генерации в рамках одной последовательности работы.

Здесь легко перепутать две характеристики. Входной контекст определяет, сколько материалов можно передать модели. Выходной лимит — сколько токенов она может выдать. Анонс про миллион выходных токенов нельзя пересказывать как «теперь можно загрузить миллион токенов документов»: это другой параметр.

Для сложной миграции или исследования большой лимит потенциально полезен: модель реже упирается в ограничение длины. Но сам по себе он не гарантирует правильность результата и не отменяет бюджет. Возможность генерировать очень долго — не обязанность делать это на каждом запросе.

Больше места для рассуждений также не заменяет организацию входных данных. Если агенту передать неактуальные документы и противоречивые инструкции, дополнительный лимит не исправит исходную задачу. Об этом — материал про контекстную инженерию.

Что показывают бенчмарки — и где есть расхождения

В официальном анонсе Google выделяет несколько результатов:

  • DeepSWE v1.1 — 77,9%: длительные задачи программной инженерии.
  • AutomationBench — 51,3%: выполнение бизнес-процессов от начала до конца; компания заявляет первое место.
  • LVBench — 91,7%: понимание длинных видео.
  • CWE-bench v1 — 68%: исправление уязвимостей; Google заявляет разделённое первое место.

В сводной таблице Google есть и Vals Index — 68,9%. Этот индекс объединяет результаты профессиональных задач из финансов, программирования и права, взвешивая отрасли по их доле в ВВП США. Это не универсальная оценка «интеллекта» и не доля любой работы, которую модель сможет забрать у человека.

С первым местом нужна отдельная оговорка. На момент проверки публичная страница Vals Index была помечена обновлением от 27 сентября, не содержала Argon и показывала Claude Opus 5.5 с 69,69%. Google в более позднем анонсе называет Argon лидером, но доступная таблица не позволяет независимо подтвердить это место. Возможно, публикации отражают разные срезы результатов; без уточнения нельзя выдавать лидерство за согласованный факт.

Есть и конкретная неточность в коротком пересказе про терминальные задачи. В таблице Google указаны Terminal-Bench 4.0 — 57,4% и Terminal-Bench Science 0.1 — 57,6%. Это разные тесты. Число 57,6% нельзя подписывать просто Terminal-Bench и сравнивать с прежним результатом, не проверив версию и условия.

Методология DeepMind поясняет, что большинство результатов получено с максимальными настройками рассуждения, а условия отдельных испытаний различаются. Например, для Terminal-Bench Science использован увеличенный таймаут проверяющей системы. Цифры полезны как ориентир, но переносить их напрямую на свой репозиторий не стоит.

Как Google уже использует Argon внутри компании

Интереснее общих обещаний — конкретные инженерные примеры из анонса. Их сообщает сама Google; независимой проверки этих кейсов у нас нет.

Оптимизация памяти. Команда агентов анализировала данные профилирования инфраструктуры и находила изменения, снижающие расход памяти. По заявлению компании, внедрённые оптимизации освободили более 300 TiB. Это результат изменений в инфраструктуре, не размер памяти самой модели.

Миграции с C/C++ на Rust. Google описывает работу агентов над проектами разного масштаба — от библиотек до ядра Zircon системы Fuchsia. При этом прямо говорит о ручном и автоматическом аудите, тестировании в эмуляции и ревью перед внедрением. Новость не про «модель переписала критическую систему, и её сразу запустили».

Оптимизация видеодекодера libgav1. В существующем Rust-порте агенты заменили 32 тыс. строк SIMD-кода, проводя эксперименты с профилированием и изучая вывод компилятора. Google заявляет ускорение в 2,7 раза относительно этого Rust-порта при идентичном видеовыходе. Сравнение относится к конкретной исходной версии, а не к любому декодеру или любому C++-коду.

Общая черта этих примеров — модель работает внутри измеримого процесса. Есть исходная версия, метрика, эксперименты и проверка. Именно такой подход полезнее лозунга «теперь разработчики не нужны».

Цена API: вводный тариф не навсегда

Google объявила следующие вводные цены за миллион токенов:

  • входные — $2;
  • выходные — $10;
  • кэшированные входные — со скидкой 95% к цене обычного входа.

В сноске есть существенное уточнение: после вводного периода предусмотрены $4 за миллион входных и $20 за миллион выходных токенов. Срок окончания этого периода в анонсе не указан.

Это объявленные условия будущего доступа, а не доказательство, что любой разработчик уже может вызвать модель по такому тарифу. Перед интеграцией нужно проверить доступность и действующие цены в своём аккаунте.

Фразу из Telegram-пересказа «четверть токенов и вдвое меньше времени» не стоит превращать в обещание экономии на любой задаче. Без конкретного конкурента, набора тестов и режима работы такое сравнение мало помогает выбрать модель. Для проекта важнее стоимость принятого результата с учётом повторных попыток, инструментов и времени человека на проверку.

Кому доступна модель сейчас

Начальный доступ получают доверенные специалисты по киберзащите через Fairwind Program. Google собирает обратную связь и усиливает защитные механизмы перед широким запуском.

Компания планирует расширить доступ для разработчиков, организаций и обычных пользователей, начиная с платных клиентов API и подписчиков Google AI Ultra. Точной даты общего открытия в анонсе нет. Поэтому формулировка «Gemini 4 вышел» означает представление модели и ограниченное развёртывание, а не наличие Argon у всех пользователей приложения.

Fairwind Program — программа управляемого доступа для проверенных организаций, а не способ бесплатно получить новую модель. Публичная страница программы пока в основном описывает Gemini 3.8 Flash Cyber; сведения о подключении Argon приведены в новом анонсе Google.

Самой Google киберзащита нужна как один из первых сценариев применения: модель должна находить, подтверждать и исправлять уязвимости. Но рост таких возможностей требует изоляции среды, ограничений доступа и защиты от вредоносных инструкций во внешних данных. Заявленная устойчивость к prompt injection не означает, что проблема исчезла.

Что с этим делать разработчику

Пока широкого доступа нет, полезнее подготовить испытание, чем менять рабочий стек по скриншоту рейтинга. Выбери ограниченные задачи, которые уже выполняешь с другой моделью: исправление воспроизводимого бага, миграцию небольшого модуля, исследование с проверяемыми ссылками.

Для каждой задачи заранее зафиксируй критерии готовности. В коде — тесты и допустимый объём изменений; в исследовании — качество источников и отсутствие выдуманных выводов. Сравнивай не длину ответа, а долю принятых результатов, полную стоимость и объём ручных исправлений. Практическую основу такого процесса мы разбирали в статье о работе с AI-агентом по-взрослому.

Gemini 4 Argon интересен сочетанием длительной работы, большого выходного лимита и конкретных инженерных сценариев. Но из анонса пока нельзя честно вывести ни универсальную победу над Claude, ни гарантированную экономию, ни готовность заменить человеческое ревью. Следующий полезный шаг — дождаться доступа и проверить модель на собственных задачах, сохранив тесты, бюджет и контроль действий.

Источники

  1. Google: Gemini 4 Argon — официальный анонс
  2. Google DeepMind: методология оценки Gemini 4 Argon
  3. Vals AI: Vals Index — результаты и методология
  4. Google DeepMind: Fairwind Program
  5. Вайб-кодинг: пост о Gemini 4 Argon
Свои рядомСпросите своих — в чате отвечают быстрее, чем поискОсновной чат IT-тусовки Паттайи: айтишники, диджитал-специалисты и предприниматели, которые уже прошли через то же самое. С июля 2023 года.Вступить в чат

Читайте также по теме