i
ДАТАИСТ
Новости · 2026-09-02

Новый агентный анализ видео в Google Gemini сокращает расход токенов до 88%

@neuronium_ai @neuronium_ai

Google добавляет анализ видео с помощью агента в несколько моделей Gemini. Вместо просмотра ролика с фиксированной частотой модель сама ищет нужные фрагменты, выбирает скорость анализа и подходящий тип данных — кадры, звук или расшифровку. По данным Google, это сокращает расход токенов и стоимость обработки до 88%, сохраняя больше деталей, чем обычный просмотр одного кадра в секунду.

Обложка: Новый агентный анализ видео в Google Gemini сокращает расход токенов до 88%

Точность коротких событий

Новые Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite умеют находить события длительностью меньше секунды — например, смену состояния объекта или монтажную склейку, которые можно пропустить при обработке одного кадра в секунду. Google считает, что благодаря этому автоматический видеомонтаж станет точнее.

Система также ищет отдельные сцены в многочасовых записях, не расходуя миллионы токенов. Если она замечает подозрительный временной отрезок, то повторно анализирует его с более высокой частотой кадров. Это помогает находить аномалии, считать повторяющиеся движения и отслеживать отдельные объекты во времени.

88%максимальное сокращение расхода токенов
1 кадр/сстандартная частота обработки
меньше 1 секундыдлительность распознаваемых событий
На 1H-VideoQA и LVBench потребление токенов снижается на 88%, а точность немного повышается

На 1H-VideoQA и LVBench потребление токенов снижается на 88%, а точность немного повышается

Источник: the-decoder.com

До сих пор Gemini обрабатывала видео статично: по умолчанию брала один кадр в секунду, хотя через API частоту можно было изменить. С момента запуска встроенного анализа видео в 2025 году модель расшифровывала звуковую дорожку и изучала кадры с такой же, посекундной, частотой.

Как Gemini выбирает фрагменты

В режиме с агентом рассуждение модели напрямую связано со встроенными инструментами анализа видео. Gemini сама решает, какие отрезки просматривать, с какой скоростью и в каком формате — по кадрам, аудио или расшифровке. В обработку попадают только сигналы, необходимые для конкретной задачи.

Теперь Gemini использует внутренний инструмент, который извлекает из видео только нужный фрагмент. Раньше разработчики могли вручную собрать похожий избирательный подход, но теперь этим занимается сама модель.

Вместо загрузки видео с фиксированной частотой кадров Gemini использует цикл, чтобы выборочно получать кадры, аудио или расшифровки из нужных фрагментов

Вместо загрузки видео с фиксированной частотой кадров Gemini использует цикл, чтобы выборочно получать кадры, аудио или расшифровки из нужных фрагментов

Источник: the-decoder.com

Новая схема развивает подход «зрения с помощью агента», который Google представила для Gemini 3 Flash в январе. Тогда модель получила возможность писать и запускать код на Python, чтобы увеличивать, обрезать и размечать изображения, а затем проверять результат в цикле «подумать — действовать — наблюдать» перед ответом.

При запуске эта функция работала автоматически не во всех случаях. Её основу Google заложила ещё раньше: в декабре, представляя Gemini 3 Flash, компания назвала рассуждение о визуальных и пространственных свойствах видео одной из будущих способностей модели.

Источник: the-decoder.com

Результаты на длинных видео

Преимущество нового режима заметнее всего на длинных роликах: от десятиминутных обучающих видео до лекций длительностью 90 минут и многочасовых записей. При статичной обработке разработчикам приходилось выбирать между большим расходом токенов и методами, которые отбрасывали важные детали.

В собственных бенчмарках Google, включая LongVideoBench, Gemini 3.7 Flash с анализом видео с помощью агента показывает наивысшее общее качество и лучшее сочетание точности и экономичности.

В собственной оценке Google 1H-VideoQA Gemini 3.7 Flash достигает наивысшей точности при самой низкой стоимости одного запроса

В собственной оценке Google 1H-VideoQA Gemini 3.7 Flash достигает наивысшей точности при самой низкой стоимости одного запроса

Источник: the-decoder.com

Функция уже доступна для загруженных видео и роликов с YouTube через Gemini API в Google ИИ Studio и Gemini Enterprise Agent Platform. В конфигурации API разработчику нужно выбрать режим обработки `agentic`. Оплата идёт по стандартным тарифам Gemini API за токены, без дополнительной комиссии. Подробности опубликованы в руководстве для разработчиков.

Интеграция с продуктами Google

Google собирается использовать эти улучшения и в собственных продуктах. В ближайшее время функция должна появиться у всех пользователей приложения Gemini на версиях Flash и Flash Lite.

В следующие месяцы анализ видео с помощью агента также начнёт поддерживать функцию «Спросить YouTube» на странице просмотра. Ответы должны точнее соответствовать тому, что действительно показано в ролике.

Источник: the-decoder.com

«С нас хватит»: тысячи сотрудников Сиднейского университета бастуют из-за ИИ и рабочих мест Разработчик стратегии британского правительства в сфере ИИ переходит в Anthropic Техногиганты убивают приватность. Австралия получила редкий шанс урезать их власть Источники: AfterQuery стала быстрейшим единорогом Y Combinator — оценка $3,2 млрд Google обновила Android: меньше укачивания, больше доступности и не только Anthropic открыла проверку ИИ-текста Claude регуляторам, СМИ, фактчекерам и другим Anthropic разрабатывает корпоративные передовые меры защиты вместе с клиентами OpenAI скоро выпустит первую ИИ-модель с «критическими» киберспособностями Anthropic представила новую Fable: дешевле, с меньшим числом ограничений Курирующий военный ИИ чиновник Пентагона продал акции ИИ-компании на миллионы Как ИИ рассчитал межзвёздный путь к Альфе Центавра Google Research картирует глобальные выбросы метана из космоса при помощи глубокого обучения ChatGPT Health подключили к Epic: врачи смогут импортировать данные пациентов Ответ Google Canva — ИИ-инструмент, где вместо дизайна задают запросы ФБР: мужчина отравил Обзоры ИИ Google и убедил женщин, что он игрок NFL AIR привлекла $50 млн, чтобы компании проверяли навыки и дополнения ИИ-агентов Новый глава Google DeepMind: важнее всего — лидерство в передовом ИИ Вышедшая из инкубатора Sequoia Empirik запустилась с $21 млн — предсказывать сбои заранее Alexa теперь сообщит о новинках, которые могут подтолкнуть вас к покупке Hugging Face представила @huggingface/kernels: более 200 WebGPU-ядер для локального ИИ

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram