Точность коротких событий
Новые Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite умеют находить события длительностью меньше секунды — например, смену состояния объекта или монтажную склейку, которые можно пропустить при обработке одного кадра в секунду. Google считает, что благодаря этому автоматический видеомонтаж станет точнее.
Система также ищет отдельные сцены в многочасовых записях, не расходуя миллионы токенов. Если она замечает подозрительный временной отрезок, то повторно анализирует его с более высокой частотой кадров. Это помогает находить аномалии, считать повторяющиеся движения и отслеживать отдельные объекты во времени.
На 1H-VideoQA и LVBench потребление токенов снижается на 88%, а точность немного повышается
Источник: the-decoder.com
До сих пор Gemini обрабатывала видео статично: по умолчанию брала один кадр в секунду, хотя через API частоту можно было изменить. С момента запуска встроенного анализа видео в 2025 году модель расшифровывала звуковую дорожку и изучала кадры с такой же, посекундной, частотой.
Как Gemini выбирает фрагменты
В режиме с агентом рассуждение модели напрямую связано со встроенными инструментами анализа видео. Gemini сама решает, какие отрезки просматривать, с какой скоростью и в каком формате — по кадрам, аудио или расшифровке. В обработку попадают только сигналы, необходимые для конкретной задачи.
Теперь Gemini использует внутренний инструмент, который извлекает из видео только нужный фрагмент. Раньше разработчики могли вручную собрать похожий избирательный подход, но теперь этим занимается сама модель.
Вместо загрузки видео с фиксированной частотой кадров Gemini использует цикл, чтобы выборочно получать кадры, аудио или расшифровки из нужных фрагментов
Источник: the-decoder.com
Новая схема развивает подход «зрения с помощью агента», который Google представила для Gemini 3 Flash в январе. Тогда модель получила возможность писать и запускать код на Python, чтобы увеличивать, обрезать и размечать изображения, а затем проверять результат в цикле «подумать — действовать — наблюдать» перед ответом.
При запуске эта функция работала автоматически не во всех случаях. Её основу Google заложила ещё раньше: в декабре, представляя Gemini 3 Flash, компания назвала рассуждение о визуальных и пространственных свойствах видео одной из будущих способностей модели.
Источник: the-decoder.com
Результаты на длинных видео
Преимущество нового режима заметнее всего на длинных роликах: от десятиминутных обучающих видео до лекций длительностью 90 минут и многочасовых записей. При статичной обработке разработчикам приходилось выбирать между большим расходом токенов и методами, которые отбрасывали важные детали.
В собственных бенчмарках Google, включая LongVideoBench, Gemini 3.7 Flash с анализом видео с помощью агента показывает наивысшее общее качество и лучшее сочетание точности и экономичности.
В собственной оценке Google 1H-VideoQA Gemini 3.7 Flash достигает наивысшей точности при самой низкой стоимости одного запроса
Источник: the-decoder.com
Функция уже доступна для загруженных видео и роликов с YouTube через Gemini API в Google ИИ Studio и Gemini Enterprise Agent Platform. В конфигурации API разработчику нужно выбрать режим обработки `agentic`. Оплата идёт по стандартным тарифам Gemini API за токены, без дополнительной комиссии. Подробности опубликованы в руководстве для разработчиков.
Интеграция с продуктами Google
Google собирается использовать эти улучшения и в собственных продуктах. В ближайшее время функция должна появиться у всех пользователей приложения Gemini на версиях Flash и Flash Lite.
В следующие месяцы анализ видео с помощью агента также начнёт поддерживать функцию «Спросить YouTube» на странице просмотра. Ответы должны точнее соответствовать тому, что действительно показано в ролике.
Источник: the-decoder.com
Читайте также
«С нас хватит»: тысячи сотрудников Сиднейского университета бастуют из-за ИИ и рабочих мест
Разработчик стратегии британского правительства в сфере ИИ переходит в Anthropic
Техногиганты убивают приватность. Австралия получила редкий шанс урезать их власть
Источники: AfterQuery стала быстрейшим единорогом Y Combinator — оценка $3,2 млрд
Google обновила Android: меньше укачивания, больше доступности и не только
Anthropic открыла проверку ИИ-текста Claude регуляторам, СМИ, фактчекерам и другим
Anthropic разрабатывает корпоративные передовые меры защиты вместе с клиентами
OpenAI скоро выпустит первую ИИ-модель с «критическими» киберспособностями
Anthropic представила новую Fable: дешевле, с меньшим числом ограничений
Курирующий военный ИИ чиновник Пентагона продал акции ИИ-компании на миллионы
Как ИИ рассчитал межзвёздный путь к Альфе Центавра
Google Research картирует глобальные выбросы метана из космоса при помощи глубокого обучения
ChatGPT Health подключили к Epic: врачи смогут импортировать данные пациентов
Ответ Google Canva — ИИ-инструмент, где вместо дизайна задают запросы
ФБР: мужчина отравил Обзоры ИИ Google и убедил женщин, что он игрок NFL
AIR привлекла $50 млн, чтобы компании проверяли навыки и дополнения ИИ-агентов
Новый глава Google DeepMind: важнее всего — лидерство в передовом ИИ
Вышедшая из инкубатора Sequoia Empirik запустилась с $21 млн — предсказывать сбои заранее
Alexa теперь сообщит о новинках, которые могут подтолкнуть вас к покупке
Hugging Face представила @huggingface/kernels: более 200 WebGPU-ядер для локального ИИ
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram