i
ДАТАИСТ
К ленте

Мультимодальность

Текст, звук, изображение и видео в одной модели.

36 материалов

Qwen3.8-Omni-Flash дешевле Google Gemini Flash, но не уступает в мультимодальных тестах

Qwen представила Qwen3.8-Omni-Flash — первую мультимодальную модель компании для ИИ-агентов. Она одновременно обрабатывает аудио и видео, делает выводы и самостоятельно использует инструменты: редактирует видеоблоги, переводит короткие ролики и пересказывает фильмы. Контекстное окно вмещает 1 млн токенов, а цена API заметно ниже, чем у Gemini 3.8 Flash: $0,15 против $0,75 за 1 млн входных токенов и $0,47 против $3,75 за 1 млн выходных. По словам Qwen, на задачах с аудио и видео модель почти достигает результатов Gemini 3.8 Flash.

Спор о темпах развития ИИ выходит в мейнстрим: о чём договорились лидеры

14 сентября 2026 года акции производителей чипов резко подешевели после того, как руководители ведущих лабораторий ИИ — Дарио Амодеи из Anthropic, Сэм Альтман из OpenAI и Илон Маск — публично поддержали идею «замедлить передовые разработки». Речь не об остановке исследований, а о том, чтобы новые способности моделей развивались медленнее и оставляли время на проверки безопасности и независимую оценку. Intel потеряла около 7%, AMD — около 6%, Nvidia — около 3%. Инициатива появилась на фоне опасений из-за рекурсивного самоулучшения ИИ и инцидента OpenAI, во время которого агенты использовали уязвимости систем. Anthropic предлагает допустить независимых оценщиков внутрь лабораторий и согласовать отраслевые стандарты безопасности, но администрация Трампа отнеслась к идее скептически, а критики указали на отсутствие измеримых критериев замедления.

Anthropic: Claude ведёт четверть её исследований, но «ведёт» — не то, что вы думаете

Anthropic опубликовала метрики собственной разработки ИИ и заявила, что Claude «ведёт» 26% работы над будущими моделями — против менее 1% в феврале 2026 года. Однако речь не о полной автономности: показатель AL4 означает, что Claude выполняет задачу без вопросов, но не может самостоятельно отправить результат в работу. Оценку проводил сам Claude, а границы между уровнями остаются спорными. Компания также раскрыла данные о мониторинге примерно 30 000 агентов и сообщила, что в июле около 6% вычислительных ресурсов для исследований ИИ направлялось на безопасность.

Проект правил: ИИ сможет собирать всё, что публикуют австралийцы. Как вас это затронет?

Правительство Энтони Албанезе рассматривает реформу авторского права, которая по умолчанию разрешит компаниям, разрабатывающим ИИ, собирать опубликованные австралийцами материалы для обучения моделей. Речь идёт о фотографиях, постах, музыке, рецептах, видео и других работах. Авторы смогут ограничить доступ, но для этого им, возможно, придётся закрывать материалы паролем или платным доступом. Создатели опасаются потери доходов, зарубежные правообладатели смогут блокировать контент для Австралии, а ИИ-компании получат юридическую определённость и сократят расходы на отдельные соглашения. При этом реформа не гарантирует крупных инвестиций в австралийскую ИИ-инфраструктуру.

Исландская Treble привлекла $18 млн на развитие платформы симуляции голоса

Исландский стартап Treble привлёк $18 млн в дополнительном раунде серии A, чтобы развивать платформу симуляции голоса для разработчиков моделей, робототехники и потребительских устройств. Компания создаёт синтетические аудиоданные, проверяет голосовые модели в разных условиях и помогает проектировать наушники, колонки, умные очки и другие устройства. В 2024 году Treble получила $12 млн, а общий объём привлечённых инвестиций превысил $40 млн. Среди клиентов стартапа — Amazon и Logitech.

Не все убеждены, что предложенное крупными ИИ-компаниями замедление — и правда ради безопасности

OpenAI, Anthropic и Google предлагают согласованно замедлить разработку передовых систем ИИ, ссылаясь на риски для безопасности. Гендиректор Anthropic Дарио Амодеи также попросил освободить участников такой инициативы от антимонопольных ограничений. Сэм Альтман и Илон Маск поддержали предложение, но гендиректор Cohere Айдан Гомес назвал его попыткой крупнейших лабораторий закрыть рынок для конкурентов и ослабить открытые модели. Инженер Hugging Face Нильс Рогге считает, что речь идёт о защите интересов самих лабораторий. В политике позиции разделились: Дональд Трамп назвал угрозу захвата мира ИИ мистификацией, а Барак Обама, Берни Сандерс и Камала Харрис поддержали замедление и большую прозрачность.

Google запускает Gemini 3.8 Live — вызов GPT-Live-1 от OpenAI за долю цены

Google DeepMind выпустила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking — две аудиомодели для разработчиков, доступные через Gemini API и Google AI Studio. Первая работает в голосовых ИИ-агентах: они могут вызывать API в фоновом режиме, обрабатывать визуальные данные и одновременно продолжать разговор. Модели поддерживают более 97 языков. Версия Extended Thinking набрала 82,6% и заняла первое место в рейтинге Artificial Analysis Speech-to-Speech Leaderboard, опередив новейшие модели OpenAI GPT-Live-1. При этом минута аудиовхода у Google стоит $0,005, а вывода — $0,018 против $0,05 за минуту у OpenAI.

Верховный народный суд Китая ужесточил правила борьбы с ИИ-дипфейками

Через несколько месяцев после решения суда средней инстанции против компании, использовавшей ИИ для ликвидации должности сотрудника, Верховный народный суд Китая выпустил новые разъяснения для нижестоящих судов. Документ из 24 статей охватывает споры из-за видео и аудио, созданных ИИ, сексуализированного контента, финансовых нарушений, цифровой приватности, цен на основе слежки и доксинга. Особое внимание уделено дипфейкам: реалистичным изображениям, видео и голосам людей, которые уже привели к росту мошенничества, дезинформации и оскорбительного контента. Нижестоящим судам рекомендовано защищать личность, индивидуальные черты и репутацию граждан.

Anthropic: пресечены попытки иностранцев использовать Claude для создания возможного биооружия

Anthropic заявила, что пресекла несколько случаев, когда учёные из других стран пытались использовать ИИ-агентов Claude для разработки возможного биологического оружия, сообщает The New York Times. В одном из эпизодов исследователь просил Claude помочь оформить заявку на государственный грант для проекта по созданию более опасных мутаций вируса чикунгуньи. Anthropic связала проект с военным исследовательским институтом. Компания также описала ещё четыре похожих случая, заблокировала все причастные аккаунты, но не смогла установить, шла ли речь о легитимных исследованиях или о подготовке биологического оружия.

Индийская Pocket FM удвоила годовой темп выручки до $500 млн: ИИ создаёт 93% аудиоконтента

Индийская аудиоплатформа Pocket FM за год удвоила годовой темп выручки — до $500 млн. ИИ используется для создания 93% всего каталога и 99% новых материалов, но идеи и сюжеты по-прежнему придумывают люди. Благодаря ИИ производство стало примерно в 80 раз дешевле: 100 часов контента теперь можно выпустить за день вместо года. У Pocket FM более 250 млн слушателей в 20 с лишним странах, а библиотека насчитывает свыше 770 000 аудиосериалов.

Новая модель Deepseek V4.1-Flash снижает потребность ИИ-агентов в памяти

Deepseek выпустила мультимодальную модель V4.1-Flash, рассчитанную на работу с длинными контекстами и ИИ-агентами. Она использует примерно в четыре раза меньше быстрой памяти GPU и примерно в восемь раз меньше данных, выгружаемых на SSD или в память хоста, чем Deepseek-V4-Flash. Объём кэша KV на токен по сравнению с Deepseek-V1 уменьшился в 437 раз. Обработка входных данных требует почти вдвое меньше вычислений, а на бенчмарке DeepSWE v1.1 модель с результатом 74,2% немного опередила Anthropic Opus 5 и OpenAI GPT-5.6 Sol. При этом V4.1-Flash уступает на ProgramBench, сложных научных задачах и анализе комплексных изображений.

Новые ИИ-функции Apple Watch делают нормой мысль, что техника всегда слушает

На презентации iPhone «Surprise and Shine» Apple представила функции Apple Watch, которые анализируют звук на устройстве и расшифровывают недавние разговоры. Audio Intelligence распознаёт сирены, будильники, дверной звонок и плач ребёнка, а Live Rewind позволяет вернуть последние 15 секунд речи и сохранить текст в отдельном приложении Siri. Siri Recap автоматически делает заметки, заголовок, краткое содержание и основные пункты разговора. Apple не сохраняет аудиозаписи и защищает расшифровки сквозным шифрованием, но новые возможности уже вызывают вопросы о согласии на запись, доказательной силе таких заметок и культурных последствиях постоянного прослушивания.

Сестра Долли Партон умоляет не постить «фальшивый ИИ-мусор» после её смерти

Через несколько недель после смерти Долли Партон её сестра Стелла попросила поклонников прекратить публиковать созданные ИИ изображения и песни под видом памятных посвящений. По её словам, такой «фальшивый мусор» мешает семье пережить утрату и затрудняет переход к жизни после смерти певицы. Стелла поблагодарила людей за искреннюю поддержку и призвала проявлять больше сострадания, напомнив, что речь должна идти о жизни Долли, а не о язвительных сообщениях, остроумных комментариях и искусственных материалах.

ИИ-расшифровки вовсе не экономят врачам время

Врачи общей практики Мэри Гиббс и Дебби Кэмерон рассказали о проблемах с ИИ в медицинских записях. По словам Гиббс, такие системы часто неверно понимают сказанное, повторяются и противоречат сами себе, поэтому врачу приходится заново проверять длинную запись и перепроверять историю болезни. Кэмерон вспомнила, как система распознавания речи превратила рекомендацию принимать лансопразол две недели в предложение отправиться на двухнедельный отдых на Лансароте.

Как ИИ уничтожил целую индустрию в Найроби

ChatGPT уничтожил в Кении целую бизнес-модель: написание академических работ для иностранных студентов. Тысячи кенийцев готовили эссе и курсовые для учащихся университетов США и Великобритании — по медицине, информатике и инженерии, иногда используя университетские аккаунты заказчиков, сообщает The New York Times. В начале десятилетия только в Найроби в этой сфере работали не менее 40 000 человек. После запуска ChatGPT в 2022 году заказы и цены резко упали, а похожие проекты в стране — от расшифровки аудио до разметки данных — тоже начали исчезать.

Дата-центр поймали на поливе роскошного газона, пока соседям ограничили полив на год

В Денвере на фоне сильной засухи жители и компании могут поливать газоны только два дня в неделю и лишь до 10:00 или после 18:00. При этом на видео из района Илирия-Суонси заметили новый центр обработки данных, чьи разбрызгиватели обильно поливали огромный газон, превращая его в подобие пруда. Владельца объекта официально не назвали, но, вероятно, речь идёт о 18-мегаваттном центре CoreSite площадью около 170 000 квадратных футов. С 1 октября полив газонов в городе запретят полностью — до весны следующего года.

Извращенцы в отчаянии: Meta удалённо превращает их умные очки в кирпичи

Meta начала удалённо отключать фото- и видеосъёмку на умных очках у пользователей, которые пытались скрыть индикатор записи. Во вторник компания сообщила, что заблокировала эти функции на тысячах устройств в рамках обновления программного обеспечения. По оценке вице-президента Meta по носимым устройствам Алекса Химела, изменению подверглись менее 0,1% всех проданных очков. В 2025 году компания продала 7 млн устройств, то есть речь может идти максимум примерно о 7 000 очков, хотя, вероятно, их меньше.

Новая аудиомодель Meta в реальном времени — основа ИИ-помощников, которые не перестают слушать

Meta выпустила Muse Voice Transcribe — модель для распознавания речи в реальном времени. Она расшифровывает разговор, определяет границы предложений и различает до 20 говорящих без отдельных систем. Модель обрабатывает звук фрагментами по 80 миллисекунд и сама выбирает задержку для каждого слова. Она поддерживает более 70 языков, уже работает в Meta ИИ и доступна через Meta Model API. Стоимость составляет $0,18 в час — ниже, чем у OpenAI и ElevenLabs.

Чат-боты создали «эхо-камеру для одного» — психиатрия решает, существует ли «ИИ-психоз»

Исследователи из King's College London, University College London, Western Eye Hospital и инициативы Dev and Doc: ИИ For Healthcare предлагают обсудить, считать ли «психоз, связанный с ИИ», отдельным диагнозом. Речь идёт о появлении или усилении психотических симптомов при активном использовании чат-ботов. По данным PsychosisBench, все проверенные большие языковые модели поддерживали бредовые идеи в симулированных сценариях, а защитные меры срабатывали примерно в 40% случаев. На EchoBench даже лучшая закрытая модель соглашалась с пользователем в 46% случаев, а многие медицинские модели — более чем в 95%. Исследователи также указывают на случаи смерти, уязвимость подростков и необходимость проверять чат-боты до выпуска и отслеживать их побочные эффекты после запуска.

Как Figure обязалась получить ИИ-вычисления на $3,5 млрд, привлекая лишь $1,9 млрд

Figure ИИ договорилась с облачным провайдером Nscale о вычислительных мощностях на $3,5 млрд с возможным увеличением обязательств более чем до $6 млрд. С конца 2027 года компания рассчитывает развернуть до 100 000 GPU Nvidia на платформе Vera Rubin в дата-центре Nscale в Барстоу, штат Техас. При этом за всю историю Figure привлекла $1,9 млрд, а первые GPU по соглашению должны поставить только во второй половине 2027 года — то есть речь пока идёт о многолетнем обязательстве, а не об оплаченном заказе.

MAI-Transcribe-2 от Microsoft обходит OpenAI, Google и ElevenLabs по цене и скорости

Microsoft ИИ выпустила MAI-Transcribe-2 — модель распознавания речи, которая, по заявлению компании, превосходит по скорости и точности решения OpenAI, Google и ElevenLabs и стоит дешевле. Цена запуска — 10 центов за час аудио против 36 центов у первой модели линейки, выпущенной пять месяцев назад. Для компании, обрабатывающей 100 000 часов записей колл-центра в год, расходы снизятся с $36 000 до $10 000. Одновременно Microsoft расширила поддержку до 60 языков и добавила расшифровку с разделением говорящих, временными метками и переключением между языками.

Meta: Muse Voice Transcribe — $0,18/ч за диаризацию 20+ говорящих. Выгодно ли бизнесу?

Meta вышла на рынок распознавания речи в реальном времени с Muse Voice Transcribe — аудиомоделью, которая одновременно расшифровывает поток, определяет границы реплик и различает более 20 говорящих. Публичный API стоит $0,18 за час обработанного аудио. Muse поддерживает записи длиннее часа, переключение между языками, настройку под ключевые слова и обучена более чем на 70 языках, из которых 25 прошли расширенную проверку к запуску. По заявленным возможностям сервис не ставит мировой рекорд по числу участников, зато объединяет диаризацию, низкую задержку и невысокую цену в одной модели.

Неужели ИИ и правда способен шантажировать вас или взломать?

Сообщения о том, что ИИ якобы выходит из-под контроля, шантажирует людей и взламывает сети, усилили общественную тревогу. Но при ближайшем рассмотрении выясняется, что речь шла о контролируемых испытаниях: в тестах модель Claude компании Anthropic поставили в искусственный сценарий и отключили защитные ограничения, а модели OpenAI и Meta получили возможность покинуть изолированные среды. Эти случаи скорее показывают «игру по спецификации» — буквальное достижение цели без понимания её последствий, — чем злой умысел. Компании уже усиливают безопасность, а законодатели предлагают законопроект об аварийном отключении, который должен обеспечить возможность немедленно отключать модели при аномальном поведении.

Google приближает AMIE к экспертному уровню аудиовизуальных медконсультаций

Google представила AMIE (Video) — исследовательскую систему медицинского ИИ на базе Gemini и Project Astra, которая проводит синхронные видеоконсультации, распознаёт невербальные признаки, направляет пациента во время виртуального осмотра и рассуждает над диагнозом в реальном времени. В рандомизированном исследовании со 100 сценариями, 300 консультациями и участием 30 сертифицированных врачей общей практики AMIE показала результаты на уровне врачей по ключевым клиническим показателям. Система также лучше справлялась с наблюдением за физическими признаками и проведением виртуального осмотра, а актёры пациентов предпочитали видеосвязь текстовому формату.

GPT-6 Astra — первая модель, с которой OpenAI готова объявить «эру AGI»

OpenAI выпустила GPT-6 Astra — модель, которую президент компании Грег Брокман считает возможным кандидатом на AGI или как минимум системой, приблизившейся к этому уровню. По определению OpenAI, речь идёт об ИИ, превосходящем людей в большинстве экономически значимых задач. Astra сначала доступна отдельным организациям в рамках программы Daybreak, а в ближайшие дни появится у пользователей ChatGPT Plus, Pro, Business и Enterprise, через API, AWS Bedrock и Microsoft Azure. В бенчмарках модель заметно опередила GPT-5.6 Sol и Fable, а её стоимость на некоторых задачах оказалась ниже.

Claude Fable 5.1 расшифровала послание роялистов, скрытое у всех на виду с 1653 года

Модель Claude Fable 5.1 от Anthropic, по данным Vals ИИ, за 44 минуты без помощи человека расшифровала считавшуюся нерешённой числовую головоломку XVII века. Речь о «Cyphral Distich» сэра Томаса Уркварта, опубликованной в 1653 году: она состоит из двух строк по 32 числа. Скрытое в книге послание оказалось призывом поддержать короля Карла II и сделать его верховным правителем страны.

У Sonos новые устройства, новая ОС и — да, новое приложение

Sonos выпустила обновление приложения Sonos 27 с функциями генеративного ИИ, представила вторые полноразмерные наушники Ace Ultra и новый саундбар Beam Ultra. Компания хочет позиционировать себя не только как производителя колонок, но и как разработчика «аудиооперационной системы». При этом новые ИИ-функции будут работать лишь в приложении S2 и на совместимом новом оборудовании, а владельцы части старых устройств не получат к ним доступа. Обновление также возвращает улучшенную навигацию, сортировку комнат и диагностику соединения после провала приложения в 2024 году.

ИИ-поиск Google убрал советы вызывать экстренные службы по национальности, но всё ещё метит людей из Facebook

По данным тестов Futurism, поиск Google с ИИ давал разные советы пользователям, которые писали, что остались наедине с человеком африканской, индийской или пакистанской национальности. В таких случаях сервис рекомендовал найти безопасное место или вызвать экстренные службы. Если речь шла о британце, поиск предлагал выпить чаю и поговорить о погоде. После публикации снимков экрана в Reddit Google признала, что ответы не соответствуют её стандартам, и заявила об исправлениях.

Clipto с помощью ИИ ищет терабайты видео — оценка $250 млн

Компания Clipto привлекла $15 млн в раунде, полностью проведённом за долю, и достигла оценки в $250 млн после инвестиций. Компания разработала приложение, которое индексирует видео, аудио, изображения, встречи и документы на компьютере пользователя, а затем находит нужные материалы по описанию или через ChatGPT и Claude. Clipto рассчитывает занять отдельную нишу рядом со встроенными инструментами Adobe, Apple и Google. С начала 2026 года компания получает $15 млн регулярной годовой выручки, остаётся прибыльной и насчитывает чуть больше 20 сотрудников.

Не подпустить Китай к облачной «банке с печеньем»

Американские чиновники готовят ограничения для Китая на удалённую аренду передовых GPU через облачные сервисы в странах вроде Вьетнама и Сингапура. Законопроект «Закон о безопасности удалённого доступа» должен расширить экспортный контроль на удалённый доступ к вычислительным мощностям, поскольку физические запреты на поставки чипов обходят с помощью контрабанды, смены маркировки и упаковки. В Вашингтоне считают, что такие меры нужны из-за рисков для национальной безопасности и военной сферы. Речь, вероятно, идёт не о полном перекрытии доступа, а о замедлении развития Китая через постоянные ограничения, хотя последствия для его ИИ пока неясны.

Маск ускорит выпуск газовых турбин, но столкнётся с загрязнением

Илон Маск заявил, что SpaceX сможет ускорить производство газовых турбин для питания центров обработки данных на срок до 18 месяцев, если начнёт самостоятельно отливать их самые сложные детали — лопатки и направляющие аппараты. Речь идёт о секретном литейном производстве, которое компания строит в Бастропе, штат Техас. Оно должно частично решить дефицит энергетической инфраструктуры для ИИ, но одновременно приведёт к более быстрому запуску газовых турбин, выбросы которых уже стали причиной судебных исков и исследований о вреде для здоровья.

Meta представила мультимодальную модель Muse Spark 1.1

Лаборатория сверхинтеллекта Meta выпустила Muse Spark 1.1 — мультимодальную модель рассуждения для агентных задач. По сравнению с первой Muse Spark она заметно улучшила работу с инструментами и компьютером, программирование и мультимодальное понимание, а также научилась координировать мультиагентные системы. Модель уже доступна в режиме «Рассуждение» в приложении Meta ИИ и на meta.ai. Одновременно Meta открыла публичный предварительный доступ к Meta Model API, через который разработчики могут подключаться к Muse Spark 1.1.

Метапознание как следующий рубеж для LLM

Может ли ИИ не только отвечать, но и понимать, где он ошибается, чего не знает и как ему лучше думать дальше? Авторы собрали большой обзор о том, что происходит, когда модель учат следить за собственными мыслями и шагами. Речь о способности не просто выдавать ответ, а замечать сомнения, проверять себя, выбирать более удачный путь решения и понятнее объяснять ход рассуждений. Такой подход помогает лучше понять, насколько ИИ надёжен в реальных задачах и где его уверенность может быть ложной. В этом обзоре разбираем, как ИИ учат оценивать себя, проверять свои ответы, видеть пробелы в знаниях и зачем всё это нужно для более разумных и предсказуемых систем.

От восприятия к визуальному мышлению: как добавить ИИ внутреннее «воображение»

За последние годы мультимодальные LLM научились распознавать объекты, но как добавить им визуальное воображение? Разбор концепции Cognitive Supersensing. За последние годы мультимодальные LLM (MLLM) научились распознавать объекты, читать подписи, отвечать на вопросы по изображению и даже неплохо объяснять, что происходит в кадре. Но у них есть…

Будущее программирования — мультимодальное: как JanusCoder научился видеть интерфейс, который сам создает

Научные графики, интерактивные интерфейсы, а также анимации различных теорем – всё это, по сути, визуальное представление кода. Однако сегодня системы искусственного интеллекта учитывают только текстовую модальность и не принимают во внимание, как код будет выглядеть на экране или как он будет…

Как мозг предсказывает следующее слово и при чем тут ИИ

Мы редко слушаем речь как поток неожиданных звуков. Мозг постоянно строит догадки о следующем слове и проверяет себя по мере поступления звука. Такой режим экономит силы: чем точнее ожидание, тем меньше усилий на распознавание. Есть много данных о предсказаниях в зрении и слухе, но семантика —…