Проблема в том, что ИИ пока плохо извлекает достоверную статистику. В бенчмарке UNICEF шесть языковых моделей обработали более 133 000 ответов на вопросы о показателях глобального развития. Средняя точность составила 21,2%, сообщил журналистам на виртуальном брифинге главный статистик организации Жуан Педру Азеведу.
В исследовании участвовали GPT-4o и GPT-4o-mini от OpenAI, Claude Sonnet 4.5 и Haiku 4.5 от Anthropic, а также Gemini 2.5 Flash и Gemini 2.0 Flash от Google.
Примерно в трёх случаях из пяти модели вообще не выдавали пригодного числа — часто они уклонялись от точного ответа. Когда те же вопросы задавали тем же версиям моделей примерно через два дня, модели, которые оба раза называли число, совпадали с собственным предыдущим ответом лишь примерно в половине случаев.
Исследование UNICEF опубликовано как рабочий материал, который готовят для подачи в журнал, и пока не прошло рецензирование. Организация планирует выпустить вместе с ним методику, код и данные.
В этом году UNICEF также зафиксировала резкий рост переходов на свой сайт из генеративных ИИ-ассистентов. Сайт получает более 6 млн посещений в месяц и входит в число самых популярных ресурсов организации. По словам Азеведу, с 1 января по 14 сентября переходы по ссылкам из ответов ChatGPT выросли на 67% год к году. На них пришлось 6,4% всех сессий за этот период, а долю ИИ-ассистентов во всех посещениях UNICEF оценивает примерно в 10%.
ООН сообщила, что 26 её подразделений присоединились к Data Commons, а данные почти 20 из них доступны уже при запуске. К 2027 году организация рассчитывает перенести на платформу 80% статистических наборов данных всей системы ООН.
Исполняющий обязанности директора Статистического отдела ООН Шантану Мукерджи заявил, что новая система впервые объединяет данные такого числа агентств и делает их доступными для ИИ в большом масштабе, с широкими возможностями и гибкой структурой.
Google.org выделила $2 млн на развитие компетенций и техническую поддержку, необходимые для создания базовой инфраструктуры платформы. Руководитель команды Google Data Commons Прем Рамасвами сообщил TechCrunch, что система размещена в экземпляре под управлением ООН. В дальнейшем её планируют самостоятельно поддерживать, эксплуатировать и масштабировать внутри ООН.
При запуске Google использовала подход «обучить инструкторов»: сотрудники, которые освоили систему, должны передавать знания другим командам. По словам Рамасвами, сотрудники системы ООН быстро набрали необходимый темп работы.
Google запустила Data Commons в 2018 году, чтобы объединять общедоступные наборы данных из разных источников в общей структуре. В прошлом году платформа получила поддержку MCP — стандарта, который позволяет ИИ-агентам напрямую запрашивать в Data Commons статистику и её источники.
Платформа ООН также сохраняет сведения о происхождении каждого показателя. Благодаря этому пользователь может проследить данные, найденные ИИ-системой, до исходного источника ООН. Азеведу отметил, что это особенно важно по мере роста зависимости людей от ИИ-инструментов для поиска и интерпретации информации.
ИИ-агенты могут не только получать отдельные показатели. Google показала, как система, подключённая к данным ООН через MCP, объединяет несколько индикаторов и создаёт на их основе панели, графики и письменный анализ без ручного поиска и сведения исходных наборов данных.
В одной из демо Google попросила ИИ-систему найти влияние американской Президентской чрезвычайной программы помощи в борьбе со СПИДом на Африку. Система нашла подходящие показатели ООН, включая число случаев заражения ВИЧ, смертность от СПИДа и ожидаемую продолжительность жизни, а затем создала инфографику.
При этом доступ к достоверным данным сам по себе не делает выводы ИИ достоверными. Прем Рамасвами предупредил, что модели могут неверно интерпретировать нюансы, поэтому человек должен проверять результаты перед цитированием или публикацией.
Читайте также
Проект правил: ИИ сможет собирать всё, что публикуют австралийцы. Как вас это затронет?
Anthropic приближает Claude Code к автономному кодингу с новыми параллельными агентами
Инфлюенсеры снимают на ИИ-очки Meta манипулятивный джойбейт с людьми на улице
Даже короля Англии одолевают сомнения по поводу ИИ
Господство ИИ не предопределено — мы можем изменить ситуацию к лучшему
Спор о замедлении ИИ омрачил праздник Salesforce
OpenAI, по сообщениям, близка к решению второй задачи тысячелетия — гипотезы Ходжа
Base Labs объединилась с Hugging Face и Goodfire ради безопасности ИИ с открытыми весами
The Spin | Роботам ещё далеко до идеальной дусры, но ИИ уже меняет крикет
Anthropic представила программу Life Sciences Verification Program
Конкурирующие ИИ-агенты Instinct и Muse от Meta получили возможность звонить
«Строите Франкенштейна — остановитесь»: Джей Ди Вэнс отверг призывы регулировать ИИ
Сотни сотрудников OpenAI читают личные чаты пользователей
Совет Meta велел удалить британские дипфейки, назвав меры «недостаточными»
Google, Nvidia и Anthropic хотят, чтобы Emerald AI нашла место в сети для новых ЦОД
Художники бойкотировали конкурс портретов из-за работ ИИ — теперь вернулись им противостоять
GPT-6 Astra: чемпион Pokemon за 18 часов, после взрыва крипера — фермер картофеля
Три брата превратили купленные СМИ в зомби-фермы ИИ-мусора: 50 млн просмотров в месяц
Huawei планирует выпустить новый ИИ-чип в I квартале 2027 года, соперничая с Nvidia
Разрешить ИИ-компаниям сговор ради «сдерживания переднего края» опасно
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram