i
ДАТАИСТ
К ленте

Практика работы с моделями

Как выжимать из модели больше: промптинг, выбор режима, типичные ошибки в использовании.

12 материалов

Anthropic управляет лабораторией, где проводят биологические эксперименты

Anthropic подтвердила TechCrunch, что в районе залива Сан-Франциско у компании есть лаборатория для экспериментов с живыми биологическими системами. Там исследователи могут использовать модели ИИ для физических экспериментов. Руководитель Anthropic Дарио Амодеи недавно заявил, что ИИ способен вылечить большинство тяжёлых заболеваний в ближайшие 5–10 лет. Для этого языковым моделям нужны методы проверки теорий в реальном мире. Компания уточнила, что лаборатория занимается фундаментальной биологией, а не разработкой лекарств, и сотрудничает с внешними партнёрами.

Будущее учебной практики: учителя создают интерактивы с генеративным интерфейсом

Google Research разработала систему, которая позволяет учителям создавать интерактивные учебные симуляции под конкретную тему, учебную программу и уровень класса. Генеративные пользовательские интерфейсы формируют задания, уровни сложности, подсказки и обратную связь, а встроенные проверки оценивают педагогику, работоспособность и оформление. В библиотеке уже доступно более 30 таких материалов на английском языке по физике, химии, биологии, математике и другим предметам STEM для средней и старшей школы. Все материалы сгенерированы ИИ и проверены учителями.

Модель OpenAI встраивала промпт-инъекции в свои заметки — исследователи не знают почему

OpenAI запустила фреймворк для систематического отслеживания, расследования и публикации случаев рассогласования поведения ИИ-моделей. Вместе с ним компания выпустила шесть первых отчётов: в одном обучаемая модель добавляла манипулятивные инструкции в собственные внутренние сводки и влияла на последующие ответы. Другие документы описывают сокрытие ошибок, поиск чужих открытых ключей API и несанкционированную передачу данных через внешние платформы. OpenAI обещает публиковать такие случаи даже до того, как их удастся объяснить или исправить.

Как граф превращает ошибки ИИ-агента в подсказки

ИИ-агенты часто ошибаются не потому, что «не знают», а потому что по дороге к цели теряют нить действий. Исследователи предлагают простую идею: вынести порядок шагов в отдельную схему, где видно, что делать сначала, что потом и при каких условиях. Такая схема помогает ИИ-агенту в каждый момент сверяться с ближайшим нужным шагом, не зацикливаться и не дергать инструменты невпопад. А если агент всё же ошибается, система сравнивает неудачные и удачные попытки и правит эту схему так, чтобы в следующий раз путь был лучше. В обзоре разберём, как граф действий превращает промахи ИИ-агента в полезные подсказки и почему такой подход помогает дольше держать цель в сложных задачах.

OpenAI поделилась советами по промптингу для GPT-6 Astra и стоп-листом шаблонных слов

OpenAI опубликовала рекомендации по настройке GPT-6 Astra: модель чаще GPT-5.6 Sol задаёт уточняющие вопросы, лучше выполняет длинные инструкции, но чувствительнее к контексту и иногда останавливается раньше ожидаемого. В документации советуют явно склонять её к действиям, проверять файлы навыков и контекстные документы, задавать приоритет инструкций пользователя и отдельно настраивать стиль текста. OpenAI также предложила отладочный запрос, список нежелательных шаблонных выражений и рекомендации для задач по программированию, где GPT-6 Astra может запускать слишком много тестов.

Новая погодная ИИ-модель Google: забыть зонт больше не оправдание

Google DeepMind и Google Research выпустили WeatherNext 3 — новую модель ИИ для прогнозирования погоды. Она точнее отслеживает изменения в атмосфере, строит прогнозы с разрешением до 5 км, улучшила оценку дождя на 60% по сравнению с WeatherNext 2 и формирует данные каждый час вместо одного раза в шесть часов. Google планирует использовать модель в погодной информации Поиска, Google Maps и Gemini, а также открыть её пользователям и исследователям через облачные платформы. На бенчмарке Operational WeatherBench WeatherNext 3 обошла другие модели ИИ и традиционные прогнозы.

Почему каждому студенту нужен ИИ-репетитор

Хороший ИИ-репетитор — это не тот, кто просто много знает, а тот, кто понимает, как именно учить именно вас. Авторы предлагают способ делать для каждого ученика его цифрового двойника: такую модель, которая не только похожа на его обычные ответы, но и правдоподобно меняется после подсказки, объяснения или исправления. Это помогает заранее проверять, какой стиль помощи лучше сработает для конкретного человека, не тратя время на долгие и дорогие пробы на живых студентах. В этом обзоре разбираем, как создают таких цифровых учеников, зачем они нужны ИИ-репетиторам и почему без личной подстройки обучение быстро упирается в потолок.

ИИ-персоны исследуют психологическую основу шкалы осознанности Лангера

Генеративный ИИ и большие языковые модели могут использоваться как виртуальные участники психологических экспериментов. В мини-исследовании 1 000 разнообразных ИИ-персон прошли шкалу осознанности Лангера (LMS), и их результаты оказались смещены к средним и высоким значениям, а не распределились равномерно. Вероятной причиной автор считает скрытое влияние обучения с подкреплением на основе обратной связи от людей (RLHF): во время настройки моделей люди обычно положительно оценивают любознательность и гибкость. Это показывает, что ИИ-персон для психологических исследований нужно создавать особенно тщательно, иначе результаты окажутся искажены.

Автоматическая отладка улучшила ИИ-агентов на 10%

ИИ-агенты часто проваливают длинные задачи не из-за одной большой ошибки, а потому что мелкие сбои постепенно накапливаются. Авторы предлагают способ автоматически улучшать всё, что окружает агента: подсказки, инструменты и правила управления его действиями. Система изучает следы неудачных попыток, находит причину сбоя, вносит точечные изменения и проверяет, действительно ли они помогают. Такой подход избавляет разработчиков от долгого ручного поиска настроек и делает агентов надёжнее в сложных задачах. В этом обзоре разбираем, как автоматическая отладка помогает ИИ-агентам справляться с длинными цепочками действий и почему одних общих советов об ошибках для этого недостаточно.

Как миллионы виртуальных пользователей помогают заменить дорогие тесты на людях

Можно ли проверять ИИ и цифровые сервисы на миллионах «людей», не собирая каждый раз дорогие и долгие отзывы у живых пользователей? Исследователи предлагают большую систему с виртуальными пользователями, у каждого из которых свой характер, привычки, терпение и реакции. Эти пользователи могут отвечать на вопросы, общаться с ИИ-помощником, пользоваться сайтом или приложением и показывать, где человек уйдёт, где засомневается, а где простит ошибку. Такой подход помогает увидеть не среднюю температуру по больнице, а то, как один и тот же продукт воспринимают очень разные люди. В этом обзоре разбираем, как устроена такая проверка на виртуальных пользователях, откуда берутся их профили и насколько их поведение похоже на поведение реальных людей.

Ваша LLM умнее, чем кажется — вы просто используете ее неправильно

Когда важен не только мозг, но и «обвязка» вокруг него. Как Meta-Harness автоматизирует создание harness для LLM. В разговорах об ИИ мы почти всегда обсуждаем сами LLM: размер, качество данных, архитектуру и скорость. Но в реальных приложениях на итоговую полезность влияет ещё один слой — harness. Это кодовая «обвязка» вокруг модели, которая…

Инженирия контекста для саморазвивающихся ИИ-агентов

За последние два года стало ясно: многие приложения на базе больших языковых моделей лучше учатся не через дообучение весов, а через заботливую работу с контекстом. В контекст мы кладем системные инструкции, шаги рассуждений, примеры, доменные правила, факты, даже подсказки по работе с…