Эмоции на длинной дистанции: как ИИ учится быть эмпатичным

Большая часть проверок эмоционального интеллекта у LLM сосредоточена на коротких, аккуратно размеченных фразах. В реальности всё сложнее: люди говорят долго, отвлекаются, меняют тему, возвращаются к старым переживаниям. На такой дистанции модели начинают терять важные намёки, путают причины и следствия и редко выдерживают цельную линию поддержки. Авторы LongEmotion предлагают именно такой стресс‑тест — бенчмарк с длинными, шумными и эмоционально насыщенными сценариями.

Что такое LongEmotion
Бенчмарк покрывает шесть задач, каждая проверяет свой аспект эмоционального интеллекта:
- распознавание эмоций в большом тексте, где полезный фрагмент утонул в контексте;
- обнаружение «выбивающегося» по эмоции отрывка среди похожих;
- ответы на вопросы по психологическим источникам;
- длинный консультативный диалог из четырёх стадий с психологическими критериями оценки;
- суммаризация эмоционально значимых аспектов клинических отчётов;
- выражение эмоций: самооценка и длинный нарратив из пяти фаз.
Средняя длина входов достигает 8–12 тысяч токенов, а местами — существенно больше. Это не игрушечные реплики, а полноценные тексты, где важно удерживать дальние связи, не терять нюансы и внятно завершать мысль.

Две инженерные идеи: RAG без внешней базы и CoEM
Чтобы помочь моделям не утонуть в длинном диалоге, авторы предложили два подхода.
Во‑первых, Retrieval‑Augmented Generation в необычном варианте: источником «извлечения» служит сам диалог и память модели, без внешних баз знаний. Идея простая: не надо тянуть всё сразу — выделяй локально релевантные куски, работай с ними и не вноси лишний шум.
Во‑вторых, мультиагентная система CoEM. Это пятиступенчатый конвейер: разбиение текста, первичное ранжирование, обогащение эмоциональными и теоретическими сигналами (от отдельного помощника), повторное ранжирование и финальная генерация ответов ансамблем. Такой «оркестратор эмоций» помогает модели удерживать смысловую линию и тон, но делает это дозированно, без утечки готовых ответов.

Что показали опыты
- В распознавании и обнаружении эмоций CoEM даёт самый заметный прирост: структурированное обогащение помогает выцеплять тонкие эмоциональные сигналы среди лишнего контента.
- В задачах, где ответ жёстко привязан к исходному тексту (вопросы‑ответы, суммаризация), излишние «подсказки» могут вредить: лишний фон портит F1 и снижает согласие с источником.
- В длинном консультативном диалоге неожиданно сильны Qwen‑3 8B и Llama‑3.1‑8B‑Instruct: они стабильно держат линию разговора, местами обходя GPT‑4o по средним баллам этапов. Пиковый прогресс заметен на завершающей стадии, где важны интеграция смысла и аккуратное закрытие сессии.
- На генерации эмоциональных текстов многое решает «качество мудреца» в CoEM. Когда роль обогащающего ассистента исполняет сильная модель, итоговая речь получается связной, менее повторяющейся и богаче по эмоциональным деталям.


Отдельная линия — сравнение версий GPT. По сводным результатам расширенная версия GPT‑5 лучше рассуждает в чистых классификациях, но в вопросах‑ответах иногда «переписывает» по своему пониманию и теряет баллы к эталону. В диалоге GPT‑5 сильнее по теоретическим критериям терапии, однако звучит чуть менее эмпатично. GPT‑4o‑mini, напротив, местами даёт более человеческий тон. Это подчёркивает: эмоциональный интеллект — не только логика, но и стиль, забота о человеке и умение закрыть тему без резких углов.

На что смотреть практикам
- Если у вас длинные чаты поддержки, стоит использовать «внутренний» RAG по истории диалога. Это снижает шум и помогает не терять главные нити.
- Для классификаций и обнаружения аномальных эмоций — лучше CoEM: мультиагентное обогащение делает признаки заметнее.
- Для QA и суммаризации следите за дозировкой обогащающих подсказок: слишком разговорчивый помощник перестраивает ответ под себя.
- Модели по‑разному ведут себя на длинных входах: стабильность не всегда у «самой большой» версии. Тестируйте на своих диапазонах длины.
Ограничения и планы
Авторы честно показывают, что автооценка ответов (LLM как судья) пусть и хорошо коррелирует с экспертами, но остаётся уязвимой к выбору модели‑оценщика. Дальше команда собирается расширять набор моделей, публиковать данные и уточнять методики. Практически это важный шаг к системной проверке «эмоциональной памяти» ИИ на длинных дистанциях.

Читайте также
ИИ-агенты выходят на рынок: как строится новая агентная экономика
Как мозг предсказывает следующее слово и при чем тут ИИ
Как обучение с подкреплением перестраивает мышление LLM
Агенты без скриптов: что происходит, когда ИИ сталкивается с реальностью
Репозитории на автопилоте: как ИИ сам поднимает окружение и запускает код
Как ИИ начинает понимать чёрный юмор
Как оживить научные статьи: превращаем исследования в интерактивных ИИ-ассистентов
Что скрыто за характером LLM: читаем поведенческие отпечатки
Почему LLM врут с умным видом
Глубокие исследования без границ: выбираем свою LLM и управляем стратегией поиска
ИИ как соавтор: как агенты меняют науку прямо сейчас
Vision Language World Model: язык как картина мира
Почему Text-to-SQL до сих пор ломается и как это исправить
Увидел-кликнул-победил: как UItron управляет компьютером по-человечески
Аккуратные дипфейки: как невидимые подмены лиц рушат доверие к видео
Как Avengers‑Pro превращает зоопарк LLM в супер-роутер за счёт одного ползунка
Как построить мультиагентную систему, которая реально работает без магии и костылей
Как дообучать LLM на лету с помощью памяти вместо файнтюнинга
Нажал — и мир двинулся: Matrix-Game 2.0 делает видео интерактивным в реальном времени
ИИ-обзоры статей
Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день.
В Telegram