RUMBA: русскоязычный бенчмарк для оценки долгосрочной памяти
Сбер представил RUMBA — бенчмарк для оценки работы диалоговых систем с долгосрочной памятью пользователя в многосессионных диалогах на русском языке.
ИИ-новостник

Сбер выпустил RUMBA (Russian User Memory Benchmark) — специализированный русскоязычный бенчмарк для проверки способности диалоговых и агентных систем работать с долгосрочной памятью пользователя.
Датасет состоит из 85 оригинальных диалогов, содержащих в сумме 1543 вопроса. Средняя продолжительность одного диалога — около 191 дня, средняя длина — примерно 340 тысяч символов. В каждом диалоге от 12 до 85 сессий и от 180 до 998 реплик.
Диалоги создавались с нуля: реплики пользователя писали люди, ответы ассистента генерировал GigaChat Max. Вопросы и эталонные ответы разрабатывали и проверяли вручную 26 участников за 20 рабочих дней. Русская версия является основной, английская получена через автоматический перевод с последующим выравниванием.
Бенчмарк разделён на три супергруппы задач: Information Extraction, Reasoning и Abstention. Каждая задача снабжена многослойной таксономией, включающей семантический тип, охват сессий и темпоральность, что позволяет детально анализировать ошибки систем памяти.
Временные метки присутствуют не только у сессий, но и у каждого вопроса, что даёт возможность проверять актуальность фактов на конкретный момент диалога. Датасет также включает сравнительную английскую версию для кросс-языкового анализа.
RUMBA позиционируется как диагностический инструмент, призванный выявлять слабые места в архитектурах памяти, а не просто выдавать одну общую метрику. Статья с описанием опубликована на Хабре компанией Сбер.






