Яндекс показал, как ускоряет быстрые ответы Алисы в Поиске
Яндекс раскрыл детали претрейна Alice AI Search — системы, которая отвечает за быстрые ответы Алисы в Поиске. Команда объяснила, как ей удаётся выдавать короткий ответ за секунды даже при высокой нагрузке, и выложила в открытый доступ модель Alice AI-T5-35B-A0.6B Base.
Почему быстрые ответы Алисы нужно было перестраивать
Быстрый ответ Алисы AI — это один из самых массовых генеративных продуктов Яндекса и для многих пользователей Поиска первое знакомство с Алисой. Поэтому к нему особые требования: ответ должен быть не только полезным, но и очень быстрым, даже когда запросов много.
Чтобы этого добиться, команда Alice AI Search переработала весь путь генерации — от собственного претрейна с нестандартной архитектурой до онлайн-RL-обучения на сигналах реальных пользователей. Главная идея проста: Поиск должен не просто находить документы, а быстро превращать их в короткий и уместный ответ.
Как Поиск сокращает контекст для модели
Сначала система получает запрос и обращается к разным типам поиска, включая текстовый и поиск по изображениям. Затем отдельная модель просматривает найденные тексты и оставляет только те куски, которые действительно помогут ответить на вопрос. Внутри команды эти фрагменты называют инфоконтекстами.
Это важно, потому что языковая модель не читает результаты поиска как человек. Она обрабатывает весь переданный контекст последовательно, а чем он длиннее, тем дороже и медленнее генерация. Поэтому в июньском релизе Яндекс сделал ставку на короткие инфоконтексты: не тащить в ответ лишнее, а передавать только самое нужное.
Что изменили в модели и зачем открыли весы
Для отбора полезных фрагментов команда с нуля обучила компактную BERT-подобную модель примерно на 80 млн параметров. Обучение шло на массивном корпусе из 4 трлн токенов. После этого модель дообучили оценивать релевантность каждого токена в документе, а разметку для старта собрали с помощью open-source LLM.
Дальше Яндекс применил подход на основе Cross-Entropy RL, чтобы искать не просто релевантные, а наиболее полезные для генерации наборы фрагментов. В экспериментах такой способ дал более стабильное обучение, чем вариант с одной бинарной маской. В итоге компания выложила в открытый доступ модель Alice AI-T5-35B-A0.6B Base: её можно запускать через Hugging Face Transformers, но оптимизированный production-инференс пока доступен только внутри Яндекса. Для бизнеса и команд, работающих с ИИ, это полезный пример того, как скорость и качество ответа можно улучшать не только за счёт самой LLM, но и за счёт умного отбора контекста.