Инструктивная MoE-модель, которая активирует всего 3,8 млрд параметров из 25,2 млрд на каждый токен. Она обеспечивает качество рассуждений уровня крупных систем при высокой скорости работы и экономии ресурсов.
Контекст: 262 144 токенов.