AI-модельLLM65,536 токенов
Разработчик: rekaai
Технические параметры и возможности
Reka Flash 3 — компактная открытая reasoning-модель Reka для общего диалога, инструкций, программирования и задач, где полезно сначала рассуждать, а затем выдавать ответ. В публикации Reka она описана как модель на 21 миллиард параметров, обученная с нуля на общедоступных и синтетических данных, с последующей настройкой на отобранных примерах и reinforcement learning через RLOO. Такой набор сведений объясняет назначение модели, но не является гарантией качества на конкретном русском, юридическом или корпоративном наборе данных: перед внедрением нужны собственные тесты.
Поставщик заявляет контекст длиной 32K токенов для выпущенной версии. Это больше, чем у многих компактных моделей, но не отменяет контроля размера запроса: историю диалога, инструкции, retrieved-документы и ожидаемую выдачу нужно считать вместе. Hugging Face публикует модель в Llama-совместимом формате и приводит пример запуска через transformers; веса доступны для загрузки и изменения по лицензии Apache 2.0. Для локального развёртывания это означает возможность выбирать совместимый inference-стек, квантование и аппаратный профиль, однако конкретная скорость, потребление памяти и пропускная способность зависят от формата весов, GPU/CPU, длины контекста и настроек сервера.
Reasoning-поведение модели имеет отдельный практический контракт. В описании Reka говорится, что модель думает перед ответом и использует теги reasoning; бюджет можно ограничивать принудительным завершением рассуждения. Карточка Hugging Face дополнительно описывает prompt format, tokenizer cl100k_base и Llama-совместимый chat template. Интеграции должны выбрать один поддержанный формат и протестировать его на используемой версии библиотек: нельзя одновременно предполагать, что любой OpenAI-совместимый клиент автоматически правильно обработает reasoning-теги. Для задач с функциями официальное описание упоминает function calling, но доступность этого режима через конкретный маршрут OpenRouter или локальный сервер нужно проверять отдельно.
Сценарии применения — недорогой чат-помощник, генерация и разбор кода, классификация с объяснением, прототип локального ассистента и доменная модель, которую команда хочет дообучить или обернуть собственным контролем инструментов. Reka прямо указывает на низкую задержку и on-device deployment как целевые свойства. Это делает модель интересной там, где важны автономность и контроль инфраструктуры, но локальность не означает готовую безопасность: секреты, права доступа, сетевые вызовы и запись результата во внешние системы должны оставаться под контролем приложения.
Ограничения поставщик описывает явно. Модель прежде всего ориентирована на английский; другие языки она способна понимать в некоторой степени, но качество и стиль рассуждений на русском нельзя считать подтверждёнными без отдельной оценки. Она не считается лучшим выбором для knowledge-intensive задач, и Reka рекомендует сочетать её с web search для запросов, требующих актуальных знаний. Также заявлено, что модель не проходила обширное alignment- или persona-обучение. Поэтому для публичного помощника нужны фильтрация, тесты на нежелательные ответы, ограничение инструментов и проверка фактов. OpenRouter даёт отдельную запись доступности, а официальный материал Reka и карточка издателя описывают происхождение, формат и ограничения; перед публикацией интеграции всё равно сверяйте текущий model ID, лимиты, стоимость и фактическое поведение провайдера.
Официальные страницы, публикации СМИ и обсуждения сообщества