Модели · открытый код
Открытые модели, дообученные на ваших данных
Все внедряемые системы держатся на одном решении: мы не перепродаём доступ к чужому облаку, а разворачиваем открытые языковые модели на сервере предприятия и дообучаем их на его собственных данных. Ниже — что это значит на практике: от того, по какому принципу выбирается модель, до того, что происходит с вашими данными на каждом шаге.
Раздел
Выбор
Три вопроса
Что решает выбор в пользу открытых моделей
Первый вопрос — где лежат данные. Коммерческая тайна, чертежи, переписка с клиентами, номенклатура и цены — всё это не покидает контур предприятия, если модель развёрнута локально. Для предприятий, работающих с 152-ФЗ, гособоронзаказом или просто с режимом коммерческой тайны, отправка документов во внешний API нередко запрещена регламентом ИБ напрямую, а не является вопросом вкуса.
Второй — что будет при отключении внешнего сервиса. Закрытый API можно закрыть: из-за санкций, решения вендора или аварии на его стороне, и предприятие в этот момент теряет систему целиком. Открытая модель развёрнута на вашем сервере: её веса, окружение и версия остаются у вас, а обновляете вы их тогда, когда готовы сами, а не когда обновление прилетело извне.
Третий — чьё это железо и во что это обходится по деньгам. Облачные API считают по токену, и счёт растёт вместе с объёмом переписки и документов на потоке; за дообучение под свою нишу тоже платится отдельно и постоянно. Локальный сервер — это фиксированные вложения в железо один раз, а не переменные расходы, которые тем выше, чем прочнее система прижилась в работе.
7–32 B
параметров — рабочий диапазон моделей, которые целиком умещаются на одном сервере предприятия
4 раза
во столько раз меньше видеопамяти требует модель после 4-битного квантования против исходных весов
0
обращений во внешние API: обработка и данные не покидают контур предприятия
24 ГБ
видеопамяти обычно достаточно, чтобы держать в проде дообученную модель такого размера
Раздел
Устройство
От модели до продакшена
Как модель попадает в продакшен
Порядок один и тот же независимо от того, разбирает модель заявки из почты или объясняет находку по вибрации. На каждом шаге есть с чем сравнить результат — с базовой моделью, с прошлой версией адаптера, с решением, которое было до неё.
Первый фильтр
Выбор базовой модели
Смотрим на лицензию — она должна разрешать коммерческое использование без ограничений и без риска, что доступ отзовут задним числом. Дальше — качество на русском без прослойки перевода и совместимость с доступным железом. Чаще всего выбор падает на семейство Qwen: сильный русский язык из коробки и версии от нескольких до десятков миллиардов параметров.
Часы, не недели
Дообучение адаптером
Поверх базовой модели обучается LoRA- или QLoRA-адаптер размером в десятки-сотни мегабайт — вместо того чтобы пересчитывать все веса заново. Обучающая выборка — переписка, регламенты, номенклатура и терминология конкретного предприятия. На выборке в несколько тысяч примеров обучение занимает часы на одной видеокарте, а не недели на кластере.
На своих данных
Проверка на реальных примерах
Дообученную модель сравниваем с базовой на отложенной выборке настоящих писем и документов заказчика, а не на публичных бенчмарках — те устроены на общем языке и не отражают отраслевой словарь и сокращения снабженцев. Метрика сравнения — та же, что в задаче: например, точность разбора позиций, а не общая «грамотность» модели.
На сервере предприятия
Развёртывание с квантованием
Модель квантуется до 4–8 бит и разворачивается через Ollama или vLLM на сервере заказчика — без исходящего трафика и без зависимости от канала связи. Версии моделей и адаптеров хранятся у вас же, поэтому откат на предыдущую версию — это выбор файла, а не заявка в техподдержку.
FP16
28 ГБ
INT4
7 ГБ
Экономия
4 раза
- Размер модели
- 7–32 млрд параметров
- Контекст
- 32–128 тыс. токенов
- Квантование
- 4–8 бит
- Инференс
- Ollama, vLLM
- Адаптер дообучения
- LoRA, QLoRA
- Лицензии
- Apache 2.0, MIT
Раздел
Модели
Семейства
Какие модели в работе
Семейство выбирается под задачу, а не одно на все случаи — но большая часть внедряемых систем держится на одном и том же основании.
- Qwen. Основное семейство для задач на русском: сильный язык из коробки, версии от единиц до сотен миллиардов параметров, лицензия Apache 2.0 у большинства размеров. На нём собраны кейсы разбора заявок и планирования сменных заданий внедряемых систем.
- DeepSeek. Открытые веса под MIT-лицензией и заметно больший контекст; берём модели этого семейства, когда задача требует рассуждения в несколько шагов, а не короткого ответа по шаблону.
- Llama и Mistral. Запасной вариант, когда нужна модель другой архитектуры для сравнения качества на конкретной задаче, — обе линейки давно проверены в проде за пределами русского языка.
- Модели, дообученные под русский. Поверх этих же семейств российские команды выпускают версии, донастроенные на русскоязычных корпусах, — например T-lite и T-pro от Т-Банка, Vikhr от независимого сообщества. Их проверяем первыми, если в задаче много канцелярита и отраслевого жаргона.
Раздел
Вход
От заказчика
Что понадобится, чтобы дообучить модель
- Примеры переписки и документов. От нескольких сотен до нескольких тысяч реальных писем, заявок, регламентов или отчётов — без разметки в привычном смысле, просто репрезентативная выборка того, с чем модели предстоит работать.
- Сервер с видеокартой. Для модели на 7–14 млрд параметров обычно достаточно одной видеокарты с 16–24 ГБ памяти — она же используется и для дообучения, которое занимает часы машинного времени, а не постоянную мощность.
- Доступ и согласование ИБ. Выгрузка данных для дообучения — разовая операция внутри вашего же контура; нужен человек, который согласует, какие документы можно использовать.
- Эталонные примеры для проверки. Десяток-другой случаев с заведомо верным ответом — по ним меряется, стала ли дообученная модель лучше базовой на самом деле, а не на глаз.
Раздел
Развитие
Что дальше
Куда система растёт дальше
- RAG поверх модели. Когда база регламентов и документации большая и часто меняется, держать её в весах не нужно — достаточно подключить поиск по актуальной базе прямо перед ответом модели.
- Несколько адаптеров под разные задачи. Одна базовая модель — а поверх неё разные LoRA-адаптеры под разбор заявок, планирование, рапорты смены. Переключение между ними — это выбор файла, а не переобучение с нуля.
- Более крупная модель под тот же контур. Когда сервер и бюджет позволяют, дообучение переносится на модель покрупнее без изменения остального процесса — данные, способ оценки и развёртывание остаются те же.
- Полное дообучение вместо адаптера. Когда данных предприятия накопилось достаточно, часть слоёв модели дообучается напрямую — шаг, оправданный объёмом накопленной истории, а не желанием ускориться раньше времени.
Раздел
Ещё
Направления