ЦЕХ.ИИ

Модели · открытый код

Открытые модели, дообученные на ваших данных

Все внедряемые системы держатся на одном решении: мы не перепродаём доступ к чужому облаку, а разворачиваем открытые языковые модели на сервере предприятия и дообучаем их на его собственных данных. Ниже — что это значит на практике: от того, по какому принципу выбирается модель, до того, что происходит с вашими данными на каждом шаге.

Раздел

Выбор

Три вопроса

Что решает выбор в пользу открытых моделей

Первый вопрос — где лежат данные. Коммерческая тайна, чертежи, переписка с клиентами, номенклатура и цены — всё это не покидает контур предприятия, если модель развёрнута локально. Для предприятий, работающих с 152-ФЗ, гособоронзаказом или просто с режимом коммерческой тайны, отправка документов во внешний API нередко запрещена регламентом ИБ напрямую, а не является вопросом вкуса.

Второй — что будет при отключении внешнего сервиса. Закрытый API можно закрыть: из-за санкций, решения вендора или аварии на его стороне, и предприятие в этот момент теряет систему целиком. Открытая модель развёрнута на вашем сервере: её веса, окружение и версия остаются у вас, а обновляете вы их тогда, когда готовы сами, а не когда обновление прилетело извне.

Третий — чьё это железо и во что это обходится по деньгам. Облачные API считают по токену, и счёт растёт вместе с объёмом переписки и документов на потоке; за дообучение под свою нишу тоже платится отдельно и постоянно. Локальный сервер — это фиксированные вложения в железо один раз, а не переменные расходы, которые тем выше, чем прочнее система прижилась в работе.

7–32 B

параметров — рабочий диапазон моделей, которые целиком умещаются на одном сервере предприятия

4 раза

во столько раз меньше видеопамяти требует модель после 4-битного квантования против исходных весов

0

обращений во внешние API: обработка и данные не покидают контур предприятия

24 ГБ

видеопамяти обычно достаточно, чтобы держать в проде дообученную модель такого размера

Раздел

Устройство

От модели до продакшена

Как модель попадает в продакшен

Порядок один и тот же независимо от того, разбирает модель заявки из почты или объясняет находку по вибрации. На каждом шаге есть с чем сравнить результат — с базовой моделью, с прошлой версией адаптера, с решением, которое было до неё.

Первый фильтр

Выбор базовой модели

Смотрим на лицензию — она должна разрешать коммерческое использование без ограничений и без риска, что доступ отзовут задним числом. Дальше — качество на русском без прослойки перевода и совместимость с доступным железом. Чаще всего выбор падает на семейство Qwen: сильный русский язык из коробки и версии от нескольких до десятков миллиардов параметров.

Часы, не недели

Дообучение адаптером

Поверх базовой модели обучается LoRA- или QLoRA-адаптер размером в десятки-сотни мегабайт — вместо того чтобы пересчитывать все веса заново. Обучающая выборка — переписка, регламенты, номенклатура и терминология конкретного предприятия. На выборке в несколько тысяч примеров обучение занимает часы на одной видеокарте, а не недели на кластере.

На своих данных

Проверка на реальных примерах

Дообученную модель сравниваем с базовой на отложенной выборке настоящих писем и документов заказчика, а не на публичных бенчмарках — те устроены на общем языке и не отражают отраслевой словарь и сокращения снабженцев. Метрика сравнения — та же, что в задаче: например, точность разбора позиций, а не общая «грамотность» модели.

На сервере предприятия

Развёртывание с квантованием

Модель квантуется до 4–8 бит и разворачивается через Ollama или vLLM на сервере заказчика — без исходящего трафика и без зависимости от канала связи. Версии моделей и адаптеров хранятся у вас же, поэтому откат на предыдущую версию — это выбор файла, а не заявка в техподдержку.

Модель на 14 млрд параметров · память под веса

4-битное квантование

FP16

28 ГБ

INT4

7 ГБ

Экономия

4 раза

Схема принципа, а не измерение на конкретной модели: точные цифры зависят от архитектуры и формата квантования.
Размер модели
7–32 млрд параметров
Контекст
32–128 тыс. токенов
Квантование
4–8 бит
Инференс
Ollama, vLLM
Адаптер дообучения
LoRA, QLoRA
Лицензии
Apache 2.0, MIT

Раздел

Модели

Семейства

Какие модели в работе

Семейство выбирается под задачу, а не одно на все случаи — но большая часть внедряемых систем держится на одном и том же основании.

  • Qwen. Основное семейство для задач на русском: сильный язык из коробки, версии от единиц до сотен миллиардов параметров, лицензия Apache 2.0 у большинства размеров. На нём собраны кейсы разбора заявок и планирования сменных заданий внедряемых систем.
  • DeepSeek. Открытые веса под MIT-лицензией и заметно больший контекст; берём модели этого семейства, когда задача требует рассуждения в несколько шагов, а не короткого ответа по шаблону.
  • Llama и Mistral. Запасной вариант, когда нужна модель другой архитектуры для сравнения качества на конкретной задаче, — обе линейки давно проверены в проде за пределами русского языка.
  • Модели, дообученные под русский. Поверх этих же семейств российские команды выпускают версии, донастроенные на русскоязычных корпусах, — например T-lite и T-pro от Т-Банка, Vikhr от независимого сообщества. Их проверяем первыми, если в задаче много канцелярита и отраслевого жаргона.

Раздел

Вход

От заказчика

Что понадобится, чтобы дообучить модель

  • Примеры переписки и документов. От нескольких сотен до нескольких тысяч реальных писем, заявок, регламентов или отчётов — без разметки в привычном смысле, просто репрезентативная выборка того, с чем модели предстоит работать.
  • Сервер с видеокартой. Для модели на 7–14 млрд параметров обычно достаточно одной видеокарты с 16–24 ГБ памяти — она же используется и для дообучения, которое занимает часы машинного времени, а не постоянную мощность.
  • Доступ и согласование ИБ. Выгрузка данных для дообучения — разовая операция внутри вашего же контура; нужен человек, который согласует, какие документы можно использовать.
  • Эталонные примеры для проверки. Десяток-другой случаев с заведомо верным ответом — по ним меряется, стала ли дообученная модель лучше базовой на самом деле, а не на глаз.

Раздел

Развитие

Что дальше

Куда система растёт дальше

  • RAG поверх модели. Когда база регламентов и документации большая и часто меняется, держать её в весах не нужно — достаточно подключить поиск по актуальной базе прямо перед ответом модели.
  • Несколько адаптеров под разные задачи. Одна базовая модель — а поверх неё разные LoRA-адаптеры под разбор заявок, планирование, рапорты смены. Переключение между ними — это выбор файла, а не переобучение с нуля.
  • Более крупная модель под тот же контур. Когда сервер и бюджет позволяют, дообучение переносится на модель покрупнее без изменения остального процесса — данные, способ оценки и развёртывание остаются те же.
  • Полное дообучение вместо адаптера. Когда данных предприятия накопилось достаточно, часть слоёв модели дообучается напрямую — шаг, оправданный объёмом накопленной истории, а не желанием ускориться раньше времени.

Обсудим вашу площадку?

Написать нам