Лёгкие модели (MobileNetV3, EfficientNet-B0)
Дообучение на 100 000 изображений занимает 4–6 GPU-часов на A10G. Себестоимость прогона ≈ 1 200 ₽. Оправдано для моделей, работающих на edge-устройствах и требующих частых обновлений.
Куем точность. Ускоряем успех. Разбираем, как посчитать реальную стоимость повышения accuracy модели и где дообучение окупается, а где только сжигает GPU-часы. Конкретные цифры по архитектурам, порогам и ROI.
Команда в производственной компании тратила 340 GPU-часов в месяц на дообучение модели дефектоскопии. Повышение accuracy с 94,1% до 95,8% окупало вычисления только на 61% — остальное уходило в «тихие» издержки: валидацию, редеплой и деградацию на новых партиях сырья.
Ниже — методика, по которой АймФордж считает экономику каждой модели: от себестоимости GPU-часа до порога, где дообучение перестаёт быть выгодным.
Одна и та же задача — классификация изображений — может стоить на порядок больше или меньше в зависимости от архитектуры. Ниже — усреднённые показатели по данным наших клиентов за Q2 2025.
Дообучение на 100 000 изображений занимает 4–6 GPU-часов на A10G. Себестоимость прогона ≈ 1 200 ₽. Оправдано для моделей, работающих на edge-устройствах и требующих частых обновлений.
Полный цикл дообучения — 22–38 GPU-часов (≈ 6 400–10 700 ₽). Оптимум: дообучать 1 раз в 2–4 недели, а не ежедневно. Дрейф данных чаще всего не требует пересборки весов целиком.
Один цикл — от 90 до 400 GPU-часов, стоимость 25 000–110 000 ₽. Здесь дообучение должно запускаться только по триггеру: падение метрики ниже порогового значения, а не по расписанию.
LoRA-дообучение — 8–15 GPU-часов, полный fine-tune — 200+ часов. Разница в себестоимости до 25 раз при сопоставимом приросте качества на 0,5–1%.
QLoRA на A100: 6–12 часов за цикл, ≈ 9 000–18 000 ₽. Критична стоимость валидации: 40% бюджета уходит на прогон тестовых наборов, а не на обучение.
У 68% наших клиентов 70% GPU-часов съедает 20% моделей. АймФордж автоматически ранжирует модели по «стоимости владения» и предлагает, какие дообучать в первую очередь.
Главная ошибка — путать «модель стала чуть хуже» с «модель требует дообучения». В большинстве случаев дешевле и быстрее калибровать порог или пересобрать фичи.
Дрейф данных > 15% по ключевым фичам, метрика упала ниже SLA (например, F1 < 0,82 при требовании 0,85), изменился бизнес-процесс или добавились новые классы. Здесь дообучение — единственный рабочий путь.
Смещение распределения выходных меток (class imbalance), сезонные колебания < 10%, деградация из-за изменения порогов. Во всех трёх случаях достаточно калибровки или A/B-теста порогов — в 0,001% стоимости полного дообучения.
Постепенный дрейф 5–15%. Решение зависит от стоимости ошибки: в финтехе даже 5% дрейфа — повод для дообучения, в рекомендательных системах допустимо наблюдать 2–3 цикла мониторинга.
GPU-часов в среднем сжигает команда на дообучение в месяц
дообучений окупается полностью в течение квартала
средняя доля GPU-бюджета, которую можно спасти калибровкой
разница между LoRA и полным fine-tune по себестоимости
Дообучение — это только вершина айсберга. В среднем 45% GPU-бюджета уходит на вспомогательные операции: валидацию, генерацию отчётов и редеплой. Их можно выжать без потери качества.
Полный прогон тестового набора не обязателен на каждом шаге. Стратифицированная выборка в 10–15% даёт статистически значимую оценку метрик и сокращает валидацию в 7–8 раз.
Переключение на FP16/BF16 ускоряет дообучение на 30–45% без потери > 0,1% accuracy. Для LLM — QLoRA вместо полного fine-tune экономит до 80% памяти и времени.
Не блокируйте продакшн на время дообучения. Канареечный деплой новой версии на 5% трафика позволяет собрать реальные метрики до полного переключения.
Короткие «спаркинг»-прогоны (2–3 эпохи) на новой партии данных показывают, стоит ли запускать полное дообучение. Стоимость — 5–8% от полного цикла.
Для моделей с дисбалансом классов дообучивайте только «проблемные» классы, а не всю модель целиком. Экономия 40–60% GPU-часов.
Кэширование промежуточных активаций между запусками сокращает время подготовки данных на 25%. Особенно эффективно при частом дообучении на похожих наборах.
Таблица ниже — ориентир по типовым сценариям. Абсолютные цифры зависят от объёма трафика и стоимости ошибки, но соотношение «стоимость дообучения / выгода» стабильно.
| Сценарий | Прирост accuracy | Стоимость дообучения | Выгода / мес. | ROI |
|---|---|---|---|---|
| Детекция дефектов на производстве | 94,1% → 95,8% | 38 000 ₽ | 210 000 ₽ | 5,5× |
| Антифрод в финтехе | 97,2% → 98,4% | 145 000 ₽ | 1 840 000 ₽ | 12,7× |
| Рекомендательная система | 41,3% → 42,1% | 52 000 ₽ | 38 000 ₽ | 0,7× |
| Классификация документов | 88,5% → 89,7% | 27 000 ₽ | 96 000 ₽ | 3,5× |
| Chatbot / LLM-ассистент | 78,0% → 79,2% | 18 000 ₽ (QLoRA) | 112 000 ₽ | 6,2× |
| Прогноз спроса в ритейле | 91,4% → 92,0% | 64 000 ₽ | 41 000 ₽ | 0,6× |
* Расчёты на данных 42 клиентов АймФордж, период июль 2024 — июнь 2025. Стоимость дообучения включает GPU-часы, валидацию и редеплой. Выгода — снижение стоимости ложных срабатываний и ручных переопераций.
Мы не просто мониторим модели — мы считаем, сколько каждая из них стоит бизнесу. Четыре инструмента, которые превращают «модель работает» в «модель окупается».
Панель, где каждая модель ранжирована по себестоимости владения: GPU-часы, стоимость валидации, частота редеплоя. Видно, какие 20% моделей съедают 70% бюджета.
Вводите стоимость ошибки и объём трафика — инструмент считает, какой прирост accuracy окупает дообучение за 30/60/90 дней. Интегрируется с биллингом AWS/GCP/Azure.
Алгоритм решает, что делать при дрейфе: дообучение, калибровка порогов или наблюдение. Решение обосновывается конкретной суммой экономии.
Быстрый 2-эпоховый прогон на новых данных до полного дообучения. Показывает прогнозный прирост метрики и стоимость полного цикла. Блокирует запуск, если ROI < 1,5×.
Уведомления, когда модель выходит за месячный бюджет на вычисления. Можно задать жёсткий лимит — платформа автоматически перейдёт на LoRA/квантизацию или приостановит цикл.
Автоматический отчёт для руководства: сколько GPU-часов потрачено, сколько окупилось, какие модели кандидатны на отключение или миграцию на более лёгкую архитектуру.
Берём фактические тарифы вашего облака (AWS, GCP, Azure или on-prem) и умножаем на реальное время занятости GPU, включая валидацию, генерацию артефактов и редеплой. Итог — полная себестоимость одного цикла дообучения.
Сначала пробуем калибровку порогов и пересборку фичей — это стоит в 1000 раз дешевле. Если и это не помогает, модель кандидатна на миграцию на более лёгкую архитектуру или на отключение.
Да. Для on-prem мы считаем стоимость по полной себестоимости владения (амортизация + электричество + обслуживание). Для облака — по фактическому биллингу через API.
Автоматически — после каждого цикла дообучения и при изменении объёма трафика более чем на 20%. Quarterly Report собирает данные за квартал для стратегических решений.
Да. Для LLM считаем QLoRA и полный fine-tune отдельно, для диффузионных — LoRA и full-adapter. Стоимость валидации учитывается отдельно, так как для генеративных моделей она занимает до 40% бюджета.
Подключите Cost Dashboard за 15 минут и узнайте, какие модели в вашем парке реально окупаются, а какие — только сжигают бюджет. Первый расчёт ROI — бесплатно.
Получить расчёт ROI