Расписанные дообучки
Планировщик запускает дообучение по календарю или по событию. Для модели скоринга «ФинГард-3» цикл срабатывает каждые 48 часов и при отклонении AUC ниже 0,86.
Три взаимосвязанных модуля — «Кузня», «Прицел» и «Выстрел» — закрывают полный цикл жизни модели: от автоматической дообучки весов до real-time контроля качества и безопасного развертывания. Разбираем, как каждый работает и как они образуют единую систему.
АймФордж не просто наблюдает за вашими моделями. Модуль «Кузня» дообучает и калибрует веса, модуль «Прицел» в реальном времени ловит дрейф данных и деградацию качества, а модуль «Выстрел» безопасно сравнивает версии через A/B-тесты и автоматически откатывает проблемные релизы. Три модуля, работающие как единый конвейер, превращают модель из статичного артефакта в систему, которая самокорректируется.
«Кузня» перезапускает дообучение по расписанию или по триггеру, когда «Прицел» фиксирует дрейф. Система сама собирает свежие размеченные примеры, подстраивает веса и применяет калибровку вероятностей — от изотонической регрессии до метода temperature scaling — чтобы прогноз оставался честным и предсказуемым.
Планировщик запускает дообучение по календарю или по событию. Для модели скоринга «ФинГард-3» цикл срабатывает каждые 48 часов и при отклонении AUC ниже 0,86.
Автоматический подбор метода калибровки: изотоническая регрессия, temperature scaling или Platt scaling. Калибровочная кривая пересчитывается на каждом релизе весов.
Каждый новый набор весов проходит проверку на эталонном наборе из 240 000 примеров. Если метрики хуже базовых, дообучка отклоняется и логируется в журнал «Кузни».
«Прицел» анализирует поток входящих данных и предсказаний со средней задержкой 9 мс. Он отслеживает распределения признаков,PSI-индексы и расхождение между ожидаемым и фактическим качеством, чтобы деградацию ловили до того, как она ударит по бизнесу.
Сравнение распределений в реальном времени через PSI и KL-дивергенцию. Порог срабатывания настраивается на каждый признак — по умолчанию 0,25.
Скользящие метрики AUC, F1 и калибровочное расхождение (ECE). При падении ECE выше 0,05 «Прицел» поднимает алерт и уведомляет дежурную смену.
События уходят в Slack, PagerDuty и webhook. Критический дрейф автоматически запускает дообучку в «Кузне» и ставит «Выстрел» в режим наблюдения.
«Выстрел» разделяет трафик между текущей и новой версией модели, собирает сравнительные метрики и принимает решение о запуске или откате. Если новая версия проигрывает по ключевому KPI или «Прицел» фиксирует аномалию, трафик автоматически возвращается к стабильной версии.
Гибкое распределение от 1% до 100% с фиксированным посевным числом. Для A/B-теста «ФинГард-3» vs. «ФинГард-4» использовалось 50/50 на 1,2 млн запросов в сутки.
Правило отката настраивается на любой KPI. Если F1 новой версии ниже базовой на 1,5 п.п. в течение 30 минут, «Выстрел» возвращает 100% трафика к старой версии за < 5 секунд.
По завершении теста формируется отчет: разброс метрик, статистическая значимость (p-value) и рекомендация по запуску. Отчет архивируется и доступен по API.
Средняя задержка «Прицела»
Время автоматического отката
Цикл дообучки «Кузни»
Примеров в эталонном наборе
Модули связаны единой шиной событий и общим хранилищем метрик. Данные из источников (Kafka, S3, PostgreSQL) поступают в «Прицел», который при аномалии инициирует дообучку в «Кузне». Готовые веса проходят проверку регрессии и попадают в «Выстрел» для A/B-тестирования. После успешного теста новая версия становится основной, а весь журнал решений сохраняется для аудита.
Модули обмениваются сигналами через Kafka-топики: drift.detected, retrain.requested, abtest.result. Задержка передачи сигнала — не более 200 мс.
Все показатели (PSI, ECE, F1, p-value) складываются в единый временной ряд в TimescaleDB. Доступ к данным — через REST и gRPC API.
Готовые коннекторы для AWS, Google Cloud и Azure; поддержка Python, TensorFlow, PyTorch и ONNX. Разворачивание — в облаке или on-premise.
За 4 минуты показываем, как выглядит работа модулей вживую: дашборд «Прицела» с live-графиками дрейфа, сценарий дообучки в «Кузне» и запуск A/B-теста с автоматическим откатом в «Выстреле». Ниже — ключевые кадры из обзора.
Live-графики PSI по признакам и скользящее ECE. Раздел «Алерты» показывает три сработавших триггера за последние сутки.
Пошагово: сбор размеченных примеров, запуск дообучки, калибровка и проверка регрессии на 240 000 эталонных примеров.
Разделение трафика 50/50, сравнение F1 двух версий и автоматический возврат к стабильной версии при падении метрик.
Да. Каждый модуль работает автономно. Но в связке они дают максимальный эффект: «Прицел» запускает «Кузню», а «Выстрел» безопасно закрывает цикл развертывания.
Поддерживаются стандартные экосистемы Python, TensorFlow, PyTorch и ONNX. Интеграция происходит через SDK и REST/gRPC API.
Откат занимает менее 5 секунд: «Выстрел» мгновенно перенаправляет 100% трафика к стабильной версии и фиксирует событие в журнале аудита.
Присоединяйтесь к командам, которые доверяют АймФордж калибровку и мониторинг своих нейросетей. Куем точность. Ускоряем успех.
Связаться с нами