Создан инструмент, выявляющий дефекты в данных до обучения ИИ-моделей

Открытый инструмент для диагностики данных перед обучением и сравнением рекомендательных моделей разработали специалисты Центра практического искусственного интеллекта Сбербанка и Института AIRI.
Об этом пишет ТАСС. В пресс-службе Сбера сообщили изданию:
Для продуктовых команд в маркетплейсах, стримингах и медиа — это надежная защита перед дорогими экспериментами: быстрая проверка данных, выбор корректного сплита и подтверждение того, что тест приближен к реальности. Это снижает риск внедрения моделей, эффективных лишь на бумаге. Исследовательским группам SplitLight упрощает документирование, воспроизводимость и сравнение с публикациями, а также позволяет анализировать сторонние датасеты для корректной оценки своих решений.
Инструмент находит сбои в логировании, смещенные временные метки и дубли событий, влияющие на итоговые метрики, фиксирует ключевые статистические характеристики используемого подхода к подготовке выборки, и помогает определить, попадают ли в обучающую выборку данные из будущего, учитываются ли новые пользователи и объекты, а также насколько различаются тренировочная и валидационная выборки.
SplitLight уже протестировали на шести популярных открытых наборах данных и выяснили, даже незначительные изменения в разбиении данных заметно влияют на метрики и оценку качества модели.
изображение magnific
Теги: дефекты данных ии-модели обучение





