Разработчики из Сбера и AIRI представили открытый инструмент для проверки обучающих данных
SplitLight обещает сэкономить миллионы на неудачных экспериментах с нейросетями
Специалисты Центра практического искусственного интеллекта Сбербанка вместе с коллегами из Института AIRI выложили в открытый доступ программу, которая позволяет проверить качество данных до того, как на них начнут обучать нейросеть. Инструмент получил название SplitLight.
Суть разработки проста. Перед запуском любого эксперимента с искусственным интеллектом данные нужно разделить на обучающую и тестовую выборки. Если на этом этапе закралась ошибка, все дальнейшие результаты пойдут насмарку. SplitLight как раз помогает отловить такие огрехи на берегу.
Проверка занимает минуты, а не дни. Разработчик видит, где в данных сбои, где временные метки сдвинуты, где события задваиваются. Программа находит аномалии, которые обычно ускользают от ручной проверки, и показывает, насколько выборка вообще реалистична.
Работать с инструментом можно двумя способами. Либо как с обычной библиотекой на Python, либо через интерактивный интерфейс, где код писать не придется вовсе. Для команд, которые не хотят глубоко погружаться в технические детали, второй вариант выглядит особенно удобным.
Руководитель направления по AI-трансформации Сбербанка Сергей Рябов пояснил, зачем вообще нужна такая диагностика. По его словам, для продуктовых команд в маркетплейсах, стриминговых сервисах и медиа это способ защититься от дорогостоящих провалов. Быстрая проверка данных, выбор правильного сплита и подтверждение того, что тест приближен к реальной жизни, — все это снижает риски перед запуском масштабных экспериментов.
Интересная деталь: SplitLight умеет фиксировать результаты между разными исследованиями. Это позволяет сравнивать итоги экспериментов между собой и видеть, не ухудшилась ли модель со временем.
Проблема некачественных данных в машинном обучении стоит острее, чем кажется. Ошибки в подготовке выборок часто всплывают уже после того, как потрачены вычислительные мощности и время специалистов. Иногда команды месяцами бьются над улучшением модели, а причина плохих результатов лежит не в архитектуре, а в кривых данных.
SplitLight решает именно эту задачу. Он не обучает модель и не подсказывает, как улучшить алгоритм. Его работа — подсветить слабые места в данных, чтобы специалист успел их исправить до старта.
Инструмент уже доступен всем желающим. Исходный код открыт, так что любой разработчик может не только пользоваться программой, но и дорабатывать её под собственные нужды.
«SplitLight позволяет специалистам детально изучить данные и заранее выявить скрытые искажения. Для продуктовых команд в маркетплейсах, стримингах и медиа это надежная защита перед дорогими экспериментами: быстрая проверка данных, выбор корректного сплита и подтверждение, что тест приближен к реальности», — отметил Сергей Рябов.