Перейти к основному содержимому

Мусор на входе, миллионы убытков на выходе: реальная цена пропуска оценки качества данных

Image 1: Himadri Roy

6 мин чтения

5 часов назад

Большинство моделей ИИ настолько хороши, насколько хороши их обучающие данные. Большинство организаций осознают это слишком поздно.

В 2023 году на Amazon появилась серия книг о собирательстве, написанных ИИ. Они были связными, хорошо оформленными и выглядели как легитимные руководства. В них также содержались советы о грибах, которые могли вас убить.

Проблема была не в качестве письма. Проблема была в качестве данных — а точнее, в полном отсутствии контроля качества данных в процессе обучения. Модель обучалась на большом корпусе текстов, который включал дезинформацию, устаревшие советы и контент из источников без предметной экспертизы. Модель не могла отличить миколога от блогера, прочитавшего три статьи. Она училась у всего с одинаковой уверенностью.

Никто не умер — насколько нам известно. Но этот пример с кристальной ясностью иллюстрирует последствия развертывания ИИ, обученного на данных, которые никогда не подвергались строгой оценке.

Мусор на входе, мусор на выходе — старейший принцип в вычислениях. В ИИ он должен быть самым громким. Но так бывает редко.

Почему оценивать качество данных в ИИ сложнее, чем в традиционной аналитике

В традиционной аналитике проблемы с качеством данных относительно легко выявить и количественно оценить. Отсутствующее поле — это отсутствующее поле. Выброс — это выброс. Влияние локально — одно неверное число в отчете.

В ИИ проблемы с качеством данных носят системный характер. Смещение в обучающих данных приводит не к одному неверному результату — оно порождает систематически искаженную модель, которая постоянно выдает неверные результаты в шаблоне, который может быть незаметен до развертывания модели. Неправильно размеченный обучающий пример не портит одно предсказание — он вносит шум в процесс обучения, влияя на общую способность модели к обобщению.

Случай с ImageNet является показательным. ImageNet — один из самых важных обучающих наборов данных в истории ИИ, используемый для обучения фундаментальных моделей компьютерного зрения. Исследование 2019 года выявило систематические ошибки маркировки в ImageNet: приблизительно 5,8% изображений были неправильно помечены. Пять процентов звучит как небольшая цифра. В наборе из 14 миллионов изображений это около 800 000 неправильно размеченных обучающих примеров — активно обучающих модели неверным шаблонам.

Девять измерений качества данных

Качество данных не является единым атрибутом. Оно имеет множество измерений, каждое из которых имеет разное значение в зависимости от создаваемого приложения ИИ. Понимание этих измерений — и оценка ваших обучающих данных по каждому из них — это то, что на практике означает оценка качества данных.

  • Точность: правильно ли данные отражают реальное явление, которое они должны представлять? Для обучающих данных это означает, что метки истинности верны, значения отражают фактические измерения и отсутствуют систематические ошибки в сборе данных.

  • Полнота: все ли обязательные поля присутствуют? Пропущенные значения в обучающих данных создают не просто пробелы — они могут смещать модель в сторону прогнозирования на основе имеющихся данных, систематически ухудшая результаты для случаев, где данные отсутствуют.

  • Согласованность: согласованы ли данные между источниками и во времени? Несогласованность проявляется, когда одна и та же сущность отображается по-разному в разных записях — разные форматы для одной даты, разные единицы для одного измерения, разные написания одного имени.

  • Своевременность: отражают ли данные текущую реальность? Исторические данные, которые больше не отражают текущие шаблоны, будут обучать модель на мире, который больше не существует. Это особенно остро для моделей, обученных на данных до пандемии и развернутых после пандемии.

  • Допустимость: соответствуют ли данные определенным форматам, диапазонам и бизнес-правилам? Поле даты, содержащее текст, или поле процента, содержащее значения выше 100, указывают на сбои допустимости, которые необходимо устранить до обучения.

Получайте истории Химадри Роя в свой почтовый ящик

Присоединяйтесь к Medium бесплатно, чтобы получать обновления от этого автора.

Запомнить меня для быстрого входа

  • Уникальность: есть ли дублирующиеся записи, которые приведут к тому, что модель будет придавать чрезмерный вес определенным примерам во время обучения?

  • Репрезентативность: представляет ли набор данных всю популяцию входных данных, с которыми модель столкнется в производстве? Пробелы в репрезентативности создают пробелы в возможностях модели — и в областях с высокими ставками они создают разную производительность между демографическими группами.

  • Точность маркировки: для обучения с учителем — верны ли обучающие метки? Ошибки маркировки являются одними из самых сложных для обнаружения проблем качества и одними из самых значительных для производительности модели.

  • Достаточность объема: содержит ли набор данных достаточно примеров, чтобы модель могла изучить необходимые шаблоны? Требования к объему варьируются в зависимости от алгоритма и сложности задачи, но недостаточный объем — это фундаментальная проблема качества, а не просто техническое ограничение.

Оценка качества данных — это не технический аудит. Это стратегическая оценка рисков. Измерения качества, наиболее важные для вашего проекта, напрямую связаны с режимами отказов, которые были бы наиболее разрушительны для вашего бизнеса.

Каскад мусора на входе

Что делает сбои качества данных особенно разрушительными в ИИ, так это каскадный эффект. Обучающие данные низкого качества приводят к плохо откалиброванной модели. Плохо откалиброванная модель порождает ненадежные результаты. Ненадежные результаты подрывают доверие пользователей. Подорванное доверие приводит к тому, что систему игнорируют — или, что еще хуже, переопределяют непоследовательными способами, которые вводят новые риски.

Чат-бот Tay от Microsoft — выпущенный в Twitter в 2016 году и переобучаемый в режиме, близком к реальному времени, на взаимодействиях пользователей — является крайним примером этого каскада. В течение 24 часов после развертывания он начал выдавать расистский и оскорбительный контент, потому что был обучен на входных данных, которые были намеренно созданы для его порчи. Модель работала именно так, как была спроектирована. Качество данных было провалом.

Менее драматично, но более распространено: модели кредитного риска, обученные на предвзятых исторических данных кредитования, продолжают систематически ставить в невыгодное положение определенные демографические группы. Медицинский ИИ, обученный на данных из богатых больничных систем, работает значительно хуже на пациентах из недостаточно обслуживаемых сообществ. Алгоритмы найма, обученные на исторических решениях о найме, воспроизводят предвзятости этих решений с эффективностью машинного масштаба.

Это не крайние случаи. Это предсказуемые последствия развертывания ИИ без тщательной оценки качества данных — в частности, без оценки репрезентативности и предвзятости измерений качества обучающих данных.

Как на самом деле выглядит оценка качества данных

Практическая оценка качества данных для проекта ИИ проходит в четыре этапа.

Профилирование: автоматический статистический анализ каждого набора данных для выявления распределения, полноты и показателей допустимости. Это отправная точка, которая показывает, с чем вы на самом деле работаете, в отличие от того, с чем, по вашему мнению, вы работаете.

Оценка предвзятости: анализ представленности по ключевым демографическим, географическим и временным измерениям, релевантным для вашего случая использования. Это требует предметной экспертизы для определения того, какие измерения важны — модель для прогнозирования розничного спроса имеет другие требования к репрезентативности, чем модель для прогнозирования текучести кадров.

Аудит маркировки: для обучения с учителем — выборочный аудит точности меток, проводимый экспертами в предметной области. Результат ImageNet о том, что 5,8% меток были неверными, был получен именно в ходе такого аудита — и он изменил то, насколько серьезно область относится к качеству маркировки.

Анализ пробелов: структурированное сравнение между качеством обучающих данных и требованиями к качеству для случая использования. Некоторые приложения могут терпеть больше шума, чем другие. Рекомендательный движок, предлагающий неправильную песню — это мелкое неудобство. Система медицинской диагностики, предлагающая неправильное лечение — это риск для безопасности пациента. Планка качества не фиксирована — она устанавливается последствиями ошибки.

Результатом оценки является не проход/непроход — это структурированное представление пробелов в качестве, их вероятного влияния на производительность модели и необходимых исправлений до начала обучения. Это представление формирует масштаб, сроки и решение о том, готов ли проект к продолжению.

Книги, которые говорили людям, какие грибы есть, были маленьким, ограниченным провалом. В большинстве организаций аналогичный провал тише, менее заметен и более значителен. Начните оценку качества данных до того, как начнете модель. Не после.

Источникmedium