Исследование в Бразилии выявило недостатки существующих систем распознавания лиц
Подробнее
Super Abril
super.abril.com.br

Исследование в Бразилии выявило недостатки существующих систем распознавания лиц

Исследователь, являющаяся исполнительным директором Instituto da Hora (IDH) и научным сотрудником Universidade Estadual de Campinas (Unicamp), представила результаты изучения технологий распознавания лиц, которые используются в метро, стадионах, аэропортах и системах общественной безопасности по всей Бразилии.

Работа, которая стала основой ее магистерской диссертации, защищенной в мае 2026 года в Институте Вычислительной Техники Unicamp, а также статьи «Frankenstein in the Pipeline», опубликованной в сборниках ACM FAccT, главной международной конференции, посвященной справедливости и ответственности в алгоритмических системах, была представлена в данном тексте.

Автор объясняет свои находки и называет это явление «компьютерным эпистемицидием». Она отмечает, что система распознавания лиц не «видит» людей, а выполняет фиксированную последовательность операций, которую вычислительная наука называет пайплайном, или производственной линией, где каждый этап трансформирует полученные данные.

Этот процесс включает обнаружение лица, которое определяет наличие классифицируемого лица на изображении; обрезку, изолирующую эту область; выравнивание, корректирующее обрезанную область по стандартизированному шаблону с ожидаемым положением глаз, носа и рта; и, наконец, векторизацию, преобразующую результат в вектор — список из сотен чисел, представляющий человека в системе.

Два следствия этой структуры легли в основу исследования. Всё зависит от первого этапа: лицо, которое не обнаруживается, перестает существовать для системы. Кроме того, выравнивание требует наличия шаблона, что подразумевает установление нормы.

Чтобы любой образ лица мог быть вписан в ожидаемые позиции, система должна была изучить, что такое «типичное лицо», основываясь на миллионах проанализированных изображений во время обучения. Автор называет эту неявную норму «каноническим лицом». Ее исследование началось с вопроса: обрабатываются ли лица, отклоняющиеся от этой нормы, с той же степенью надежности?

Существование расовых различий в этих технологиях не является новой гипотезой. В 2018 году исследование Gender Shades, проведенное учеными Joy Buolamwini и Timnit Gebru, показало, что коммерческие системы анализа лиц ошибались значительно чаще в отношении темнокожих женщин, чем светлокожих мужчин. В следующем году NIST, национальный институт стандартов и технологий США, проанализировал сотни алгоритмов и задокументировал различия в производительности между демографическими группами в большинстве из них.

Реакция индустрии на эти открытия обычно сводится к одному выводу: расхождения являются ограничениями устаревших моделей, которые можно исправить с помощью более современных архитектур и больших обучающих выборок. Хотя это предположение обосновано и поддается проверке, требовалось провести контролируемый тест, сравнивая различные семейства моделей в идентичных условиях, чтобы проверить, исчезают ли расхождения с техническим прогрессом. Именно это автор решила сделать.

Были выбраны три модели из разных технологических семейств. Первые две принадлежат к линейке YOLO, что означает «you only look once» (ты смотришь один раз) — модели обнаружения объектов, широко используемые в камерах и системах наблюдения благодаря своей скорости для работы в реальном времени. YOLOv11 использует сверточные нейронные сети, вдохновленные зрительной системой человека, которые сканируют изображение небольшими фильтрами в поисках границ, текстур и форм, доминируя в компьютерном зрении за последнее десятилетие. YOLOv12 дополняет эту базу механизмами внимания, позволяющими модели придавать больший вес областям изображения, считающимся важными.

Третья модель, RT-DETRv2, относится к семейству Трансформеров — архитектуре, которая одновременно обрабатывает изображение, связывая все его части, и служит основой таких систем, как ChatGPT, часто представляясь «передовым состоянием искусства» в этой технологии.

Все три модели были оценены на одном и том же наборе данных, Casual Conversations v2, созданном Meta для оценки справедливости. Это 26 467 видео с участием 5 567 оплачиваемых участников, которые дали согласие на использование изображений своих лиц в исследованиях алгоритмической справедливости, снятых в семи странах, включая Бразилию. Участники самостоятельно указали такие атрибуты, как возраст и пол. Тренированные аннотаторы классифицировали видимый тон кожи по стандартизированным шкалам, а условия съемки, включая вариации освещения, были задокументированы. Такой подход позволил измерять показатели ошибок обнаружения отдельно для каждой группы, вместо того чтобы усреднять их в общем показателе.

Центральный результат заключается в следующем: все три архитектуры демонстрируют одинаковые закономерности различий по тону кожи, последовательно ошибаясь в отношении одних и тех же групп. Если три машины с разными анатомиями ошибаются в одних и тех же лицах, проблема не принадлежит ни одной из них индивидуально. Она принадлежит тому, что они имеют общего: методу производства, его данным, шаблонам и неявному определению лица. Таким образом, обещание, что следующее поколение моделей решит проблемы неравенства, не находит поддержки в данных, собранных автором.

До сих пор вывод носит эмпирический характер. Следующий шаг диссертации носит концептуальный характер: какое название дать этому явлению? Общепринятый лексикон говорит о «алгоритмическом смещении», предполагая техническое отклонение, которое можно скорректировать калибровкой. Автор утверждает, что такая рамка описывает ошибку, но скрывает механизм, который ее порождает, и то, что она делает с затронутыми людьми. Выбор слов также имеет институциональные последствия: будучи рассматриваемой как баг, проблема остается под исключительной юрисдикцией производителей систем.

Альтернатива автора основана на концепции эпистемицида, разработанной бразильской философом Sueli Carneiro в ее докторской диссертации для обозначения систематической дисквалификации знаний и способов существования расиализованных групп как составной части расизма, а не как его случайности. В своей диссертации автор расширяет эту концепцию до технической сферы. «Компьютерный эпистемицид» — это процесс, посредством которого система создает норму лица, навязывает эту норму в качестве критерия распознавания и отрицает вычислительное существование тех, кто ей не соответствует, под видом математической объективности.

Франкенштейн, созданный Мэри Шелли, таким образом перестает быть иллюстрацией и становится методом чтения. Роман предоставил аналитическую структуру, которую метрика точности не улавливает: существо, собранное из рассеченных частей, обладающее авторитетом, но не имеющее ответственного за него.

Пайплайн систем распознавания лиц воспроизводит эту структуру. Он расчленяет лицо на фрагменты, восстанавливает числовой заменитель и начинает действовать с практическим авторитетом над жизнями, без внешнего аудита, без публичной воспроизводимости и без канала оспаривания для тех, кто классифицируется.

Исследование автора не призывает отказаться от всего компьютерного зрения и не оценивает намерения кого-либо. То, что она поддерживает на основе данных, более конкретно. Когда ущерб кроется в методе, калибровка результата его не устраняет: система идентификации лица с высокой точностью, внедренная в систему общественной безопасности, которая уже фокусируется на подходах к чернокожим и периферийным населением, лишь ускоряет и затрудняет оспаривание этой концентрации.

Поэтому автор выступает за то, что она называет «точную отказ»: отказ от определенных операций, таких как распознавание лиц в общественной безопасности, ущерб от которых не зависит от архитектуры, и инвестирование в то, что она называет «компьютерным исправлением»: принципы для аудируемых, оспариваемых систем, созданных с участием популяций, которые до сих пор попадали в базы данных только как сырье.

Существо, воображаемое Мэри Шелли более двух столетий назад, стало чудовищным не из-за материала, из которого оно было сделано, а потому, что никто не захотел нести за него ответственность. Распространение и предложение решений для ошибок, совершенных цифровыми существами, которые мы создаем и устанавливаем в наших городах — с властью судить и влиять на судьбы людей — это работа, которая начинается здесь.

Популярное