Вопрос о том, является ли больший размер искусственного интеллекта (ИИ) гарантией лучшей работы, зависит от конкретной задачи, по мнению исследователей из USP и Unicamp. В ряде приложений более эффективные и специализированные системы могут требовать меньше данных и вычислительных ресурсов, при этом обеспечивая необходимый уровень производительности.
Эта дискуссия не означает, что крупные модели потеряли свою значимость. В то время как Марсело Фингер критикует растущую зависимость систем от данных и вычислительных мощностей, математик Маркос Эдуардо Валье указывает на пробел между мелкими моделями и крупными системами глубокого обучения, видя потенциал для изучения промежуточных решений.
Для Марсело Фингера одним из главных достижений недавнего прогресса в области ИИ стало расширение способности машин распознавать закономерности в различных типах информации, включая речь, изображения и звуки. Этот прорыв получил новый импульс в 2017 году с появлением архитектуры Transformer, изначально разработанной для перевода между языками, которая стала основой современных больших языковых моделей.
Однако Фингер отмечает ограничение этого подхода: Transformer вынужден многократно пересматривать входные данные, и этот процесс растет квадратично с увеличением размера входных данных. Проще говоря, чем больше информации нужно проанализировать модели, тем быстрее увеличивается количество необходимых вычислений, что повышает затраты на обработку и требуемые ресурсы для работы с всё более крупными моделями.
Кроме вычислительной мощности, Фингер упоминает такие ресурсы, как энергия и вода, а также тепловыделение, связанное с эксплуатацией оборудования. Он также считает, что после популяризации больших языковых моделей развитие этой области стало чрезмерно фокусироваться на этом подходе, поскольку часть исследований начала следовать этому направлению, когда ИИ вышел на рынок.
Маркос Эдуардо Валье также видит пределы в этом процессе, предполагая, что развитие аппаратного обеспечения может приближаться к стагнации. Он ссылается на прогресс графических процессоров (GPU) как на фактор, позволивший увеличить доступную мощность для глубокого обучения, но утверждает: «Этот вопрос аппаратного обеспечения, кажется, застопорился, и я считаю, что мы тоже упремся в потолок этого предела, возможно, эти гигантские модели стагнируют».
Большие модели общего назначения имеют очевидное преимущество — они способны справляться с большим разнообразием ситуаций. Тем не менее, по мнению Валье, это не делает их оптимальным выбором для любой задачи. Он приводит примеры медицины и сельского хозяйства, где объем данных может быть несопоставим с данными, используемыми для обучения больших языковых моделей. В медицине, например, получение нужной информации часто зависит от профессиональных оценок и включает более сложные процессы.
В таких условиях решение, разработанное для конкретной задачи, может лучше использовать имеющиеся данные. Вместо попытки изучить огромное количество возможностей, модель может интегрировать известные характеристики самой проблемы. Однако эта специализация имеет условие: специфическая модель основывается на определенных предположениях о решаемой задаче. Если эти предпосылки окажутся неверными в реальной ситуации, генералистская модель может оказаться более выгодной благодаря своей способности обрабатывать больше вариантов. Как он подчеркнул: «Итак, нельзя пытаться поместить его в другую задачу, для которой он не был спроектирован».
Таким образом, выбор не сводится только к размеру модели; также важны тип и объем доступных данных, цель применения и особенности самой проблемы.
Проект, проведенный Фингером во время пандемии Covid-19, демонстрирует применение специализированного подхода в условиях дефицита данных. Целью было анализ голоса человека для выявления признаков дыхательной недостаточности и помощи в идентификации пациентов, которым могла потребоваться госпитализация. При этом целью не было обнаружение коронавируса по голосу.
Первоначальная задача заключалась в выявлении дыхательной недостаточности, проблемы, которая может возникать по разным причинам и во время пандемии была связана с наиболее тяжелыми случаями Covid-19. Первым препятствием стало получение данных: команда собрала информацию о примерно 600 пациентах за два месяца, но почти треть записей пришлось отбросить из-за проблем с записью. Аудиозаписи делались в больничных условиях с большим количеством шумов, включая кашель, работу оборудования, телевизор и перемещение людей.
Вместо простого удаления этих звуков, команда решила использовать окружающий шум для придания данным большей схожести. Исследователи собрали образцы звуков из мест обслуживания и добавили эти шумы к записям. Это было сделано для того, чтобы система не усваивала характеристику, не относящуюся к исследованию: разницу между записью, сделанной в больнице, и записью, сделанной дома. Сделав сигналы более схожими, команда стремилась заставить модель обращать внимание на голосовые признаки, связанные с дыхательной недостаточностью.
Согласно Фингеру, первая версия достигла 91% точности. После изменений в алгоритме и новых анализов этот показатель вырос до 96,5%, а затем до 99% для идентификации дыхательной недостаточности в изучаемом контексте. Результат был представлен исследователем и относится к контексту, исследованному командой; инструмент имел четко ограниченную задачу: выявлять признаки дыхательной недостаточности.
Более эффективное решение не обязательно должно создаваться с нуля. Валье упоминает методы, позволяющие использовать знания, полученные моделями, обученными на больших базах данных. Одним из них является трансферное обучение, при котором модель, обученная на большом наборе данных, впоследствии адаптируется для более специфической задачи. Другой метод — дистилляция знаний, позволяющая использовать знания более крупной модели для построения меньшей.
Эта возможность показывает, что большие модели и специализированные решения не обязательно должны конкурировать. Валье приводит пример возможности использовать большую языковую модель для взаимодействия с пользователем, а затем передавать информацию меньшей, специализированной модели, отвечающей за определенную задачу. В такой архитектуре различные системы могут выполнять разные функции: генералистская модель занимается коммуникацией, а специализированное решение обрабатывает информацию согласно потребностям приложения.
Сам труд Валье основан на этой идее. Математик изучает модели глубокого обучения, которые включают геометрическую и алгебраическую информацию для улучшения производительности и снижения потребности в данных в определенных приложениях. Один из примеров, представленных исследователем, связан с камерой наблюдения. Если системе необходимо распознать подозрительное движение, изменение положения камеры не должно привести к тому, что она перестанет распознавать это движение. Подход учитывает информацию о геометрии проблемы, позволяя включать в разработку характеристики, которые остаются актуальными даже при изменении перспективы. По словам Валье, такая стратегия может сделать модели более эффективными и, в конечном итоге, обученными на меньшем количестве данных.
Существуют также преимущества в эксплуатации таких систем. Валье утверждает, что более компактные решения могут показывать хорошую производительность при меньших затратах, требуя меньше обработки, энергии и вычислительных ресурсов. В зависимости от приложения, их можно запускать локально, избегая передачи данных в облако.
Фингер видит тенденцию в концентрации внимания на больших моделях. По его мнению, исследователи и компании склонны направлять усилия на технологии, которые находятся в центре внимания. Он отметил: «Область вычислений больше руководствуется модой, чем высокой модой».
Валье занимает менее бинарную позицию. Он полагает, что большие модели все еще имеют пространство для развития, но также видит возможность в области между традиционными мелкими моделями и гигантскими системами глубокого обучения. «Я думаю, что тенденция — двигаться в этом разрыве, создать модель, которая не слишком большая и не слишком маленькая. Таким образом, я думаю, что есть много чего для исследования в моделях среднего размера».
