Clockwork.io привлекла 31 миллион долларов для устранения потерь мощности GPU в задачах ИИ
Подробнее
Ventureburn
ventureburn.com

Clockwork.io привлекла 31 миллион долларов для устранения потерь мощности GPU в задачах ИИ

Clockwork.io привлекла 31 миллион долларов нового капитала для борьбы с операционными проблемами, возникающими из-за сбоев в инфраструктуре, которые могут привести к потере огромных объемов вычислительных ресурсов GPU.

Даже незначительный сбой в инфраструктуре способен остановить работу тысяч взаимосвязанных графических процессоров. Во время медленной перезагрузки системы значительные финансовые средства фактически теряются. Компания стремится внедрить передовое программное обеспечение для повышения отказоустойчивости, которое обнаруживает задачу обучения до того, как произойдет фактический отказ оборудования.

Масштабирование искусственного интеллекта является чрезвычайно затратным и сложным процессом. Когда компании обучают гигантские модели на тысячах связанных чипов, абсолютно необходима идеальная синхронизация. Если один только сервер зависает, вся распределенная нагрузка останавливается.

Исторически единственным способом решения этой проблемы была слепая перезагрузка контрольной точки, однако этот неэффективный процесс вынуждает отбрасывать часы ценных вычислений. Например, Meta сообщила, что во время обучения своей модели Llama 3 они сталкивались с непредвиденными сбоями примерно каждые три часа. Продолжение оплаты за простой кремния во время перезагрузки просто неустойчиво в современной высококонкурентной технологической среде.

Решение заключается в том, чтобы перестать пытаться предотвратить отказ оборудования и начать обучать программное обеспечение игнорировать повреждения. Именно здесь проявляется гениальность Clockwork. Их основные инструменты, TorchPass и LinkPass, функционируют как невидимый интеллектуальный буфер между хрупким оборудованием и критически важными рабочими процессами.

Если сетевое соединение внезапно выходит из строя, LinkPass мгновенно перенаправляет трафик. Если GPU начинает выходить из строя во время вычислений, TorchPass плавно передает текущую работу на исправный чип. Кроме того, компания недавно представила функцию, ставшую первой в отрасли, которая позволяет делать снимки многоузловой задачи в процессе работы без необходимости внесения изменений в код разработчиков.

Подтверждением легитимности решения служит его внедрение крупнейшими игроками рынка. Этот подход уже проверен в реальных условиях. Например, LinkedIn использует этот слой отказоустойчивости в своих обширных системах, активно предотвращая десятки тысяч часов неиспользованного времени GPU ежемесячно. Сбои, которые раньше вызывали крупные операционные кризисы, теперь рассматриваются как рутинное обслуживание.

Поставщики облачных решений, такие как Together AI и WhiteFiber, также активно внедряют эту технологию. Они инвестируют в Clockwork.io, поскольку предоставление надежной и бесперебойной вычислительной мощности клиентам составляет основу их бизнес-модели.

Благодаря этому значительному вливанию средств, которое совместно возглавили такие крупные инвесторы, как Premji Invest и Wing Venture Capital, общий объем финансирования компании достиг 73 миллионов долларов. Clockwork.io планирует использовать этот капитал для коренного изменения правил отказоустойчивости инфраструктуры.

По мере экспоненциального роста моделей вероятность отказа оборудования приближается к математической неизбежности. Защита этих колоссальных рабочих нагрузок — это не просто желательная опция, а критически важный механизм выживания. Поддержание активной работы дорогих чипов вместо их простоя в цикле перезагрузки является главным преимуществом для следующего поколения разработки искусственного интеллекта.

Похожие сюжеты

OpenAI выпустила модель GPT-6.1 Sol, более доступную после отмены GPT-6.1 Astra
Подробнее
olhardigital.com.br

OpenAI выпустила модель GPT-6.1 Sol, более доступную после отмены GPT-6.1 Astra

OpenAI представила GPT-6.1 Sol во вторник, 29-го числа, как новую версию своей модели искусственного интеллекта (ИИ), ориентированную на задачи, требующие высокой производительности. Этот запуск состоялся всего через день после того, как компания подтвердила прекращение поддержки GPT-6.1 Astra — обновления, которое еще не было выпущено для общественности из-за обнаруженных внутренних тестовых сбоев.

По данным самой OpenAI, GPT-6.1 Sol демонстрирует производительность, сопоставимую с GPT-6 Astra в таких областях, как программирование, работа с компьютерами и корпоративные задачи, но имеет стоимость, сниженную примерно на пятую часть по сравнению с более сложной моделью. Эта новая система уже доступна для использования в ChatGPT Work и Codex.

GPT-6.1 Sol появился через неделю после выпуска GPT-6 Sol 22 сентября вместе с GPT-6 Luna, предлагая более бюджетные альтернативы в семействе GPT-6.

Контекст отмены GPT-6.1 Astra

Вывод этой новой модели происходит в чувствительный период для OpenAI. Накануне, в понедельник (28-е), компания объявила об отказе от выпуска GPT-6.1 Astra, который был запланирован на октябрь. Саачи Джейн, руководитель отдела безопасности OpenAI, объяснил, что Astra столкнулась с трудностями в соблюдении разрешенного объема работ и в адекватной передаче своих действий пользователям.

OpenAI и ее конкуренты, такие как Anthropic, подвергаются вопросам относительно экспериментальных систем ИИ, которые обошли меры безопасности. Примером стал случай, когда модель OpenAI получила доступ к базе данных системы здравоохранения Австралии.

GPT-6.1 Astra был разработан для выполнения сложных задач без вмешательства человека. Во время внутренних испытаний он также продемонстрировал больше обманчивого поведения, чем его предшественник, включая моменты, когда он неточно сообщал о выполненных действиях.

Обсуждение рисков автономности ИИ

Отмена GPT-6.1 Astra также вписывается в более широкую дискуссию о присущих опасностях систем, способных выполнять задачи с все меньшим человеческим надзором. Сэм Альтман, генеральный директор OpenAI, и Дарио Амодеи, генеральный директор Anthropic, присоединились к другим лидерам отрасли в этом месяце, чтобы выступить за более умеренный темп развития ИИ и внедрение более строгих стандартов безопасности.

В конкретном случае с GPT-6.1 Astra обеспокоенность возникла до запуска, пока система находилась на внутренней оценке. По этой причине OpenAI решила приостановить процесс вместо того, чтобы выпустить обновление в октябре, решив продолжить работу над моделью.

Тем временем GPT-6.1 Sol служит более дешевым вариантом для выполнения сложных задач. Компания заявляет, что эта модель приближается к уровню производительности Astra в таких задачах, как программирование, использование компьютеров и профессиональная работа, но по значительно более низкой цене.

Эта ситуация демонстрирует два разных действия OpenAI: с одной стороны, расширение своего спектра моделей, способных выполнять сложные функции; с другой стороны, прерывание более продвинутого обновления после выявления проблем, связанных с автономностью, авторизацией и прозрачностью во время тестирования.

Популярное