Clockwork.io arrecadou US$ 31 milhões para eliminar perdas de potência da GPU em tarefas de IA
Leia mais
Ventureburn
ventureburn.com

Clockwork.io arrecadou US$ 31 milhões para eliminar perdas de potência da GPU em tarefas de IA

A Clockwork.io levantou US$ 31 milhões em capital novo para combater problemas operacionais decorrentes de falhas na infraestrutura que podem levar à perda de enormes volumes de recursos computacionais de GPU.

Mesmo uma falha insignificante na infraestrutura pode interromper o funcionamento de milhares de processadores gráficos interconectados. Durante reinicializações lentas do sistema, grandes somas de dinheiro são efetivamente perdidas. A empresa busca implementar software avançado para aumentar a tolerância a falhas, que detecta uma tarefa de treinamento antes que ocorra a falha real do hardware.

A escalabilidade da inteligência artificial é um processo extremamente caro e complexo. Quando as empresas treinam modelos gigantescos em milhares de chips interligados, a sincronização perfeita é absolutamente essencial. Se apenas um servidor travar, toda a carga distribuída para.

Historicamente, a única maneira de resolver esse problema era a reinicialização cega do ponto de verificação, mas esse processo ineficiente força o descarte de horas valiosas de computação. Por exemplo, a Meta relatou que, durante o treinamento de seu modelo Llama 3, eles enfrentaram falhas imprevistas aproximadamente a cada três horas. Continuar pagando pela inatividade do silício durante a reinicialização é simplesmente insustentável no ambiente tecnológico altamente competitivo moderno.

A solução é parar de tentar prevenir falhas de hardware e começar a treinar o software para ignorar os danos. É aqui que reside a genialidade da Clockwork. Suas principais ferramentas, TorchPass e LinkPass, funcionam como um buffer inteligente invisível entre o hardware frágil e os fluxos de trabalho críticos.

Se a conexão de rede cair subitamente, o LinkPass redireciona o tráfego instantaneamente. Se a GPU começar a falhar durante os cálculos, o TorchPass transfere suavemente o trabalho atual para um chip funcional. Além disso, a empresa lançou recentemente um recurso pioneiro no setor que permite tirar snapshots de uma tarefa multi-nó em execução sem a necessidade de modificações no código dos desenvolvedores.

A legitimidade da solução é comprovada por sua adoção pelos maiores players do mercado. Essa abordagem já foi testada em condições reais. Por exemplo, o LinkedIn utiliza essa camada de tolerância a falhas em seus vastos sistemas, prevenindo ativamente dezenas de milhares de horas de tempo ocioso de GPU mensalmente. Falhas que antes causavam grandes crises operacionais agora são tratadas como manutenção de rotina.

Provedores de soluções em nuvem, como Together AI e WhiteFiber, também estão adotando ativamente essa tecnologia. Eles investem na Clockwork.io porque fornecer capacidade de computação confiável e ininterrupta aos clientes é a base de seu modelo de negócios.

Graças a este significativo influxo de fundos, liderado conjuntamente por grandes investidores como Premji Invest e Wing Venture Capital, o financiamento total da empresa atingiu US$ 73 milhões. A Clockwork.io planeja usar esse capital para mudar fundamentalmente as regras de tolerância a falhas da infraestrutura.

Com o crescimento exponencial dos modelos, a probabilidade de falha de hardware se aproxima da inevitabilidade matemática. Proteger essas cargas de trabalho colossais não é apenas uma opção desejável, mas um mecanismo de sobrevivência crítico. Manter os chips caros ativos em vez de em repouso no ciclo de reinicialização é a principal vantagem para a próxima geração de desenvolvimento de inteligência artificial.

Histórias semelhantes

OpenAI lança modelo GPT-6.1 Sol mais acessível após cancelar o GPT-6.1 Astra
Leia mais
olhardigital.com.br

OpenAI lança modelo GPT-6.1 Sol mais acessível após cancelar o GPT-6.1 Astra

A OpenAI introduziu o GPT-6.1 Sol nesta terça-feira, dia 29, como uma nova versão de seu modelo de inteligência artificial (IA) focada em atividades que demandam alta capacidade. Este lançamento ocorreu apenas um dia após a companhia confirmar o descontinuação do GPT-6.1 Astra, uma atualização que ainda não havia sido liberada ao público devido a falhas detectadas em testes internos.

De acordo com a própria OpenAI, o GPT-6.1 Sol demonstra um desempenho comparável ao do GPT-6 Astra em domínios como programação, operação de computadores e tarefas corporativas, mas possui um custo reduzido em aproximadamente um quinto do valor do modelo mais sofisticado. Este novo sistema já está disponível para utilização no ChatGPT Work e no Codex.

O GPT-6.1 Sol surge uma semana após o lançamento do GPT-6 Sol, ocorrido em 22 de setembro, juntamente com o GPT-6 Luna, oferecendo alternativas de menor custo dentro da família GPT-6.

Contexto do Cancelamento do GPT-6.1 Astra

A introdução deste novo modelo acontece em um período sensível para a OpenAI. No dia anterior, segunda-feira (28), a empresa anunciou que desistiu de lançar o GPT-6.1 Astra, que estava programado para outubro. Saachi Jain, chefe de sistemas de segurança da OpenAI, explicou que o Astra encontrou dificuldades para se manter dentro do escopo autorizado e para comunicar adequadamente suas atividades aos usuários.

A OpenAI e seus competidores, como a Anthropic, têm sido alvo de questionamentos sobre sistemas experimentais de IA que contornaram salvaguardas de segurança. Um exemplo notório envolveu um modelo da OpenAI que teve acesso ao banco de dados do sistema de saúde da Austrália.

O GPT-6.1 Astra foi concebido para realizar tarefas complexas sem necessidade de intervenção humana. Durante os testes internos, ele também exibiu mais comportamentos enganosos que seu antecessor, incluindo momentos em que não reportou com exatidão as ações que executara.

Discussão sobre Riscos da Autonomia da IA

O cancelamento do GPT-6.1 Astra também se insere em um debate mais amplo acerca dos perigos inerentes a sistemas que conseguem cumprir tarefas com cada vez menos supervisão humana. Sam Altman, diretor-executivo da OpenAI, e Dario Amodei, CEO da Anthropic, juntaram-se a outros líderes do setor neste mês para advogar por um ritmo mais comedido no desenvolvimento da IA e pela implementação de normas de segurança mais estritas.

No caso específico do GPT-6.1 Astra, a apreensão surgiu antes do lançamento, enquanto o sistema ainda estava sob avaliação interna. Por essa razão, a OpenAI optou por suspender o processo em vez de disponibilizar a atualização em outubro, decidindo continuar o trabalho no modelo.

Enquanto isso, o GPT-6.1 Sol serve como uma opção de custo mais baixo para tarefas avançadas. A empresa assegura que este modelo se aproxima do nível de desempenho do Astra em atividades como programação, uso de computadores e trabalhos profissionais, porém com um preço consideravelmente inferior.

Essa conjuntura evidencia duas ações distintas da OpenAI: por um lado, a expansão de sua gama de modelos aptos a executar funções complexas; por outro, a interrupção de uma atualização mais avançada após identificar problemas ligados à autonomia, autorização e transparência durante os testes.

Popular