SenseTime lança SenseNova U1.5: modelo de 8 bilhões de parâmetros para visão unificada com código aberto de treinamento
Leia mais
Pandaily
pandaily.com

SenseTime lança SenseNova U1.5: modelo de 8 bilhões de parâmetros para visão unificada com código aberto de treinamento

A SenseTime apresentou o SenseNova U1.5, um modelo com oito bilhões de parâmetros que unifica a compreensão, o raciocínio e a geração no espaço de pixels em um sistema multimodal nativo único.

Diferentemente dos pipelines existentes, que utilizam um codificador de visão para percepção e um autoencoder variacional separado para síntese, o U1.5 mapeia pixels e texto em uma estrutura comum sem esses módulos externos. Isso se alinha à linha NEO-unify da empresa, ao mesmo tempo que melhora a reconstrução espacial para alcançar maior precisão em resoluções de produção.

A alteração arquitetônica consiste na substituição da decodificação independente de patches MLP por um decodificador espacial leve. Os tokens visuais são transformados em um campo de características bidimensional e, em seguida, restaurados usando estágios de Pixel Shuffle e convoluções locais, permitindo que regiões adjacentes troquem informações antes da finalização dos pixels.

A SenseTime informou que a interface ainda exibe cada área de 32x32 em um token visual, mas suporta geração nativa até 4K com menos falhas de costura e heterogeneidade de textura em comparação com a versão anterior U1. Isso foi possível graças ao condicionamento de ruído que considera a resolução em proporções de aspecto mais amplas.

O processo pós-treinamento segue uma receita de especialização, seguida por unificação. Especialistas em aprendizado por reforço focam na estética visual, renderização bilíngue de texto, maquetes de infográficos e edição de imagens. Em seguida, a destilação multi-experta baseada em política combina essas habilidades em um único aluno ao longo de suas próprias trajetórias de geração.

A SenseTime afirma que os resultados do U1.5 superam os do U1 em conjuntos de dados de geração e edição de imagens, incluindo renderização bilíngue de texto competitiva e edição multi-referência, mantendo, no geral, altas pontuações de compreensão multimodal em benchmarks padrão de STEM, VQA e OCR.

Juntamente com o relatório técnico publicado no arXiv e Hugging Face Papers, a SenseTime disponibiliza o código de treinamento, que abrange ajuste fino controlado, aprendizado por reforço e destilação de política. Os ativos do modelo estão disponíveis nas coleções SenseNova e Hugging Face sob a organização OpenSenseNova. Este lançamento representa um produto completo U1.5, e não uma versão preliminar U1.5-Lite-Preview, e é destinado a desenvolvedores que desejam obter um modelo de visão unificado nativo compacto para explorar, ajustar e retreinar completamente.

Popular