CiberSegurançaNews
Tendência

Alibaba antecipa arquitetura do Qwen4 e aposta em IA mais eficiente para agentes e contextos gigantes

Novo Qwen3.8-Flash-Next funciona como uma prévia tecnológica da próxima geração Qwen4, combinando arquitetura Mixture-of-Experts, atenção otimizada e apenas 6 bilhões de parâmetros ativos por token.

A Alibaba revelou uma das primeiras pistas concretas sobre o futuro da família Qwen. A equipe responsável pelos modelos de inteligência artificial lançou o Qwen3.8-Flash-Next, apresentado como uma prévia da arquitetura que servirá de base para a próxima geração Qwen4.

A informação que circula na imagem está correta em essência. O modelo foi disponibilizado em 26 de agosto com pesos abertos justamente para permitir que desenvolvedores experimentem antecipadamente algumas das tecnologias planejadas para a nova geração. A Alibaba, porém, ainda não anunciou oficialmente uma data para o lançamento completo do Qwen4.

Mais do que buscar simplesmente aumentar o número de parâmetros, a estratégia da empresa está concentrada em um problema que começa a dominar o desenvolvimento da IA: como executar agentes autônomos durante longos períodos e processar enormes quantidades de contexto sem fazer o custo computacional crescer na mesma proporção.

125 bilhões de parâmetros, mas apenas 6 bilhões trabalham por token

O Qwen3.8-Flash-Next utiliza uma arquitetura Mixture-of-Experts (MoE) com aproximadamente 125 bilhões de parâmetros principais, mas apenas cerca de 6 bilhões são ativados para processar cada token.

O sistema ainda incorpora aproximadamente 51 bilhões de parâmetros adicionais em embeddings N-gram, criando uma arquitetura com enorme capacidade armazenada sem exigir que todos esses parâmetros sejam utilizados simultaneamente durante a inferência.

Essa separação é importante.

Em modelos densos tradicionais, grande parte da rede precisa participar do processamento de cada token. Em arquiteturas MoE, apenas determinados especialistas são acionados conforme a tarefa.

Na prática, a Alibaba tenta combinar a capacidade de um modelo muito grande com custos computacionais mais próximos aos de modelos significativamente menores.

Qwen4 está sendo projetado para contextos enormes

Outro foco importante é o processamento de sequências extensas.

O Qwen3.8-Flash-Next combina diferentes mecanismos de atenção, incluindo Gated DeltaNet (GDN) e uma nova tecnologia chamada Qwen Sparse Attention (QSA).

A arquitetura intercala camadas capazes de manter estados compactos com mecanismos de atenção seletiva, reduzindo a necessidade de comparar constantemente cada novo token com todo o histórico anterior.

Isso se torna particularmente relevante quando um modelo precisa analisar centenas de milhares — ou até milhões — de tokens.

Testes divulgados pela equipe Qwen indicam ganhos expressivos em determinadas operações de atenção quando o contexto chega à casa de 1 milhão de tokens, cenário no qual arquiteturas convencionais podem exigir enormes quantidades de memória e processamento.

Agentes de IA estão no centro da estratégia

A escolha arquitetônica também revela para onde a Alibaba acredita que a inteligência artificial está caminhando.

Os modelos atuais são usados principalmente para responder perguntas, escrever textos, gerar código ou analisar documentos. Agentes de IA, porém, precisam permanecer ativos durante períodos muito maiores.

Um agente pode pesquisar informações, consultar arquivos, executar ferramentas, navegar por sistemas, escrever código, verificar resultados e repetir essas etapas dezenas ou centenas de vezes até concluir uma tarefa.

Cada nova ação aumenta o histórico que o modelo precisa compreender.

Quanto maior esse histórico, maior tende a ser o custo computacional.

Por isso, contexto longo e eficiência de inferência estão se tornando elementos estratégicos para a próxima geração de modelos de IA.

A própria Alibaba já vem direcionando seu ecossistema para sistemas capazes de executar tarefas. O aplicativo Qwen, por exemplo, ganhou integrações capazes de coordenar serviços, pagamentos, viagens e outras operações utilizando agentes.

Treinamento pode ficar muito mais barato

Talvez uma das afirmações mais relevantes envolvendo a nova arquitetura esteja no custo de desenvolvimento.

Segundo números divulgados pela equipe responsável pelo projeto, o treinamento do Qwen3.8-Flash-Next exigiu aproximadamente um nono do custo computacional utilizado no treinamento do Qwen3.7-Plus.

Se essa eficiência conseguir ser reproduzida em modelos maiores, a consequência pode ser significativa.

A corrida pela IA deixou de depender apenas de quem possui o modelo com mais parâmetros. O custo para treinar e principalmente operar esses sistemas está se tornando uma das principais limitações econômicas da indústria.

Um modelo capaz de entregar desempenho competitivo consumindo menos processamento pode permitir preços menores nas APIs, mais usuários simultâneos e agentes funcionando durante períodos muito mais longos.

Alibaba mostra o Qwen4 antes de lançá-lo

Existe ainda uma característica incomum na estratégia.

Em vez de manter completamente fechadas as tecnologias da próxima geração até o lançamento oficial, a Alibaba colocou parte da arquitetura nas mãos da comunidade antecipadamente.

Isso permite que pesquisadores e desenvolvedores estudem questões como quantização, consumo de memória, compatibilidade com diferentes aceleradores e comportamento em contextos extensos antes mesmo da chegada do Qwen4 definitivo.

O movimento também fortalece a presença da empresa no ecossistema de modelos com pesos abertos, onde a família Qwen se tornou uma das principais alternativas aos modelos proprietários norte-americanos.

Próxima batalha da IA pode ser pela eficiência

A prévia do Qwen4 aponta para uma mudança importante na corrida global pela inteligência artificial.

Durante os últimos anos, grande parte da competição esteve concentrada no aumento do tamanho dos modelos e da infraestrutura utilizada para treiná-los.

Agora, empresas como Alibaba estão tentando encontrar maneiras de fazer modelos gigantes utilizarem apenas uma pequena parcela de sua capacidade a cada operação.

Essa lógica será especialmente importante para agentes autônomos, que podem executar centenas ou milhares de ações durante uma única tarefa.

Se o Qwen4 mantiver as tecnologias apresentadas no Flash-Next, a próxima geração da Alibaba deverá apostar menos em simplesmente colocar mais parâmetros para trabalhar e mais em decidir quais parâmetros realmente precisam trabalhar em cada momento.

Em uma indústria na qual cada token processado representa consumo de chips, memória e energia, eficiência pode se transformar em uma vantagem tão importante quanto inteligência.

Artigos relacionados

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *

Botão Voltar ao topo