Bitget App
Trade smarter
Comprar criptomoedasMercadosTradingFuturosStocksEarnInstituiçõesIA e mais
Morgan Stanley: Escassez de memória para IA deve durar anos; três caminhos para superação, armazenamento e poder de computação heterogêneo trazem oportunidades estruturais

Morgan Stanley: Escassez de memória para IA deve durar anos; três caminhos para superação, armazenamento e poder de computação heterogêneo trazem oportunidades estruturais

智通财经智通财经2026/10/05 14:12
Show original
By:智通财经

Morgan Stanley publicou um relatório sobre o setor de semicondutores, destacando que a escassez de memória DRAM irá persistir durante o atual ciclo da indústria de IA, e a expansão do poder computacional de IA não vai esperar até que novas fábricas de wafers sejam construídas e entrem em operação.

O aplicativo da Portuguese Investimento Inteligente informa que o Morgan Stanley publicou um relatório sobre a indústria de semicondutores destacando que a escassez de memória DRAM irá persistir durante o atual ciclo da indústria de IA, e a expansão do poder computacional em IA não irá esperar até que as novas fábricas de wafers entrem em operação. O setor está avançando na construção de capacidade computacional, mesmo sob restrições de oferta, adotando três principais abordagens técnicas para contornar o gargalo de memória: redução de hardware, desacoplamento da arquitetura de inferência e a criação de pools de memória com CXL. O banco segue otimista com os líderes em armazenamento, como Micron (MU.US) e SanDisk (SNDK.US), além de ver oportunidades crescentes nos setores de interconexão CXL e inferência heterogênea, recomendando Astera Labs (ALAB.US), Marvell (MRVL.US), Cerebras (CBRS.US) e Nvidia (NVDA.US).

O Morgan Stanley enfatiza que a atual escassez de memória de IA não é uma perturbação de curto prazo, mas sim uma contradição estrutural onde o crescimento do desempenho computacional supera em muito a velocidade de oferta de memória. O tamanho dos modelos de última geração duplica a cada seis meses, as principais janelas de contexto crescem entre 5 e 6 vezes ao ano, e, somando-se à demanda crescente por inferência simultânea, as necessidades de capacidade e largura de banda de memória continuam explodindo. Com o ciclo de construção de fábricas de DRAM levando anos e uma elasticidade de oferta extremamente baixa, a situação de escassez deve durar vários anos. O CEO da Nvidia, Jensen Huang, também afirmou publicamente que o setor precisa mudar de abordagem, respondendo às restrições de memória através da inovação arquitetural, em vez de simplesmente esperar pela expansão da capacidade produtiva.

Diante da escassez de HBM e memória principal, a resposta mais direta da indústria é reduzir de forma seletiva as especificações de memória por dispositivo (De-speccing). Tomando como exemplo a arquitetura Rubin da Nvidia, a capacidade de LPDDR5 por máquina foi reduzida de 54TB planejados para 28TB, e a capacidade de HBM por GPU caiu de 288GB para 192GB, visando garantir o volume de entregas por meio da diminuição da altura de empilhamento da memória. O Morgan Stanley aponta que essa redução não elimina o gargalo da memória, apenas transfere a pressão entre os diferentes níveis de memória: ao cortar a memória local de alta velocidade, dados como caches KV e outros de baixa frequência migram para armazenamento NAND; ao mesmo tempo, as interações de dados entre GPUs aumentam, gerando maior demanda por largura de banda de interconexão de rede. No fundo, trata-se de compensar a escassa memória de alta largura de banda com redes ainda mais rápidas e recursos de armazenamento de menor custo.

A segunda abordagem é o desacoplamento da arquitetura de inferência (Disaggregation). A inferência de IA compreende duas fases distintas: Preenchimento inicial (Prefill) e Decodificação (Decode). O Prefill consome essencialmente poder computacional, enquanto o Decode depende fortemente da largura de banda de memória. Arquiteturas tradicionais usavam o mesmo acelerador para ambos, com baixa eficiência de uso de recursos. Atualmente, o setor avança rapidamente para a inferência heterogênea, separando as duas fases em hardwares distintos: Prefill, intensivo em computação, fica a cargo de GPUs convencionais e o Decode, intensivo em largura de banda de memória, é tratado por chips aceleradores especiais equipados com grande capacidade de SRAM on-chip.

Exemplos típicos incluem o motor em nível de wafer da Cerebras e a arquitetura Groq LPU adquirida pela Nvidia, ambos capazes de fornecer eficiência de largura de banda de memória no Decode muito superior à dos GPUs tradicionais. Segundo o Morgan Stanley, a inferência heterogênea será uma direção importante de evolução da infraestrutura de IA, e as empresas especializadas nos estágios de decodificação deverão conquistar mercados crescentes.

A terceira via é a reestruturação do sistema de memória por meio da tecnologia CXL. O CXL (interconexão de alta velocidade para computação) permite a expansão, compartilhamento e pooling de memória via conexão de alta velocidade, eliminando o vínculo da memória com um único processador e tornando-se uma forma central de superar os limites de capacidade. O banco estima que a demanda de IA elevará o mercado de CXL e chips de memória associados a cerca de 6 bilhões de dólares até 2030, ultrapassando em muito o tamanho do mercado tradicional de expansão de memória para CPUs. O valor central reside em construir uma arquitetura de memória hierarquizada: dados mais acessados permanecem na HBM, os de acesso intermediário vão para o pool de memória CXL, e dados frios de baixa frequência descem ao NAND, combinando o custo ao padrão de acesso do dado.

Em relação às principais linhas de investimento, o Morgan Stanley reitera três frentes: primeiro, seguir superalocando em Micron e SanDisk, uma vez que a redução de especificações resulta de escassez de oferta, e não de enfraquecimento da demanda — a necessidade por memória de IA seguirá forte no longo prazo, com o déficit de oferta absorvendo a capacidade produtiva; em segundo, apostar nos líderes de interconexão CXL e scale-up, como Astera Labs e Marvell; por fim, ficar atento aos beneficiários da inferência heterogênea, como Cerebras, além da Nvidia, que fortaleceu sua posição heterogênea com a aquisição da Groq.

Alerta de risco: crescimento da demanda por capacidade de IA abaixo do esperado; progresso do CXL mais lento que o previsto; expansão da capacidade de memória acima das expectativas.

0
0

Disclaimer: The content of this article solely reflects the author's opinion and does not represent the platform in any capacity. This article is not intended to serve as a reference for making investment decisions.

PoolX: Bloqueie e ganhe
Pelo menos 12% de APR. Quanto mais bloquear, mais pode ganhar.
Bloquear agora!