Inteligência Arntificial

A revolução de inferência de IA está aqui

A revolução de inferência de IA está aqui


Desde cerca de 2020, A IA concentrou-se largamente na formação de modelos maiores e melhores. Modelos de linguagem grandes (MLMs) balões de milhões de parâmetros para trilhões. Isso se mostrou eficaz: A maior versão do GPT-3 da OpenAI, lançado em 2020, respondeu corretamente apenas 43,9 por cento das perguntas sobre um referencial popular de conhecimento e raciocínio. Apenas quatro anos mais tarde, o GPT-4o atingiu uma pontuação de 88,7% no mesmo exame, efetivamente correspondendo aos de especialistas humanos.

Os laboratórios avançados de IA ainda estão treinando modelos cada vez maiores, mas esse treinamento retrocedeu um pouco para o fundo da conversa sobre IA. Em 2026, a inferência — o uso de modelos treinados para produzir códigos, escrever ensaios ou fazer imagens de nós mesmos como elfos — chegou à vanguarda.

“É como se o treinamento fosse notícia de ontem”, diz Matt Kimball, principal analista de data-center da Moor Insights & Strategy. “Tudo o que qualquer diretor de informação quer falar é inferência.” O CEO da Nvidia, Jensen Huang, falando na conferência GTC 2026 da empresa, citou esta mudança como o “ponto de inflexão de inferência”.

Parte do que causou a mudança é muito simples: LLMs estão se tornando úteis, então as pessoas estão usando-os. Além disso, muitos modelos no mercado hoje são modelos de raciocínio. Em resposta à consulta de um usuário, eles executam inferência não apenas uma vez, mas várias vezes, reprompting-se em um processo chamado cadeia de pensamento. Os modelos de raciocinação geram saídas mais longas, e modelos com alto esforço de raciocínio podem produzir até 20 vezes mais texto do que aqueles com baixo ou nenhum esforço. Adicionando ainda mais à carga de trabalho de inferência do mundo, o aumento da IA agente resultou em inferência que funciona não apenas como uma resposta em tempo real à consulta de um usuário, mas também o tempo todo, trabalhando de forma autônoma em direção a um objetivo definido pelo usuário.

O chip Trainium da Amazon foi originalmente projetado para treinamento de IA. No entanto, a Amazon Web Services optou por dividir a inferência de IA em duas partes, com o Trainium executando a porção mais computacionalmente complexa e o motor em escala de wafers da Cerebras assumindo a porção mais intensiva em memória. Amazonas

A explosão resultante na demanda de inferências levou a alianças inesperadas entre gigantes tecnológicos. A OpenAI e a Amazon implantaram chips do tamanho de um prato de jantar projetado pela Cerebras, apesar da Amazon ter seus próprios chips de trem. Nvidia comprou talento chave e propriedade intelectual de AI-inference startup Groq em um acordo controverso no valor de US $ 20 bilhões. E o Anthropic está a pagar ao concorrente da LLM SpaceXAI mais de um bilhão de dólares por mês para alugar contas de reposição.

Embora possam parecer semelhantes, o treinamento de IA e a inferência de IA são computacionalmente diferentes. Esses grandes movimentos dos gigantes de tecnologia sinalizam que, para suportar a demanda de inferência, vamos precisar de uma mistura de hardware muito diferente do que os especialistas podem ter esperado até mesmo alguns anos atrás.

Como é que a inferência de IA difere do treinamento de IA?

Um LLM não treinado é como uma mistura de peças Scrabble em uma mesa. Em vez de letras simples, porém, os azulejos mostram fragmentos de palavras, chamadas tokens. Tudo que você precisa para escrever quase tudo está presente, mas nada faz sentido.

Treinar um modelo organiza esta confusão usando um jogo de adivinhação jogado em escala. O modelo é mostrado texto real com o próximo token oculto e pedido para prever o que vem a seguir. Após cada palpite, o token correto é revelado e então comparado com a predição, e a diferença é usada para calcular a precisão do modelo. O jogo é jogado não com uma única frase, mas mais de bilhões de passagens.


Enquanto um jogo real de Scrabble pode ser jogado sobre um saco de fichas e algumas bebidas, treinamento de IA é computacionalmente intenso. O modelo atualiza seus parâmetros através da retropropagação, um processo que calcula repetidamente como cada um dos bilhões ou trilhões de parâmetros de um modelo deve mudar para melhorar a próxima previsão. É por isso que os gigantes tecnológicos estão a construir centros de dados maiores do que nunca.

Eventualmente o criador do modelo decide que treinamento adicional não vale o custo, e o jogo de adivinhação pára. As extremidades da retropropagação, os parâmetros são congelados, e o LLM torna-se um modelo pré-treinado. Fine-tuning - uma curta execução de treinamento em dados menores e mais especializados - acrescenta ajustes finais, e o modelo é implantado.



A seguir vem a inferência. Este é o processo de usar o modelo implantado, que, agora que foi treinado, aprendeu a cuspir telhas Scrabble - tokens - em uma ordem sensata.

Você pode pensar que a inferência de IA é menos exigente computacionalmente porque os cálculos de retropropagação usados para atualizar parâmetros são eliminados. Mas Sudeep Bhoja, fundadora e CTO da empresa de inferência-hardware d-Matrix, explica que inferência acrescenta novos desafios.

Os modelos são “autoregressivos” na natureza. Isto é, a próxima saída depende da anterior. “Então, para gerar o próximo token, você tem que ler todos os pesos e todos os [contextos] do token anterior”, explica Bhoja. O contexto inclui todos os seus prompts, todas as respostas do LLM, e todos os arquivos que você envia. É um monte de dados e muito processamento.

Um LLM gera sua resposta em duas fases: pré-preenchimento e decodificação. Prefill é o modelo lendo um prompt. Processa cada token de uma vez, calculando como cada token se relaciona com todos os outros. Esta operação é chamada a atenção, e é uma característica definidora da arquitetura do transformador por trás dos LLMs modernos. Permite-lhes responder a uma palavra em sua frase, parágrafo, e contexto maior, em vez de por conta própria. Pense nisso como organizar peças Scrabble antes de colocá-los em um jogo. Muitos jogadores movem azulejos para imaginar como eles se conectam. Auto-atenção desempenha um papel semelhante, embora em vez de mover peças físicas, cada token envia uma consulta para os outros e recebe uma pontuação indicando a relevância do token.

Essas consultas resultam em dois tipos de vetores: as chaves e valores. Eles são normalmente colocados em uma loja chamada cache KV. Isso não é estritamente necessário, como um modelo poderia, em vez disso, recomputar esses vetores com cada novo token que ele gera. Mas quase todos os LLMs usam um cache KV para reduzir quanta computação eles fazem. O cache KV é armazenado na memória e torna-se um scratchpad para o qual o LLM pode voltar a entender uma conversa, e embora ele começa pequeno, ele pode inchar para dezenas de gigabytes.

Prefill é um problema que pode ser facilmente dividido e trabalhado em paralelo. É por isso que as GPUs se tornaram o acelerador dominante de IA enquanto as LLMs cresciam em popularidade. A rasterização gráfica (computando a cor de cada pixel em uma tela) também é maciçamente paralela, então arquiteturas GPU foram um ajuste natural.



A seguir vem descodificar. Aqui, o modelo gera sua resposta um token de cada vez. A cada passo, toma o token mais recente, pesa-o contra tudo no cache KV, usa essa informação para prever o próximo token, e adiciona a chave e o valor do novo token ao cache. Depois repete-se em sequência, token por token.

É aqui que a natureza autorregressiva do modelo funciona contra a velocidade de inferência. Prever cada token requer ler todo o modelo da memória, e esse modelo consiste em possivelmente dezenas a centenas de gigabytes de parâmetros (os números que representam o que o modelo aprendeu no treinamento). Crucialmente, isso é além da memória necessária para armazenar o cache KV.

Como resultado, o movimento de todos estes dados através da memória muitas vezes requer mais largura de banda do que o hardware de inferência tem disponível. Assim, pelo menos algumas das partes computacionais de uma GPU ficam ociosas enquanto espera por dados. Pesquisadores descobriram que as GPUs Nvidia H100 executando LLMs de código aberto ficam ociosas de 50 a 80 por cento do tempo.

O papel da memória na inferência

Shahriar “Sha” Rabii, ex-chefe de engenharia de silício da Meta e cofundador da startup da IA Majestic Labs, diz que processadores ociosos são os motivos pelos quais muitas empresas que estão tentando melhorar o desempenho de inferência de IA são focadas a laser na memória. “Com a abordagem baseada na GPU, você acaba com computação superprovisionante e com fome de memória. Isso é levar a grande [memória] para fora”, diz.

Os Laboratórios Majestic da Bhoja d-Matrix e da Rabii focam este gargalo de memória. No entanto, suas empresas imaginam diferentes soluções.

O acelerador de IA de segunda geração de d-Matrix, Raptor, visa melhorar o desempenho de inferência, minimizando a distância entre computação e memória. As GPUs na maioria das implementações atuais de inferência de IA fazem isso colocando a memória de alta largura de banda (HBM) em torno do perímetro da GPU. Cada HBM é uma pilha de DRAM morre conectados e conectados a uma interface superrápida para a GPU. Isso é ótimo para treinamento, mas para inferência, a quantidade de memória que você pode empilhar desta forma e a largura de banda que ele pode fornecer deixam algo a desejar.

Arquitectura empilhada de d-Matrix




D-Matrix Raptor remove esse gargalo empilhando um acelerador de IA em um DRAM morrer. Em vez de empilhar memória, d-Matrix empilha memória e computação. Bhoja diz que isso reduz a distância que os dados devem percorrer para “micrometros em vez de milímetros”. Como construir um arranha-céus, ir verticalmente torna possível fazer mais dentro da mesma pegada física.

Majestic toma a abordagem oposta. Em vez de tentar minimizar o comprimento que os dados devem percorrer entre computação e memória, a empresa está focada em melhorar a interface de memória para acomodar traços de fio mais longos, mantendo a largura de banda alta. Fios mais longos permitem que Majestic conecte pilhas de memória que não estão diretamente ao lado da GPU, removendo a limitação de espaço da HBM.

“Uma interface de memória tem uma distância física muito curta que pode operar sobre. No caso da HBM, é de até 2 ou 3 milímetros. Você tem esta linha de costa em torno da periferia, que é o único lugar onde você pode colocar HBM”, diz Rabii.

Majestic afirma que sua interface de memória pode transmitir bits até cerca de um metro. Isso é conseguido com um link de cobre proprietário e um chip agregador de memória que coordena dados. “O agregador é o ponto final para a interface de alta velocidade e uma maneira de se espalhar por muitos chips DRAM de mercadorias,” diz Rabii. Por causa disso, Majestic pode suportar até 128 terabytes de memória DRAM em um único rack de servidor – um aumento significativo sobre o rack GB300 NVL72 da Nvidia, que tem cerca de 20 TB de HBM3E.

Arquitetura de agregação de memória da Majestic Labs



d-Matrix e Majestic têm uma coisa em comum: Em vez de HBM, ambos usam DRAM fora da prateleira. Este é o tipo mais comum de memória de computador no mundo; está em tudo, desde smartphones a carros. O analista de memória Jim Handy diz que a HBM custa de duas a três vezes mais do que a DRAM. d-Matrix e Majestic escolheram DRAM em parte por causa desta vantagem de preço. No entanto, os proponentes da HBM, que incluem gigantes de memória como Samsung e SK Hynix, não estão sentados ociosos.

HBM4, a versão mais recente da memória HBM, está agora em produção e será usado pela Nvidia Vera Rubin GPU, que é esperado para enviar na segunda metade de 2026. Hoshik Kim, chefe de pesquisa de sistemas de memória da SK Hynix, diz que a HBM4 “quebrará decisivamente os gargalos de memória que constrangem hoje a inferência de IA”, dobrando a largura de banda máxima de memória da HBM e aumentando a quantidade de memória HBM por pilha.

Combinando chips para inferência mais rápida

Os grandes jogadores – Nvidia e Amazon – estão indo para uma abordagem tudo-chips-on-deck. As GPUs da Nvidia e os aceleradores de treinamento de treinamento da Amazon ainda são ótimos para parte da carga de trabalho de inferência: o estágio de pré-preenchimento, onde são calculadas todas as chaves e valores de contexto. Mas para acelerar a decodificação, a parte onde novos tokens são gerados, eles estão olhando para novas arquiteturas centradas na memória de jogadores menores.

No caso de Nvidia, o jogador menor era Groq (não confundir com Grok, a família de LLMs treinada pela SpaceXAI). Nvidia comprou propriedade intelectual e contratou talentos da Groq no final de 2025, e apenas três meses depois na conferência GTC 2026 da Nvidia, Jensen Huang revelou a unidade de processamento de idiomas Nvidia Groq 3 (LPU). A arquitetura de Groq depende da memória – em seu caso, SRAM – construída diretamente na arquitetura do chip.


A menos que você é um arquiteto de chip, ou um jogador de PC hardcore, você provavelmente nunca dar SRAM um pensamento. O SRAM tem o benefício de ser bem integrado à arquitetura de um chip de computação – ele está no mesmo pedaço de silício que o processador – e tem o inconveniente de ser menos denso e mais caro do que o DRAM. A maioria das fichas incluem apenas algumas dezenas de megabytes de SRAM. A inferência de IA, no entanto, acendeu novo interesse em SRAM como forma de aproximar os pesos do modelo armazenados na memória.

Ian Buck, vice-presidente e gerente geral de computação de hiperescala e de alto desempenho na Nvidia, diz que a LPU tem um conjunto muito diferente de prioridades do que as GPUs da empresa. A LPU tem muito menos poder de computação bruto do que uma GPU padrão, mas ganha 500 megabytes de SRAM on-die conectado diretamente às suas unidades matemáticas de ponto flutuante. “O benefício é a largura de banda da memória. A LPU tem sete vezes a largura de banda de memória da GPU”, diz.

Entre a GPU Rubin e a LPU Groq, prefill e decodificação podem ser acelerados para obter o melhor de ambos os mundos, a teoria vai. “Nós fazemos toda a matemática de atenção e processamento de contexto no rack Vera Rubin [GPU]”, explica Buck. “Para todos os cálculos especializados... as multiplicações matriciais, fazemos essa parte na LPU.” A empresa embala 256 LPUs no Groq 3 LPX, um sistema do tamanho de um data-center rack.

A abordagem de inferência de dois chips da Nvidia



A Amazon Web Services (AWS), por sua vez, fez um acordo com a Cerebras, para emparelhar o acelerador Trainium com o Wafer-Scale Engine 3 (WSE-3). Cerebras adota uma abordagem similar a Groq, embora em uma escala muito maior. WSE-3 transforma uma bolacha de silício inteira em um único chip que contém mais de 4 trilhões de transistores. O design não se conecta à memória externa, mas, em vez disso, marca 44 gigabytes de SRAM em cada wafer. “Nós armazenamos os pesos [modelo] na SRAM”, diz James Wang, ex-diretor de marketing de produtos na Cerebras, que se mudou desde então para o SpaceXAI. “Então é fácil 40 a 80 bilhões de parâmetros que podemos suportar em um chip.”

Amazon planeja usar chips AWS Trainium para pré-preenchimento e Cerebras para decodificar. Mas os chips de Cerebras também podem ir sozinho em inferência. O WSE-3 foi implantado pela OpenAI para alimentar o GPT-5.3-Codex-Spark, uma variante do modo de codificação da empresa, produzindo mais de 1.000 tokens por segundo. Para comparação, as saídas de implantação padrão GPT-5.4 da OpenAI 50 a 125 tokens por segundo.

Estratégia de inferência de dois chips da Amazon Web Services



Cerebras também podem enfrentar pré-preenchimento sem mover a carga de trabalho para diferentes chips especializados. Para isso, ele conecta vários chips WSE-3 para formar um único pool de memória. Cerebras demonstrou que pode servir modelos com até 1T parâmetros, como o Kimi 2.6 da Moonshot AI, embora Wang diga que “a arquitetura não tem limitação inata em termos de quantos parâmetros ela fará.”

Apesar destas diferenças de estratégia, Nvidia e AWS parecem concordar que o futuro da inferência de IA será resolvido por uma abordagem de sistemas que agrupa diferentes tipos de chips para enfrentar os maiores LLMs. Ou, como Buck diz: “Para fazer uma inferência moderna de IA, você precisa de todas as fichas.”

Aprender a fazer mais com menos (bits)

A Nvidia tornou-se a empresa de tecnologia mais valiosa do mundo porque desenhou as GPUs mais desejadas do mundo. Mas nem toda a atenção está focada em melhorar o hardware de inferência de IA. Pesquisadores de IA também estão aprendendo a otimizar software e hardware LLM em conjunto para fazer o melhor uso dos componentes de memória e computação.

A maioria dos computadores armazena números em um formato de 32 bits ou 64 bits. Estes determinam quantos bits estão disponíveis para representar um único número. Se poucos bits estiverem disponíveis, o número não pode ser armazenado sem perder informações. A qualidade de um LLM beneficia de formatos de números mais precisos, mas isso cria um problema para o desempenho de inferência. Números mais precisos não são gratuitos. Os bits que os descrevem ocupam mais espaço na memória e requerem mais silício e energia para computar.

Gilles Backhus, cofundador da empresa de acelerador de IA Tensordyne, diz que isso cria uma tensão entre tamanho do modelo e precisão numérica. “Você prefere um modelo de tamanho x mas funciona em 8 bits, ou você prefere um modelo que é o dobro do tamanho, mas funciona em 4 bits?” O tamanho de cada modelo será aproximadamente o mesmo em termos de memória e computação, “mas a abordagem de 4 bits lhe dá o dobro de sinapses, se você quiser. E as pessoas estão descobrindo que [a abordagem de 4 bits] vale a pena.”

O processo de conversão de um LLM de um formato de número mais preciso para um formato menos preciso é chamado de quantização, e está em uso há vários anos. No entanto, os pesquisadores estão encontrando novas maneiras de quantizar modelos para baixo, mantendo uma grande maioria da qualidade do modelo.

Nvidia recentemente criou um novo formato de número de 4 bits, NVFP4, para este fim. AMD, Intel e Qualcomm, em vez disso, reuniram-se em torno de um formato de número de 4 bits competitivo chamado MXFP4 que Nvidia também contribuiu para o desenvolvimento. “É a arte negra da IA”, diz Buck, da Nvidia. Quando a Nvidia quantizou o DeepSeek-R1 do FP8 para o NVFP4, as pontuações em sete grandes benchmarks degradaram menos de um por cento enquanto o desempenho melhorou em três vezes, diz a empresa.

A quantificação é provavelmente apenas a ponta da lança, já que pesquisadores e startups de IA estão investigando uma diversidade de oportunidades de otimização, algumas das quais podem mudar drasticamente o silício encontrado no hardware de inferência de IA.

A abordagem única da Tensordyne à inferência de IA combina um formato de número logarítmico com hardware sob medida no chip Napier da empresa. Tensordyne

Espera-se que o tensordyne acelere a inferência de IA com um sistema de números logarítmicos que se apoia em uma propriedade de logaritmos: O log de A vezes B é igual ao log de A mais o log de B. Assim, armazenar números como seus expoentes permite que o chip adicionar onde de outra forma se multiplicaria. Isso importa no silício porque os circuitos multiplicadores extraem mais energia e usam mais área de matrizes do que as adiposas. Tensordyne diz que seu hardware em escala de rack, chamado Napier, pode produzir até 1.300 tokens por segundo por usuário, e pode fazê-lo ao usar menos de um décimo de poder como hardware Nvidia comparável.

Etched, uma startup baseada em San Jose, Calif., está até mesmo projetando aceleradores de IA que traduzem a arquitetura do transformador usado por LLMs diretamente em silício. Ao invés de construir GPUs de uso geral, a empresa está fiação das conexões necessárias para cálculos eficientes do transformador em seu chip, tornando o chip muito menos flexível, mas mais eficiente para as tarefas mais executadas pelos LLMs atuais. A empresa diz que seu primeiro acelerador de IA, Sohu, pode rodar o modelo Llama 70B da Meta em um impressionante 500.000 tokens por segundo, embora esta abordagem também signifique que não será capaz de executar LLMs que se afastam de uma arquitetura de transformadores típica.

Se estas ideias se revelarão frutuosas, resta ver. O Etched acabou de enviar a primeira prateleira em Agosto. Tensordyne acredita que seu primeiro hardware estará disponível em 2027. Mesmo assim, essas startups mostram como a demanda por desempenho de inferência está alimentando ideias não convencionais.

A inferência é o jogo de todos

A grande variedade de abordagens para aceleração de inferência de IA – compactação de computação na memória, estendendo interfaces de milímetros para metros, usando uma bolacha de silício inteira para SRAM, apertando modelos em 4 bits – levanta uma pergunta: Qual vai ganhar, e qual vai perder?

Mas essa provavelmente não é a pergunta certa, dizem os especialistas. A demanda por IA é atualmente insaciável, e enquanto os medos de uma bolha de IA perseguem a indústria, ela ainda tem que dificultar o crescimento.

Pelo contrário, Kimball of Moor Insights & Strategy acha que inferência pode conduzir intensa demanda por hardware de IA a longo prazo, porque não é óbvio onde essa demanda vai terminar. “Você poderia adicionar um milhão de agentes à sua organização”, diz ele. “Essas coisas funcionam 24 horas por dia; elas não vão para casa às cinco horas da noite como nós fazemos.”

Se a inferência de IA permanecer tão desejável quanto Kimball espera, a evolução provavelmente seguirá a mesma trajetória que a CPU. A CPU não melhorou ao longo de um único eixo, mas em vez disso através de várias frentes simultaneamente. Uma vez que a escala do transistor diminuiu, as inovações de arquitetura de chip e sistema de todos os tipos proliferaram. A lista de inovações individuais que levaram à computação pessoal onipresente e poderosa de hoje poderia preencher dezenas de livros.

Daqui a algumas décadas, a história da inovação de inferência de IA mostrará profundidade semelhante.