O que é o World Model, o modelo mundial? Como ele pode revolucionar o mundo, como funciona o princípio de operação, a batalha entre os quatro gigantes e as controvérsias

世界 model (World Model) faz a IA construir um modelo interno de como o mundo funciona: ela entende espaço, física e causalidade, e prevê o próximo estado do mundo — não apenas o próximo “pedaço de texto”, como acontece com grandes modelos de linguagem. Já foi colocada em prática em carros autônomos, robôs e cenários de jogos, mas “parecer realista” não é sinônimo de estar fisicamente correto. Quem realmente é o caminho certo para a AGI: LLM ou World Model? Até hoje, isso segue entre as maiores disputas da indústria.
(Contexto: Li Feifei sobre o próximo passo do LLM: a IA precisa ter “inteligência espacial” para compreender o mundo real; como o modelo Marble realiza isso?)
(Complemento de contexto: Serenity: o maior consenso em World Model no ecossistema de IA; capital chinês abandona modelos base e migra para IA física)

Sumário

Toggle

  • O que é world model?
  • Qual a diferença entre world model e grandes modelos de linguagem (LLM)?
  • Como o world model funciona? Espaço latente e “previsão do próximo instante”
  • Disputa de world model em 2026: o que quatro gigantes estão apostando?
  • O que o world model consegue fazer? Exemplos reais em carros autônomos, robôs e jogos
  • Controvérsias e limitações do world model: ele é realmente mais forte do que LLM?
  • O futuro do world model: outra via rumo à AGI?

World model (World Model) é um dos termos mais citados — e também mais mal compreendidos — no ecossistema de IA hoje. Em uma frase: world model é um sistema que permite que a IA crie um modelo interno de “como o mundo funciona”, para que ela compreenda relações de espaço, física e causalidade e, com base nisso, preveja o que deve acontecer em seguida.

Ele não é a mesma rota tecnológica de modelos de linguagem grandes como ChatGPT e Claude, que o público conhece bem. O LLM prevê “o próximo token (palavra)”; o world model prevê o “próximo estado do mundo”.

O que é world model?

World model, em termos simples, é uma técnica para fazer a IA aprender a fazer “simulações mentais”. Um exemplo: antes de humanos atravessarem a rua, eles simulam automaticamente na mente “se eu der este passo agora, em quantos segundos o carro vai chegar diante de mim”. Essa simulação não exige que a pessoa realmente saia andando até a frente do carro para testar o resultado.

O objetivo do world model é dar essa capacidade à IA: primeiro simular internamente várias possibilidades e só depois decidir o próximo movimento, em vez de testar no mundo real toda vez.

A professora de Ciência da Computação da Universidade Stanford e uma figura de referência em IA, Li Feifei, decompôs as funções do world model em três partes:

  • Geração (generation)
  • Compreensão (understanding)
  • Simulação e interação (simulation/interaction)

A World Labs, que ela fundou, criou o produto Marble com foco justamente na terceira parte: simulação e interação. Isso é visto como a etapa mais crucial — e também a mais difícil — de toda a cadeia técnica. Não é difícil gerar “uma imagem bonita”; o difícil é gerar um espaço que seja “percorrível”, “interativo” e com lógica física ainda assim coerente.

Essa tendência ganhou força e explodiu em 2026 por parte porque, na indústria, apareceu uma ansiedade clara em torno do teto do LLM. Quando o limite da rota “continuação de texto” fica cada vez mais evidente, uma leva de pesquisadores começou a apostar em outra via: fazer a IA aprender diretamente “o mundo” em si, e não apenas como imitar como os humanos descrevem o mundo.

Vale esclarecer um mal-entendido comum: world model não existe para substituir LLM em conversas ou escrita. Ele resolve um problema completamente diferente: raciocínio espacial, simulação física, planejamento de ações. Por isso ele foi implantado primeiro justamente em carros autônomos, robôs e jogos — áreas que precisam compreender o mundo físico — e não em robôs de chat.

Qual a diferença entre world model e grandes modelos de linguagem (LLM)?

Grandes modelos de linguagem (LLM) são construídos sobre a arquitetura Transformer. O funcionamento consiste em prever o “próximo token” de uma sequência. Em outras palavras: depois de ver uma quantidade enorme de texto, o LLM aprende “qual é a próxima palavra mais provável naquela frase” — e toda a computação acontece no “espaço do texto”.

Ele nunca “vê” nem “simula” de verdade o mundo físico. Dentro dele não existe gravidade, colisão ou coordenadas espaciais — apenas relações estatísticas entre palavras.

World model segue um caminho diferente. Tomando como exemplo o JEPA proposto por Yann LeCun: ele não prevê cada pixel da imagem original, nem prevê tokens de texto; em vez disso, ele prevê, no “espaço latente”, representações abstratas do próximo estado.

Em linguagem simples: ele primeiro descarta ativamente detalhes de ruído que não importam (por exemplo, um reflexo numa parede ao fundo) e retém apenas as informações centrais necessárias para compreender aquele mundo — para saber para que direção a bola está rolando e quanto tempo falta para o carro chegar no cruzamento. Como a saída é construída a partir de um estado interno bem definido e verificável, se o que o modelo “pensa por dentro” não casar com o que ele “entrega”, essa inconsistência tende a ser detectada com mais facilidade. É algo que o LLM tem dificuldade de fazer.

As diferenças entre os dois podem ser comparadas rapidamente nesta tabela:

| Projeto em comparação | | --- | Grandes modelos de linguagem (LLM) | World model (World Model) | | --- | --- | | Alvo de previsão | Próximo token (texto) | Próximo estado do mundo | | Espaço de operação | Texto / espaço de linguagem | Espaço latente (latent space) | | Arquitetura central | Transformer | JEPA, modelos de difusão, Transformers autorregressivos etc. | | Entendimento de física | Não simula física; não há modelo interno do mundo | Aprende regras físicas como movimento de objetos, colisão, gravidade | | Erros típicos | Alucinação (a maioria ainda acima de 15%) | Imagens realistas, mas a física pode não estar correta | | Aplicações representativas | Diálogo, escrita, geração de código | Simulação para carros autônomos, treinamento de robôs, mundo 3D explorável |

É preciso lembrar de um ponto: “parecer fisicamente realista” não equivale a “estar fisicamente correto”. Em world model baseado em geração de vídeo, como a meta de treinamento mira mais diretamente “parecer de verdade”, não necessariamente garante “se faz sentido fisicamente”. Isso é crucial e está no centro de uma das controvérsias, principalmente em cenários com tolerância a erro muito baixa, como carros autônomos e robôs.

Como o world model funciona? Espaço latente e “previsão do próximo instante”

Para entender a lógica de funcionamento do world model, é preciso primeiro compreender dois termos: espaço latente e previsão do próximo instante.

Espaço latente: de forma simples, a IA “comprime” a imagem observada em uma série de números abstratos, retendo apenas as informações úteis para compreender aquele mundo e descartando ruído visual desnecessário.

Por exemplo: em um trecho de vídeo de dashcam, o espaço latente pode reter apenas uma descrição abstrata do tipo “há um carro à frente, a distância está diminuindo, a velocidade é média” — sem registrar a cor de cada folha que aparece na imagem. A vantagem é reduzir drasticamente a carga computacional e, além disso, o modelo aprende “padrões/regas” em vez de memorizar a imagem.

Com o espaço latente, o passo seguinte é “prever o próximo instante”: dado o estado atual e uma ação (por exemplo, virar o volante para a esquerda), o modelo prevê como será o estado seguinte.

Esse processo é iterado repetidamente, transformando-se em um “simulador interno” que permite “antecipar”. Você dá à IA um instante e ela pode rodar mentalmente algumas possibilidades de futuros antes de decidir qual ação tomar — em vez de precisar bater no mundo real para descobrir o resultado.

JEPA (Joint Embedding Predictive Architecture, arquitetura de previsão com embeddings conjuntos) é, até agora, a arquitetura mais representativa dessa lógica. Ela foi proposta por Yang LeCun em 2022 no artigo “A Path Towards Autonomous Machine Intelligence”.

A tese central do JEPA é: em vez de obrigar o modelo a gerar todos os pixels detalhados (o que desperdiça capacidade de computação e ainda pode ser desviado por ruídos irrelevantes), é melhor comparar diretamente em nível abstrato se “o futuro previsto” e “o futuro real” são consistentes.

É por isso que LeCun afirma que o world model torna os erros “detectáveis”: como a saída precisa alinhar-se com uma representação interna clara, se não bater, vira um sinal — e não algo que fica “quieto”, misturado em uma sequência de texto que parece fluida, como no caso do LLM.

Mas espaço latente não é uma panaceia. A decisão de quais detalhes devem ser descartados e quais devem ser mantidos é um julgamento de engenharia sem resposta padrão: se descartar demais, a simulação perde fidelidade; se descartar pouco, a eficiência computacional cai. Esse é um dos pontos de maior divergência entre as arquiteturas de world model existentes.

Disputa de world model em 2026: o que quatro gigantes estão apostando?

O mercado de world model em 2026 já reuniu alguns dos atores com maior peso na indústria. O volume de capital também é grande o suficiente para mostrar que não se trata de uma moda tecnológica passageira.

A World Labs, fundada por Li Feifei, foi uma das primeiras a ganhar destaque. Em setembro de 2024, a World Labs saiu do “modo captação” com uma rodada de US$ 230 milhões e avaliação de US$ 1 bilhão. Em janeiro de 2026, surgiu a notícia de que estava negociando uma nova rodada com avaliação de cerca de US$ 5 bilhões. Já em 18 de fevereiro de 2026, a World Labs anunciou oficialmente ter captado US$ 1 bilhão. Entre os investidores estão AMD, Autodesk, Emerson Collective, Fidelity, NVIDIA e Sea. A Autodesk liderou com US$ 200 milhões — a maior aposta da Autodesk em uma empresa iniciante até então.

No acumulado, a World Labs já levantou cerca de US$ 1,23 bilhão. O produto principal, Marble, abriu testes beta limitados em novembro de 2025; em fevereiro de 2026 passou a ser comercialmente disponível. Como entrada, pode receber texto, fotos, vídeos, panoramas ou modelos 3D rústicos. Como saída, entrega ambientes 3D navegáveis, com armazenamento persistente e editáveis — e cada geração produz, ao mesmo tempo, dois tipos de malha: a triangle mesh de alta precisão para geometria e a collider mesh, voltada a detecção de colisão para engines físicas.

O Genie 3, da Google DeepMind, é o único world model que já conseguiu fazer “interação em tempo real”. Ele apareceu primeiro em agosto de 2025, como prévia de pesquisa; em 29 de janeiro de 2026 foi lançado oficialmente, liberado para assinantes do Google AI Ultra na região dos EUA. Ao mesmo tempo, foi lançado um demo online do Project Genie, que permite aos usuários gerar o mundo, entrar para explorar e até remixar/mudar.

Em especificações técnicas, o Genie 3 é um Transformer autorregressivo com 11B de parâmetros, capaz de gerar em tempo real um mundo navegável com resolução 720p e 24 quadros por segundo (24fps). A consistência pode permanecer por vários minutos sem desmoronar.

A NVIDIA segue uma rota de plataforma. Em janeiro de 2025, lançou a plataforma de world model Cosmos; em 1º de junho de 2026, lançou o Cosmos 3, dizendo ser o primeiro omnimodel totalmente aberto. Ele usa uma arquitetura híbrida com Mixture of Experts (especialistas) em Transformer, integrando visão/predição do mundo e previsão de ações em um único sistema, cobrindo múltiplas modalidades como texto, imagens, vídeo, sons do ambiente e ações.

O volume de dados de treino é impressionante: cerca de 20 trilhões de tokens de dados multimodais, incluindo quase 1 bilhão de imagens e 400 milhões de vídeos reais e sintéticos. A NVIDIA afirma que o ciclo de treinamento e avaliação para physical AI (IA física) foi reduzido de “vários meses” para “alguns dias”. O Cosmos 3 ainda tem variações: Super (versão de alta precisão para robôs e carros autônomos), Nano (foco em velocidade extrema) e Edge. A NVIDIA também montou uma aliança chamada Cosmos Coalition, reunindo empresas como Runway, Black Forest Labs e Skild AI.

O movimento de Yann LeCun foi o mais dramático. Em novembro de 2025, ele deixou a Meta, onde ficou por 12 anos e ocupava originalmente o cargo de diretor da FAIR, e cofundou a AMI Labs com Alexandre LeBrun. A sede fica em Paris, e há escritórios em Nova York, Montreal e Singapura.

Em 10 de março de 2026, a AMI Labs anunciou que sua rodada seed levantou US$ 1,03 bilhão (cerca de € 890 milhões). A avaliação pré-investimento é de US$ 3,5 bilhões — a maior captação seed da história de startups na Europa. Entre os investidores estão Bezos Expeditions, NVIDIA, Samsung, Temasek, Toyota Ventures e investidores individuais conhecidos como Mark Cuban e Eric Schmidt. LeCun vem defendendo publicamente há muito tempo que “LLM não chega à inteligência artificial geral” e agora, após deixar a Meta, apostou toda a sua trajetória profissional — junto com US$ 1,03 bilhão — nessa rota de world model.

A posição de cada uma das quatro pode ser resumida assim:

| Empresa / equipe | | --- | Pessoa-chave | Produto representativo | Rodada / escala mais recente | Foco técnico | | --- | --- | --- | --- | | World Labs | Li Feifei | Marble | Acumulado ~ US$ 1,23 bilhão (rodada única de US$ 1 bilhão em 2026/2) | Espaço 3D gerado, navegável e persistente | | Google DeepMind | Equipe DeepMind | Genie 3 | Apoio de recursos internos do Google | 11B de parâmetros, geração de mundo com interação em tempo real | | NVIDIA | Equipe da NVIDIA | Cosmos 3 | Recursos próprios da NVIDIA + aliança Cosmos Coalition | Plataforma aberta de omnimodel, mirando physical AI | | AMI Labs | Yann LeCun | Pesquisa da linha JEPA | Seed de US$ 1,03 bilhão, avaliação de US$ 3,5 bilhões | Arquitetura de previsão em espaço latente do JEPA, linha teórica mais agressiva |

As rotas técnicas dessas quatro empresas não são totalmente iguais. A World Labs dá mais peso a produtos 3D utilizáveis; a Genie 3 foca em interação em tempo real; a Cosmos 3 segue rumo a uma plataforma aberta; a AMI Labs se dedica à pesquisa de arquitetura base. Mas a crença em comum é a mesma:

A próxima grande ruptura em IA não vai depender só de fazer o LLM ficar maior; ela vai depender de fazer a IA realmente “entender” o mundo em que ela está.

O que o world model consegue fazer? Exemplos reais em carros autônomos, robôs e jogos

Os primeiros cenários em que o world model se materializa estão quase sempre ligados diretamente à necessidade de “entender o mundo físico”. Carros autônomos são o exemplo mais direto.

A startup Decart lançou o Oasis 3 em junho de 2026. Ele consegue gerar em tempo real ambientes de direção com duração de até horas e com alta fidelidade. A ideia é ajudar carros autônomos a simular “cenários raros” que dificilmente surgem na vida real, mas que são cruciais para a segurança — como pedestres que surgem de repente em meio a chuva forte e pedestres/veículos em situações em que o carro que vem em sentido contrário perde o controle e desvia para a faixa.

A API do Oasis 3 já está liberada para uso. O preço fica em cerca de 2 centavos de US$ por segundo. O objetivo é conquistar espaço na “camada de simulação” da cadeia de fornecimento de physical AI. A Waymo também divulgou, em fevereiro de 2026, uma arquitetura de simulação generativa própria baseada no Genie 3. Tesla, NVIDIA, Wayve e outras empresas também estão fazendo coisas semelhantes. O valor central dessa tecnologia é bem direto: permitir que o carro autônomo treine repetidamente em “infinitas combinações de cenários simulados”, sem precisar levar o veículo à rua para bater uma vez de verdade e só então aprender a lição.

Robôs são outro campo de batalha importante. Sistemas como Cosmos 3 e Oasis 3 podem gerar ambientes simulados controláveis e com múltiplas perspectivas. Robôs podem aprender no “espaço virtual” a pegar objetos, andar e manipular itens, refinando continuamente as estratégias de ação. Ao substituir dados coletados do mundo real por dados sintéticos, dá para reduzir significativamente custo e tempo de treinamento de robôs. Ações que antes exigiam que robôs físicos testassem milhares de vezes no mundo real para serem aprendidas, agora podem começar rodando uma primeira “volta” no ambiente de simulação.

Jogos e criação de conteúdo são uma aplicação relativamente “mais agradável”. O Genie 3 e o Marble conseguem gerar um mundo explorável a partir de uma simples descrição em texto — isso vira uma ferramenta direta de produtividade para o desenvolvimento de protótipos de jogos e construção de cenas virtuais. Ao mesmo tempo, startups que antes faziam geração de vídeo, como Luma e Runway, começaram a fazer a transição dos próprios modelos de geração de vídeo “que entendem física” na direção de world model. Isso mostra que world model não surgiu do nada como uma nova categoria de competição, mas como uma evolução natural da geração de vídeo rumo a “ser interativo e controlável”.

Esses casos têm um ponto em comum: o valor do world model não está em “quão bonito é o visual”, mas em “se dá para usar para treinar, simular e tomar decisões”. Essa é exatamente a maior linha divisória entre ele e ferramentas apenas de geração de vídeo.

Controvérsias e limitações do world model: ele é realmente mais forte do que LLM?

A aposta mais chamativa dentro do lado que defende world model vem de Yann LeCun. Depois que ele deixou a Meta, fundou a AMI Labs e levantou US$ 1,03 bilhão na seed. No essencial, ele colocou toda a sua carreira num julgamento: a rota de LLM nunca chegará à inteligência artificial geral, e a saída deve ser world model. Esse posicionamento não é consenso na indústria.

Do lado contrário, a voz mais forte é o CEO da Anthropic, Dario Amodei. Ele argumenta que, enquanto a gente continuar expandindo o tamanho dos modelos e fazendo melhorias incrementais na arquitetura, o próprio LLM já é suficiente para superar as limitações atuais. E, no otimismo, até haveria uma chance de 2026 surgir uma “virada de habilidade” — algo que ele descreve como um salto de capacidade rumo a um “país das maravilhas dos gênios dentro de um data center”.

Em outras palavras: um lado acredita que o teto da rota atual já foi visto e é preciso trocar de rota; o outro acredita que o teto ainda não foi alcançado e que é preciso continuar avançando. Nesta disputa de rota, até agora nenhum lado conseguiu apresentar evidência decisiva para convencer o outro. Em certo sentido, ambos estão apostando dinheiro real em uma pergunta que ainda não tem resposta.

O próprio world model também não está livre de falhas. Antes, mencionamos que a arquitetura de espaço latente torna erros com “inconsistência interna” mais fáceis de detectar — mas isso não significa que world model não vai errar. Ele resolve a questão de “se o erro pode ser capturado”, e não “se o erro vai acontecer”. O problema mais crítico é: imagens realistas não significam necessariamente física correta.

Em world model baseado em geração de vídeo, os objetivos de treino são mais direcionados a “parecer de verdade” do que a fazer uma otimização equivalente de “fazer sentido fisicamente”. Uma trajetória de uma bola pode parecer natural e fluida, mas os cálculos de aceleração real e de força de atrito podem não resistir a verificação. Isso é um risco que não pode ser ignorado em aplicações em que “um erro uma vez” vira acidente — como carros autônomos e robôs.

Outra barreira real são custos de computação e latência. Em world model baseado em difusão (diffusion), para gerar uma única cena por frame é preciso passar por múltiplas operações de denoising. Em cenários que exigem resposta em tempo real, como robôs e carros autônomos, o custo de latência fica bem alto: decidir meio segundo atrasado pode virar, no mundo real, um pequeno toque.

Além disso, segundo estimativas da equipe do Open-Sora, para reproduzir um modelo de geração de vídeo em nível comercial, seriam necessários cerca de US$ 200 mil em custo de computação. Isso ainda é só o limiar de “reproduzir” resultados já existentes — não inclui o investimento em P&D para desenvolver uma nova arquitetura do zero.

O futuro do world model: outra via rumo à AGI?

Juntando esses indícios, dá para ver um sinal claro da indústria: em 2026, o world model já deixou de ser apenas um conceito acadêmico e virou uma disputa de rota que mobiliza dezenas de bilhões de dólares e reúne as figuras mais pesadas do setor. Li Feifei provou com Marble que “um mundo 3D navegável” pode virar produto. A Google DeepMind provou com Genie 3 que “interação em tempo real” é tecnicamente viável. A NVIDIA transformou em uma plataforma aberta com Cosmos 3, mirando abocanhar toda a cadeia de suprimento de physical AI. LeCun apostou toda a sua trajetória profissional — e a maior rodada seed da história das startups europeias — no julgamento de que “LLM não chega à AGI”.

Se essa rota realmente leva à inteligência artificial geral, ninguém consegue responder com certeza agora. Mas é possível afirmar que, enquanto aplicações que exigem “entender o mundo físico”, como carros autônomos e robôs, continuarem se expandindo, o valor comercial do world model seguirá sendo validado — sem precisar esperar que o problema final “AGI” seja resolvido.

Para o leitor, em vez de se prender a “o world model vai substituir o LLM?”, vale mudar o ângulo: essas duas rotas técnicas provavelmente vão coexistir por muito tempo. O LLM fica com linguagem e conhecimento; o world model fica com espaço e física. Cada um resolve os problemas que o outro não consegue resolver.

Em resumo, o world model (World Model) representa uma divisão séria e em larga escala da indústria de IA. Quando problemas de alucinação do LLM não foram corrigidos de forma definitiva por muito tempo, um grupo de pesquisadores de ponta decidiu apostar que a IA deve aprender a entender o mundo físico diretamente. Da Marble de Li Feifei, passando pelo Genie 3 da Google e pelo Cosmos 3 da NVIDIA, até a AMI Labs em que Yann LeCun colocou toda a sua trajetória, mais de US$ 3 bilhões já foram investidos nessa batalha.

Se essa será outra via rumo à AGI, ainda é cedo para cravar. Mas é certo que o debate sobre “como a IA deve entender o mundo” está só começando.

AMD8,18%
ADSK-3,09%
NVDA1,86%
META-0,37%
Ver original
Esta página pode conter conteúdo de terceiros, que é fornecido apenas para fins informativos (não para representações/garantias) e não deve ser considerada como um endosso de suas opiniões pela Gate nem como aconselhamento financeiro ou profissional. Consulte a Isenção de responsabilidade para obter detalhes.
  • Recompensa
  • Comentário
  • Repostar
  • Compartilhar
Comentário
Adicionar um comentário
Adicionar um comentário
Sem comentários
  • Fixado