O que é o World Model do mundo? Como subverter o mundo, princípio de funcionamento, batalha entre os quatro grandes e as controvérsias

Modelo do Mundo (World Model) permite que a IA construa um modelo interno de “como o mundo funciona”, compreendendo espaço, física e causalidade. O que prevê é o próximo estado do mundo — não, como os grandes modelos de linguagem, apenas a próxima palavra. Já foi implementado em veículos autónomos, robôs e cenários de jogos, mas “ser visualmente realista” não é o mesmo que “ser fisicamente correto”. Discutir qual é o caminho certo para chegar à AGI — o que fazem os LLMs ou o que fazem os World Models — continua a ser uma das maiores controvérsias da indústria.
(Antecedentes: Li Fei-Fei sobre o próximo passo dos LLMs: para compreender o mundo real, a IA precisa ter “inteligência espacial”; como funciona o modelo Marble?)
(Extra de contexto: Serenity: consenso máximo sobre World Models no círculo de IA; fundos chineses abandonam modelos base e passam para física IA)

Índice do artigo

Toggle

  • O que é um World Model?
  • Em que é que um World Model e um grande modelo de linguagem (LLM) diferem?
  • Como funciona um World Model? Espaço latente e “prever o próximo instante”
  • O panorama dos World Models em 2026: o que estão a apostar quatro gigantes?
  • O que é que World Models conseguem fazer? Casos reais em veículos autónomos, robôs e jogos
  • Controvérsias e limitações dos World Models: é mesmo mais forte do que os LLMs?
  • O futuro dos World Models: outra via para a AGI?

Modelo do Mundo (World Model) é um dos termos mais falados no mundo da IA atualmente — e também um dos mais frequentemente mal compreendidos. Definição em uma frase: um World Model é um sistema que permite à IA construir um modelo interno de “como o mundo funciona”, para compreender as relações entre espaço, física e causalidade e, com base nisso, prever o que acontecerá a seguir.

Não é a mesma linha tecnológica que os grandes modelos de linguagem (LLM) com que o público está familiarizado, como ChatGPT ou Claude. Os LLMs preveem “a próxima palavra (token)”; os World Models preveem “o próximo estado do mundo”.

O que é um World Model?

World Model, em termos simples, é uma tecnologia para fazer com que a IA aprenda a “simular dentro da cabeça”. Por exemplo: antes de um humano atravessar a estrada, o cérebro prepara automaticamente — sem precisar de experimentar uma vez à frente do carro — “se eu sair agora, em quantos segundos é que aquele carro chega à minha frente”.

A ideia do World Model é dar à IA essa capacidade: primeiro simular internamente várias possibilidades, e depois decidir o próximo passo, em vez de tentar no mundo real sempre.

A professora de Ciência da Computação da Stanford e figura de referência no setor de IA, Li Fei-Fei, decompõe a função do World Model em três partes:

  • Geração (generation)
  • Compreensão (understanding)
  • Simulação e interação (simulation/interaction)

A World Labs, que ela fundou, tem o produto Marble como aposta principal na terceira parte — simulação e interação. Esta é vista como a etapa mais crucial e também a mais difícil de toda a cadeia tecnológica: gerar “um desenho bonito” não é difícil; o difícil é gerar um espaço “onde se consegue entrar, interagir e cuja lógica física também faz sentido”.

Esta vaga começou a explodir com força em 2026 por uma parte das preocupações da indústria com o “teto” dos LLMs. Quando o limite da abordagem de “ligações de texto” fica cada vez mais claro, um grupo de investigadores passa a apostar noutra rota: fazer com que a IA aprenda diretamente “o mundo em si”, e não apenas como imitar a forma como as pessoas descrevem o mundo.

Vale a pena esclarecer um mal-entendido comum: o World Model não pretende substituir os LLMs para conversar ou escrever. Ele resolve um problema completamente diferente: raciocínio espacial, simulação física e planeamento de ações. É também por isso que começou a ser aplicado primeiro em domínios como veículos autónomos, robôs e jogos — ou seja, áreas que “precisam compreender o mundo físico” — e não em robots de conversação.

Em que é que um World Model e um grande modelo de linguagem (LLM) diferem?

Os grandes modelos de linguagem (LLM) assentam na arquitetura Transformer. O seu funcionamento é prever o “próximo token” (palavra) numa sequência. Em termos simples: depois de ver volumes enormes de texto, o LLM aprende “qual é a próxima letra/palavra que é mais provável aparecer nesta frase”, e todo o cálculo ocorre num “espaço de texto”.

Nunca “viu” nem “simulou” verdadeiramente o mundo físico. No seu interior não há gravidade, não há colisões, não há coordenadas espaciais — apenas relações estatísticas entre palavras.

O World Model segue um caminho diferente. Exemplo: o JEPA proposto por Yann LeCun. Em vez de prever cada pixel do frame original, e em vez de prever tokens de texto, prevê representações abstratas do estado futuro num “espaço latente”.

Dito de forma mais simples: ele primeiro descarta ativamente pormenores de ruído que não são importantes (por exemplo, um reflexo numa parede ao fundo), mantendo apenas a informação central necessária para compreender o mundo — para entender para que direção a bola está a rolar, ou quantos segundos faltam para o carro chegar ao cruzamento. Como a saída é construída sobre um estado interno explícito e verificável, se “aquilo em que o modelo pensa” e “aquilo que produz” não estiverem alinhados, essa inconsistência tende a ser detetada com relativa facilidade — algo que os LLMs têm dificuldade em fazer.

As diferenças entre os dois podem ser vistas rapidamente na tabela abaixo:

| Item de comparação | | --- | Modelo de linguagem grande (LLM) | Modelo do Mundo (World Model) | | --- | --- | | Objetivo de previsão | Próximo token (texto) | Próximo estado do mundo | | Espaço de funcionamento | Espaço de texto / linguagem | Espaço latente (latent space) | | Arquitetura central | Transformer | JEPA, modelos de difusão, Transformer auto-regressivo, etc. | | Compreensão da física | Não simula física; sem um modelo interno do mundo | Aprende regularidades físicas como movimento de objetos, colisões e gravidade | | Erros típicos | Alucinação (a maioria dos modelos ainda fica acima de 15%) | Visualmente realista, mas nem sempre fisicamente correta | | Aplicações representativas | Conversa, escrita, geração de código | Simulação para condução autónoma, treino de robôs e mundos 3D exploráveis |

Vale lembrar: “parecer visualmente realista” não equivale a “estar correto fisicamente”. Num World Model baseado em geração de vídeo, como o objetivo de treino está mais diretamente alinhado com “parecer real”, não é garantido que otimize igualmente “ser fisicamente plausível”. Em cenários de tolerância a falhas muito baixa — como veículos autónomos e robôs — esta diferença é crítica e constitui uma das controvérsias mais centrais daqui em diante.

Como funciona um World Model? Espaço latente e “prever o próximo instante”

Para compreender a lógica de funcionamento de um World Model, há que entender primeiro dois termos: espaço latente e prever o próximo instante.

Espaço latente, de forma simples, é isto: a IA “comprime” a imagem que vê agora numa série de números abstratos, conservando apenas as informações úteis para compreender o mundo e descartando ruído visual excedentário.

Por exemplo: numa sequência de um dashcam, o espaço latente pode reter apenas descrições abstratas como “há um carro à frente, a distância está a diminuir, a velocidade é moderada”, sem registar a cor de cada folha no cenário. A vantagem é que reduz drasticamente o custo computacional e permite que o modelo aprenda “padrões/regra” em vez de memorizar o ecrã.

Com o espaço latente, o passo seguinte é “prever o próximo instante”. Dado o estado atual e uma ação (por exemplo, virar o volante para a esquerda), o modelo tem de prever como será o estado seguinte.

Ao repetir este processo, transforma-se num simulador interno capaz de “projetar para a frente”: dá-se à IA um estado atual, e ela executa primeiro várias possibilidades futuras na cabeça para decidir qual ação tomar — sem precisar de testar mesmo no mundo real para saber o resultado.

JEPA (Joint Embedding Predictive Architecture, arquitetura preditiva de embeddings conjunta) é, atualmente, a arquitetura mais representativa desta lógica. Foi proposta por Yang LeCun no artigo de 2022 “A Path Towards Autonomous Machine Intelligence”.

A ideia central do JEPA é: em vez de obrigar o modelo a gerar todos os detalhes de cada pixel (o que desperdiça capacidade de computação e ainda o torna suscetível a ser desviado por ruído irrelevante), comparar diretamente em nível abstrato se “o futuro previsto” coincide com “o futuro real”.

É por isso que LeCun afirma que os World Models tornam os erros “detetáveis”: porque a saída tem de se alinhar com uma representação interna clara. Se não bater certo, é um sinal — não como nos LLMs, em que um erro pode misturar-se silenciosamente numa sequência de texto que, à primeira vista, parece fluida.

No entanto, espaço latente não é uma cura milagrosa. Quais detalhes o modelo deve descartar e quais deve conservar é uma decisão de engenharia sem resposta padrão: descartar demasiado leva a simulações distorcidas; descartar demasiado pouco arruina a eficiência computacional. Esta é, também, uma das maiores divergências no desenho das arquiteturas de World Model entre diferentes equipas.

Panorama dos World Models em 2026: o que estão a apostar quatro gigantes?

Em 2026, a corrida dos World Models já reuniu os nomes com mais peso na indústria e um volume de financiamento tão grande que deixa claro que não se trata apenas de uma moda tecnológica momentânea.

World Labs, fundada por Li Fei-Fei, foi das primeiras a ganhar tração nesta vaga. Em setembro de 2024, a World Labs saiu com uma ronda de captação de 230 milhões de dólares e avaliação de 1.000 milhões. Em janeiro de 2026, surgiram notícias de que estava a negociar uma nova ronda com avaliação de cerca de 5.000 milhões de dólares. E em 18 de fevereiro de 2026, a World Labs anunciou oficialmente que tinha levantado 1.000 milhões de dólares; entre os investidores incluem-se AMD, Autodesk, Emerson Collective, Fidelity, NVIDIA e Sea. A Autodesk liderou com 200 milhões — a maior aposta da Autodesk alguma vez em investimento numa startup.

Somando até agora, a World Labs tem um total aproximado de 1,23 mil milhões de dólares captados. O produto flagship Marble abriu testes beta limitados em novembro de 2025; em fevereiro de 2026, entrou em produção comercial. A entrada pode ser texto, fotos, vídeos, mapas panorâmicos ou modelos 3D grosseiros; a saída é um ambiente 3D navegável, com persistência e editável. Além disso, cada geração produz dois tipos de malhas em simultâneo: um triangle mesh para geometria de alta precisão e um collider mesh feito para deteção de colisões no motor físico.

Genie 3, da Google DeepMind, é atualmente o único World Model que conseguiu “interação em tempo real”. Apresentado em agosto de 2025 como uma prévia de investigação, ficou publicamente disponível em 29 de janeiro de 2026. Foi aberto a utilizadores de assinatura do Google AI Ultra na região dos EUA. Em paralelo, também lançou o demo online Project Genie, permitindo aos utilizadores gerar mundos, entrar e explorar, e até fazer remixes/modificações.

Em especificações técnicas, Genie 3 é um Transformer auto-regressivo (autoregressive) com 11B parâmetros. Consegue gerar em tempo real mundos navegáveis com liberdade: resolução 720p, 24 fps (24 frames por segundo). A consistência pode manter-se por vários minutos sem colapsar.

A NVIDIA está a seguir uma via de plataforma. Em janeiro de 2025, lançou a plataforma base Cosmos World Model; em 1 de junho de 2026, lançou o Cosmos 3, que se diz ser o primeiro omnimodel totalmente aberto. Usa uma arquitetura híbrida do tipo mixture of experts (Transformer), integrando raciocínio visual, geração de mundo e previsão de ações num único sistema, cobrindo várias modalidades como texto, imagens, vídeos, ambiente sonoro e ações.

O volume de dados de treino é impressionante: dados multimodais de cerca de 20 triliões (20兆) de tokens, incluindo quase 1.000 milhões de imagens e 400 milhões de vídeos reais e sintéticos. A NVIDIA afirma que esta plataforma reduz significativamente o ciclo de treino e avaliação de physical AI (IA física), de meses para poucos dias. Sob o Cosmos 3 existem variantes: Super (versão de alta precisão para robôs e carros autónomos), Nano (para extrema velocidade) e Edge. A NVIDIA também reuniu uma aliança com Runway, Black Forest Labs, Skild AI e outras empresas para criar o Cosmos Coalition.

O movimento de Yann LeCun foi o mais dramático. Em novembro de 2025, ele deixou a Meta, onde esteve durante 12 anos e onde antes era diretor da FAIR. Em conjunto com Alexandre LeBrun, cofundou a AMI Labs, com sede em Paris e pontos também em Nova Iorque, Montreal e Singapura.

Em 10 de março de 2026, a AMI Labs anunciou que a ronda de seed levantou 1.03 mil milhões de dólares (cerca de 890 milhões de euros). A avaliação pré-investimento foi de 3,5 mil milhões de dólares. Trata-se da maior seed da história de startups europeias. O grupo de investidores inclui Bezos Expeditions, NVIDIA, Samsung, Temasek, Toyota Ventures, além de investidores individuais de renome como Mark Cuban e Eric Schmidt. LeCun defende publicamente há muito tempo que “LLM não chega à inteligência artificial geral”; agora, depois de sair da Meta, ele apostou toda a sua carreira e os 1,03 mil milhões de dólares nesta rota dos World Models.

A posição das quatro equipas pode ser comparada de forma simples:

| Empresa / Equipa | | --- | Figura-chave | Produto representativo | Última captação / dimensão | Posicionamento técnico | | --- | --- | --- | --- | | World Labs | Li Fei-Fei | Marble | Aproximadamente 1,23 mil milhões de dólares (em fevereiro de 2026: 1.000 milhões numa ronda só) | Geração de espaço 3D navegável e persistente | | Google DeepMind | Equipa DeepMind | Genie 3 | Apoio de recursos internos da Google | Transformer com 11B parâmetros, geração de mundos com interação em tempo real | | NVIDIA | Equipa da NVIDIA | Cosmos 3 | Recursos próprios da NVIDIA + Cosmos Coalition | Plataforma omnimodel aberta, foco em physical AI | | AMI Labs | Yann LeCun | Série JEPA | Seed 1,03 mil milhões de dólares, avaliação 3,5 mil milhões de dólares | Arquitetura de previsão em espaço latente JEPA; rota teórica mais agressiva |

As rotas técnicas das quatro empresas não são totalmente idênticas: a World Labs foca em produtos 3D utilizáveis; a Genie 3 foca em interação em tempo real; a Cosmos 3 foca em plataforma aberta; a AMI Labs foca em pesquisa de arquitetura de base. Ainda assim, a crença comum é consistente:

O próximo grande salto em IA não virá apenas por tornar os LLMs maiores; virá por fazer com que a IA realmente “compreenda” o mundo em que está inserida.

O que é que World Models conseguem fazer? Casos reais em veículos autónomos, robôs e jogos

Os primeiros cenários onde os World Models chegam ao terreno estão quase sempre altamente relacionados com “precisar compreender o mundo físico”. Veículos autónomos são o exemplo mais direto.

A startup Decart lançou o Oasis 3 em junho de 2026. Consegue gerar em tempo real ambientes de condução altamente realistas por horas, com o objetivo de ajudar veículos autónomos a simular “cenários raros” difíceis de encontrar no mundo real, mas cruciais para a segurança — como peões que surgem subitamente durante uma chuva forte, ou carros em sentido contrário que perdem o controlo e desviam para a faixa errada.

A API do Oasis 3 já está disponível, com um preço de cerca de 2 centavos de dólar por segundo. A meta é conquistar espaço na “camada de simulação” da cadeia de fornecimento de physical AI. A Waymo também anunciou a sua própria arquitetura de simulação generativa em fevereiro de 2026, construída sobre o Genie 3. A Tesla, NVIDIA, Wayve e outras empresas fazem coisas semelhantes. O valor central desta tecnologia é direto: permitir que os veículos autónomos treinem repetidamente em “infinitos cenários simulados”, sem precisar de conduzir na estrada para provocar um acidente e só aí aprender.

Robótica é outro campo de batalha importante. Sistemas como Cosmos 3 e Oasis 3 podem gerar ambientes simulados controláveis e com múltiplos pontos de vista. Os robôs podem aprender, neste espaço virtual, a agarrar, andar e operar objetos, melhorando iterativamente estratégias de ação. Substituir a recolha de dados do mundo real por dados sintéticos pode reduzir drasticamente custo e tempo de treino. Ações que antes exigiam que robôs físicos testassem milhares de vezes no ambiente real para aprender, agora podem ser executadas primeiro uma ronda no simulador.

Jogos e criação de conteúdos são aplicações relativamente mais “agradáveis”. Tanto Genie 3 como Marble conseguem gerar um mundo explorável a partir de uma simples descrição por texto. Isto é uma ferramenta de produtividade direta para desenvolver protótipos de jogos e montar cenários virtuais. Ao mesmo tempo, startups antes focadas em geração de vídeo, como Luma e Runway, também começaram a adaptar os seus modelos de vídeo “que entendem física” para uma direção de World Model. Isto mostra que World Model não é uma via totalmente do zero, mas uma evolução natural da geração de vídeo para “torná-la interativa e controlável”.

Estes casos partilham algo em comum: o valor dos World Models não está em “o ecrã parecer mais bonito”, mas em “poder ser usado para treinar, simular e tomar decisões”. É exatamente esta a fronteira mais clara em relação a ferramentas de geração de vídeo apenas.

Controvérsias e limitações dos World Models: será mesmo mais forte do que os LLMs?

A aposta mais chamativa no campo dos World Models vem de Yann LeCun. Ao sair da Meta, fundar a AMI Labs e levantar 1,03 mil milhões de dólares na seed, na essência apostou toda a sua carreira numa avaliação: a rota dos LLMs nunca chegará à inteligência artificial geral; a saída tem de ser o World Model. Esta posição não é um consenso da indústria.

Do lado oposto, o maior destaque é o CEO da Anthropic, Dario Amodei. Ele argumenta que, desde que se continue a aumentar o tamanho dos modelos e se façam melhorias incrementais a nível de arquitetura, os próprios LLMs podem ultrapassar as limitações atuais. Mesmo numa perspetiva otimista, em 2026 poderia surgir uma melhoria que ele descreve como um “país das maravilhas de génio nos centros de dados”.

Por outras palavras: um lado acredita que o teto da rota atual já foi alcançado e que é preciso mudar; o outro acredita que o teto ainda não chegou e que vale a pena continuar a avançar. Até agora, nesta disputa de rota, nenhum dos lados conseguiu provas decisivas para convencer o outro. Em certo sentido, ambos os lados estão a apostar dinheiro real num problema que ainda não tem resposta.

O próprio World Model também não está isento de falhas. Antes foi dito que a arquitetura de espaço latente torna erros de “inconsistência interna” mais fáceis de detetar, mas isso não significa que o World Model não cometa erros. Ele resolve o problema de “conseguir apanhar erros”, e não o de “os erros deixarem de acontecer”. O ponto mais crítico é outro: “ser visualmente realista” não equivale a “ser fisicamente correto”.

Num World Model baseado em geração de vídeo, o objetivo de treino está mais diretamente alinhado com “parece ou não parece real”. Não é necessariamente otimizado para “se a lógica física faz ou não sentido”. A trajetória de uma bola pode parecer natural e fluida, mas o cálculo de aceleração real e forças de fricção pode não resistir a validação. Este é um risco que não pode ser ignorado em aplicações como veículos autónomos e robôs, onde “errar uma vez” pode virar acidente.

Outra barreira real é o custo de computação e de latência. Num World Model baseado em difusão (diffusion), para gerar cada frame é necessário passar por múltiplas operações de remoção de ruído. Em cenários que exigem reações imediatas, como robôs e veículos autónomos, o custo de latência é muito elevado. Decisões ficam “meio segundo atrasadas” e, no mundo real, pode ser uma única colisão.

Além disso, segundo estimativas da equipa Open-Sora, para recriar um modelo de geração de vídeo de nível comercial seriam necessários cerca de 200.000 dólares em custos de computação. Isto é apenas a barreira para “recriar” resultados já existentes, não inclui o investimento de I&D para desenvolver uma arquitetura nova do zero.

O futuro dos World Models: outra via para a AGI?

Juntando estas pistas, dá para ver um sinal claro da indústria: em 2026, o World Model já deixou de ser apenas um conceito académico e virou uma disputa de rota que mobiliza dezenas de milhares de milhões de dólares e reúne as figuras mais pesadas da indústria.

Li Fei-Fei usou Marble para provar que “um mundo 3D navegável” pode tornar-se um produto; a Google DeepMind usou Genie 3 para provar que “interação em tempo real” é tecnicamente possível; a NVIDIA usa Cosmos 3 para transformá-lo numa plataforma aberta, tentando conquistar toda a cadeia de fornecimento de physical AI; e LeCun apostou toda a sua carreira e a maior seed da história das startups europeias na avaliação de que “LLM não chega à AGI”.

Se esta rota consegue realmente conduzir à inteligência artificial geral, ninguém consegue dar uma resposta definitiva. O que é certo é que, enquanto a condução autónoma, a robótica e outras aplicações que precisam “compreender o mundo físico” continuarem a expandir, o valor comercial dos World Models continuará a ser validado, sem precisar esperar pela resposta ao “problema final” da AGI.

Para os leitores, em vez de se prenderem à questão de “o World Model vai substituir os LLMs?”, talvez valha a pena mudar de perspetiva: estas duas linhas tecnológicas provavelmente vão coexistir por muito tempo. Os LLMs ficam responsáveis por linguagem e conhecimento; os World Models ficam responsáveis por espaço e física — cada um resolve problemas que o outro não resolve bem.

Em resumo, o World Model (World Model) representa uma bifurcação séria e consciente na indústria de IA: quando o problema das alucinações dos LLMs não é curado de forma persistente, um grupo de investigadores de topo decide apostar na compreensão direta do mundo físico pela IA. De Marble (Li Fei-Fei) e Genie 3 (Google), passando por Cosmos 3 (NVIDIA), até AMI Labs, onde Yann LeCun apostou toda a sua carreira, já foram investidos mais de 3.000 milhões de dólares nesta batalha.

Se será outra via para a AGI, ainda é cedo para decretar. Mas é certo que o debate sobre “como a IA deve compreender o mundo” está apenas a começar.

AMD8,18%
ADSK-3,09%
NVDA1,86%
META-0,37%
Ver original
Esta página pode conter conteúdos de terceiros, que são fornecidos apenas para fins informativos (sem representações/garantias) e não devem ser considerados como uma aprovação dos seus pontos de vista pela Gate, nem como aconselhamento financeiro ou profissional. Consulte a Declaração de exoneração de responsabilidade para obter mais informações.
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
Comentar
Adicionar um comentário
Adicionar um comentário
Nenhum comentário
  • Fixado