Básico
Spot
Opera con criptomonedas libremente
Margen
Multiplica tus beneficios con el apalancamiento
Convertir e Inversión automática
0 Fees
Opera cualquier volumen sin tarifas ni deslizamiento
ETF
Obtén exposición a posiciones apalancadas de forma sencilla
Trading premercado
Opera nuevos tokens antes de su listado
Contrato
Accede a cientos de contratos perpetuos
CFD
Oro
Plataforma global de activos tradicionales
Opciones
Hot
Opera con opciones estándar al estilo europeo
Cuenta unificada
Maximiza la eficacia de tu capital
Trading de prueba
Introducción al trading de futuros
Prepárate para operar con futuros
Eventos de futuros
Únete a eventos para ganar recompensas
Trading de prueba
Usa fondos virtuales para probar el trading sin asumir riesgos
CFD
Derivados de Contratos por Diferencia sobre Acciones
Acciones EE. UU.
Accede a acciones y ETF estadounidenses reales
Acciones HK
Opera con acciones de calidad cotizadas en Hong Kong
Acciones surcoreanas
SK Hynix
Opera con acciones surcoreanas reales e invierte en activos populares
Futuros de acciones
Alto apalancamiento, trading 24/7
Acciones tokenizadas
Respaldado por acciones reales
IPO Access
Accede al acceso completo a las OPV de acciones globales
GUSD
3.8%
Acuña GUSD para obtener rendimientos de RWA del Tesoro
Actividades de acciones
Opera con acciones populares y desbloquea grandes airdrops
Lanzamiento
CandyDrop
Acumula golosinas para ganar airdrops
Launchpool
Staking rápido, ¡gana nuevos tokens con potencial!
HODLer Airdrop
Holdea GT y consigue airdrops enormes gratis
Pre-IPOs
Accede al acceso completo a las OPV de acciones globales
Puntos Alpha
Opera activos on-chain y recibe airdrops
Puntos de futuros
Gana puntos de futuros y reclama recompensas de airdrop
Inversión
Simple Earn
Genera intereses con los tokens inactivos
Inversión automática
Invierte automáticamente de forma regular
Inversión dual
Aprovecha la volatilidad del mercado
Staking flexible
Gana recompensas con el staking flexible
Préstamo de criptomonedas
0 Fees
Usa tu cripto como garantía y pide otra en préstamo
Centro de préstamos
Centro de préstamos integral
Centro de patrimonio VIP
Planes de aumento patrimonial prémium
Gate Wealth
Toma el control del futuro financiero
Quant Fund
Estrategias cuantitativas de alto nivel
Staking
Haz staking de criptomonedas para ganar en productos PoS
Apalancamiento inteligente
Apalancamiento sin liquidación
GUSD
3.8%
Deposita y canjea cuando quieras, sin comisiones
Promociones
Centro de actividades
Únete a actividades y gana recompensas
Referido
200 USDT
Invita amigos y gana por tus referidos
Programa de afiliados
Gana recompensas de comisión exclusivas
Gate Booster
Aumenta tu influencia y gana airdrops
Anuncio
Novedades de plataforma en tiempo real
Gate Blog
Artículos del sector de las criptomonedas
Servicios VIP
Grandes descuentos en tarifas
Gestión de activos
Solución integral para la gestión de activos
Institucional
Soluciones de activos digitales: empresas
Desarrolladores (API)
Conecta con el ecosistema de aplicaciones Gate
Transferencia bancaria OTC
Deposita y retira fiat
Programa de bróker
Reembolsos generosos mediante API
AI
Gate AI
Tu compañero de IA conversacional para todo
Gate AI Bot
Usa Gate AI directamente en tu aplicación social
GateClaw
Gate Blue Lobster, listo para usar
Gate for AI Agent
Infraestructura de IA, Gate MCP, Skills y CLI
Gate Skills Hub
+10 000 habilidades
De la oficina al trading, una biblioteca de habilidades todo en uno para sacar el máximo partido a la IA
¿Qué es el World Model (modelo del mundo)? Cómo puede trastocar el mundo, su principio de funcionamiento, la batalla entre los cuatro grandes y las controversias
世界模型 (World Model) permite que la IA construya un modelo interno de “cómo funciona el mundo”, comprendiendo el espacio, la física y la causalidad; predice el siguiente estado del mundo, en lugar de, como los grandes modelos de lenguaje, predecir solo la siguiente palabra. Ya se ha materializado en vehículos autónomos, robots y escenarios de juegos, pero el hecho de que las imágenes sean realistas no equivale a que la física sea correcta; y la pregunta de qué camino es el correcto hacia la AGI entre los modelos de LLM y el world model sigue siendo una de las mayores controversias de la industria.
(Resumen previo: Li Fei-Fei habla sobre el siguiente paso de los LLM: la IA necesita “inteligencia espacial” para comprender el mundo real; ¿cómo logra el modelo Marble hacerlo?)
(Información de contexto: Serenity: el world model es el mayor consenso en el círculo de la IA; financiamiento chino que abandona los modelos base y se pasa a la física IA)
Índice del artículo
Toggle
El world model (modelo del mundo) es uno de esos términos que se mencionan más en el ámbito de la IA, pero también se malinterpreta con más frecuencia. Definición en una frase: un world model es un sistema que permite que la IA construya un modelo interno de “cómo funciona el mundo”, para que entienda las relaciones de espacio, física y causalidad, y con base en eso prediga qué sucederá después.
No sigue la misma ruta tecnológica que la que la gente conoce, como ChatGPT y Claude, los grandes modelos de lenguaje (LLM). El LLM predice “el siguiente token (palabra)”, mientras que el world model predice “el siguiente estado del mundo”.
¿Qué es el world model?
En pocas palabras, el world model es una técnica que busca que la IA aprenda la capacidad de “simular en el cerebro”. Por ejemplo: antes de cruzar la calle, los humanos suelen preensayar mentalmente “si ahora doy este paso, ¿en cuántos segundos el auto llegará a mí?”, sin necesidad de realmente acercarse al auto una vez para conocer el resultado.
El world model busca que la IA tenga esa misma capacidad: primero simula internamente varias posibilidades y luego decide el siguiente movimiento, en vez de tener que probar en el mundo real cada vez.
Li Fei-Fei, profesora de Ciencias de la Computación en Stanford y figura indicadora del sector de la IA, descompuso la función del world model en tres partes:
World Labs, la empresa que fundó, y su producto Marble, se enfocan justamente en la tercera parte: la simulación y la interacción. En la cadena tecnológica completa, esto se considera el eslabón más clave y también el más difícil, porque generar “una imagen bonita” no es lo complicado; lo difícil es generar un espacio “en el que se puede entrar, con el que se puede interactuar, y cuya lógica física también sea razonable”.
Esta ola por qué explotó con fuerza en 2026 tiene una razón: en la industria creció una ansiedad visible por el “techo” de los LLM. Cuando el camino de “recrear texto en cadena” se vuelve cada vez más claro en cuanto a límites, un grupo de investigadores empezó a apostar por otra ruta: que la IA aprenda a comprender “el mundo” en sí misma, en lugar de solo aprender a imitar cómo describen los humanos el mundo.
Vale la pena aclarar un malentendido común: el world model no busca reemplazar a los LLM para conversar o para escribir. Resuelve problemas completamente distintos: razonamiento espacial, simulación física y planificación de acciones. Por eso se implementa primero en vehículos autónomos, robots y juegos: dominios que “necesitan comprender el mundo físico”, en lugar de en chatbots.
¿En qué se diferencia el world model de los grandes modelos de lenguaje (LLM)?
Los grandes modelos de lenguaje (LLM) están construidos sobre la arquitectura Transformer. Su funcionamiento consiste en predecir el “siguiente token” dentro de una secuencia. En simple: después de haber visto cantidades enormes de texto, el LLM aprende “qué palabra tiene más probabilidad de aparecer después en esa frase”, y todo el cálculo ocurre en el “espacio del texto”.
Nunca ha “visto” ni “simulado” realmente el mundo físico. Dentro no hay gravedad, no hay colisiones, no hay coordenadas espaciales: solo hay relaciones estadísticas entre palabras.
El world model toma otro camino. Un ejemplo es el JEPA propuesto por Yann LeCun: en lugar de predecir cada píxel del video original, o predecir tokens de texto, predice en un “espacio latente” representaciones abstractas de los estados futuros.
Dicho de forma coloquial: primero desecha detalles de ruido que no importan (por ejemplo, un reflejo en una pared del fondo) y conserva solo la información central necesaria para entender el mundo: hacia qué dirección se mueve esta pelota, o cuántos segundos faltan para que este auto llegue a la intersección. Como la salida se construye sobre un estado interno claro y verificable, si lo que “piensa” internamente el modelo no coincide con lo que “produce” en la salida, esa inconsistencia es relativamente fácil de detectar; algo que los LLM tienen más difícil de lograr.
La diferencia entre ambos puede compararse rápido con la siguiente tabla:
| Comparación de proyectos | | --- | Grandes modelos de lenguaje (LLM) | World model (World Model) | | --- | --- | | Objetivo de predicción | Siguiente token (texto) | Siguiente estado del mundo | | Espacio de operación | Espacio de texto / lenguaje | Espacio latente (latent space) | | Arquitectura central | Transformer | JEPA, modelos de difusión y Transformers autorregresivos, etc. | | ¿Comprende física? | No simula física; sin modelo interno del mundo | Aprende reglas físicas como movimiento de objetos, colisiones, gravedad | | Errores típicos | Alucinaciones (la mayoría de los modelos aún supera el 15%) | Imágenes realistas pero la física no necesariamente es correcta | | Aplicaciones representativas | Conversación, escritura, generación de código | Simulación para conducción autónoma, entrenamiento de robots, mundos 3D explorables |
Conviene recordar algo: “que se vea realista” no equivale a “que sea físicamente correcto”. En los world models basados en generación de video, como el objetivo de entrenamiento se enfoca más directamente en “si se ve o no real”, no necesariamente garantiza “si es físicamente razonable o no”; y en escenarios de tolerancia de error muy baja como vehículos autónomos y robots, esa diferencia es clave, y también una de las controversias centrales que vienen.
¿Cómo funciona el world model? Espacio latente y “predicción del siguiente instante”
Para entender la lógica del funcionamiento del world model, primero hay que comprender dos términos: espacio latente y predicción del siguiente instante.
Espacio latente: en pocas palabras, la IA “comprime” la imagen que ve en un conjunto de números abstractos, conservando solo la información útil para comprender este mundo y eliminando el ruido visual sobrante.
Por ejemplo: en una grabación de un dashcam, el espacio latente puede conservar solo descripciones abstractas como “hay un auto delante, la distancia se está acortando, la velocidad es media”, y no registrar el color de cada hoja del encuadre. La ventaja es que reduce drásticamente el costo de cómputo y el modelo aprende “patrones” en vez de memorizar la imagen.
Con el espacio latente, el siguiente paso es “predecir el siguiente instante”: dado el estado actual y un conjunto de acciones (por ejemplo, girar el volante a la izquierda), el modelo debe predecir cómo será el siguiente estado.
Este proceso se repite una y otra vez, convirtiéndose en un simulador interno que permite “adelantar” escenarios: con un estado actual, la IA puede ejecutar en su mente varias posibles futuras y decidir qué acción tomar, sin tener que chocar una vez en el mundo real para saber el resultado.
JEPA (Joint Embedding Predictive Architecture, arquitectura predictiva de embeddings conjunta) es la arquitectura que mejor representa esta lógica, propuesta por Yang LeCun en su paper de 2022 titulado 《A Path Towards Autonomous Machine Intelligence》.
La tesis central de JEPA es: en vez de obligar al modelo a generar cada detalle de píxel (lo cual desperdicia capacidad de cómputo y además lo puede desviar el ruido irrelevante), es mejor comparar directamente en un nivel abstracto si “la predicción del futuro” coincide con “el futuro real”.
Por eso LeCun dice que el world model hace que los errores sean “detectables”: porque su salida debe alinearse con una representación interna clara; si no encaja, eso es una señal, y no como en los LLM, donde los errores pueden mezclarse silenciosamente dentro de una cadena de texto aparentemente fluida.
Pero el espacio latente no es una panacea. Qué detalles se deben desechar y cuáles conservar sigue siendo una decisión de ingeniería sin respuesta estándar. Si se desecha demasiado, la simulación pierde fidelidad; si se desecha muy poco, se destruye la eficiencia del cómputo. Ese es uno de los mayores puntos de divergencia en el diseño de arquitecturas de world model de cada empresa.
La batalla del world model en 2026: ¿qué apuestan cuatro titanes?
En el segmento de world model de 2026, ya se han reunido algunos de los nombres más pesados de la industria, con un tamaño de capital tan grande que demuestra que no es un simple “giro tecnológico” pasajero.
World Labs, fundada por Li Fei-Fei, es la empresa que más temprano se hizo conocida en esta ola. En septiembre de 2024, World Labs salió con una ronda de levantamiento de 230 millones de dólares y una valuación de 1.000 millones de dólares; en enero de 2026 se informó que estaban negociando una nueva ronda con una valuación de alrededor de 5.000 millones de dólares; y el 18 de febrero de 2026, World Labs anunció oficialmente haber recaudado 1.000 millones de dólares, con inversionistas como AMD, Autodesk, Emerson Collective, Fidelity, NVIDIA y Sea, entre otros. En esa ronda, Autodesk lideró con 200 millones de dólares; esa fue la inversión más grande de Autodesk en la historia para una startup.
Sumando en total, hasta ahora World Labs ha recaudado aproximadamente 1.230 millones de dólares. El producto insignia Marble abrió un beta limitado en noviembre de 2025; en febrero de 2026 pasó a uso comercial oficial. Las entradas pueden ser texto, fotos, videos, panorámicas o modelos 3D aproximados; las salidas son entornos 3D navegables, persistentes y editables. Además, una sola generación produce simultáneamente dos tipos de mallas: triangle mesh de alta precisión para geometría, y collider mesh diseñada específicamente para detección de colisiones del motor físico.
Genie 3 de Google DeepMind, por su parte, es el único world model que logra “interacción en tiempo real”. Apareció en agosto de 2025 como una vista previa de investigación; el 29 de enero de 2026 se hizo público de forma oficial. Se abrió para usuarios suscritos a Google AI Ultra en Estados Unidos, y al mismo tiempo lanzó el demo en línea de Project Genie, para que los usuarios puedan generar mundos directamente, entrar y explorar, e incluso hacer remix y modificaciones.
En términos de especificaciones técnicas, Genie 3 es un Transformer autorregresivo (autoregressive) con 11B parámetros. Puede generar en tiempo real mundos navegables con resolución 720p y 24 cuadros por segundo (24fps). La consistencia puede mantenerse durante varios minutos sin colapsar.
NVIDIA sigue una ruta de plataforma. En enero de 2025 lanzó el plataforma base Cosmos world model; el 1 de junio de 2026 presentó Cosmos 3, al que llama el primer omnimodel totalmente abierto. Utiliza una arquitectura Transformer de mezcla de expertos: integra en un único sistema el razonamiento visual, generación del mundo y predicción de acciones, cubriendo múltiples modalidades como texto, imágenes, video, sonidos ambientales y acciones.
El volumen de datos de entrenamiento es sorprendente: datos multimodales de cerca de 20 billones de tokens, que incluyen casi 1.000 millones de imágenes y 400 millones de videos reales y sintéticos. NVIDIA afirma que este sistema reduce el ciclo de entrenamiento y evaluación del physical AI (IA física) de varios meses en el pasado a solo días. Bajo Cosmos 3 también hay tres variantes: Super (versión de alta precisión para robots y vehículos autónomos), Nano (para buscar velocidad extrema) y Edge. NVIDIA también formó la alianza Cosmos Coalition con empresas como Runway, Black Forest Labs y Skild AI.
El movimiento de Yann LeCun fue el más dramático. En noviembre de 2025, dejó Meta, donde estuvo durante 12 años y donde originalmente era director de FAIR. Junto con Alexandre LeBrun cofundó AMI Labs, con sede en París, y además con sedes en Nueva York, Montreal y Singapur.
El 10 de marzo de 2026, AMI Labs anunció que en su ronda semilla había recaudado 1.030 millones de dólares (aprox. 890 millones de euros). La valuación previa de inversión fue de 3.500 millones de dólares, lo que constituye la ronda semilla más grande en la historia de las startups europeas. La lista de inversionistas incluye Bezos Expeditions, NVIDIA, Samsung, Temasek, Toyota Ventures, y reconocidos inversionistas individuales como Mark Cuban y Eric Schmidt. LeCun ha defendido públicamente durante mucho tiempo que “los LLM no llegarán a la inteligencia artificial general”; ahora, después de dejar Meta, apuesta toda su trayectoria profesional —junto con los 1.030 millones de dólares— a esta ruta del world model.
La posición de las cuatro puede resumirse así:
| Empresa / Equipo | | --- | Personaje clave | Producto representativo | Última ronda / escala de financiamiento | Posicionamiento técnico | | --- | --- | --- | --- | | World Labs | Li Fei-Fei | Marble | Aproximadamente 1.230 millones de dólares (ronda única de 1.000 millones en 2026/2) | Generación de espacio 3D navegable y persistente | | Google DeepMind | Equipo de DeepMind | Genie 3 | Apoyo de recursos internos de Google | Transformer de 11B parámetros, generación de mundos interactivos en tiempo real | | NVIDIA | Equipo de NVIDIA | Cosmos 3 | Recursos propios de NVIDIA + alianza Cosmos Coalition | Plataforma omnimodel abierta, enfocada en physical AI | | AMI Labs | Yann LeCun | Investigación de la serie JEPA | Ronda semilla 1.030 millones de dólares, valuación 3.500 millones de dólares | Arquitectura predictiva de espacio latente de JEPA, ruta teórica más agresiva |
Las rutas técnicas de las cuatro empresas no son idénticas: World Labs se inclina por productos 3D espaciales utilizables; Genie 3 se enfoca en interacción en tiempo real; Cosmos 3 adopta plataforma abierta; AMI Labs se especializa en investigación de infraestructura subyacente. Pero la creencia compartida es consistente:
¿Qué puede hacer el world model? Casos reales en vehículos autónomos, robots y juegos
Los escenarios donde el world model se implementa primero casi siempre están altamente relacionados con “necesitar comprender el mundo físico”. Los vehículos autónomos son el ejemplo más directo.
La startup Decart, en junio de 2026, lanzará Oasis 3: puede generar en tiempo real entornos de conducción altamente realistas durante hasta horas. Su enfoque es ayudar a los vehículos autónomos a simular “escenarios raros” que son difíciles de encontrar en la realidad, pero cruciales para la seguridad. Por ejemplo, peatones que aparecen de repente bajo una lluvia intensa, o vehículos que pierden el control en el carril contrario y se desvían.
La API de Oasis 3 ya está disponible. El precio es de aproximadamente 2 centavos de dólar por segundo. El objetivo es capturar en la cadena de suministro de physical AI “la capa de simulación”. Waymo también presentó en febrero de 2026 su propia arquitectura de simulación generativa, construida sobre Genie 3. Tesla, NVIDIA, Wayve, etc., hacen cosas similares. El valor central de esta tecnología es muy directo: permitir que los vehículos autónomos practiquen repetidamente en “infinitas variedades de escenarios simulados”, sin necesidad de aprender las lecciones estrellándose una vez en la vía real.
El área de robots es otro campo de batalla clave. Sistemas como Cosmos 3 y Oasis 3 pueden generar entornos de simulación controlables y con múltiples perspectivas. Los robots pueden aprender a agarrar, caminar y operar objetos en ese espacio virtual, y mejorar repetidamente sus estrategias de movimiento. Usar datos sintéticos en lugar de recopilar datos en el mundo real reduce de forma drástica el costo y el tiempo de entrenamiento. Acciones que antes requerían que robots físicos hicieran pruebas miles de veces en entornos reales para aprender, ahora pueden probarse primero en un entorno de simulación.
En cuanto a juegos y creación de contenidos, es un caso relativamente “más atractivo”. Genie 3 y Marble pueden generar un mundo en el que se puede entrar y explorar a partir de una sola descripción en texto; esto es una herramienta de productividad directa para el desarrollo de prototipos de juegos y la construcción de escenarios virtuales. Al mismo tiempo, startups como Luma y Runway, que originalmente hacían generación de video, también empiezan a transformar sus modelos de generación de video “que entiende física” hacia el rumbo del world model. Esto muestra que el world model no es una pista completamente inventada desde cero: es el siguiente paso natural de la generación de video hacia una generación “interactiva y controlable”.
Estos casos comparten un punto: el valor del world model no está en “si el video se ve más bonito”, sino en si se puede usar para entrenar, para simular y para tomar decisiones. Esa es la línea divisoria más grande frente a herramientas de generación de video meramente visuales.
Controversias y límites del world model: ¿es realmente más fuerte que el LLM?
Una apuesta dentro del bando del world model que llama especialmente la atención proviene de Yann LeCun. Al dejar Meta, fundar AMI Labs y recaudar 1.030 millones de dólares en ronda semilla, en esencia puso toda su carrera en una decisión: que la ruta de los LLM jamás llegará a la inteligencia artificial general, y que la salida debe ser el world model. Esta postura no es consenso en la industria.
Del lado contrario, el CEO de Anthropic, Dario Amodei, es quien más fuerte ha hecho oír su voz. Su argumento es que, si se continúa ampliando el tamaño de los modelos y se acompaña con mejoras incrementales a nivel de arquitectura, los LLM por sí mismos son suficientes para romper límites actuales; e incluso, en un escenario optimista, en 2026 podría haber un salto de capacidades parecido a lo que él describe como “el país de los genios dentro de un centro de datos”.
Dicho de otra manera: una parte cree que ya se ve la “pared” del techo en la ruta actual y hay que cambiar de camino; la otra cree que el techo aún no se ha alcanzado y que seguir empujando es la estrategia correcta. En esta disputa de rutas, hoy ninguna parte puede aportar evidencia decisiva que convenza a la otra; en cierto grado, ambos lados están apostando dinero real a una pregunta que todavía no tiene respuesta.
El world model tampoco está exento de fallas. Antes se mencionó que la arquitectura de espacio latente hace que los errores de “inconsistencia interna” sean más fáciles de detectar; pero eso no significa que el world model no cometerá errores. Lo que resuelve es si “se pueden atrapar los errores”, no si “los errores no ocurrirán”. El problema más importante sigue siendo: “que la imagen se vea realista” no equivale a “que sea físicamente correcto”.
En world models basados en generación de video, el objetivo de entrenamiento se orienta más directamente a “si se ve como verdadero”, y no necesariamente optimiza en el mismo grado “si la lógica física es o no razonable”. Una trayectoria de una pelota puede verse natural y fluida, pero los cálculos de aceleración real y fuerza de fricción podrían no pasar la prueba. En aplicaciones donde “un error es un accidente”, como vehículos autónomos y robots, este riesgo no puede ignorarse.
Los costos de cómputo y la latencia también son barreras reales. En world models basados en difusión (diffusion), cada cuadro requiere múltiples operaciones de denoise. Para escenarios que exigen reacción inmediata, como robots y vehículos autónomos, el costo de latencia es bastante alto: una decisión a medias, y en el mundo real puede ser un roce o choque.
Además, según estimaciones del equipo de Open-Sora, para reproducir un modelo de generación de video de nivel comercial se necesitan aproximadamente 200.000 dólares de costo en cómputo. Y eso es solo el umbral para “reproducir” resultados existentes, sin incluir la inversión de I+D para desarrollar una arquitectura nueva desde cero.
El futuro del world model: ¿otra ruta hacia la AGI?
Al juntar estas pistas se ve una señal clara de la industria: en 2026, el world model ya pasó de ser un concepto académico a convertirse en una lucha de rutas donde se movilizan decenas de miles de millones de dólares y se concentran las figuras más pesadas de la industria. Li Fei-Fei usa Marble para demostrar que “un mundo 3D navegable” puede convertirse en producto; Google DeepMind usa Genie 3 para demostrar que “la interacción en tiempo real” es viable; NVIDIA usa Cosmos 3 para convertirlo en una plataforma abierta y busca comerse toda la cadena de suministro de physical AI; LeCun, por su parte, pone toda su trayectoria profesional y la mayor ronda semilla en la historia de startups europeas apostando a la decisión de que “los LLM no llegarán a la AGI”.
Si esta ruta realmente puede llevar a la inteligencia artificial general, nadie puede dar una respuesta segura hoy. Pero sí es claro que mientras se siga expandiendo la demanda de aplicaciones que “requieren comprender el mundo físico” como vehículos autónomos y robots, el valor comercial del world model seguirá validándose, sin tener que esperar a que el problema final de “AGI” sea resuelto.
Para los lectores, en vez de obsesionarse con “¿el world model reemplazará a los LLM?”, conviene cambiar el ángulo de comprensión: es probable que estas dos rutas de tecnología coexistan a largo plazo. Los LLM se encargan del lenguaje y el conocimiento; el world model se encarga del espacio y la física; cada uno resuelve problemas que el otro no puede abordar bien.
En resumen, el world model (World Model) representa una escisión seria en la industria de la IA: cuando el problema de las alucinaciones de los LLM no se puede curar del todo, un grupo de investigadores de primer nivel decide apostar a que la IA comprenda el mundo físico directamente. Desde Marble de Li Fei-Fei, Genie 3 de Google y Cosmos 3 de NVIDIA, hasta AMI Labs donde Yann LeCun arriesga toda su trayectoria, ya se han invertido más de 3.000 millones de dólares en esta batalla.
Si será “otra ruta hacia la AGI” aún es demasiado pronto para dictaminar, pero lo seguro es que este debate sobre “cómo debe la IA comprender el mundo” apenas empieza.