Medio chileno con Inteligencia Artificial
Jueves, 24 de septiembre de 2026
Últimas noticias
Tecnología e Innovación

Atlas, el modelo de “mundo” de Fei-Fei Li, apuesta a que la próxima frontera de la IA no es el lenguaje

World Labs, la empresa de Fei-Fei Li, presentó Atlas, un modelo que genera y simula espacios en tres dimensiones. La compañía lo enmarca como el intento de hacer con el mundo físico lo que los modelos de lenguaje hicieron con el texto de internet — aunque su disponibilidad real y su lugar frente a otros "modelos de mundo" siguen sin definirse.

Ilustración de un entorno tridimensional que se disuelve entre detalle fotorrealista y una malla de wireframe, representando un modelo de IA que genera espacios no capturados
Foto: Niranjan Ramamurthy / Wikimedia Commons (CC BY-SA 4.0)

World Labs, la empresa fundada por Fei-Fei Li, presentó Atlas, un modelo de inteligencia artificial capaz de generar, reconstruir y simular espacios en tres dimensiones, según reportó Xataka. La compañía lo describe como un "modelo de mundo": en lugar de predecir la próxima palabra de un texto, predice qué debería verse desde una posición específica dentro de un entorno tridimensional, incluso desde ángulos de cámara que nunca fueron grabados.

Según la nota, Atlas es un "transformer de difusión autorregresivo multimodal" que procesa texto, imágenes, posiciones de cámara, mapas de profundidad y secuencias de video. World Labs lo entrenó desde cero, específicamente para tareas de comprensión espacial, y no como una adaptación de un modelo de lenguaje o de generación de video ya existente, de acuerdo con la descripción que difundió la propia empresa.

Li resume la apuesta con una frase que Xataka le atribuye de forma directa: "There is no language out there. You don't go to nature and see words written in the sky for you" (no hay lenguaje ahí afuera; uno no va a la naturaleza y ve palabras escritas en el cielo). Es una cita de la fundadora reportada por Xataka; esta redacción no pudo confirmarla contra un registro primario —entrevista, paper o evento— de forma independiente. La comparación que propone es directa: así como los modelos de lenguaje se entrenaron sobre el texto acumulado en internet, Atlas apunta al mundo físico, con la idea de construir, a partir de entornos 3D de videojuegos, simuladores y software de arquitectura, algo equivalente a un "internet" para entrenar robots.

Las capacidades que reporta la nota incluyen generar ángulos de cámara realistas a partir de grabaciones limitadas —dos o tres videos de celular, según el ejemplo que da Xataka—, mantener coherencia espacial en áreas que el video original no cubrió, y convertir espacios reales en simulaciones para entrenar robots antes de exponerlos al mundo físico. Las aplicaciones que menciona la fuente van del cine, donde permitiría posicionar una cámara virtual sin necesidad de grabación física, a la robótica, donde entrenar en simulación evitaría los costos de los fallos de entrenamiento físico.

Todo esto —la descripción técnica, las capacidades reportadas, las aplicaciones— es lo que difundió World Labs y lo que Xataka reprodujo. No es un hallazgo verificado por un tercero independiente ni por esta redacción.

Lo que la nota no aclara es tan relevante como lo que sí dice. No hay, en el material disponible, una comparación directa entre Atlas y otros modelos que también se presentan como "modelos de mundo" —Genie, de Google DeepMind, es otro ejemplo del concepto, aunque no aparece mencionado en la cobertura de Xataka—, lo que hace difícil ubicar a Atlas dentro de una categoría cuya definición compartida y estado de madurez todavía no están establecidos. Tampoco queda claro el estado real de disponibilidad del modelo: según la nota, el acceso está limitado a socios de acceso anticipado, sin fecha ni condiciones anunciadas para un lanzamiento más amplio.