Yaratıcı bünyeler için günlük besin kaynağı
Piksel Hassasiyetinde Kamera Kontrolüyle 3B Dünyalar Üreten Çok Modlu Yapay Zekâ: Atlas

Piksel Hassasiyetinde Kamera Kontrolüyle 3B Dünyalar Üreten Çok Modlu Yapay Zekâ: Atlas

World Labs’in yeni modeli Atlas; metinleri, görselleri, videoları ve 3B verileri aynı uzamsal bağlamda işleyerek görüntüler ve videolar üretiyor ve gerçek dünyadaki mekanları 3B olarak yeniden oluşturuyor.

Yapay zekâ araştırma şirketi World Labs, mekânı yalnızca görüntüler üzerinden değil, üç boyutlu bir dünya olarak anlamaya ve modellemeye odaklanan yeni yapay zekâ modeli Atlas’ı tanıttı. Şirketin “uzamsal zekâ” (spatial intelligence) yaklaşımının yeni nesil modeli olarak konumlandırdığı Atlas, 1 Eylül 2026’da duyuruldu. World Labs, modeli “dünyayı üretmek, yeniden oluşturmak ve simüle etmek” üzere geliştiriyor.

World Labs’in X’teki tanımına göre Atlas, “dünyanın ilk çok modlu dünya modeli” olarak; görüntü ve video karelerini piksel düzeyinde hassas kamera kontrolüyle üretebiliyor ve bunları 3B olarak yeniden oluşturabiliyor.

Atlas, önceden eğitilmiş bir “omni” model olarak metin, görsel, video ve 3B verilerle doğal biçimde çalışıyor. World Labs’e göre model, tüm bu girdileri ortak bir uzamsal bağlamda birleştiriyor ve bu bağlama dayanarak bir sonraki çıktıyı üretiyor. Böylece gördüğü unsurlarla 3B açıdan tutarlı kalırken, görüntülerde bulunmayan bölümleri de dünya bilgisine dayanarak hayal edebiliyor. Modelin performansının kullanılan eğitim hesaplama gücü arttıkça yükseldiği ve bu eğilimin ölçek büyütüldükçe devam etmesinin beklendiği belirtiliyor.

Atlas, hassas kamera geometrisini modelin doğal girdilerinden biri olarak kullanıyor

Atlas’ın öne çıkan özelliklerinden biri, bir ya da daha fazla referans görüntüden yeni kamera açıları oluşturabilmesi. Kullanıcı, kameranın konumunu ve açısını belirleyebiliyor; Atlas da referans görüntülerin içeriği ve geometrisiyle tutarlı yeni görüntüler üretiyor. Görüntülerde görünmeyen bölümleri ise mevcut dünya bilgisine dayanarak tamamlıyor. Model, görüntülerin yanı sıra farklı kamera hareketleriyle videolar da oluşturabiliyor ve altı adede kadar referans görüntü ile tasarlanmış kamera yollarından 1440p çözünürlükte ve maksimum 1 dakika uzunlukta video üretebiliyor.

Buradaki kamera kontrolü, yalnızca metinle “kamerayı sağa çevir” gibi komutlar vermekten farklı çalışıyor. Atlas, hassas kamera geometrisini modelin doğal girdilerinden biri olarak kullanıyor. Bu sayede her planın kadrajı ve kamera hareketi daha doğrudan kontrol edilebiliyor. World Labs’in örneklerinde model, tek bir görüntüden yola çıkarak sahnenin farklı açılardan görünümlerini oluştururken görüntüde bulunmayan alanları da tamamlıyor.

Atlas’ın bir başka özelliği ise farklı görüntüleri ortak bir 3B bağlama yerleştirebilmesi. Örneğin birbiriyle ilgisiz iki görüntü uzayda farklı noktalara yerleştirildiğinde model, bu iki görüntü arasında kapılar, koridorlar ve diğer geçiş alanlarını hayal ederek aradaki dünyayı oluşturabiliyor. Bu yaklaşım, görüntü üretimini yalnızca tek bir kareyi tamamlamaktan çıkarıp görüntüler arasındaki fiziksel mekanı modelleme yönüne taşıyor.

Yalnızca iki ya da üç görüntüyle gerçek bir mekanın oldukça sadık bir yeniden oluşturmasını gerçekleştirebiliyor

Atlas, gerçek dünyadaki mekanları da az sayıda görüntüden yeniden oluşturabiliyor. Özel çekim ekipmanlarına veya yüzlerce yoğun görüntüye ihtiyaç duymadan çalışabilen model, genellikle yalnızca iki ya da üç görüntüyle gerçek bir mekanın oldukça sadık bir yeniden oluşturmasını gerçekleştirebiliyor. Daha fazla görüntü verildiğinde ise modelin hayal ettiği alan azalıyor ve gerçek dünyaya ilişkin daha fazla bağlam kullanılıyor. Bununla birlikte Atlas, uzamsal bağlamında yüzden fazla görüntüyü de değerlendirebiliyor.

World Labs, örneklerde tek bir yer seviyesinden çekilmiş fotoğraftan sahnenin havadan görünümünü oluşturuyor; ikinci ve üçüncü görüntülerin eklenmesiyle daha fazla gerçek bilgi sağlayarak sahnenin doğruluğunu artırıyor. Stanford Üniversitesi’nin Main Quad alanına ilişkin örnekte ise yalnızca iki ila 25 yer seviyesinden çekilmiş görüntü kullanılarak kampüsün çok yukarıdan geçen hava görüntüsü rotaları oluşturulabiliyor. Atlas ayrıca aynı sahne için farklı kamera rotaları üretebiliyor ve kamera yolu değiştirildiğinde sahnenin tutarlılığını koruyor.

Modelin ürettiği sonuçlar yalnızca 2B görüntü ve videolarla sınırlı değil. Atlas, 2B görüntü karelerinin yanı sıra 3B derinlik haritalarıyla da çalıştığı için dünyaları nokta bulutları veya 3B Gaussian splat olarak dışa aktarabiliyor. Tek bir görüntüden yeni görünümler üretip geometrisini tahmin ederek tam bir 3B dünya oluşturabiliyor; gerçek bir mekanın videosundan ise her karenin derinliğini tahmin edip bunları bir 3B yeniden oluşturma içinde birleştirebiliyor. Kamera tarafından hiç görülmeyen alanlar da bu süreçte dolduruluyor.

Atlas’ın uzay ve zamanı birlikte modelleme yeteneği ise özellikle görsel efektler ve robotik açısından öne çıkıyor. Model, yalnızca bir mekanın yapısını değil, bu mekanın zaman içinde nasıl değiştiğini de anlamaya çalışıyor. Örneğin yalnızca üç kameradan alınan görüntülerle bir tür “bullet time” çekim stüdyosu oluşturabiliyor; zamanı dondurup gerçek görüntüleri daha önce kameranın bulunmadığı açılardan yeniden çerçeveleyebiliyor. World Labs, bu örneklerin profesyonel fotoğrafçılar veya özel ekipmanlarla değil, tripod ve sırt çantasına sığabilecek aparatlar üzerindeki sıradan cep telefonları ve aksiyon kameralarıyla çekildiğini belirtiyor. Atlas, üç ila beş kamera açısından sahneyi yeniden oluşturduktan sonra görüntünün kamera açısı yeniden belirlenebiliyor.

Robotik alanında nasıl kullanılıyor?

Robotik tarafında ise Atlas, “gerçekten simülasyona” (Real-to-Sim) yaklaşımını ölçeklendirmek için kullanılabiliyor. Model, gerçek bir mekanı 3B olarak yeniden oluşturmanın yanında, simüle edilen bir robot hareket ederken robotun sensörlerinin göreceği RGB ve derinlik verilerini de üretebiliyor. World Labs’in örneklerinde iki büyük ortamın her biri cep telefonu videosundan yalnızca 24 kare kullanılarak yeniden oluşturuluyor; daha sonra farklı robotların farklı rotalarda hareketleri simüle edilerek robotun gövdesine yerleştirilmiş kameraların göreceği görüntüler Atlas tarafından oluşturuluyor.

Model, robotik manipülasyon için de kullanılabiliyor. Birkaç sıradan kayıt üzerinden nesnelerin nasıl hareket ettiğini ve birbirleriyle nasıl etkileşime girdiğini içeren simülasyonlar oluşturulabiliyor. Bu simülasyonlarda nesnelerin kendisi ve konumları, robotun hareketi, ışıklandırma ve arka plan değiştirilebiliyor. Böylece robotik sistemlerin eğitimi ve test edilmesi için daha çeşitli veri ve ortamlar üretilebiliyor. Atlas, sert, eklemli ve deforme olabilen nesneler arasındaki fiziksel etkileşimleri yeniden oluşturmayı ve bu etkileşimleri kontrollü biçimde çeşitlendirmeyi de destekliyor.

Modelin ana odağı dünya modelleme olsa da Atlas bir görüntü üreticisi olarak da çalışıyor. Karmaşık istemleri takip edebiliyor, görsellerin içinde metin oluşturabiliyor ve farklı görsel stiller üretebiliyor. Ayrıca metin veya görsel istemlerden 360 derecelik panoramik görüntüler oluşturabiliyor.

Teknik açıdan Atlas, çok modlu otoregresif bir difüzyon transformer’ı olarak tasarlandı. Model; metin, görüntü, kamera konumları ve 3B derinlik haritalarını doğal olarak işleyebiliyor; videolar ise görüntü dizileri olarak temsil ediliyor. Her görüntü ve derinlik haritası açık bir kamera konumuyla ilişkilendirildiği için uzamsal kontrol mimarinin merkezinde yer alıyor. Otoregresif yapı, çıktıları daha önceki unsurlara bağlı olarak sırayla üretirken, difüzyon bileşeni çıktıları kademeli olarak gürültüden arındırarak oluşturuyor.

World Labs, Atlas’ın hem kamera kontrollü üretim hem de 3B yeniden oluşturma testlerinde daha özel amaçlı modellerin önüne geçtiğini belirtiyor. Kamera kontrollü üretim testlerinde tek bir görüntüye bir ila üç sinematik kamera hareketinden oluşan rotalar veriliyor ve üçüncü taraf insan değerlendiriciler hangi modelin hedeflenen kamera yolunu daha iyi takip ettiğini değerlendiriyor. Atlas’ın avantajının kamera rotaları karmaşıklaştıkça arttığı aktarılıyor. 3B yeniden oluşturma testlerinde ise model, görüntüler ve bunlara ait kamera konumlarından her piksele karşılık gelen 3B noktaları tahmin ediyor ve uzmanlaşmış açık kaynaklı yeniden oluşturma modellerinden daha iyi sonuç verdiği belirtiliyor.

World Labs ayrıca Atlas’ı farklı boyutlarda ve farklı hesaplama kaynaklarıyla eğiterek modelin ölçeklendikçe yeni yetenekler kazandığını gözlemlediğini söylüyor. Şirket, gelecekteki dünya modellerinin de daha fazla veri ve hesaplama gücüyle önemli ölçüde gelişmeye devam edeceğine inanıyor.

Atlas şu anda seçili iş ortaklarıyla erken erişim aşamasında. World Labs, modeli gelecekte kendi ürünlerinin özellikle de 3B dünya oluşturma platformu Marble’ın yeni sürümlerine güç verecek bir temel olarak konumlandırıyor. Şirket aynı zamanda Atlas’ın dünyaları üretmek, yeniden oluşturmak ve simüle etmek için başvurulacak bir dünya modeli haline gelmesini hedefliyor.

Daha fazla bilgi için, World Labs’in blogundaki Atlas duyurusuna göz atabilirsiniz.

Görsel: World Labs