in Technology

Atlas – Multimodal Autoregressive Diffusion Transformer

เพิ่ง เขียนเรื่อง World Models ไปไม่นาน ทางบริษัท World Labs ของ Fei-Fei Li ก็เปิดตัวโมเดลใหม่ชื่อ Atlas ที่มีความสามารถสุดมหัศจรรย์ สามารถแปลงภาพถ่ายไม่กี่ภาพเป็นโลกที่เดินสำรวจได้ หมุนมุมกล้องได้ตามต้องการ เรียกว่าอลังการมากๆ

อธิบายเป็นคำพูดลำบาก ดูคลิปง่ายกว่า

คำถามที่ตามมาคือ World Labs ทำได้อย่างไร

ในบล็อก Atlas มีคำอธิบายทางเทคนิคอยู่นิดหน่อย บอกว่าสถาปัตยกรรมของโมเดลคือ “multimodal autoregressive diffusion transformer”

ถ้าอธิบายง่ายๆ มันคือการรวมร่างกันของโมเดลตระกูล transformer (LLM) และโมเดลตระกูล diffusion (พวกโมเดลสร้างภาพ) แต่รวมกันอย่างไร?

4 คำตามชื่อโมเดลมีความสำคัญมาก เพราะแต่ละคำอธิบายว่าโมเดล Atlas เกิดจากอะไรบ้าง

  • Multimodal – แปลว่ารองรับข้อมูลหลายประเภท (data tyle) ทั้งข้อความ ภาพ ตำแหน่งและมุมกล้อง (camera pose) และแผนที่ความลึก 3D (depth map) ส่วนอินพุทแบบวิดีโอจะมองเป็นภาพที่เรียงต่อกัน โดยภาพและแผนที่ความลึกจะถูกแปลความเป็น camera pose เพื่อให้ข้อมูลเชิงมิติ (spatial context) ว่าโลกที่เราจะสร้างมีหน้าตาอย่างไรที่มุมมองตรงไหน
  • Autoregressive หรือ AR – ตามภาษาทางสถิติคือการพยากรณ์ลำดับ (sequence) โดยใช้อินพุทจาก sequence ก่อนหน้าไปคำนวณเป็นผลลัพธ์ใน sequence ถัดไป การนำ AR มาใช้งานในโมเดลสร้างโลก จะเป็นการมองเชิงลำดับเวลาว่าอินพุทแต่ละอย่างถูกป้อนเข้ามา แล้วสถานะของมันจะเป็นอย่างไรต่อ หรืออธิบายง่ายๆ ว่า AR เป็นเทคนิคที่ช่วยให้โลกที่สร้างโดยโมเดลมีมิติของลำดับเวลาและเหตุการณ์
  • Diffusion – เทคนิคจากโมเดลฝั่งสร้างภาพ หลักคิดสำคัญคือสร้างผลลัพธ์ด้วยวิธี denoising (ลดสัญญาณรบกวน) ซึ่งใช้กันแพร่หลายในวงการ computer vision อยู่แล้ว และเหมาะกับงานที่มีข้อมูลต่อเนื่องหลายมิติ เช่น ภาพหรือวิดีโอ แถมยังสามารถเลือกปรับได้ว่าจะเอาคุณภาพสูงหรือความเร็วสูง
  • Transformer – โมเดลหลักของการพยากรณ์คำ ในเนื้อแท้ของมันคือการคูณเมทริกซ์ขนาดใหญ่ (เคยเขียนเรื่องนี้ไปแล้ว)

ความแตกต่างสำคัญของ world model กับโมเดลสร้างวิดีโอ คือ โมเดลเข้าใจ spatial context รู้ตำแหน่งพิกัดด้วย ไม่ได้รู้แค่ข้อมูลภาพอย่างเดียวแล้วไปพยากรณ์ภาพถัดไป (ซึ่งอาจจะผิด เพราะไม่รู้บริบทเชิงตำแหน่ง)

ส่วนรายละเอียดของการรวม Autoregressive Transformer (LLM) กับ Diffusion นั้นยังไม่เปิดเผย (อันนี้เข้าใจได้เพราะเป็นความลับการค้าของบริษัท) แต่เท่าที่เข้าใจคือใช้ Autoregressive Transformer คุมลำดับเวลา เป็นตัวกำหนด “ความทรงจำ” ของโลกที่สร้างขึ้น แล้วใช้ Diffusion ควบคุมรายละเอียดของภาพที่เป็นผลลัพธ์อีกที

อีกประเด็นที่น่าสนใจคือ World Labs บอกเองว่าเมื่อ Atlas เป็นทั้ง Autoregressive Transformer กับ Diffusion มันจึงสามารถใช้เทคนิคเร่งความเร็วของทั้งฝั่ง LLM (เช่น KV-cache) และฝั่ง Diffusion (เช่น การทำ distillation) โดยฮาร์ดแวร์รุ่นใหม่ๆ รองรับเทคนิคเหล่านี้มาพร้อมอยู่แล้ว ทำให้ประสิทธิภาพของ Atlas ออกมาดีทั้งในแง่คุณภาพและความเร็วด้วย

ส่วน World Labs ใช้ชิปจากบริษัทไหน คำตอบคงเดาไม่ยาก

รายละเอียดเพิ่มเติม