NAMVIS

Next-Scale Autoregressive Multi-View Image Synthesis

Ramil Khafizov1, Ilya Statsenko2, Ruslan Rakhimov2, Artem Komarichev1, Peter Wonka3, Evgeny Burnaev1,4

1 Applied AI Institute · 2 T-Tech · 3 KAUST · 4 AXXX

NeurIPS 2026

Input viewsGenerated novel view

TL;DR: Given sparse posed views, NAMVIS autoregressively generates consistent novel views at unseen camera poses.

More qualitative examples

Frog input view 1 Frog input view 2
Frog NAMVIS-generated view 1 Frog NAMVIS-generated view 2 Frog NAMVIS-generated view 3 Frog NAMVIS-generated view 4 Frog NAMVIS-generated view 5
Loader input view 1 Loader input view 2
Loader NAMVIS-generated view 1 Loader NAMVIS-generated view 2 Loader NAMVIS-generated view 3 Loader NAMVIS-generated view 4 Loader NAMVIS-generated view 5
Peashooter input view 1 Peashooter input view 2
Peashooter NAMVIS-generated view 1 Peashooter NAMVIS-generated view 2 Peashooter NAMVIS-generated view 3 Peashooter NAMVIS-generated view 4 Peashooter NAMVIS-generated view 5
Treasure chest input view 1 Treasure chest input view 2
Treasure chest NAMVIS-generated view 1 Treasure chest NAMVIS-generated view 2 Treasure chest NAMVIS-generated view 3 Treasure chest NAMVIS-generated view 4 Treasure chest NAMVIS-generated view 5
Car input view 1 Car input view 2
Car NAMVIS-generated view 1 Car NAMVIS-generated view 2 Car NAMVIS-generated view 3 Car NAMVIS-generated view 4 Car NAMVIS-generated view 5

How it works

NAMVIS tokenizes the source views and generates target-view tokens coarse-to-fine, with camera geometry injected into attention at every scale.

NAMVIS architecture overview
NAMVIS predicts target views autoregressively, refining view-conditioned tokens from coarse to fine.

Multi-scale ProPE

Projective pose encoding injects the source and target camera transformations into target-view self-attention and source-to-target cross-attention at every generation scale.

Dual-path conditioning

A pooled source representation provides global conditioning, while dense, geometry-aware cross-attention preserves appearance details from the input views.

Comparison with prior methods

All methods are evaluated on the same source observations and target camera for direct visual comparison.

Input viewZero-1-to-3Zero-1-to-3 XLSyncDreamerEscherNetNAMVISGT
BUILD_A_ZOO source view Zero-1-to-3 BUILD_A_ZOO generated view Zero-1-to-3-XL BUILD_A_ZOO generated view SyncDreamer BUILD_A_ZOO generated view EscherNet BUILD_A_ZOO generated view NAMVIS BUILD_A_ZOO generated view BUILD_A_ZOO ground truth view
backpack_022 source view Zero-1-to-3 backpack_022 generated view Zero-1-to-3-XL backpack_022 generated view SyncDreamer backpack_022 generated view EscherNet backpack_022 generated view NAMVIS backpack_022 generated view backpack_022 ground truth view
3D_Dollhouse_Swing source view Zero-1-to-3 3D_Dollhouse_Swing generated view Zero-1-to-3-XL 3D_Dollhouse_Swing generated view SyncDreamer 3D_Dollhouse_Swing generated view EscherNet 3D_Dollhouse_Swing generated view NAMVIS 3D_Dollhouse_Swing generated view 3D_Dollhouse_Swing ground truth view

Quantitative comparison

Better perceptual quality and faster inference

MethodPSNR ↑LPIPS ↓Time ↓
Zero-1-to-316.9350.2092.6s
Zero-1-to-3 XL17.1990.1942.6s
SyncDreamer17.6980.20316.6s
EscherNet18.5740.1572.1s
NAMVIS 1B21.7660.1020.6s

PSNR and LPIPS are averaged across Objaverse, GSO, and OmniObject3D (OO3D). Time is seconds per target view in the 1-to-1 setting.

Full quantitative results
MethodObjaverseGSOOO3DTime
PSNRSSIMLPIPSPSNRSSIMLPIPSPSNRSSIMLPIPS
Zero-1-to-319.0970.8160.15215.6140.7490.25716.0940.7680.2192.6s
Zero-1-to-3 XL19.3410.8270.13615.9360.7470.23616.3200.7670.2092.6s
SyncDreamer19.3680.8260.15616.9610.7810.24616.7660.7930.20716.6s
EscherNet19.0780.8160.14718.8780.7990.15617.7670.7800.1672.1s
NAMVIS 1B22.4850.8610.09121.7150.8430.11121.0980.8450.1040.6s

Results are averaged over nine source-target configurations: 1-to-1, 1-to-2, 1-to-3, 2-to-1, 2-to-2, 2-to-3, 3-to-1, 3-to-2, and 3-to-3 at 256 × 256 resolution.

Generated views as turntable videos

Objaverse sample 01
Objaverse sample 02
Backpack 003
Backpack 016
Chair 002
JBL speaker
Boat shoe
Patch cord
Toasty orca
Toy animal