ScenarioControl: Vision-Language Controllable Vectorized Latent Scenario Generation

Published in ECCV 2026, 2026

We present a vision-language control mechanism that synthesizes diverse, realistic 3D scenario rollouts — including map structure, reactive agents over time, pedestrians, infrastructure, and ego-view observations. We introduce a cross-global control mechanism that combines cross-attention with a global-context branch, enabling fine-grained control over road layout and traffic conditions for vectorized latent scenario generation.

Joint first authors with equal contribution. Please cite as

@inproceedings{scenariocontrol2026,
  title     = {ScenarioControl: Vision-Language Controllable Vectorized
               Latent Scenario Generation},
  author    = {Gao, Lili and Xu, Yanbo and Koch, William and
               Ruffino, Samuele and Rowe, Luke and Chalaki, Behdad and
               Rivkin, Dmitriy and Ost, Julian and Girgis, Roger and
               Bijelic, Mario and Heide, Felix},
  booktitle = {Proceedings of the European Conference on Computer Vision (ECCV)},
  year      = {2026}
}

Lili Gao*, Yanbo Xu*, William Koch*, Samuele Ruffino, Luke Rowe, Behdad Chalaki, Dmitriy Rivkin, Julian Ost, Roger Girgis, Mario Bijelic, Felix Heide. 2026. "ScenarioControl: Vision-Language Controllable Vectorized Latent Scenario Generation". ECCV. https://princeton-computational-imaging.github.io/ScenarioControl/