ScenarioControl: Vision-Language Controllable Vectorized Latent Scenario Generation
Published in ECCV 2026, 2026
We present a vision-language control mechanism that synthesizes diverse, realistic 3D scenario rollouts — including map structure, reactive agents over time, pedestrians, infrastructure, and ego-view observations. We introduce a cross-global control mechanism that combines cross-attention with a global-context branch, enabling fine-grained control over road layout and traffic conditions for vectorized latent scenario generation.
Joint first authors with equal contribution. Please cite as
@inproceedings{scenariocontrol2026,
title = {ScenarioControl: Vision-Language Controllable Vectorized
Latent Scenario Generation},
author = {Gao, Lili and Xu, Yanbo and Koch, William and
Ruffino, Samuele and Rowe, Luke and Chalaki, Behdad and
Rivkin, Dmitriy and Ost, Julian and Girgis, Roger and
Bijelic, Mario and Heide, Felix},
booktitle = {Proceedings of the European Conference on Computer Vision (ECCV)},
year = {2026}
}
Lili Gao*, Yanbo Xu*, William Koch*, Samuele Ruffino, Luke Rowe, Behdad Chalaki, Dmitriy Rivkin, Julian Ost, Roger Girgis, Mario Bijelic, Felix Heide. 2026. "ScenarioControl: Vision-Language Controllable Vectorized Latent Scenario Generation". ECCV. https://princeton-computational-imaging.github.io/ScenarioControl/
