LogicDirector: Enforcing Temporal Composition in Text-to-Video Generation

Yujiang Pu, Zixu Cheng, Shaogang Gong, Handong Zhao, Yu Kong

NeurIPS 2026

TL;DR: We introduce LogicDirector, a test-time guidance framework that enforces temporal composition in text-to-video generation via first-order logic constraints. By applying a lightweight, gradient-free latent search during the early denoising steps, our method mitigates temporal concept bleeding and event omission while preserving visual fidelity.

1. Qualitative Comparisons on TempBench

CogVideoX-2B

Wan 2.1-1.3B

2. Qualitative Analysis of Best-of-n Latent Search

"A frog jumps onto a lily pad before a bird flies away."
Baseline
n=1, K=1, T=10
n=1, K=3, T=10 (Ours)
n=3, K=3, T=10
n=1, K=5, T=10
n=3, K=1, T=10
n=1, K=3, T=20

3. Qualitative Comparisons on T2V-CompBench

Action Binding

Object Interaction

4. More Challenging Cases on StoryEval