A preprint reports that a task-routed video-language model averaged 62.9 across five COIN tasks, with lower compute and higher throughput in one profile.