This paper studies object-driven shortcuts in zero-shot compositional action recognition (ZS-CAR), where models may infer verbs from labeled objects instead of temporal evidence. The authors propose Robust COmpositional REpresentations (RCORE), combining Co-occurrence Prior Regularization (CPR), which treats frequent co-occurrences as hard negatives, and Temporal Order Regularization for Composition (TORC), which encourages sensitivity to temporal order. Experiments on Sth-com and EK100-com reportedly reduce shortcut diagnostics and improve generalization to unseen verb-object compositions, although the supplied abstract does not provide numerical gains.
No heat snapshots are available in the last 24 hours.