Efficient-TAL-vision-language-modeling

Study the efficiency and generalizability of CLIP-based STALE for temporal action localization in resource-constrained environments

// repository documentation