--- library_name: pytorch tags: - video-classification - vision-transformer - trackmae - videomae --- # TrackMAE Checkpoints Pretrained and fine-tuned video checkpoints from [TrackMAE: Video Representation Learning via Track Mask and Predict](https://arxiv.org/abs/2603.27268). The weights are PyTorch state dictionaries compatible with the official [TrackMAE codebase](https://github.com/rvandeghen/TrackMAE). ## Pretrained Checkpoints | File | Backbone | Dataset | Epochs | Spatial Target | | --- | --- | --- | --- | --- | | `pretrain/vit_b/videomae_cotracker_base_bs_512_mask_tube_800_lambda_0.25_up_14_clip.pth` | ViT-B | Kinetics-400 | 800 | CLIP | | `pretrain/vit_l/videomae_cotracker_large_bs_1024_mask_tube_800_lambda_0.25_up_14_clip_k700.pth` | ViT-L | Kinetics-700 | 800 | CLIP | ## Fine-Tuned Checkpoints | File | Backbone | Pretraining | Fine-tuning | | --- | --- | --- | --- | | [`finetune/vit_b/k400_finetuned_vit_b_with_k400_pretraining_trackmae.pth`](https://huggingface.co/rvandeghen/TrackMAE/blob/main/finetune/vit_b/k400_finetuned_vit_b_with_k400_pretraining_trackmae.pth) | ViT-B | Kinetics-400 | Kinetics-400 | | [`finetune/vit_b/k400_finetuned_vit_b_with_k400_pretraining_trackmae_with_spatial_pixel_targets.pth`](https://huggingface.co/rvandeghen/TrackMAE/blob/main/finetune/vit_b/k400_finetuned_vit_b_with_k400_pretraining_trackmae_with_spatial_pixel_targets.pth) | ViT-B | Kinetics-400 | Kinetics-400 | | [`finetune/vit_b/ssv2_finetuned_vit_b_with_k400_pretraining_trackmae.pth`](https://huggingface.co/rvandeghen/TrackMAE/blob/main/finetune/vit_b/ssv2_finetuned_vit_b_with_k400_pretraining_trackmae.pth) | ViT-B | Kinetics-400 | Something-Something V2 | | [`finetune/vit_b/ssv2_finetuned_vit_b_with_k400_pretraining_trackmae_with_spatial_pixel_targets.pth`](https://huggingface.co/rvandeghen/TrackMAE/blob/main/finetune/vit_b/ssv2_finetuned_vit_b_with_k400_pretraining_trackmae_with_spatial_pixel_targets.pth) | ViT-B | Kinetics-400 | Something-Something V2 | | [`finetune/vit_b/ssv2_finetuned_vit_b_with_ssv2_pretraining_trackmae.pth`](https://huggingface.co/rvandeghen/TrackMAE/blob/main/finetune/vit_b/ssv2_finetuned_vit_b_with_ssv2_pretraining_trackmae.pth) | ViT-B | Something-Something V2 | Something-Something V2 | | [`finetune/vit_l/ssv2_finetuned_vit_l_with_k700_pretraining_trackmae.pth`](https://huggingface.co/rvandeghen/TrackMAE/blob/main/finetune/vit_l/ssv2_finetuned_vit_l_with_k700_pretraining_trackmae.pth) | ViT-L | Kinetics-700 | Something-Something V2 | | [`finetune/vit_l/k400_finetuned_vit_l_with_k700_pretraining_trackmae.pth`](https://huggingface.co/rvandeghen/TrackMAE/blob/main/finetune/vit_l/k400_finetuned_vit_l_with_k700_pretraining_trackmae.pth) | ViT-L | Kinetics-700 | Kinetics-400 | ## Usage Download a pretrained checkpoint: ```python from huggingface_hub import hf_hub_download checkpoint = hf_hub_download( repo_id="rvandeghen/TrackMAE", filename="pretrain/vit_b/videomae_cotracker_base_bs_512_mask_tube_800_lambda_0.25_up_14_clip.pth", ) ``` ## Citation ```bibtex @inproceedings{vandeghen2026trackmae, title = {TrackMAE: Video Representation Learning via Track Mask and Predict}, author = {Vandeghen, Renaud and Thoker, Fida Mohammad and Van Droogenbroeck, Marc and Ghanem, Bernard}, booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition}, year = {2026} } ```