166 skills found · Page 1 of 6
huggingface / Transformers🤗 Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.
huggingface / Pytorch Image ModelsThe largest collection of PyTorch image encoders / backbones. Including train, eval, inference, export scripts, and pretrained weights -- ResNet, ResNeXT, EfficientNet, NFNet, Vision Transformer (ViT), MobileNetV4, MobileNet-V3 & V2, RegNet, DPN, CSPNet, Swin Transformer, MaxViT, CoAtNet, ConvNeXt, and more
2toinf / X VLA[ICLR 2026] The offical Implementation of "Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model"
changzy00 / Pytorch Attention🦖Pytorch implementation of popular Attention Mechanisms, Vision Transformers, MLP-Like models and CNNs.🔥🔥🔥
google-research / Maxvit[ECCV 2022] Official repository for "MaxViT: Multi-Axis Vision Transformer". SOTA foundation models for classification, detection, segmentation, image quality, and generative modeling...
TechyNilesh / DeepImageSearchDeepImageSearch is a Python library for fast and accurate image search. It offers seamless integration with Python, GPU support, and advanced capabilities for identifying complex image patterns using the Vision Transformer models.
ViTAE-Transformer / Remote Sensing RVSAThe official repo for [TGRS'22] "Advancing Plain Vision Transformer Towards Remote Sensing Foundation Model"
whlzy / FiT[ICML 2024 Spotlight] FiT: Flexible Vision Transformer for Diffusion Model
asyml / Vision Transformer PytorchPytorch version of Vision Transformer (ViT) with pretrained models. This is part of CASL (https://casl-project.github.io/) and ASYML project.
davide-coccomini / Combining EfficientNet And Vision Transformers For Video Deepfake DetectionCode for Video Deepfake Detection model from "Combining EfficientNet and Vision Transformers for Video Deepfake Detection" presented at ICIAP 2021.
rachtibat / LRP EXplains TransformersLayer-wise Relevance Propagation for Large Language Models and Vision Transformers [ICML 2024]
sunsmarterjie / ITPN(CVPR2023/TPAMI2024) Integrally Pre-Trained Transformer Pyramid Networks -- A Hierarchical Vision Transformer for Masked Image Modeling
anyantudre / Florence 2 Vision Language ModelFlorence-2 is a novel vision foundation model with a unified, prompt-based representation for a variety of computer vision and vision-language tasks.
LayneH / GreenMIM[NeurIPS2022] Official implementation of the paper 'Green Hierarchical Vision Transformer for Masked Image Modeling'.
qubvel / Transformers NotebooksInference and fine-tuning examples for vision models from 🤗 Transformers
SforAiDl / VformerA modular PyTorch library for vision transformer models
Yangyi-Chen / SOLO[TMLR] Public code repo for paper "A Single Transformer for Scalable Vision-Language Modeling"
VITA-Group / M3ViT[NeurIPS 2022] “M³ViT: Mixture-of-Experts Vision Transformer for Efficient Multi-task Learning with Model-Accelerator Co-design”, Hanxue Liang*, Zhiwen Fan*, Rishov Sarkar, Ziyu Jiang, Tianlong Chen, Kai Zou, Yu Cheng, Cong Hao, Zhangyang Wang
yang-ruixin / PyTorch Image Models Multi Label ClassificationMulti-label classification based on timm.
gordonhu608 / MQT LLaVA[NeurIPS 2024] Matryoshka Query Transformer for Large Vision-Language Models