IMvision12's picture
Upload README.md with huggingface_hub
bac91ec verified
|
Raw
History Blame Contribute Delete
6.26 kB
metadata
pipeline_tag: image-classification
license: apache-2.0
base_model: timm/maxvit_large_tf_224.in21k
library_name: zeromodels
tags:
  - keras
  - zeromodels
  - image-classification
  - maxvit
  - backbone
  - arxiv:2204.01697
  - pytorch
  - jax
  - tf

See our collection for all versions of MaxViT.

Run MaxViT with Keras 3: JAX, PyTorch, or TensorFlow

GitHub Docs Collection

zeromodels/maxvit_large_tf_224_in21k

Paper: MaxViT: Multi-Axis Vision Transformer (arXiv:2204.01697) · HF Papers

MaxViT combines blocked local and dilated global attention (multi-axis) in a hierarchical CNN/Transformer hybrid.

For more details on the model, please go to the upstream model card.

Pure-Keras 3 conversion of timm/maxvit_large_tf_224.in21k for zeromodels. One implementation runs unmodified on TensorFlow / Torch / JAX.

This is an image-classification / backbone checkpoint (MaxViTImageClassify / MaxViTModel).

✨ Quick start

import os

os.environ["KERAS_BACKEND"] = "torch"  # or "jax" / "tensorflow"

from PIL import Image
from zeromodels.models.maxvit import MaxViTImageClassify, MaxViTModel, MaxViTImageProcessor

model = MaxViTImageClassify.from_weights("zeromodels/maxvit_large_tf_224_in21k")
processor = MaxViTImageProcessor.from_weights("zeromodels/maxvit_large_tf_224_in21k")

image = Image.open("your_image.jpg").convert("RGB")
pixels = processor(image)  # resize + normalize (normalization lives in the processor)
logits = model(pixels, training=False)
print(logits.shape)  # (1, num_classes)

# Feature extraction: the backbone without the classifier head
backbone = MaxViTModel.from_weights("zeromodels/maxvit_large_tf_224_in21k", as_backbone=True)
features = backbone(pixels, training=False)

Load any MaxViT variant the same way with from_weights("zeromodels/<variant>"):

Variant Hub
maxvit_base_tf_224_in1k zeromodels/maxvit_base_tf_224_in1k
maxvit_base_tf_224_in21k zeromodels/maxvit_base_tf_224_in21k
maxvit_base_tf_384_in1k zeromodels/maxvit_base_tf_384_in1k
maxvit_base_tf_384_in21k_ft_in1k zeromodels/maxvit_base_tf_384_in21k_ft_in1k
maxvit_base_tf_512_in1k zeromodels/maxvit_base_tf_512_in1k
maxvit_base_tf_512_in21k_ft_in1k zeromodels/maxvit_base_tf_512_in21k_ft_in1k
maxvit_large_tf_224_in1k zeromodels/maxvit_large_tf_224_in1k
maxvit_large_tf_224_in21k zeromodels/maxvit_large_tf_224_in21k
maxvit_large_tf_384_in1k zeromodels/maxvit_large_tf_384_in1k
maxvit_large_tf_384_in21k_ft_in1k zeromodels/maxvit_large_tf_384_in21k_ft_in1k
maxvit_large_tf_512_in1k zeromodels/maxvit_large_tf_512_in1k
maxvit_large_tf_512_in21k_ft_in1k zeromodels/maxvit_large_tf_512_in21k_ft_in1k
maxvit_small_tf_224_in1k zeromodels/maxvit_small_tf_224_in1k
maxvit_small_tf_384_in1k zeromodels/maxvit_small_tf_384_in1k
maxvit_small_tf_512_in1k zeromodels/maxvit_small_tf_512_in1k
maxvit_tiny_tf_224_in1k zeromodels/maxvit_tiny_tf_224_in1k
maxvit_tiny_tf_384_in1k zeromodels/maxvit_tiny_tf_384_in1k
maxvit_tiny_tf_512_in1k zeromodels/maxvit_tiny_tf_512_in1k
maxvit_xlarge_tf_224_in21k zeromodels/maxvit_xlarge_tf_224_in21k
maxvit_xlarge_tf_384_in21k_ft_in1k zeromodels/maxvit_xlarge_tf_384_in21k_ft_in1k
maxvit_xlarge_tf_512_in21k_ft_in1k zeromodels/maxvit_xlarge_tf_512_in21k_ft_in1k

Tips

  • Set KERAS_BACKEND before importing Keras / zeromodels.
  • MaxViTImageClassify returns class logits; MaxViTModel returns features (as_backbone=True for multi-scale stages).
  • See docs and Loading Weights.
  • Upstream / timm checkpoints: MaxViTImageClassify.from_weights("hf:timm/maxvit_large_tf_224.in21k").

Special Thanks

A huge thank you to the MaxViT authors and the timm / Hub communities for creating and releasing these models.

License: see YAML license (usually matches the upstream checkpoint).