Image-Text-to-Text
Keras
PyTorch
JAX
TensorFlow
English
zeromodels
qwen3_vl
qwen3-vl
multimodal
vision
Instructions to use zeromodels/qwen3-vl-32b-instruct with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Keras
How to use zeromodels/qwen3-vl-32b-instruct with Keras:
# Available backend options are: "jax", "torch", "tensorflow". import os os.environ["KERAS_BACKEND"] = "jax" import keras model = keras.saving.load_model("hf://zeromodels/qwen3-vl-32b-instruct") - Notebooks
- Google Colab
- Kaggle
Migrate to zeromodels (rename kf_*.json -> zm_*.json, fix refs in config + README, ensure tag + badge)
2af5fc1 verified | { | |
| "library_name": "zeromodels", | |
| "zeromodels_version": "1.2.2", | |
| "model_module": "zeromodels.models.qwen3_vl", | |
| "model_class": "Qwen3VLConditionalGenerate", | |
| "variant": "qwen3-vl-32b-instruct", | |
| "weights": "model.weights.json", | |
| "schema_version": 2, | |
| "weight_dtype": "bfloat16", | |
| "model_type": "qwen3_vl", | |
| "text_config": { | |
| "vocab_size": 151936, | |
| "embed_dim": 5120, | |
| "mlp_dim": 25600, | |
| "num_layers": 64, | |
| "num_heads": 64, | |
| "num_kv_heads": 8, | |
| "head_dim": 128, | |
| "norm_eps": 1e-06, | |
| "rope_theta": 5000000, | |
| "mrope_section": [ | |
| 24, | |
| 20, | |
| 20 | |
| ], | |
| "tie_embeddings": false | |
| }, | |
| "vision_config": { | |
| "depth": 27, | |
| "embed_dim": 1152, | |
| "mlp_dim": 4304, | |
| "num_heads": 16, | |
| "out_dim": 5120, | |
| "act": "gelu_pytorch_tanh", | |
| "num_position_embeddings": 2304, | |
| "deepstack_visual_indexes": [ | |
| 8, | |
| 16, | |
| 24 | |
| ], | |
| "patch_size": 16, | |
| "spatial_merge_size": 2, | |
| "temporal_patch_size": 2, | |
| "in_channels": 3 | |
| }, | |
| "image_token_id": 151655, | |
| "video_token_id": 151656, | |
| "vision_start_token_id": 151652, | |
| "vision_end_token_id": 151653 | |
| } | |