Skip to main content
ALAlibaba/ Qwen

Qwen3 VL 32B Instruct

alibaba/qwen3-vl-32b-instruct

Qwen3-VL-32B-Instruct is a large-scale multimodal vision-language model designed for high-precision understanding and reasoning across text, images, and video. With 32 billion parameters, it combines deep visual perception with advanced text...

Model information

Released
2025-10-23
Context window
131K
Max output
33K
Model parameters
33B
Weights
Open

Modalities

Input
ImageText
Output
Text

Identity

Version
qwen3-vl-32b-instruct
License
Apache-2.0

Resources

Capabilities

Open weightStructuredTemperatureTool call

Providers

ProviderProvider model IDProtocolContextMax outputInputOutputCapabilitiesNotesPricingStreaming
OpenRouterqwen/qwen3-vl-32b-instructopenai_chat131K33K
AttachmentsTool callStructuredTemperature
Hugging Face: Qwen/Qwen3-VL-32B-Instruct
input $0.104/M · output $0.416/M
Yes
Kilo Gatewayqwen/qwen3-vl-32b-instructopenai_chat131K33K
AttachmentsTool callStructuredTemperature
-
input $0.104/M · output $0.416/M
Yes
Alibabaqwen3-vl-32b-instructcustom131K33K
---Yes

FAQ