Qwen3 VL 235B A22B (Reasoning)
説明
Qwen3-VL-235B-A22B-Thinking is the most powerful vision-language model in the Qwen series, featuring 236B parameters with MoE architecture for reasoning-enhanced multimodal understanding. Key capabilities include: Visual Agent (operates PC/mobile GUIs, recognizes elements, invokes tools), Visual Coding (generates Draw.io/HTML/CSS/JS from images/videos), Advanced Spatial Perception (2D grounding and 3D grounding for spatial reasoning and embodied AI), Long Context & Video Understanding (native 256K context expandable to 1M, handles hours-long video with second-level indexing), Enhanced Multimodal Reasoning (excels in STEM/Math with causal analysis), Upgraded Visual Recognition (celebrities, anime, products, landmarks, flora/fauna), and Expanded OCR (32 languages, robust in low light/blur/tilt). Architecture innovations include Interleaved-MRoPE for positional embeddings, DeepStack for multi-level ViT feature fusion, and Text-Timestamp Alignment for precise video temporal modeling.
能力レーダー
専門的な科学ベンチマークが利用できない場合、Scienceは推論プロキシを使用して推定します。
ランキング
| ドメイン | #順位 | スコア | ソース |
|---|---|---|---|
| エージェント能力 | 19 | 66.0 | LS |
| コーディングランキング | 158 | 55.0 | AA |
| 総合ランキング | 165 | 55.0 | AA |
| 数学的推論 | 49 | 89.0 | AA |
| マルチモーダルランキング | 73 | 67.0 | LS |
| 推論 | 40 | 75.0 | LS |
| 科学 | 155 | 54.0 | AA |
ベンチマークスコア (LLM Stats)
3d
Agents
Chemistry
Code
Communication
Creativity
Embodied
Factuality
Finance
General
Grounding
Healthcare
Image To Text
Instruction Following
Language
Long Context
Math
Multimodal
Reasoning
Spatial Reasoning
Vision
AA評価指数
LLM Statsカテゴリスコア
価格設定
速度
プロバイダー価格ランキング
プロバイダー価格ランキング
10 プロバイダー
このモデルの異なるAPIプロバイダー間の価格を比較。