Saltar al contenido principal

Qwen2.5 VL 7B Instruct

Alibaba Cloud / Qwen TeamQwenOpen WeightApache 2.0 · Uso Comercial

Descripción

Qwen2.5-VL is a vision-language model from the Qwen family. Key enhancements include visual understanding (objects, text, charts, layouts), visual agent capabilities (tool use, computer/phone control), long video comprehension with event pinpointing, visual localization (bounding boxes/points), and structured output generation.

Fecha de lanzamiento
2025-01-26
Parámetros
8.3B
Longitud del contexto
131K
Modalidades
image, text

Radar de capacidades

60
general
0
coding
50
reasoning
51
scienceest.
50
agents
90
multimodal

Science se estima a partir de las puntuaciones científicas de LLM Stats o del razonamiento cuando no hay benchmarks científicos dedicados.

Rankings

Dominio#PosiciónPuntuaciónFuente
Ranking multimodal147
16.0
LS

Puntuaciones de benchmarks (LLM Stats)

(LLM Stats (zeroeval))

General

AndroidWorld_SR25.5%Aut.

Math

MathVista-Mini68.2%Aut.
MathVision25.1%Aut.

Multimodal

MobileMiniWob++_SR91.4%Aut.
Android Control Low_EM91.4%Aut.
AITZ_EM81.9%Aut.
VideoMME w/o sub.65.1%Aut.
Android Control High_EM60.1%Aut.
MMMU58.6%Aut.

Reasoning

ChartQAMasry et al. (2022)87.3%Aut.

Video

PerceptionTest70.5%Aut.
MLVU70.2%Aut.
CharadesSTA43.6%Aut.
MMBench-Video1.8%Aut.

Vision

DocVQADocVQA (2020)95.7%Aut.
OCRBench86.4%Aut.
TextVQA84.9%Aut.
ScreenSpot84.7%Aut.
MMBench84.3%Aut.
InfoVQA82.6%Aut.
CC-OCR77.8%Aut.
TempCompass71.7%Aut.
VideoMME w sub.71.6%Aut.
MVBench69.6%Aut.
MMVet67.1%Aut.
MMStar63.9%Aut.
MMT-Bench63.6%Aut.
LongVideoBench54.7%Aut.
Hallusion Bench52.9%Aut.
LVBench45.3%Aut.
MMMU-Pro38.3%Aut.
ScreenSpot Pro29.0%Aut.

Índices de evaluación AA

(Artificial Analysis)

No hay datos de evaluación AA disponibles

Puntuaciones por categoría LLM Stats

(LLM Stats (zeroeval))
Image To Text
90
Structured Output
80
Text-to-image
80
Long Context
60
Multimodal
60
Reasoning
60
Spatial Reasoning
60
General
60
Grounding
60
Healthcare
60
Vision
60
Math
50
Agents
50
Video
50
Language
40

Precios

Precio de entrada$0.35 / 1M tokens
Precio de salida$1.05 / 1M tokens
Precio mixto (3:1)$0.525 / 1M tokens

Velocidad

No hay datos de velocidad disponibles

Ranking de Precios por Proveedor

Ranking de Precios por Proveedor

3 proveedores

Más barato: Alibaba (China)Más caro: Alibaba
ProveedorEntradaSalida
1Alibaba (China)Más barato
$0.287
$0.717
2Alibaba Cloud / Qwen TeamPRINCIPAL
$0.35
$1.05
3Alibaba
$0.35
$1.05

Comparar precios entre diferentes proveedores de API para este modelo.

Fuentes externas