Saltar al contenido principal

Qwen2.5-Omni-7B

Alibaba Cloud / Qwen TeamQwenOpen WeightApache 2.0 · Uso Comercial

Descripción

Qwen2.5-Omni is the flagship end-to-end multimodal model in the Qwen series. It processes diverse inputs including text, images, audio, and video, delivering real-time streaming responses through text generation and natural speech synthesis using a novel Thinker-Talker architecture.

Fecha de lanzamiento
2025-03-27
Parámetros
7.0B
Longitud del contexto
33K
Modalidades
audio, image, text, video

Radar de capacidades

60
general
80
coding
60
reasoning
26
scienceest.
66
agents
80
multimodal

Science se estima a partir de las puntuaciones científicas de LLM Stats o del razonamiento cuando no hay benchmarks científicos dedicados.

Rankings

Dominio#PosiciónPuntuaciónFuente
Ranking multimodal83
25.0
LS

Puntuaciones de benchmarks (LLM Stats)

(LLM Stats (zeroeval))

Audio

VocalSound93.9%Aut.
GiantSteps Tempo88.0%Aut.
MMAU Music69.2%Aut.
MMAU Sound67.9%Aut.
MMAU65.6%Aut.
MMAU Speech59.8%Aut.
OmniBench Music52.8%Aut.
CoVoST2 en-zh0.41 / 100Aut.
MusicCaps32.8%Aut.
Common Voice 150.08 / 100Aut.

Biology

GPQANYU + Cohere + Anthropic (2023)30.8%Aut.

Code

HumanEvalOpenAI (2021)78.7%Aut.

Communication

VoiceBench Avg74.1%Aut.
MM-MT-Bench0.06 / 100Aut.

Creativity

Meld57.0%Aut.

Finance

MMLU-Pro47.0%Aut.

General

MBPP0.73 / 100Aut.
MMLU-Redux71.0%Aut.
MultiPL-E65.8%Aut.
MMStar64.0%Aut.
MME-RealWorld61.6%Aut.
MMMU59.2%Aut.
MMMU-Pro36.6%Aut.
LiveBench29.6%Aut.
NMOS0.05 / 100Aut.

Grounding

PointGrounding66.5%Aut.

Healthcare

CRPErelation76.5%Aut.

Image To Text

DocVQADocVQA (2020)95.2%Aut.
TextVQA84.4%Aut.
OCRBench_V257.8%Aut.

Language

FLEURS95.9%Aut.

Long Context

EgoSchema68.6%Aut.

Math

GSM8k88.7%Aut.
MATH71.5%Aut.
MathVista67.9%Aut.
MathVision25.0%Aut.

Multimodal

ChartQAMasry et al. (2022)85.3%Aut.
AI2D83.2%Aut.
MMBench-V1.181.8%Aut.
VideoMME w sub.72.4%Aut.
MVBench70.3%Aut.
MuirBench59.2%Aut.
OmniBench56.1%Aut.

Spatial Reasoning

RealWorldQA70.3%Aut.

Vision

ODinW42.4%Aut.

Índices de evaluación AA

(Artificial Analysis)

No hay datos de evaluación AA disponibles

Puntuaciones por categoría LLM Stats

(LLM Stats (zeroeval))
Speech To Text
100
Image To Text
80
Code
80
Long Context
70
Spatial Reasoning
70
Language
70
Audio
70
Video
70
Vision
70
Math
60
Multimodal
60
Reasoning
60
General
60
Legal
50
Finance
50
Healthcare
50
Physics
30
Biology
30
Chemistry
30
Communication
10

Precios

Precio de entrada$0.1 / 1M tokens
Precio de salida$0.4 / 1M tokens
Precio mixto (3:1)$0.175 / 1M tokens

Velocidad

No hay datos de velocidad disponibles

Ranking de Precios por Proveedor

Ranking de Precios por Proveedor

3 proveedores

Más barato: Alibaba (China)Más caro: Alibaba
ProveedorEntradaSalida
1Alibaba (China)Más barato
$0.087
$0.345
2Alibaba Cloud / Qwen TeamPRINCIPAL
$0.1
$0.4
3Alibaba
$0.1
$0.4

Comparar precios entre diferentes proveedores de API para este modelo.

Fuentes externas