Saltar al contenido principal

DeepSeek-Coder-V2

DeepSeekDeepSeek
Fecha de lanzamiento
2024-06-17
Parámetros
Longitud del contexto
1.0M
Modalidades
text

Radar de capacidades

5
general
70
coding
74
reasoning
77
scienceest.
60
agents
0
multimodal

Science usa un proxy de razonamiento cuando los benchmarks científicos dedicados no están disponibles.

Rankings

Dominio#PosiciónPuntuaciónFuente
Ranking general517
7.0
AA
Razonamiento matemático112
73.0
AA

Puntuaciones de benchmarks (LLM Stats)

Agents

GDPval-AA1203.00 / 3000Aut.
BrowseComp73.2%Aut.
MCP Atlas69.0%Aut.
Terminal-Bench 2.056.9%Aut.
SWE-Bench Pro52.6%Aut.
Toolathlon47.8%Aut.

Biology

GPQA88.1%Aut.

Code

LiveCodeBench91.6%Aut.
SWE-Bench Verified79.0%Aut.
SWE-bench Multilingual73.3%Aut.

Factuality

SimpleQA34.1%Aut.

Finance

MMLU-Pro86.2%Aut.

General

CSimpleQA78.9%Aut.
MRCR 1M78.7%Aut.
CorpusQA 1M60.5%Aut.

Math

CodeForces1.00 / 3000Aut.
HMMT Feb 2694.8%Aut.
IMO-AnswerBench88.4%Aut.
MathArena Apex85.7%Aut.
Humanity's Last Exam45.1%Aut.

Índices de evaluación AA

Intelligence Index
5.1
Math 500
0.7

Puntuaciones por categoría LLM Stats

Legal
100
Finance
100
Agents
100
General
100
Reasoning
68
Physics
90
Healthcare
90
Biology
90
Chemistry
90
Language
80
Long Context
80
Math
80
Frontend Development
80
Search
70
Code
70
Tool Calling
60
Vision
50
Factuality
30

Precios

Precio de entradaGratis
Precio de salidaGratis
Precio mixto (3:1)Gratis
Precio de lectura caché$0.0028 / 1M tokens

Velocidad

Tokens/seg0.0
Retraso del primer token0.00s
Tiempo hasta la respuesta0.00s

Ranking de Precios por Proveedor

No hay datos de proveedores disponibles

Fuentes externas