Claude 3.5 Sonnet
AnthropicClaudeProprietary
Description
Claude 3.5 Sonnet is a powerful AI model with industry-leading software engineering skills. It excels in coding, planning, and problem-solving, with significant improvements in agentic coding and tool use tasks. The model includes computer use capabilities in public beta, allowing it to interact with computer interfaces like a human user.
Date de sortie
2024-10-22
Paramètres
—
Longueur du contexte
—
Modalités
image, text
Radar de capacités
80
general
70
coding
90
reasoning
60
scienceest.
60
agents
100
multimodal
Science est estimé à partir des scores scientifiques de LLM Stats ou du raisonnement lorsque les benchmarks scientifiques dédiés ne sont pas disponibles.
Classements
| Domaine | #Rang | Score | Source |
|---|---|---|---|
| Classement multimodal | 28 | 60.0 | LS |
Scores de benchmarks (LLM Stats)
(LLM Stats (zeroeval))Chat
TAU-bench Retail
69.2%Aut.
General
MMLU
90.4%Aut.
OSWorld Extended
22.0%Aut.
Language
MMLU-Pro
77.6%Aut.
Math
GSM8k
96.4%Aut.
MGSM
91.6%Aut.
MATH
78.3%Aut.
MathVista
67.7%Aut.
Multimodal
MMMU
68.3%Aut.
OSWorld Screenshot-only
14.9%Aut.
Reasoning
HumanEvalOpenAI (2021)
93.7%Aut.
BIG-Bench Hard
93.1%Aut.
ChartQAMasry et al. (2022)
90.8%Aut.
DROP
87.1%Aut.
GPQANYU + Cohere + Anthropic (2023)
67.2%Aut.
SWE-Bench Verified
49.0%Aut.
TAU-bench Airline
46.0%Aut.
Vision
DocVQADocVQA (2020)
95.2%Aut.
AI2D
94.7%Aut.
Indices d'évaluation AA
(Artificial Analysis)Aucune donnée d'évaluation AA disponible
Scores par catégorie LLM Stats
(LLM Stats (zeroeval))Image To Text100
Language90
Math90
Legal80
Multimodal80
Reasoning80
Finance80
General80
Healthcare80
Vision80
Chat70
Physics70
Biology70
Chemistry70
Code70
Communication60
Tool Calling60
Frontend Development50
Tarification
Aucune donnée de prix disponible
Vitesse
Aucune donnée de vitesse disponible
Classement des Prix par Fournisseur
Aucune donnée de fournisseur disponible