Passer au contenu principal

Claude 3.5 Sonnet

AnthropicClaudeProprietary

Description

Claude 3.5 Sonnet is a powerful AI model with industry-leading software engineering skills. It excels in coding, planning, and problem-solving, with significant improvements in agentic coding and tool use tasks. The model includes computer use capabilities in public beta, allowing it to interact with computer interfaces like a human user.

Date de sortie
2024-10-22
Paramètres
Longueur du contexte
Modalités
image, text

Radar de capacités

80
general
70
coding
90
reasoning
60
scienceest.
60
agents
100
multimodal

Science est estimé à partir des scores scientifiques de LLM Stats ou du raisonnement lorsque les benchmarks scientifiques dédiés ne sont pas disponibles.

Classements

Domaine#RangScoreSource
Classement multimodal6
65.0
LS

Scores de benchmarks (LLM Stats)

(LLM Stats (zeroeval))

Agents

OSWorld Extended22.0%Aut.
OSWorld Screenshot-only14.9%Aut.

Biology

GPQANYU + Cohere + Anthropic (2023)67.2%Aut.

Code

HumanEvalOpenAI (2021)93.7%Aut.
SWE-Bench Verified49.0%Aut.

Communication

TAU-bench Retail69.2%Aut.
TAU-bench Airline46.0%Aut.

Finance

MMLU90.4%Aut.
MMLU-Pro77.6%Aut.

General

MMMU68.3%Aut.

Image To Text

DocVQADocVQA (2020)95.2%Aut.

Language

BIG-Bench Hard93.1%Aut.

Math

GSM8k96.4%Aut.
MGSM91.6%Aut.
DROP87.1%Aut.
MATH78.3%Aut.
MathVista67.7%Aut.

Multimodal

AI2D94.7%Aut.
ChartQAMasry et al. (2022)90.8%Aut.

Indices d'évaluation AA

(Artificial Analysis)

Aucune donnée d'évaluation AA disponible

Scores par catégorie LLM Stats

(LLM Stats (zeroeval))
Image To Text
100
Math
90
Language
90
Legal
80
Multimodal
80
Reasoning
80
Finance
80
General
80
Healthcare
80
Vision
80
Physics
70
Biology
70
Chemistry
70
Code
70
Communication
60
Tool Calling
60
Frontend Development
50

Tarification

Aucune donnée de prix disponible

Vitesse

Aucune donnée de vitesse disponible

Classement des Prix par Fournisseur

Aucune donnée de fournisseur disponible

Sources externes