Перейти к основному содержанию

Claude Mythos Preview

AnthropicClaudeProprietary

Описание

Claude Mythos Preview is an unreleased general-purpose frontier model from Anthropic, a new tier above Opus (internal codename 'Capybara'). It identified thousands of zero-day vulnerabilities across every major operating system and web browser as part of Project Glasswing, a cross-industry cybersecurity initiative with 12 partners including AWS, Apple, Microsoft, and Google. State-of-the-art on SWE-bench Verified (93.9%), GPQA Diamond (94.6%), USAMO (97.6%), Terminal-Bench 2.0 (82.0%), CyberGym (83.1%), and Cybench (100% pass@1, saturated). Represents a 4.3x increase over the previous trendline for model performance. Deployed under ASL-3 Standard. Best-aligned Claude model to date per Anthropic's risk report, with the first-ever 24-hour internal alignment review before deployment. Not planned for general availability. Pricing for participants: $25/$125 per million tokens (input/output). 244-page system card.

Дата выхода
2026-05-07
Параметры
Длина контекста
Модальности
image, text

Радар способностей

80
general
80
coding
80
reasoning
77
scienceоцен.
80
agents
80
multimodal

При отсутствии специализированных научных бенчмарков Science оценивается по научным категориям LLM Stats или на основе рассуждений.

Рейтинги

Домен#МестоОценкаИсточник
Агентные возможности6
76.0
LS
Мультимодальный рейтинг7
65.0
LS

Оценки бенчмарков (LLM Stats)

(LLM Stats (zeroeval))

Agents

CyBench100.0%Сам.
BrowseCompOpenAI (2025)86.9%Сам.
CyberGym83.1%Сам.
Terminal-Bench 2.0Stanford × Laude Institute (2026)82.0%Сам.
OSWorld-Verified79.6%Сам.
SWE-Bench ProPrinceton NLP (2024)77.8%Сам.
SWE-Bench Multimodal59.0%Сам.

Biology

GPQANYU + Cohere + Anthropic (2023)94.6%Сам.

Code

SWE-Bench Verified93.9%Сам.
SWE-bench Multilingual87.3%Сам.

General

MMMLU92.7%Сам.

Healthcare

FigQA89.0%Сам.

Long Context

Graphwalks BFS >128k80.0%Сам.

Math

USAMO2597.6%Сам.
Humanity's Last Exam64.7%Сам.

Multimodal

CharXiv-R93.2%Сам.

Индексы оценки AA

(Artificial Analysis)

Нет данных AA оценки

Оценки категорий LLM Stats

(LLM Stats (zeroeval))
Physics
90
Safety
90
Search
90
Language
90
Frontend Development
90
Healthcare
90
Biology
90
Chemistry
90
Long Context
80
Math
80
Multimodal
80
Reasoning
80
Spatial Reasoning
80
General
80
Agents
80
Code
80
Tool Calling
80
Vision
80

Цены

Нет данных о ценах

Скорость

Нет данных о скорости

Рейтинг цен провайдеров

Нет данных провайдеров

Внешние ссылки