GPT-4o (Aug '24)
OpenAIGPTProprietary
Описание
GPT-4o ('o' for 'omni') is a multimodal AI model that accepts text, audio, image, and video inputs, and generates text, audio, and image outputs. It matches GPT-4 Turbo performance on text and code, with improvements in non-English languages, vision, and audio understanding.
Дата выхода
2024-08-06
Параметры
—
Длина контекста
128K
Модальности
image, text
Радар способностей
7
general
32
coding
40
reasoning
37
science
50
agents
90
multimodal
Рейтинги
| Домен | #Место | Оценка | Источник |
|---|---|---|---|
| Рейтинг кодинга | 427 | 31.0 | AA |
| Общий рейтинг | 576 | 20.0 | AA |
| Мультимодальный рейтинг | 115 | 39.0 | LS |
| Наука | 506 | 26.0 | AA |
Оценки бенчмарков (LLM Stats)
(LLM Stats (zeroeval))Chat
IFEvalGoogle Research (2023)
81.0%Сам.
Multi-IF
60.9%Сам.
TAU-bench Retail
60.3%Сам.
Tau2 Airline
45.5%Сам.
Multi-Challenge
40.3%Сам.
Communication
Tau2 Retail
63.4%Сам.
Tau2 Telecom
23.5%Сам.
Factuality
SimpleQA
38.2%Сам.
General
MMLU
85.7%Сам.
Aider-Polyglot
30.7%Сам.
Internal API instruction following (hard)
29.2%Сам.
Aider-Polyglot Edit
18.2%Сам.
Language
MMMLU
81.4%Сам.
MMLU-Pro
74.7%Сам.
COLLIE
61.0%Сам.
Long Context
ComplexFuncBench
66.5%Сам.
OpenAI-MRCR: 2 needle 128k
31.9%Сам.
Math
MathVista
61.4%Сам.
AIME 2024
13.1%Сам.
Multimodal
MMMU
72.2%Сам.
VideoMMMU
61.2%Сам.
Reasoning
ChartQAMasry et al. (2022)
85.7%Сам.
CharXiv-D
85.3%Сам.
GPQANYU + Cohere + Anthropic (2023)
70.1%Сам.
CharXiv-R
58.8%Сам.
TAU-bench Airline
42.8%Сам.
Graphwalks BFS <128k
41.7%Сам.
Graphwalks parents <128k
35.4%Сам.
SWE-Bench Verified
33.2%Сам.
SWE-Lancer
32.6%Сам.
SWE-Lancer (IC-Diamond subset)
12.4%Сам.
Humanity's Last Exam
5.3%Сам.
Vision
AI2D
94.2%Сам.
DocVQADocVQA (2020)
92.8%Сам.
EgoSchema
72.2%Сам.
ActivityNet
61.9%Сам.
MMMU-Pro
59.9%Сам.
ERQA
35.2%Сам.
Индексы оценки AA
(Artificial Analysis)Math 500(OpenAI (2024), subset of Hendrycks et al. MATH (2021))79.5
Gpqa(NYU + Cohere + Anthropic (2023))52.1
Lcr(Artificial Analysis)41.0
Ifbench(Google Research (2023))36.0
Livecodebench(UC Berkeley + MIT + Cornell (2024))31.7
Tau2(Sierra + U Toronto + Vector Institute (2025))28.9
Aime(MAA (Mathematical Association of America))11.7
Terminalbench Hard(Stanford × Laude Institute (2026))8.3
Intelligence Index(Artificial Analysis)7.7
Hle(Center for AI Safety + Scale AI (2025))2.3
Оценки категорий LLM Stats
(LLM Stats (zeroeval))Image To Text90
Legal80
Finance80
Instruction Following70
Language70
Multimodal70
Physics70
Healthcare70
Biology70
Chemistry70
Vision70
Chat60
Long Context60
Structured Output60
Writing60
Math50
Reasoning50
General50
Communication50
Tool Calling50
Spatial Reasoning40
Factuality40
Frontend Development30
Code30
Цены
Цена ввода$2.5 / 1M токенов
Цена вывода$10 / 1M токенов
Смешанная цена (3:1)$4.375 / 1M токенов
Скорость
Токенов/сек0.0
Задержка первого токена0.00s
Время до первого ответа0.00s
Рейтинг цен провайдеров
Рейтинг цен провайдеров
2 провайдеров
Самый дешевый: OpenAIСамый дорогой: Azure
ПровайдерВводВывод
1OpenAIСамый дешевый
$0
$0.00001
2Azure
$0
$0.00001
Сравнение цен разных API-провайдеров для этой модели.