メインコンテンツへスキップ

o3-mini

OpenAIOpenAI o-seriesProprietary

説明

A smaller variant of O3, expected to offer enhanced multimodal capabilities, improved reasoning, and more efficient resource utilization compared to previous models while maintaining strong performance on core tasks.

リリース日
2025-01-31
パラメータ
コンテキスト長
200K
モダリティ
file, text

能力レーダー

39
general
39
coding
83
reasoning
49
science推定
40
agents
85
multimodal

専門的な科学ベンチマークが利用できない場合、Scienceは推論プロキシを使用して推定します。

ランキング

ドメイン#順位スコアソース
Code Ranking230
37.0
AA
General Ranking214
48.0
AA
Math Reasoning50
89.0
AA
Reasoning78
54.0
LS
Science146
54.0
AA

ベンチマークスコア (LLM Stats)

Biology

GPQA77.2%自己申告

Code

Aider-Polyglot66.7%自己申告
Aider-Polyglot Edit60.4%自己申告
SWE-Bench Verified49.3%自己申告
SWE-Lancer18.0%自己申告
SWE-Lancer (IC-Diamond subset)7.4%自己申告

Communication

Multi-IF79.5%自己申告
TAU-bench Retail57.6%自己申告
Multi-Challenge39.9%自己申告
TAU-bench Airline32.4%自己申告

Factuality

SimpleQA15.0%自己申告

Finance

MMLU86.9%自己申告

General

IFEval93.9%自己申告
LiveBench84.6%自己申告
Multilingual MMLU80.7%自己申告
Internal API instruction following (hard)50.0%自己申告

Language

COLLIE98.7%自己申告

Long Context

OpenAI-MRCR: 2 needle 128k18.7%自己申告
ComplexFuncBench17.6%自己申告

Math

MATH97.9%自己申告
MGSM92.0%自己申告
AIME 202487.3%自己申告
FrontierMath9.2%自己申告

Reasoning

Graphwalks parents <128k58.3%自己申告
Graphwalks BFS <128k51.0%自己申告

AA評価指数

Intelligence Index
25.9
Coding Index
17.9
Math 500
1.0
Mmlu Pro
0.8
Aime
0.8
Gpqa
0.7
Livecodebench
0.7
Scicode
0.4
Tau2
0.3
Hle
0.1
Terminalbench Hard
0.1

LLM Statsカテゴリスコア

Writing
100
Finance
90
Healthcare
90
Instruction Following
90
Language
90
Legal
90
Biology
80
Chemistry
80
Math
80
Physics
80
General
70
Structured Output
60
Reasoning
60
Spatial Reasoning
50
Communication
50
Frontend Development
50
Tool Calling
40
Code
40
Long Context
20
Factuality
10

価格設定

入力価格$1.1 / 1M tokens
出力価格$4.4 / 1M tokens
混合価格(3:1)$1.925 / 1M tokens

速度

トークン/秒135.1 tokens/s
初トークン遅延10.07s
初回答遅延10.07s

利用可能なプロバイダー

(LS内部単位)

プロバイダーデータがありません

外部リンク