Перейти к основному содержанию

DeepSeek R1 Zero

DeepSeekDeepSeekОткрытые весаMIT · Коммерческое использование

Описание

DeepSeek-R1-Zero, a model trained via large-scale reinforcement learning (RL) without supervised fine-tuning (SFT) as a preliminary step, demonstrated remarkable performance on reasoning. With RL, DeepSeek-R1-Zero naturally emerged with numerous powerful and interesting reasoning behaviors. However, DeepSeek-R1-Zero encounters challenges such as endless repetition, poor readability, and language mixing. To address these issues and further enhance reasoning performance, we introduce DeepSeek-R1, which incorporates cold-start data before RL. DeepSeek-R1 achieves performance comparable to OpenAI-o1 across math, code, and reasoning tasks.

Дата выхода
2025-01-20
Параметры
671.0B
Длина контекста
Модальности

Радар способностей

80
general
50
coding
90
reasoning
60
scienceоцен.
78
agents
0
multimodal

При отсутствии специализированных научных бенчмарков Science оценивается по научным категориям LLM Stats или на основе рассуждений.

Рейтинги

Нет данных рейтинга

Оценки бенчмарков (LLM Stats)

(LLM Stats (zeroeval))

Biology

GPQANYU + Cohere + Anthropic (2023)73.3%Сам.

Code

LiveCodeBench50.0%Сам.

Math

MATH-50095.9%Сам.
AIME 202486.7%Сам.

Индексы оценки AA

(Artificial Analysis)

Нет данных AA оценки

Оценки категорий LLM Stats

(LLM Stats (zeroeval))
Math
90
Reasoning
80
General
80
Physics
70
Biology
70
Chemistry
70
Code
50

Цены

Нет данных о ценах

Скорость

Нет данных о скорости

Рейтинг цен провайдеров

Нет данных провайдеров

Внешние ссылки