Перейти к основному содержанию

Phi-3.5-mini-instruct

MicrosoftPhiОткрытые весаMIT · Коммерческое использование

Описание

Phi-3.5-mini-instruct is a 3.8B-parameter model that supports up to 128K context tokens, with improved multilingual capabilities across over 20 languages. It underwent additional training and safety post-training to enhance instruction-following, reasoning, math, and code generation. Ideal for environments with memory or latency constraints, it uses an MIT license.

Дата выхода
2024-08-23
Параметры
3.8B
Длина контекста
—
Модальности
text

Радар способностей

60
general
60
coding
60
reasoning
26
scienceоцен.
60
agents
0
multimodal

При отсутствии специализированных научных бенчмарков Science оценивается по научным категориям LLM Stats или на основе рассуждений.

Рейтинги

Нет данных рейтинга

Оценки бенчмарков (LLM Stats)

(LLM Stats (zeroeval))

General

MMLU69.0%Сам.
TruthfulQA64.0%Сам.
Arena Hard37.0%Сам.

Language

BoolQ78.0%Сам.
MEGA TyDi QA62.2%Сам.
MEGA MLQA61.7%Сам.
MMMLU55.4%Сам.
MMLU-Pro47.4%Сам.
MEGA UDPOS46.5%Сам.

Long Context

RULER84.1%Сам.
RepoQA77.0%Сам.

Math

GSM8k86.2%Сам.
MATH48.5%Сам.
MGSM47.9%Сам.

Reasoning

ARC-C84.6%Сам.
PIQA81.0%Сам.
OpenBookQA79.2%Сам.
Social IQa74.7%Сам.
MEGA XStoryCloze73.5%Сам.
MBPP0.70 / 100Сам.
HellaSwagAI2 (2019)69.4%Сам.
BIG-Bench Hard69.0%Сам.
Winogrande68.5%Сам.
MEGA XCOPA63.1%Сам.
HumanEvalOpenAI (2021)62.8%Сам.
Qasper41.9%Сам.
GPQANYU + Cohere + Anthropic (2023)30.4%Сам.

Summarization

GovReport25.9%Сам.
SQuALITY24.3%Сам.
QMSum21.3%Сам.
SummScreenFD16.0%Сам.

Индексы оценки AA

(Artificial Analysis)

Нет данных AA оценки

Оценки категорий LLM Stats

(LLM Stats (zeroeval))
Psychology
70
Reasoning
70
Language
60
Legal
60
Math
60
Physics
60
Finance
60
General
60
Healthcare
60
Code
60
Creativity
60
Long Context
50
Chat
40
Writing
40
Biology
30
Chemistry
30
Summarization
20

Цены

Нет данных о ценах

Скорость

Нет данных о скорости

Рейтинг цен провайдеров

Нет данных провайдеров

Внешние ссылки