Phi-3.5-mini-instruct
MicrosoftPhiОткрытые весаMIT · Коммерческое использование
Описание
Phi-3.5-mini-instruct is a 3.8B-parameter model that supports up to 128K context tokens, with improved multilingual capabilities across over 20 languages. It underwent additional training and safety post-training to enhance instruction-following, reasoning, math, and code generation. Ideal for environments with memory or latency constraints, it uses an MIT license.
Дата выхода
2024-08-23
Параметры
3.8B
Длина контекста
—
Модальности
text
Радар способностей
60
general
60
coding
60
reasoning
26
scienceоцен.
60
agents
0
multimodal
При отсутствии специализированных научных бенчмарков Science оценивается по научным категориям LLM Stats или на основе рассуждений.
Рейтинги
Нет данных рейтинга
Оценки бенчмарков (LLM Stats)
(LLM Stats (zeroeval))General
MMLU
69.0%Сам.
TruthfulQA
64.0%Сам.
Arena Hard
37.0%Сам.
Language
BoolQ
78.0%Сам.
MEGA TyDi QA
62.2%Сам.
MEGA MLQA
61.7%Сам.
MMMLU
55.4%Сам.
MMLU-Pro
47.4%Сам.
MEGA UDPOS
46.5%Сам.
Long Context
RULER
84.1%Сам.
RepoQA
77.0%Сам.
Math
GSM8k
86.2%Сам.
MATH
48.5%Сам.
MGSM
47.9%Сам.
Reasoning
ARC-C
84.6%Сам.
PIQA
81.0%Сам.
OpenBookQA
79.2%Сам.
Social IQa
74.7%Сам.
MEGA XStoryCloze
73.5%Сам.
MBPP
0.70 / 100Сам.
HellaSwagAI2 (2019)
69.4%Сам.
BIG-Bench Hard
69.0%Сам.
Winogrande
68.5%Сам.
MEGA XCOPA
63.1%Сам.
HumanEvalOpenAI (2021)
62.8%Сам.
Qasper
41.9%Сам.
GPQANYU + Cohere + Anthropic (2023)
30.4%Сам.
Summarization
GovReport
25.9%Сам.
SQuALITY
24.3%Сам.
QMSum
21.3%Сам.
SummScreenFD
16.0%Сам.
Индексы оценки AA
(Artificial Analysis)Нет данных AA оценки
Оценки категорий LLM Stats
(LLM Stats (zeroeval))Psychology70
Reasoning70
Language60
Legal60
Math60
Physics60
Finance60
General60
Healthcare60
Code60
Creativity60
Long Context50
Chat40
Writing40
Biology30
Chemistry30
Summarization20
Цены
Нет данных о ценах
Скорость
Нет данных о скорости
Рейтинг цен провайдеров
Нет данных провайдеров