Перейти к основному содержанию

North Micro Vision Instruct

CohereОткрытые весаApache 2.0 · Коммерческое использование

Описание

Compact open-weight vision-language model (2.4B) with native-resolution image support for VQA, captioning, grounding, OCR, charts, and documents. Custom 400M SigLIP 2-based vision encoder + 2B North Micro LLM backbone (Command A+ style). Multilingual and multi-image. LM context 128K; multimodal training validated to 8K. Not a reasoning/tool-calling model. Intended for prototyping and fine-tuning.

Дата выхода
2026-08-12
Параметры
2.4B
Длина контекста
Модальности

Радар способностей

60
general
0
coding
40
reasoning
34
scienceоцен.
28
agents
70
multimodal

При отсутствии специализированных научных бенчмарков Science оценивается по научным категориям LLM Stats или на основе рассуждений.

Рейтинги

Домен#МестоОценкаИсточник
Мультимодальный рейтинг86
18.0
LS

Оценки бенчмарков (LLM Stats)

(LLM Stats (zeroeval))

3d

BLINK52.7%Сам.

Communication

Multi-IF37.3%Сам.

Finance

MMLU50.4%Сам.
MMLU-Pro30.7%Сам.

General

IFEvalGoogle Research (2023)74.9%Сам.
MMStar51.8%Сам.
MMMU (val)32.9%Сам.

Grounding

RefCOCO-avg0.73 / 100Сам.

Image To Text

DocVQADocVQA (2020)92.1%Сам.
OCRBench79.2%Сам.
OCRBench-V2 (en)36.7%Сам.

Multimodal

ChartQAMasry et al. (2022)80.8%Сам.
AI2D77.5%Сам.
MMBench-V1.168.7%Сам.
InfoVQA65.2%Сам.
CharXiv-D60.0%Сам.

Reasoning

CountBench0.72 / 100Сам.
Hallusion Bench61.5%Сам.

Spatial Reasoning

RealWorldQA62.2%Сам.

Индексы оценки AA

(Artificial Analysis)

Нет данных AA оценки

Оценки категорий LLM Stats

(LLM Stats (zeroeval))
Spatial Reasoning
70
Image To Text
70
Grounding
70
Multimodal
60
Reasoning
60
Structured Output
60
Instruction Following
60
General
60
Vision
60
3d
50
Legal
40
Math
40
Language
40
Finance
40
Healthcare
40
Communication
40

Цены

Нет данных о ценах

Скорость

Нет данных о скорости

Рейтинг цен провайдеров

Нет данных провайдеров

Внешние ссылки