Перейти к основному содержанию

North Micro Vision Instruct

CohereОткрытые весаApache 2.0 · Коммерческое использование

Описание

Compact open-weight vision-language model (2.4B) with native-resolution image support for VQA, captioning, grounding, OCR, charts, and documents. Custom 400M SigLIP 2-based vision encoder + 2B North Micro LLM backbone (Command A+ style). Multilingual and multi-image. LM context 128K; multimodal training validated to 8K. Not a reasoning/tool-calling model. Intended for prototyping and fine-tuning.

Дата выхода
2026-08-12
Параметры
2.4B
Длина контекста
—
Модальности
—

Радар способностей

60
general
0
coding
40
reasoning
34
scienceоцен.
28
agents
70
multimodal

При отсутствии специализированных научных бенчмарков Science оценивается по научным категориям LLM Stats или на основе рассуждений.

Рейтинги

Домен#МестоОценкаИсточник
Мультимодальный рейтинг148
12.0
LS

Оценки бенчмарков (LLM Stats)

(LLM Stats (zeroeval))

Chat

IFEvalGoogle Research (2023)74.9%Сам.
Multi-IF37.3%Сам.

General

MMLU50.4%Сам.

Language

MMLU-Pro30.7%Сам.

Reasoning

ChartQAMasry et al. (2022)80.8%Сам.
CharXiv-D60.0%Сам.

Vision

DocVQADocVQA (2020)92.1%Сам.
OCRBench79.2%Сам.
AI2D77.5%Сам.
RefCOCO-avg0.73 / 100Сам.
CountBench0.72 / 100Сам.
MMBench-V1.168.7%Сам.
InfoVQA65.2%Сам.
RealWorldQA62.2%Сам.
Hallusion Bench61.5%Сам.
BLINK52.7%Сам.
MMStar51.8%Сам.
OCRBench-V2 (en)36.7%Сам.
MMMU (val)32.9%Сам.

Индексы оценки AA

(Artificial Analysis)

Нет данных AA оценки

Оценки категорий LLM Stats

(LLM Stats (zeroeval))
Image To Text
70
Spatial Reasoning
70
Grounding
70
Chat
60
Instruction Following
60
Multimodal
60
Reasoning
60
Structured Output
60
General
60
Vision
60
3d
50
Language
40
Legal
40
Math
40
Finance
40
Healthcare
40
Communication
40

Цены

Нет данных о ценах

Скорость

Нет данных о скорости

Рейтинг цен провайдеров

Нет данных провайдеров

Внешние ссылки