Cohere выпустила North Micro Vision — компактную VLM на 2,4 млрд параметров

3 мин
Cohere выпустила North Micro Vision — компактную VLM на 2,4 млрд параметров

Cohere Labs выпустила North Micro Vision — компактную vision‑language model (VLM) с 2,4 млрд параметров. Это самая маленькая зрительно‑языковая модель компании на момент релиза. Основной скрипт North Micro Vision — работа с документами, таблицами, графиками, скриншотами, формами и другими структурированными изображениями.

Главное отличие модели от многих компактных VLM — обработка изображения в исходном разрешении. Обычно перед подачей в мультимодальную модель изображение приводят к фиксированному размеру. При таком ресайзе могут теряться мелкие элементы: текст, подписи на графиках, границы таблиц и другие детали. North Micro Vision сохраняет исходные пропорции изображения, что особенно полезно для document understanding и OCR. При этом высокое разрешение увеличивает требования к памяти и задержку обработки.

Модель выпущена с открытыми весами под лицензией Apache 2.0. Cohere позиционирует ее как компактную основу для прототипирования и task‑specific fine‑tuning — то есть дообучения под конкретную предметную область или тип документов.

Архитектура

Общий размер модели составляет приблизительно 2,4 млрд параметров. В ней используется vision encoder примерно на 400 млн параметров, обученный на основе SigLIP 2 SO400M, и языковая часть около на 2 млрд параметров.

Языковой backbone построен на архитектуре North Micro LLM. В основе — чередование sliding‑window attention и глобального attention без позиционных эмбеддингов. Для локального внимания используется RoPE, а глобальный слой не привязан к позиционной разметке. Такой оформление позволяет сочетать локальный контекст с возможностью учитывать информацию на уровне всей последовательности.

Интереснее устроено соединение зрения и языка. Вместо того чтобы передавать языковой модели только один набор визуальных признаков, North Micro Vision использует информацию с нескольких уровней vision encoder и внедряет ее в ранние слои языковой части. Этот решение основан на архитектурной идее DeepStack: языковая модель получает визуальные признаки разной степени абстракции, а не только итоговое представление изображения.

За счет этого схема лучше сохраняет мелкие визуальные детали, которые особенно важны при разборе документов и структурированных изображений.

На что рассчитана модель

Cohere не позиционирует North Micro Vision как замену крупным универсальным мультимодальным моделям. Ее преимущество — в компактности и специализированных сценариях.

Основные задачи — visual question answering, OCR, распознавание и разбор документов, работа с графиками и таблицами, visual grounding и извлечение структурированных данных. Поддерживаются равным образом некоторое количество изображений в одном запросе и мультиязычный ввод.

Небольшое количество параметров делает модель интересной для локального запуска и дообучения. Cohere отдельно указывает на возможность использовать ее как базовую модель для создания специализированного visual expert под конкретный набор данных.

При этом ограничения тоже существенны. North Micro Vision не является reasoning‑моделью, а ее способности к математическим и программным задачам ограничены. Кроме того, native‑resolution обработка может заметно увеличивать потребление памяти и время инференса по мере роста размера изображения.

Бенчмарки

В опубликованном сравнении Cohere схема сопоставлялась с другими компактными VLM. Сильнее всего North Micro Vision демонстрирует себя именно на задачах, для которых она и проектировалась: документация, графики, понимание структуры изображения и visual grounding.

По данным Cohere, на DocVQA модель получила 0,921, на ChartQA — 0,808, на AI2D — 0,775, а на RefCOCO — 0,732. При этом на более общих тестах вроде MMMU результаты значительно слабее.

Разработчики оптимизировали схема под конкретный класс мультимодальных задач, где критичны детали изображения, пространственная структура и извлечение информации из визуальных данных. Мы получили минимальный размер модели в обмен на специализацию и возможность функционировать непосредственно с визуальными деталями исходного изображения.

Читают сейчас

IFPI требует от ЕС активировать средство yt‑dlp для скачивания с YouTube в список способствующих пиратству ресурсов

1 час назад

IFPI требует от ЕС активировать средство yt‑dlp для скачивания с YouTube в список способствующих пиратству ресурсов

Международная федерация производителей фонограмм (International Federation of the Phonographic Industry, IFPI) попросила Европейскую комиссию активировать в список способствующих пиратству ресурсов ин

Реестр платформ для самозанятых расширили до 13 сервисов

1 час назад

Реестр платформ для самозанятых расширили до 13 сервисов

Минэкономразвития России расширило реестр посреднических цифровых платформ — сейчас в него входят 13 прошедших проверку сервисов. Для включения система должна иметь среднесуточную аудиторию не менее 1

За Bare Metal — тоже к нам: RUVDS вышел на сегмент аренды физических серверов

2 часа назад

За Bare Metal — тоже к нам: RUVDS вышел на сегмент аренды физических серверов

Говорим как есть: мы вышли на сегмент Bare Metal. Возможность заказать новую услугу уже доступна на сайте RUVDS. Свежий кластер, реализованный на базе ДЦ в Московском регионе, дополняет наши существую

Еврокомиссия развернёт меры против 10 видеоигровых компаний в рамках борьбы с проблемами внутриигровых покупок

2 часа назад

Еврокомиссия развернёт меры против 10 видеоигровых компаний в рамках борьбы с проблемами внутриигровых покупок

Европейская комиссия анонсировала меры против 10 видеоигровых компаний, чтобы защитить права игроков. Претензия Сети по защите прав потребителей (Consumer Protection Cooperation, CPC) и ЕК касается ви

Слух: Naughty Dog работает над новой частью Uncharted

3 часа назад

Слух: Naughty Dog работает над новой частью Uncharted

В Сети появились слухи о новой части Uncharted. По данным источников, инициатива станет следующей игрой студии Naughty Dog после релиза Intergalactic: The Heretic Prophet. Ознакомиться новости далее