1 час назад
Cohere выпустила North Micro Vision — компактную VLM на 2,4 млрд параметров

Cohere Labs выпустила North Micro Vision — компактную vision‑language model (VLM) с 2,4 млрд параметров. Это самая маленькая зрительно‑языковая модель компании на момент релиза. Основной скрипт North Micro Vision — работа с документами, таблицами, графиками, скриншотами, формами и другими структурированными изображениями.
Главное отличие модели от многих компактных VLM — обработка изображения в исходном разрешении. Обычно перед подачей в мультимодальную модель изображение приводят к фиксированному размеру. При таком ресайзе могут теряться мелкие элементы: текст, подписи на графиках, границы таблиц и другие детали. North Micro Vision сохраняет исходные пропорции изображения, что особенно полезно для document understanding и OCR. При этом высокое разрешение увеличивает требования к памяти и задержку обработки.
Модель выпущена с открытыми весами под лицензией Apache 2.0. Cohere позиционирует ее как компактную основу для прототипирования и task‑specific fine‑tuning — то есть дообучения под конкретную предметную область или тип документов.
Архитектура
Общий размер модели составляет приблизительно 2,4 млрд параметров. В ней используется vision encoder примерно на 400 млн параметров, обученный на основе SigLIP 2 SO400M, и языковая часть около на 2 млрд параметров.
Языковой backbone построен на архитектуре North Micro LLM. В основе — чередование sliding‑window attention и глобального attention без позиционных эмбеддингов. Для локального внимания используется RoPE, а глобальный слой не привязан к позиционной разметке. Такой оформление позволяет сочетать локальный контекст с возможностью учитывать информацию на уровне всей последовательности.
Интереснее устроено соединение зрения и языка. Вместо того чтобы передавать языковой модели только один набор визуальных признаков, North Micro Vision использует информацию с нескольких уровней vision encoder и внедряет ее в ранние слои языковой части. Этот решение основан на архитектурной идее DeepStack: языковая модель получает визуальные признаки разной степени абстракции, а не только итоговое представление изображения.
За счет этого схема лучше сохраняет мелкие визуальные детали, которые особенно важны при разборе документов и структурированных изображений.
На что рассчитана модель
Cohere не позиционирует North Micro Vision как замену крупным универсальным мультимодальным моделям. Ее преимущество — в компактности и специализированных сценариях.
Основные задачи — visual question answering, OCR, распознавание и разбор документов, работа с графиками и таблицами, visual grounding и извлечение структурированных данных. Поддерживаются равным образом некоторое количество изображений в одном запросе и мультиязычный ввод.
Небольшое количество параметров делает модель интересной для локального запуска и дообучения. Cohere отдельно указывает на возможность использовать ее как базовую модель для создания специализированного visual expert под конкретный набор данных.
При этом ограничения тоже существенны. North Micro Vision не является reasoning‑моделью, а ее способности к математическим и программным задачам ограничены. Кроме того, native‑resolution обработка может заметно увеличивать потребление памяти и время инференса по мере роста размера изображения.
Бенчмарки
В опубликованном сравнении Cohere схема сопоставлялась с другими компактными VLM. Сильнее всего North Micro Vision демонстрирует себя именно на задачах, для которых она и проектировалась: документация, графики, понимание структуры изображения и visual grounding.
По данным Cohere, на DocVQA модель получила 0,921, на ChartQA — 0,808, на AI2D — 0,775, а на RefCOCO — 0,732. При этом на более общих тестах вроде MMMU результаты значительно слабее.
Разработчики оптимизировали схема под конкретный класс мультимодальных задач, где критичны детали изображения, пространственная структура и извлечение информации из визуальных данных. Мы получили минимальный размер модели в обмен на специализацию и возможность функционировать непосредственно с визуальными деталями исходного изображения.
Читают сейчас
59 минут назад
Автомат повышения точности снимков ДЗЗ
Программный алгоритм GeoCorrect позволяет автоматически повысить точность геопривязки уже имеющихся спутниковых снимков до 1–2 GSD (размера пикселя на местности), не изменяя сам растр — пересчитываютс

1 час назад
Стаи медуз заставили вывести из строя 3,2 гигаватта французской атомной энергии
«Массовое нашествие» медуз вынудило компанию Electricité de France SA остановить три энергоблока на АЭС «Гравелин» и сократить мощность четвёртого, что привело к ограничению поставок электроэнергии в

1 час назад
Уязвимость приложения Screen Sharing предоставляет злоумышленникам цельный контроль над Mac жертв
Злоумышленники активно используют уязвимость CVE-2026-65400, позволяющую обойти аутентификацию функции «Совокупный экран» (Screen Sharing) в macOS для компрометации компьютеров Mac с открытым портом 5

1 час назад
Adobe уволила инженера‑разработчика с 25-летним стажем, который потом целый год искал работу и стал водителем автобуса
Проработав более двух десятилетий в технологической индустрии, бывший старший инженер Adobe решил сменить профессию на совершенно другую. Джеймс Строун, проживающий в Колорадо, рассказал, что после ув

1 час назад
В Подмосковье введут авторизацию пользователей электросамокатов через «Госуслуги»
Операторы сервисов аренды средств индивидуальной мобильности (СИМ) в Московской области до 30 сентября 2026 года должны обеспечить обязательную авторизацию пользователей электросамокатов и электровело