DeepSeek получил компьютерное зрение — схема «водит пальцем по картинке»

2 мин
DeepSeek получил компьютерное зрение — схема «водит пальцем по картинке»

18 июня DeepSeek включила режим работы с изображениями (Vision) в своем приложении и веб-версии. Об этом сообщил Чэнь Сяокан — один из авторов мультимодальных моделей серии DeepSeek-VL. Теперь в чате три режима вместо прежней пары кнопок: быстрый (Fast), экспертный (Expert) и зрение (Vision), который идеально подходит для понимания сложной графики.

Интереснее не сам факт, что нейросеть научилась смотреть, а то, как она одновременно рассуждает. В основе режима лежит подход, который команда описала в техническом отчете под названием Thinking with Visual Primitives — "мышление визуальными примитивами". Вместо того чтобы просто описывать изображение словами, модель расставляет на нем точки и рамки и вплетает эти метки прямо в цепочку рассуждения — как человек, который водит пальцем по строчкам при счете или прокладывает путь в нарисованном на бумаге лабиринте. Логика такая: обычный текст слишком расплывчат, чтобы точно указать на нужный объект в плотной сцене, и в связи с этой неточности модели начинают путаться и выдавать выдуманные ответы.

Технически зрение построено поверх модели DeepSeek-V4-Flash. Чтобы картинка не съедала слишком множество вычислений, разработчики сжимают служебную хранилище: каждые четыре визуальных токена схлопываются в одну запись. В итоге на одно изображение уходит заметно меньше ресурсов, чем у обычных мультимодальных моделей, — а это прямой удар по стоимости работы со зрением.

По заявлению авторов, на задачах подсчета объектов и пространственного рассуждения модель держится на уровне GPT-5.4, Claude Sonnet 4.6 и Gemini 3 Flash. Здесь важна оговорка, которую делают сами авторы: это узкий срез тестов, подобранный под тему их работы, а не оценка общих способностей. К тому же веса модели пока не выложены.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Читают сейчас

Одной картинки хватило, чтобы взломать OpenAI

1 час назад

Одной картинки хватило, чтобы взломать OpenAI

Команда Hacktron нашла цепочку из двух багов. Начальный жил в обработке HEIC/HEIF. Если скачать на форум специально собранный файл, он давал удалённое выполнение кода. По существу, позволял исполнять

Версия открытого проекта Segra 1.8.0 для записи игр на ПК с Windows

2 часа назад

Версия открытого проекта Segra 1.8.0 для записи игр на ПК с Windows

В середине сентября 2026 года разработчик Олоф Сегергрен опубликовал обновление 1.8.0 открытого проекта Segra для записи игр на ПК с Windows. Исходный исходник решения написан на C# и TypeScript и обн

Вышел пиринговый видеохостинг PeerTube 8.3

3 часа назад

Вышел пиринговый видеохостинг PeerTube 8.3

15 сентября 2026 года состоялся релиз версии пирингового видеохостинга PeerTube 8.3. Версия PeerTube 1.0 вышел в октябре 2018 года. Релиз PeerTube 6.0 состоялся в ноябре 2023 года, подход PeerTube 7.0

Агенту поручили починить программа, а он изменил собственную схема

6 часов назад

Агенту поручили починить программа, а он изменил собственную схема

Исследователи Irregular поручили кодинг-агенту на базе Qwen3.5-27B задачу по исправлению приложения, которое неправильно обрабатывало запросы. Агент нашёл обучающие примеры и инструменты для fine-tuni

Claude Code сам делит инициатива между AI-агентами

6 часов назад

Claude Code сам делит инициатива между AI-агентами

Anthropic целиком переделала Projects в Claude Code. Теперь это не папка с чатами, а единый центр управления разработкой. Описываем какую-нибудь большую и грандиозную цель. В частности, хотим ускорить