Даём DeepSeek мультимодальность: подход Qwen-3.7-Flash vision
У DeepSeek V4 Flash нет мультимодальности — что делать с пониманием изображений? После обзора рынка самый выгодный по цене вариант сейчас — Qwen-3.7-Flash: распознавание одной картинки стоит почти ничего, и в паре с V4 Flash дыра закрывается.
Chen Dahuang
Инди-разработчик

Оригинал опубликован в X — 89 000 просмотров, 600+ лайков.
Многие жалуются, что у DeepSeek V4 Flash нет мультимодальных способностей. Это реальный пробел — но вовсе не обязательно венчаться с одной-единственной моделью.
Проблема
Текстовые способности V4 Flash на пределе, но с изображениями она беспомощна: скриншоты, таблицы-картинки, мокапы UI, сканы документов — ничего из этого не работает.
Мультимодальность — это цена «дешевизны»: нужны визуальные энкодеры, параметры раздуваются, расходы растут.
Решение: комбинировать модели
Я прошёлся по самым выгодным по цене vision-моделям на рынке, и ответ — Qwen-3.7-Flash.
Стоимость распознавания одной картинки пренебрежимо мала. Используй её как выделенную vision-модель, текстовые рассуждения оставь на V4 Flash — и получай лучшее от обеих.
Как их соединить
Простейшая идея — «маршрутизация»: есть на входе картинка → vision-модель; чистый текст → V4 Flash.
// псевдокод: маршрутизация по запросу
function route(input) {
if (hasImage(input)) {
return qwenVision(input) // распознать картинку + извлечь ключевую информацию
}
return deepseekV4Flash(input) // текстовые рассуждения
}
Продвинутый приём — скармливать вывод vision-модели прямо в V4 Flash для дальнейшего рассуждения:
- Qwen-3.7-Flash распознаёт картинку и выдаёт структурированное описание
- Передаём описание вместе с исходным вопросом в DeepSeek V4 Flash
- V4 Flash глубоко рассуждает над описанием — пишет код, резюмирует
Так ты получаешь и зрение, и дешевизну с быстротой V4 Flash.
Где это пригодится
- Q&A по скриншотам: кидай скриншоты ошибок и скриншоты переписок
- Таблицы / документы-картинки в структурированные данные
- Мокапы UI в код
- Извлечение информации из сканов счетов и договоров
- Агентам, которым нужно «видеть» экран
Почему не другие варианты
Чистые vision-LLM (например, мультимодальные модели семейства GPT) сильны, но цена есть цена — для ежедневной пакетной работы экономически невыгодно.
Qwen-3.7-Flash берёт своим соотношением цена/качество: качество распознавания достаточное, стоимость почти невидимая, и можно гонять большие батчи, не морщась.
Итог
Комбинирование моделей — это норма. Не жди, что одна модель сможет всё.
Текстовая рабочая лошадка V4 Flash (дёшево, быстро, огромный контекст) + зрительная добавка Qwen-3.7-Flash (дёшево, достаточно хорошо) — эта связка сейчас лучший вариант по соотношению цена/качество. Латай пробелы, а не жди прихода «модели, которая умеет всё, но дорогой».
По теме: DeepSeek V4 Flash — подробный разбор стабильного релиза
Похожие статьи
05.08.2026 · 7 мин
DeepSeek V4 Flash — стабильный релиз, проверка на практике: дёшево, быстро, контекст 1M, встроенный поиск
Несколько дней погружался в стабильный релиз DeepSeek V4 Flash: невероятно дёшево, молниеносно быстро, контекст 1M, официальный встроенный веб-поиск, полностью открытый код. Единственная слабость — мультимодальность, но её можно закрыть связкой с другими моделями.
05.08.2026 · 6 мин
В API DeepSeek встроен веб-поиск — официальный поиск на халяву через Responses API
DeepSeek встроил веб-поиск прямо в API: вызываешь deepseek-v4-flash через интерфейс Responses и объявляешь инструмент web_search. Никакой интеграции со сторонним поисковиком, никакого ключа поискового API не нужно.