Перейти к содержимому
Чэнь Дахуан
Все посты
5 мин чтенияПервоначально из X

Даём DeepSeek мультимодальность: подход Qwen-3.7-Flash vision

У DeepSeek V4 Flash нет мультимодальности — что делать с пониманием изображений? После обзора рынка самый выгодный по цене вариант сейчас — Qwen-3.7-Flash: распознавание одной картинки стоит почти ничего, и в паре с V4 Flash дыра закрывается.

Chen Dahuang

Chen Dahuang

Инди-разработчик

Даём DeepSeek мультимодальность: подход Qwen-3.7-Flash vision

Оригинал опубликован в X — 89 000 просмотров, 600+ лайков.

Многие жалуются, что у DeepSeek V4 Flash нет мультимодальных способностей. Это реальный пробел — но вовсе не обязательно венчаться с одной-единственной моделью.

Проблема

Текстовые способности V4 Flash на пределе, но с изображениями она беспомощна: скриншоты, таблицы-картинки, мокапы UI, сканы документов — ничего из этого не работает.

Мультимодальность — это цена «дешевизны»: нужны визуальные энкодеры, параметры раздуваются, расходы растут.

Решение: комбинировать модели

Я прошёлся по самым выгодным по цене vision-моделям на рынке, и ответ — Qwen-3.7-Flash.

Стоимость распознавания одной картинки пренебрежимо мала. Используй её как выделенную vision-модель, текстовые рассуждения оставь на V4 Flash — и получай лучшее от обеих.

Как их соединить

Простейшая идея — «маршрутизация»: есть на входе картинка → vision-модель; чистый текст → V4 Flash.

// псевдокод: маршрутизация по запросу
function route(input) {
  if (hasImage(input)) {
    return qwenVision(input)   // распознать картинку + извлечь ключевую информацию
  }
  return deepseekV4Flash(input) // текстовые рассуждения
}

Продвинутый приём — скармливать вывод vision-модели прямо в V4 Flash для дальнейшего рассуждения:

  1. Qwen-3.7-Flash распознаёт картинку и выдаёт структурированное описание
  2. Передаём описание вместе с исходным вопросом в DeepSeek V4 Flash
  3. V4 Flash глубоко рассуждает над описанием — пишет код, резюмирует

Так ты получаешь и зрение, и дешевизну с быстротой V4 Flash.

Где это пригодится

  • Q&A по скриншотам: кидай скриншоты ошибок и скриншоты переписок
  • Таблицы / документы-картинки в структурированные данные
  • Мокапы UI в код
  • Извлечение информации из сканов счетов и договоров
  • Агентам, которым нужно «видеть» экран

Почему не другие варианты

Чистые vision-LLM (например, мультимодальные модели семейства GPT) сильны, но цена есть цена — для ежедневной пакетной работы экономически невыгодно.

Qwen-3.7-Flash берёт своим соотношением цена/качество: качество распознавания достаточное, стоимость почти невидимая, и можно гонять большие батчи, не морщась.

Итог

Комбинирование моделей — это норма. Не жди, что одна модель сможет всё.

Текстовая рабочая лошадка V4 Flash (дёшево, быстро, огромный контекст) + зрительная добавка Qwen-3.7-Flash (дёшево, достаточно хорошо) — эта связка сейчас лучший вариант по соотношению цена/качество. Латай пробелы, а не жди прихода «модели, которая умеет всё, но дорогой».

По теме: DeepSeek V4 Flash — подробный разбор стабильного релиза

Если было полезно — поделитесь со знакомым.

Похожие статьи