Bổ sung đa phương thức cho DeepSeek: giải pháp nhận diện ảnh Qwen-3.7-Flash
DeepSeek V4 Flash không có đa phương thức — cần hiểu ảnh thì phải làm sao? Khảo sát một vòng, giải pháp có hiệu quả chi phí cao nhất hiện nay là Qwen-3.7-Flash: chi phí nhận diện một bức ảnh gần như bằng không, tổ hợp với V4 Flash là vá được điểm yếu.
Chen Dahuang
Indie developer

Bài gốc đăng trên X — 89 nghìn lượt xem, 600+ lượt thích.
Nhiều người than phiền DeepSeek V4 Flash không có khả năng đa phương thức. Đây đúng là một điểm yếu — nhưng không cần phải chết dính vào một model.
Vấn đề
Khả năng văn bản của V4 Flash đã đầy tới mức tối đa, nhưng gặp tình huống đọc ảnh là chịu chết: ảnh chụp màn hình, ảnh bảng biểu, bản thiết kế UI, tài liệu quét — không thứ nào xử lý được.
Đa phương thức là cái giá của "rẻ" — model phải làm mã hóa thị giác, tham số phình to, chi phí đội lên.
Cách giải: tổ hợp model
Tôi khảo sát một vòng mấy model nhận diện ảnh có hiệu quả chi phí cao nhất hiện nay, kết luận là Qwen-3.7-Flash.
Chi phí nhận diện một bức ảnh thấp đến mức có thể bỏ qua. Dùng nó làm model thị giác chuyên dụng, suy luận văn bản tiếp tục đi qua V4 Flash, là giữ được cả hai ưu điểm.
Tổ hợp thế nào
Ý tưởng đơn giản nhất là "routing": input có ảnh → đi qua model thị giác; thuần văn bản → đi qua V4 Flash.
// Mã giả: routing theo nhu cầu
function route(input) {
if (hasImage(input)) {
return qwenVision(input) // nhận diện ảnh + trích xuất thông tin chính
}
return deepseekV4Flash(input) // suy luận văn bản
}
Cách chơi cao cấp hơn là nhét luôn kết quả nhận diện ảnh vào V4 Flash để tiếp tục suy luận:
- Dùng Qwen-3.7-Flash nhận diện ảnh, xuất ra mô tả có cấu trúc
- Giao mô tả + câu hỏi gốc cùng lúc cho DeepSeek V4 Flash
- V4 Flash dựa trên mô tả suy luận sâu, viết code, tóm tắt
Vừa nhìn được ảnh, lại vừa được cái rẻ và nhanh của V4 Flash.
Tình huống hợp
- Hỏi đáp bằng ảnh chụp màn hình: ném ảnh chụp lỗi, ảnh chụp hội thoại vào
- Ảnh bảng biểu / tài liệu thành dữ liệu có cấu trúc
- Bản thiết kế UI thành code
- Trích xuất thông tin từ hóa đơn, hợp đồng đã quét
- Tình huống Agent cần "nhìn" màn hình
Vì sao không phải phương án khác
LLM thị giác thuần túy (như mấy model đa phương thức nhà GPT) rất mạnh, nhưng giá thì vẫn thế — xử lý hàng loạt hằng ngày không kinh tế.
Qwen-3.7-Flash thắng ở hiệu quả chi phí: chất lượng nhận diện đủ dùng, chi phí gần như vô hình, chạy cả đống batch cũng không xót.
Tổng kết
Tổ hợp model là chuyện thường — đừng trông mong một model làm hết.
V4 Flash làm ngựa thồ văn bản (rẻ, nhanh, context khổng lồ), Qwen-3.7-Flash bổ sung thị giác (rẻ, đủ dùng) — bộ đôi này là phương án có hiệu quả chi phí cao nhất hiện nay. Thiếu gì vá nấy, thực tế hơn nhiều so với chờ một model "toàn năng mà đắt".
Bài viết liên quan
05.08.2026 · 7 phút
Trải nghiệm sâu bản chính thức DeepSeek V4 Flash: rẻ, nhanh, context 1M, tìm kiếm tích hợp sẵn
Mấy ngày trải nghiệm sâu bản chính thức DeepSeek V4 Flash: rẻ cực độ, nhanh như chớp, context 1M, tìm kiếm web chính thức tích hợp sẵn, mã nguồn mở hoàn toàn. Điểm yếu duy nhất là đa phương thức — nhưng có thể vá bằng cách tổ hợp các model khác.
05.08.2026 · 6 phút
API của DeepSeek có sẵn tìm kiếm web: xài chùa khả năng tìm kiếm chính thức qua Responses API
DeepSeek nhúng thẳng tìm kiếm web vào API: gọi deepseek-v4-flash qua giao diện Responses và khai báo tool web_search là xong. Không cần tích hợp công cụ tìm kiếm bên thứ ba, không cần xin key API tìm kiếm.