سدّ نقص تعدد الوسائط لدى DeepSeek: خطة التعرف على الصور Qwen-3.7-Flash
لا يملك DeepSeek V4 Flash تعدد وسائط، فكيف نتعامل مع صوره؟ بعد البحث، الخطة الأكثر كفاءة سعراً حالياً هي Qwen-3.7-Flash: تكلفة التعرف على صورة واحدة ضئيلة للغاية، وبدمجها مع V4 Flash يُسدّ هذا النقص.
Chen Dahuang
مطوّر مستقل

نُشر أصلاً على X، مع 89 ألف مشاهدة وأكثر من 600 إعجاب.
كثيرون ينتقدون DeepSeek V4 Flash لعدم امتلاكه تعدد الوسائط. وهذا نقص حقيقي — لكن لا داعي للإصرار العنيد على نموذج واحد.
المشكلة
قدرات V4 Flash النصية كاملة العتاد، لكنه بمجرد مواجهة سيناريوهات قراءة الصور يعمى: لقطات الشاشة، وصور الجداول، وتصاميم واجهات UI، والمستندات الممسوحة — لا شيء يستطيع معالجته.
إن تعدد الوسائط هو ثمن «الرخص»: فعندما يشفّر النموذج الصور بصرياً، تتضخم معاملاته فترتفع التكلفة.
الحل: الدمج
طفتُ على محيط من نماذج التعرف على الصور بحثاً عن الأعلى كفاءة سعرية، وكانت الخلاصة Qwen-3.7-Flash.
تكلفة التعرف على صورة واحدة منخفضة لدرجة يمكن تجاهلها. اجعلها نموذج الرؤية المتخصص، واستمر في الاستدلال النصي عبر V4 Flash، فتجنِ منزلتي الحُسنيين.
كيفية الدمج
أبسط فكرة هي «التوجيه»: مدخل يحوي صورة → إلى نموذج الرؤية؛ ونص خالص → إلى V4 Flash.
// 伪代码:按需路由
function route(input) {
if (hasImage(input)) {
return qwenVision(input) // 识图 + 提取关键信息
}
return deepseekV4Flash(input) // 文本推理
}
والأسلوب الأكثر تقدماً هو تمرير مخرجات التعرف على الصور مباشرة إلى V4 Flash لمواصلة الاستدلال:
- تعرّف على الصورة بـ Qwen-3.7-Flash واخرج وصفاً منظماً (struct)
- سلّم الوصف مع السؤال الأصلي معاً إلى DeepSeek V4 Flash
- يبني V4 Flash استدلالاً عميقاً وكتابة كود وتلخيصاً استناداً إلى الوصف
هكذا ترى الصور، وتستمتع في الوقت نفسه برخص V4 Flash وسرعته.
السيناريوهات المناسبة
- الاستفسار عن لقطات الشاشة: ألقِ لقطات الأخطاء ولقطات المحادثات
- تحويل صور الجداول/المستندات إلى بيانات منظمة
- تحويل تصاميم UI إلى كود
- استخراج المعلومات من المستندات الممسوحة كالفواتير والعقود
- سيناريوهات حاجة الوكيل إلى «رؤية» الشاشة
لماذا ليست الخطط الأخرى
نماذج الرؤية الضخمة (كتعدد الوسائط في عائلة GPT) قوية جداً، لكن سعرها باهظ كما هو، فلا تجدي نفعاً في المعالجة الدفعية اليومية.
تنتصر Qwen-3.7-Flash بكفاءة السعر: جودة تعرفٍ مقبولة، وتكلفة شبه منعدمة، وقدرة على تشغيل مهام دفعية ضخمة دون وخز ضمير.
الخلاصة
الدمج بين النماذج هو الوضع الطبيعي؛ فلا تنتظر نموذجاً واحداً يفعل كل شيء.
للنصوص أساسٌ هو V4 Flash (رخيص سريع واسع السياق)، وللرؤية مكمّلٌ هو Qwen-3.7-Flash (رخيص وكافٍ)؛ هذه التركيبة هي الأكفأ سعراً حالياً. سدّ النقص بما ينقصك، أكثر واقعية من انتظار نموذج «شامل لكنه غالٍ».
اقرأ أيضاً: تجربة متعمقة للإصدار الرسمي من DeepSeek V4 Flash
قراءات ذات صلة
05.08.2026 · 7 دقيقة
تجربة متعمقة للإصدار الرسمي من DeepSeek V4 Flash: رخيص وسريع وسياق 1M وبحث مدمج
تجربة متعمقة لبضعة أيام مع الإصدار الرسمي من DeepSeek V4 Flash: رخص مطلق، سرعة البرق، سياق 1M، بحث عبر الإنترنت مدمج رسمياً، ومصدر مفتوح بالكامل. القصور الوحيد هو تعدد الوسائط، لكن يمكن تعويضه بدمج نماذج أخرى.
05.08.2026 · 6 دقيقة
البحث عبر الإنترنت مدمج في DeepSeek API — وResponses API تمنحك قدرة البحث الرسمية مجاناً
دمجت DeepSeek رسمياً البحث عبر الإنترنت في واجهة API: باستدعاء deepseek-v4-flash عبر واجهة Responses وإعلان أداة web_search فقط، لا حاجة لربط محركات بحث خارجية ولا لتقديم طلبات مفاتيح بحث.