मुख्य सामग्री पर जाएँ
चेन दाहुआंग
सभी पोस्ट
पढ़ने में 8 मिनटमूल रूप से X से

फ़र्स्ट-पार्टी Harness हमेशा बेस्ट आंसर नहीं होता: ओपन-मॉडल युग में मॉडल और Harness अलग-अलग चुनें

Claude इस्तेमाल करते हो तो Claude Code? ओपन-मॉडल युग में यह इंस्टिंक्ट अपग्रेड का हक़दार है। फ़र्स्ट-पार्टी का फ़ायदा असली है, लेकिन अच्छा मॉडल ट्रेन करना और अच्छा Harness बनाना दो अलग इंजीनियरिंग हैं — यह लेख समझाता है कि मॉडल और Harness अब अलग-अलग क्यों चुने जा सकते हैं, साथ में पाँच Harness की पोज़िशनिंग मैप।

Chen Dahuang

Chen Dahuang

इंडी डेवलपर

फ़र्स्ट-पार्टी Harness हमेशा बेस्ट आंसर नहीं होता: ओपन-मॉडल युग में मॉडल और Harness अलग-अलग चुनें

मूल विचार पहली बार X पर प्रकाशित हुआ; यह लेख पूरा विस्तृत वर्ज़न है, पाँच Harness की पोज़िशनिंग मैप के साथ।

Coding Agent चुनते वक़्त ज़्यादातर लोगों की पहली सोच बिल्कुल नैचुरल है: Claude इस्तेमाल करो तो Claude Code; GPT तो Codex; GLM तो ZCode; DeepSeek तो ज़ाहिर तौर पर पहले DeepSeek का अपना Harness ही देखो।

यह सोच असल में पूरी तरह सही है। फ़र्स्ट-पार्टी का सबसे बड़ा फ़ायदा यही है कि वह अपने मॉडल को सबसे अच्छी तरह जानता है।

फ़र्स्ट-पार्टी का फ़ायदा असली है

मॉडल किस तरह का Prompt पसंद करता है, Tool Schema का कौन सा डिज़ाइन सबसे स्टेबल रहता है, लंबा Context कैसे व्यवस्थित हो, नए वर्ज़न में कौन सी क्षमताएँ आईं, कहाँ-कहाँ सबसे आसानी से लड़खड़ाता है — ये सब फ़र्स्ट-पार्टी आमतौर पर थर्ड पार्टी से पहले जानती है।

इसलिए Claude Code और Codex जैसे प्रोडक्ट्स में, जहाँ मॉडल और Harness लंबे समय तक साथ में इटरेट करते हैं, फ़र्स्ट-पार्टी कॉम्बो ही अक्सर सबसे मज़बूत वर्ज़न-आंसर होता है। इस पर मैं बहस नहीं करूँगा।

लेकिन मॉडल ट्रेन करना और Harness बनाना दो बिल्कुल अलग इंजीनियरिंग हैं

जब DeepSeek, GLM जैसे ओपन मॉडल्स पर आते हैं, तो बात दिलचस्प होने लगती है — क्योंकि अच्छा मॉडल ट्रेन करना और अच्छा Harness बनाना असल में दो बिल्कुल अलग इंजीनियरिंग हैं।

Coding Agent असल में चलने लगता है, तो मॉडल से बाहर की ढेर सारी समस्याएँ सामने आती हैं:

  • फ़ाइलें कैसे पढ़ी जाएँ, कोड कैसे एडिट हो
  • Agent Loop कैसे कंट्रोल हो, Context कैसे कंप्रेस हो
  • Cache का कैसे फ़ायदा उठे, Tool Call फ़ेल होने पर कैसे रिकवर हो
  • Subagent कैसे शेड्यूल हों, परमिशन कैसे मैनेज हों

इन जगहों पर काम कितना अच्छा हुआ, यही तय करता है कि वही मॉडल आख़िर में इस्तेमाल में कैसा लगेगा। वही मॉडल, दूसरे Harness में, अनुभव ज़मीन-आसमान का फ़र्क़ हो सकता है।

बड़ी समस्या: मॉडल्स बहुत तेज़ी से अपडेट हो रहे हैं

आज GLM ऊपर है; अगले महीने DeepSeek शायद और दमदार Flash ले आए; थोड़ी देर में कोई नया मॉडल और निकल आए।

अगर पूरा Coding वर्कफ़्लो किसी एक फ़र्स्ट-पार्टी प्रोडक्ट से बँधा हो, तो मॉडल बदलने पर अक्सर टूल्स और आदतें भी बदलनी पड़ती हैं। कुछ महीनों में तैयार किए कॉन्फ़िग, मेमोरी और वर्कफ़्लो सब धड़ाम।

थर्ड-पार्टी Harness की क़ीमत यहीं है: अपने परिचित टूल्स, Skills, MCP, परमिशन और वर्कफ़्लो को टिका के रख सकते हो, और नीचे का सिर्फ़ मॉडल बदल सकते हो। आज DeepSeek, कल GLM, परसों कोई और — काम का माहौल नए सिरे से नहीं बनाना पड़ता।

पाँच Harness की पोज़िशनिंग मैप

मेनस्ट्रीम पाँच की जगह साफ़ कर देता हूँ (अगस्त 2026 के अंत तक के मेरे इस्तेमाल के आधार पर):

Pi: फ़िलसॉफ़ी बेहद मिनिमल; Harness मॉडल में जितना हो सके कम दखल देता है। हल्का, तेज़, Token खर्च कम, आकार देने में बेहद आसान। अपने लंबे समय के Agent की बुनियाद बनाने के लिए बेहतरीन — सिंपल, साफ़, मनमर्ज़ी से मॉडिफ़ाई करने योग्य।

OMP: Pi के ऊपर LSP, Debugger, Browser, AST जैसी भारी Coding क्षमताएँ ढेर करता जाता है, जैसे एजेंट को पूरा IDE पहना दिया हो। सचमुच हैवी कोडिंग और मुश्किल Repo नेविगेशन के लिए सही।

DeepSeek Harness: सबसे आगे जाता है — Everything is Plugin। Agent Loop, टूल्स, परमिशन, Preset और UI सब खोलकर दोबारा जोड़े जा सकते हैं। एजेंट आर्किटेक्चर, Preset, मल्टी-एजेंट और अगली पीढ़ी के Runtime के साथ छेड़छाड़ करने वालों के लिए। PTC मोड ज़्यादा आज़माएँ — तेज़ भी और Token भी बचाता है।

OpenCode: फ़िलहाल सबसे संतुलित क़िस्म — ओपन सोर्स, कई Provider, बड़ा इकोसिस्टम, Client/Server, डेस्कटॉप ऐप और Subagent सब काफ़ी मैच्योर। जिसे एक मैच्योर, जनरल-पर्पज़, मल्टी-मॉडल Coding Agent चाहिए, उसके लिए।

Command Code: रास्ता बिल्कुल अलग — इसे मॉडल की कमी पूरी करना बहुत पसंद है। Tool Call के ग़लत पैरामीटर लोकली ठीक कर देता है; फ़ाइल के डुप्लीकेट रीड डिडुप्लीकेट कर देता है; लंबे सेशन में Stable Prefix बनाए रखकर Cache Hit बढ़ाता है; Context फटने ही वाला हो तो Compaction कर देता है। DeepSeek V4 Flash, GLM-5.3 Flash जैसे मेहनती मॉडल्स पर इस सोच की वैल्यू सबसे ज़्यादा है: मॉडल थोड़ा कमज़ोर हो, Harness पूरी कर देता है।

मेरा चुनाव

अगर सिर्फ़ लॉन्ग-टर्म मॉलियेबिलिटी देखनी हो तो मुझे अब भी Pi पसंद है। लेकिन अगर आज मुझसे DeepSeek V4 Flash या GLM-5.3 से कड़क मेहनत करानी हो, तो Command Code का ज़ायक़ा ज़रूर चखूँगा — मॉडल और Harness की जोड़ी टास्क के हिसाब से बनती है, कैंप के हिसाब से नहीं।

ओपन-मॉडल युग में मॉडल और Harness अब पूरी तरह अलग-अलग चुने जा सकते हैं। “किसके मॉडल के साथ किसका टूल” पूछना बंद करें, यह पूछें कि “यह मॉडल किस Harness में सबसे अच्छा काम करता है।”

अगर यह काम आया, तो किसी दोस्त के साथ शेयर करें।

संबंधित लेख