विश्लेषण पर वापस जाएं
बिल्ड लॉग्स8 मिनट में पढ़ें

LLMs वीडियो एडिट नहीं करते: एजहेंट हार्नेस और टूल्स क्यों मायने रखते हैं

आपका LLM वीडियो एडिट नहीं कर रहा है; FFmpeg जैसे टूल्स कर रहे हैं। मॉडल, हार्नेस और टूल्स के बीच का अंतर समझना AI एजहेंट्स बनाने की कुंजी है।

Toby 4 अक्टूबर 2026

LLM आपका वीडियो एडिट नहीं कर रहा है। ffmpeg कर रहा है। हर कट, हर जोड़ और हर ओवरले एक एजेंट हार्नेस द्वारा जारी किया गया टूल कॉल है, और लूप में मौजूद मॉडल विचार-कार्य कर रहा है, फ़ाइल-कार्य नहीं। यदि आपने किसी को ऑनलाइन यह दावा करते देखा है कि WAN, LTX, या कोई अन्य वीडियो मॉडल सीधे फ़ुटेज "editing" कर रहा है, तो वे तीन बिल्कुल अलग घटकों को एक में समेट रहे हैं। यहाँ वह आर्किटेक्चर है, उसी क्रम में जिस क्रम में यह वास्तव में चलता है।

वे तीन घटक जिन्हें लोग बार-बार मिलाते रहते हैं

जब कोई एजेंट एक तैयार वीडियो बनाता है, तो तीन चीज़ें होनी ज़रूरी थीं, और वे एक ही चीज़ नहीं हैं। वर्तमान हाइप साइकल में, मार्केटिंग विभाग इन सबको "The Model" के बैनर तले समेट देते हैं, लेकिन यह इंजीनियरिंग स्टैक की एक मौलिक गलतफहमी है। कुछ ऐसा बनाने के लिए जो वास्तव में काम करे—विशेषकर फ़िटनेस टेक जैसी एक विशिष्ट श्रेणी में जहाँ सटीकता मायने रखती है—आपको इन चिंताओं को अलग करना होगा।

  • एक LLM: तय करता है कि टेक्स्ट कहाँ जाना चाहिए, कट क्या होने चाहिए, और क्या इंस्टॉल करना है। यह तर्क-क्षमता प्रदान करता है।
  • एक हार्नेस: लक्ष्य को जीवंत रखता है, मेमोरी थामे रहता है, लूप चलाता है, और काम सौंपता है। यह सतत स्थिति (persistent state) है।
  • टूल्स का एक सेट: आमतौर पर ffmpeg और स्थानीय बॉक्स पर जो कुछ भी उपलब्ध है, वास्तव में बाइट्स को हिलाता है। ये मांसपेशियाँ हैं।

वह अंतिम बिंदु वही है जो अधिकांश ऑनलाइन बहसों को तोड़ता है। LLM के पास "इस क्लिप को काटो" जैसा कोई बटन नहीं है। उसके पास ffmpeg के लिए एक टूल विवरण है, और वह एक कमांड उत्सर्जित करता है। शेल उस कमांड को चलाता है। पिक्सेल बदलते हैं। मॉडल ने कभी फ़ाइल को छुआ नहीं। उसने केवल टेक्स्ट का एक स्ट्रिंग सुझाया, जिसे कंप्यूटर द्वारा निष्पादित करने पर एक फ़ाइल परिवर्तन हुआ।

कौन क्या करता है, इसका एक संक्षिप्त मानचित्र

घटक स्टैक में भूमिका यह वास्तव में क्या उत्पन्न करता है
LLM निर्णय लेता है और योजना बनाता है टूल कॉल, इंस्टॉलेशन कमांड, अगले कदम का तर्क
Harness लक्ष्य, मेमोरी और लूप को थामे रहता है एजेंट की सततता और ऑर्केस्ट्रेशन
टूल्स (ffmpeg, codecs, scripts, CLIs) स्थानीय सिस्टम पर निष्पादित होता है वास्तविक फ़ाइल उत्परिवर्तन, रेंडर, एन्कोड, स्प्लाइस
APIs / MCPs डेटा के लिए इंटरफ़ेस बाहरी सेवाओं के विरुद्ध संरचित रीड और राइट

यदि आप कुछ भी याद नहीं रखते हैं तो बस यह याद रखें: LLM बोलता है, हार्नेस याद रखता है, और टूल्स करते हैं।

हृदय रूपक, मस्तिष्क रूपक नहीं

सबसे आम मानसिक मॉडल ग़लत है। लोग LLM को एजेंट का "मस्तिष्क" कहते हैं। यह मस्तिष्क नहीं है।

LLM एक हृदय के अधिक निकट है। इसके बिना रक्त प्रवाहित नहीं होता। इसके साथ बाकी सब कुछ गति कर सकता है। लेकिन हृदय के कोई लक्ष्य नहीं होते। उसकी कोई योजना नहीं होती। वह बस पंप करता है।

यह महत्वपूर्ण है क्योंकि यह रूपक मात्र काव्यात्मक नहीं है। मॉडल की क्षमता पूरे एजेंट की गति की ऊपरी सीमा तय करती है, ठीक वैसे ही जैसे हृदयी निर्गम शरीर के शेष भाग की कार्य-क्षमता को सीमित करता है। यदि LLM अगला टोकन उत्पन्न करने में धीमा है, तो हार्नेस रुक जाता है, और उपकरण निष्क्रिय पड़े रहते हैं। एक ही मशीन पर, छोटे पैरामीटर काउंट पर चलने वाला स्थानीय मॉडल उच्च-प्रदर्शन इन्फरेंस हार्डवेयर वाले फ्रंटियर क्लाउड मॉडल जितना थ्रूपुट नहीं पंप कर पाएगा।

मेरे अपने सेटअप में, मॉडल तीन मशीनों में वितरित है, और जनरेशन को फैलाने से पहले GX10 कम्प्यूट-गहन प्रीफिल चरण को संभालता है। इस कॉन्फ़िगरेशन में एक छोटा मॉडल भी बहुत तेज़ चलता है। हालाँकि, अगर मैं उसी मेमोरी पूल में कोई भारी स्थानीय मॉडल—जैसे GLM 4.7 या Minimax 25—लोड करने का प्रयास करूँ, तो या तो वह लोड ही नहीं होगा, या कुछ टोकन प्रति सेकंड की गति से रेंगता रहेगा। यही हृदय का पर्याप्त न पंप करना है। उपकरण और हार्नेस चाहे कितने भी सही हों, अगर पंप कमज़ोर है, तो एजेंट अनुत्तरदायी और भद्दा महसूस होगा।

हार्नेस ही मस्तिष्क क्यों है

LLM के संस्थापक शोधकर्ताओं में से एक ने इस तर्क का सबसे स्पष्ट संस्करण प्रस्तुत किया है, और यह वही हिस्सा है जिसे मुझे लगता है कि अधिकांश लोग नज़रअंदाज़ कर देते हैं। अकेले LLM का कोई लक्ष्य नहीं हो सकता। अगले-टोकन का पूर्वानुमान लक्ष्य नहीं है; यह एक सांख्यिकीय संभावना है। दीर्घ-रूप, सतत, बहु-घंटे का उद्देश्य किसी एकल ट्रांसफॉर्मर फ़ॉरवर्ड पास से प्रकट नहीं होता। LLM में "मैं यह संपादन पूरा करना चाहता हूँ" की कोई निहित अवधारणा नहीं है।

हार्नेस के पास यह होता है। हार्नेस (जैसे OpenClaw या कस्टम Python रैपर) को लक्ष्य दिया जा सकता है, उस लक्ष्य को डेटाबेस या संदर्भ विंडो में बनाए रखा जा सकता है, मेमोरी संरचना थामी जा सकती है, लूप चलाए जा सकते हैं, त्रुटियों से उबरा जा सकता है, और अनेक व्यक्तिगत टूल कॉल्स में एजेंट को एक ही लक्ष्य पर केंद्रित रखा जा सकता है। यह मस्तिष्क-सम व्यवहार है, और यह मॉडल के वेट्स में नहीं, बल्कि हार्नेस कोड में निवास करता है।

जो कंपनियाँ LLM को स्वयं मस्तिष्क बनाने का प्रयास करेंगी, वे असफल होंगी। मुझे नहीं लगता कि Anthropic या OpenAI आंतरिक रूप से मानते हों कि मॉडल ही मस्तिष्क है। गलती उपयोगकर्ता समुदाय में बसती है, जहाँ LLM बातचीत में इतना मानव-सम लगता है कि हम शेष संज्ञान को उस पर आरोपित कर देते हैं। लेकिन बातचीत उसके लिए सबसे आसान काम है। बाहरी दुनिया के विरुद्ध दीर्घ-क्षितिज की योजना बनाना बिल्कुल ही अलग चीज़ है।

वास्तविक दुनिया में उपकरण वास्तव में कैसे दिखते हैं

जब आप एजेंट से किसी वेबसाइट पर नेविगेट करने या वीडियो संपादित करने को कहते हैं, तो हार्नेस में आमतौर पर अंतर्निहित ब्राउज़र या वीडियो एनकोडर नहीं होता।

इसके बजाय, एजेंट मौजूदा स्थिति का स्क्रीनशॉट ले सकता है, मल्टीमोडल मॉडल के ज़रिए पिक्सेल वापस पढ़ सकता है, यह तर्क कर सकता है कि कर्सर कहाँ जाना चाहिए, और फिर ऑपरेटिंग सिस्टम को माउस-मूव और क्लिक कॉल जारी कर सकता है। इनमें से हर एक कदम स्थानीय सिस्टम के खिलाफ़ एक टूल कॉल है।

वीडियो के लिए भी यही सच है। अगर आप किसी एजेंट को Fable या Codecs जैसी स्टैक की ओर इशारा करते हैं, तो वह आपकी मशीन पर डिपेंडेंसीज़ डाउनलोड करेगा। यह Git रेपो, कोडेक्स, एनकोडर बायनेरिज़, और कभी-कभी एक पूरा मॉडल चेकपॉइंट इंस्टॉल करता है। वीडियो इसलिए नहीं दिखाई देता क्योंकि किसी चैटबॉट ने उसे टाइप करके अस्तित्व में ला दिया। वीडियो इसलिए दिखाई देता है क्योंकि हार्नेस ने ffmpeg को फ़िल्टर्स, बिटरेट्स और टाइमस्टैम्प्स वाले तर्कों की एक जटिल स्ट्रिंग के साथ कॉल करने का फ़ैसला किया—और ffmpeg ने पिक्सेल क्रंच करने का भारी काम किया।

फ़िटनेस टेक कनेक्शन: Speediance और उससे आगे

जब यह मेरे लिए पहली बार समझ आया, तब मैंने शुरुआती दौर में ही एक फ़्री-टियर Google Gemini सब्सक्रिप्शन को OpenClaw की ओर इंगित किया। मैंने उससे मेरी फ़िटनेस ट्रैकिंग सिस्टम का पहला वर्ज़न बनाने को कहा। मैंने कोड की एक भी लाइन नहीं लिखी। हार्नेस ने तय किया कि क्या इंस्टॉल करना है, और LLM ने हार्नेस के ज़रिए टूल कॉल जारी करना शुरू किया: उसने GitHub रेपोज़िटरीज़ क्लोन किए, Garmin Connect के API क्लाइंट को डाउनलोड किया, डेटा फ़्लो वायर किया, और मेरे स्थानीय बॉक्स पर गायब लाइब्रेरीज़ इंस्टॉल कीं।

इनमें से कुछ भी "एक LLM द्वारा फ़ाइल एडिट करना" नहीं था। वह एक हार्नेस था जो एक प्लानिंग लूप चला रहा था, एक मॉडल सही अगला कमांड जनरेट कर रहा था, और एक स्थानीय टूलचेन उसे निष्पादित कर रहा था। फ़िटनेस टेक्नोलॉजी के लिए इसकी दो प्रमुख सीखें हैं:

  1. स्थानीय सिस्टम उत्पाद का हिस्सा है: अगर आप इंस्टॉलेशन ब्लॉक करते हैं या मशीन को मेमोरी से वंचित रखते हैं, तो एजेंट फ़ेल हो जाता है। एजेंट केवल क्लाउड चैटबॉट की झलक नहीं, बल्कि एक पूर्ण-स्टैक इकाई है।
  2. API ही फ़्रंटियर है: टूल्स फ़ाइल का काम करते हैं, लेकिन API और MCP (मॉडल कॉन्टेक्स्ट प्रोटोकॉल) डेटा का काम करते हैं। Speediance अपने उपकरण डेटा के लिए इस साल के अंत में एक API लॉन्च कर रहा है, जो एक बड़ा बदलाव है। एक बार जब जिम हार्डवेयर के लिए एक स्वच्छ API उपलब्ध होगा, तो हार्नेस एक वर्कआउट में लूप कर सकेगा, सेट डेटा खींच सकेगा, और उसके बारे में तर्क कर सकेगा। LLM अभी भी आपके वर्कआउट को "एडिट" नहीं करता; एजेंट तर्क के आधार पर आपके रिकॉर्ड अपडेट करने के लिए API को कॉल करता है।

सही मानसिक मॉडल चुनना

जब आप "यह LLM वीडियो एडिट करता है" जैसा दावा देखें, तो वास्तविक घटकों को प्रतिस्थापित करें और देखें कि क्या दावा अभी भी टिकता है। अगर LLM एडिटिंग कर रहा है, तो वह कौन सा टूल कॉल कर रहा है? अगर वह ffmpeg कॉल कर रहा है, तो ffmpeg वीडियो एडिट कर रहा है। अगर कोई टूल नहीं है, तो कोई एडिट नहीं है—केवल इस बात का टेक्स्ट-आधारित विवरण है कि एक एडिट कैसी दिख सकती है।

इस तर्क का सबसे साफ़ संस्करण भी सबसे छोटा है: वीडियो मॉडल सीधे फ़ाइलें संपादित नहीं कर रहे हैं; FFmpeg और अन्य टूल कॉल्स काम कर रहे हैं, और हार्नेस एजेंट को लक्ष्य, मेमोरी, लूप और व्यावहारिक क्षमता देता है। एक बार जब आप इन तीन हिस्सों को अलग-अलग रख लेते हैं, तो AI-एजेंट स्टैक का बाकी हिस्सा, जिसमें वे हिस्से भी शामिल हैं जो अंततः आपके प्रशिक्षण डेटा को छुएँगे, तर्क करने के लिए बहुत आसान हो जाता है।

यह लंबी लाइवस्ट्रीम का विषय-संपादित कट है। पूरा तर्क, जिसमें GX10 सेटअप का स्क्रीन-कैप्चर वॉकथ्रू भी शामिल है, YouTube पर है: LLMs वीडियो संपादित नहीं करते। टूल और हार्नेस करते हैं।

#AI एजहेंट्स#हार्नेस#FFmpeg#टूल कॉलिंग#OpenClaw#Speediance API