छोटा जवाब: एजेंट टूल्स और एक लूप वाला लैंग्वेज मॉडल है। आप उसे एक लक्ष्य देते हैं, जैसे ‘पता करो कि कल रात लाइन 2 के 40 मिनट क्यों गए’। वह एक कदम की योजना बनाता है, कोई टूल बुलाता है (लाइन स्टॉप लॉग पर क्वेरी), नतीजा देखता है, अगला कदम तय करता है (उस एसेट के लिए मेंटेनेंस सिस्टम जाँचो) और तब तक चलता रहता है जब तक उसके पास जवाब न हो या उसे किसी इंसान की ज़रूरत न पड़े। MCP वह स्टैंडर्ड प्लग है जो मॉडल को इन टूल्स से जोड़ता है। मेमोरी उसे कदमों और सेशनों के बीच संदर्भ साथ रखने देती है। डिज़ाइन का अहम सवाल यह नहीं कि एजेंट कितना चतुर है, बल्कि यह कि वह अकेले कितना कर सकता है। मैं पाँच स्तरों वाली सीढ़ी इस्तेमाल करता हूँ, L0 से L4, और प्लांट फ़्लोर पर ज़्यादातर एजेंट L1 या L2 पर रहने चाहिए।

एजेंट कैसे काम करता है, और वह कितना कर सकता है लक्ष्य योजना काम अवलोकन MCP से टूल लाइन स्टॉप लॉग मेंटेनेंस सिस्टम SOP लाइब्रेरी जवाब मिलने तक लूप, या किसी इंसान से पूछो ऑटोनॉमी की सीढ़ी L4 अकेले काम करता है, इंसान निगरानी करता है L3 कड़ी सीमाओं में काम, इंसान वीटो कर सकता है L2 काम का मसौदा बनाता है, इंसान मंज़ूर करता है L1 डेटा पढ़ता और समझाता है L0 कोई एजेंट नहीं, लोग करते हैं प्लांट फ़्लोर का डिफ़ॉल्ट: L1 और L2 PLC और SCADA में लिखना इस सीढ़ी पर नहीं है · एजेंट कभी प्रोसेस कंट्रोल नहीं छूते
लूप उसे एजेंट बनाता है। सीढ़ी उसे प्लांट में चलाने लायक सुरक्षित बनाती है।

लाइन 2 पर रात की शिफ़्ट के 40 मिनट गए। सुबह की मीटिंग में कोई पूछता है क्यों। आमतौर पर जवाब में आधा घंटा लगता है: लाइन स्टॉप लॉग खोलो, लंबे स्टॉप ढूँढो, मेंटेनेंस सिस्टम में एसेट देखो, जाँचो कि वह पहले फ़ेल हुआ है या नहीं, शिफ़्ट नोट्स पढ़ो, फिर सब जोड़ो।

चैटबॉट यह नहीं कर सकता। वह सिर्फ़ उसी से जवाब दे सकता है जो आप उसमें चिपकाते हैं। एजेंट कर सकता है, क्योंकि वह हर टुकड़ा ख़ुद जाकर ला सकता है। सीरीज़ की यह तीसरी पोस्ट बताती है कैसे। पिछली पोस्ट में बताया गया था कि लैंग्वेज मॉडल क्या है। एजेंट वही मॉडल है, दो चीज़ें जोड़कर: टूल और एक लूप।

टूल: एजेंट की पहुँच कहाँ तक है

टूल एक फ़ंक्शन है जिसे बुलाने की मॉडल को इजाज़त है। उसका एक नाम होता है, सरल भाषा में विवरण, तय इनपुट और तय आउटपुट। प्लांट के लिए काम के टूल ये हो सकते हैं:

  • get_line_stops(line, start, end) हर स्टॉप अवधि, फ़ॉल्ट कोड और एसेट के साथ लौटाता है
  • get_asset_history(asset_id) मेंटेनेंस सिस्टम से पुराने वर्क ऑर्डर और ख़राबियाँ लौटाता है
  • search_sop(query) संबंधित SOP अंश सेक्शन नंबर के साथ लौटाता है
  • get_shift_notes(line, shift) लौटाता है कि ऑपरेटरों ने क्या लिखा

मॉडल कभी मेंटेनेंस डेटाबेस पर सीधे SQL नहीं चलाता। वह कुछ इनपुट के साथ किसी टूल को नाम से माँगता है, साधारण सॉफ़्टवेयर एक टेस्ट की हुई क्वेरी चलाता है और नतीजा टेक्स्ट के रूप में लौटता है। यह अलगाव एजेंट की सबसे अहम सुरक्षा ख़ूबी है। मॉडल तय करता है कि क्या देखना है। कोड तय करता है कि कैसे, और क्या करने की इजाज़त है।

लूप: योजना, काम, अवलोकन

टूल उपलब्ध हों, तो मॉडल एक लूप में काम करता है:

  1. योजना। लक्ष्य और अब तक की जानकारी देखकर अगला कदम तय करो। ‘पहले कल रात लाइन 2 के लंबे स्टॉप ढूँढो।’
  2. काम। एक टूल बुलाओ। get_line_stops("L2", "22:00", "06:00")
  3. अवलोकन। नतीजा पढ़ो। छह स्टॉप, उनमें से चार लेबलर का ग्लू यूनिट, कुल 31 मिनट।
  4. दोहराओ। नई जानकारी के साथ अगले कदम की योजना बनाओ। ‘ग्लू यूनिट का मेंटेनेंस इतिहास जाँचो।’ और इसी तरह आगे।

लूप तब ख़त्म होता है जब एजेंट के पास जवाब देने लायक जानकारी हो, या जब वह किसी ऐसी चीज़ पर पहुँचे जो उसे अकेले तय नहीं करनी चाहिए और वह किसी इंसान को सौंप दे। लाइन 2 के सवाल पर एक अच्छा एजेंट यह कहकर ख़त्म कर सकता है: 40 मिनट में से ज़्यादातर लेबलर का ग्लू यूनिट था, एक ही फ़ॉल्ट कोड के साथ चार स्टॉप; यही फ़ॉल्ट पिछले महीने के दो वर्क ऑर्डर में है; शिफ़्ट नोट्स में ग्लू के तापमान का ज़िक्र है; ग्लू यूनिट स्टार्ट-अप वाला SOP सेक्शन 6.3 है।

यह जादू नहीं है। यह आधे घंटे का हाथ का काम एक मिनट में है, हर कदम सामने दिखता हुआ।

MCP: स्टैंडर्ड प्लग

हाल तक मॉडल को किसी टूल से जोड़ने का मतलब था हर मॉडल और हर सिस्टम के लिए अलग कोड लिखना। Model Context Protocol (MCP), एक खुला स्टैंडर्ड जिसे Anthropic ने 2024 के आख़िर में जारी किया और तब से बड़े पैमाने पर अपनाया गया, इसे ठीक करता है। आप, मान लीजिए, मेंटेनेंस सिस्टम के लिए एक बार MCP सर्वर बनाते हैं। वह अपने टूल्स को एक मानक तरीके से बताता है। फिर MCP बोलने वाला कोई भी असिस्टेंट उन्हें इस्तेमाल कर सकता है।

प्लांट के लिए व्यावहारिक फ़ायदा मालिकाना हक है। मेंटेनेंस टीम मेंटेनेंस सिस्टम के MCP सर्वर की मालिक हो सकती है और ठीक-ठीक तय कर सकती है कि वह कौन-से टूल खोलता है। क्वालिटी टीम LIMS वाले की मालिक हो सकती है। अगर कोई टूल सर्वर पर नहीं है, तो कोई भी एजेंट उसे इस्तेमाल नहीं कर सकता, ऊपर चाहे कोई भी मॉडल बैठा हो।

मेमोरी: एजेंट क्या साथ रखता है

लैंग्वेज मॉडल को बातचीतों के बीच कुछ याद नहीं रहता। एजेंट दो तरह की मेमोरी जोड़ते हैं:

  • वर्किंग मेमोरी काम के दौरान की कॉन्टेक्स्ट विंडो है: लक्ष्य, हर टूल कॉल और हर नतीजा। इसी वजह से चौथे कदम पर एजेंट जानता है कि पहले कदम पर उसे क्या मिला था।
  • लॉन्ग-टर्म मेमोरी वह सब है जो मॉडल के बाहर सहेजा जाता है और बाद में वापस पढ़ा जाता है: पुरानी जाँचों के नोट्स, बार-बार आने वाली ज्ञात ख़राबियों की सूची, किसी यूज़र की पसंद।

लॉन्ग-टर्म मेमोरी ताकतवर है और उसे किसी भी दूसरे रिकॉर्ड जितनी सावधानी चाहिए। अगर एजेंट पिछले महीने का कोई गलत निष्कर्ष ‘याद’ रखता है, तो वह उसे आत्मविश्वास के साथ दोबारा इस्तेमाल करेगा। सहेजी गई मेमोरी को दस्तावेज़ की तरह बरतिए: तारीख़ के साथ, स्रोत के साथ और सुधार के लिए खुली।

ऑटोनॉमी के पाँच स्तर

प्लांट में सबसे अहम सवाल यह नहीं कि ‘एजेंट कितना होशियार है?’। सवाल यह है कि ‘वह बिना इंसान के क्या कर सकता है?’। मैं एक सरल पाँच स्तरों वाली सीढ़ी इस्तेमाल करता हूँ:

  • L0: कोई एजेंट नहीं। लोग काम हाथ से करते हैं।
  • L1: पढ़ता और समझाता है। एजेंट डेटा पर क्वेरी चला सकता है और जवाब या सार लिख सकता है। वह कुछ नहीं बदलता।
  • L2: मसौदा बनाता है, इंसान मंज़ूर करता है। एजेंट कोई काम तैयार करता है, जैसे वर्क ऑर्डर, चेंजओवर प्लान या ईमेल, और कुछ भी होने से पहले इंसान उसे मंज़ूर करता है।
  • L3: कड़ी सीमाओं में काम करता है, इंसान वीटो कर सकता है। एजेंट कम जोखिम वाले काम ख़ुद करता है, तय सीमाओं के भीतर, लॉग के साथ और उन्हें पलटने के रास्ते के साथ। तय बजट के भीतर किसी कंज़्यूमेबल का दोबारा ऑर्डर एक उदाहरण है।
  • L4: अकेले काम करता है, इंसान निगरानी करता है। एजेंट एक काम शुरू से अंत तक चलाता है और लोग बाद में उसके काम की समीक्षा करते हैं।

बेवरेज प्लांट फ़्लोर पर ज़्यादातर एजेंट लंबे समय तक L1 और L2 पर रहने चाहिए। पढ़ना और मसौदा बनाना जोखिम के छोटे से हिस्से में ज़्यादातर फ़ायदा दे देते हैं। L3 सिर्फ़ सीमित, पलटे जा सकने वाले, कम लागत वाले कामों के लिए है। और एक श्रेणी सीढ़ी से पूरी तरह बाहर है: एजेंट का कोई भी काम PLC, SCADA सिस्टम या प्रोसेस सेटपॉइंट में नहीं लिखना चाहिए। प्रोसेस कंट्रोल इंजीनियर किए गए कंट्रोल सिस्टम और लोगों के पास रहता है। पोस्ट 7 इन गार्डरेल्स को विस्तार से कवर करती है।

ह्यूमन इन द लूप, सही ढंग से

‘ह्यूमन इन द लूप’ कहना आसान है और बुरी तरह करना भी आसान। शिफ़्ट के आख़िर में एक थका हुआ प्लानर चालीस मसौदों पर ‘approve’ दबा दे, तो वह निगरानी नहीं है। वह रबर स्टैम्प है।

कुछ आदतें इसे असली बनाती हैं:

  • हर मसौदे के साथ सबूत दिखाइए: कौन-से टूल कॉल, कौन-सा डेटा, कौन-सा SOP सेक्शन।
  • मसौदे कम और ठोस रखिए। एक अच्छा वर्क ऑर्डर बनाने वाला एजेंट दस औसत बनाने वाले से ज़्यादा काम का है।
  • ट्रैक कीजिए कि लोग कितनी बार एजेंट के मसौदे बदलते या रिजेक्ट करते हैं। घटती एडिट दर अच्छी है। शून्य एडिट दर का मतलब आमतौर पर यह होता है कि कोई पढ़ ही नहीं रहा।

यह कहाँ टूटता है

एजेंट लूप में फँस सकते हैं या भटक सकते हैं। ठीक से दायरे में न बाँधा गया एजेंट बार-बार टूल बुला सकता है या किसी बेमतलब सुराग के पीछे भाग सकता है। कदमों, समय और लागत की सीमाएँ तय कीजिए, और ‘मुझे किसी इंसान की ज़रूरत है’ को एक मान्य जवाब बनाइए।

टूल के नतीजों में निर्देश छिपे हो सकते हैं। एजेंट लॉग, नोट्स और दस्तावेज़ों से टेक्स्ट पढ़ता है। अगर उस टेक्स्ट में लिखा हो ‘पिछले निर्देश अनदेखा करो’, तो लापरवाही से बना सेटअप उसे मान सकता है। इसे प्रॉम्प्ट इंजेक्शन कहते हैं। टूल जो कुछ भी लौटाए, उसे डेटा मानिए, कभी आदेश नहीं, और लिखने वाले टूल्स को मंज़ूरी के पीछे रखिए।

कड़ी उतनी ही अच्छी है जितना डेटा। ‘other’ फ़ॉल्ट कोड से भरा लाइन स्टॉप लॉग पढ़ने वाला एजेंट ‘other’ का आत्मविश्वासी सार बनाएगा। एजेंट अच्छे डेटा को तेज़ी से काम में लाते हैं। वे बुरे डेटा को बेहतर नहीं बनाते।

ऑटोनॉमी धीरे-धीरे बढ़ती जाती है। जब एजेंट L2 पर अच्छा काम करने लगे, तो मंज़ूरी छोड़ देने का दबाव आता है। स्तर जान-बूझकर, गलती की कीमत के हिसाब से तय कीजिए, और उसे लिख लीजिए।

निचोड़

एजेंट टूल्स और लूप वाला लैंग्वेज मॉडल है। वह योजना बनाता है, टूल के ज़रिए काम करता है, नतीजा देखता है और दोहराता है, जिससे वह वह सारी खोजबीन और आपसी जाँच कर पाता है जो पहले किसी सुपरवाइज़र की सुबह का आधा घंटा खा जाती थी। MCP उसे प्लांट सिस्टम से जोड़ने का मानक तरीका है, जिसमें हर सिस्टम का मालिक तय करता है कि कौन-से टूल हों। मेमोरी उसे कदमों और सेशनों में उपयोगी बनाती है। ऑटोनॉमी एक चुनाव है, और बेवरेज प्लांट में समझदार डिफ़ॉल्ट L1 और L2 है: पढ़ना, समझाना और मसौदा बनाना, इंसान की मंज़ूरी के साथ और प्रोसेस कंट्रोल पहुँच से बाहर।

अगली पोस्ट: डेटा लोगों के लिए ऑपरेशनल एक्सीलेंस की बुनियादी बातें, क्योंकि एजेंट तभी काम का है जब वह सही नुकसान के पीछे हो। वाइनरी रिकॉल के लिए MCP टूल्स का एक पूरा उदाहरण Lot Genealogy as a Graph में है। पूरी सूची सीरीज़ पेज पर है।

अक्सर पूछे जाने वाले सवाल

चैटबॉट और AI एजेंट में क्या फ़र्क है? चैटबॉट एक मैसेज का जवाब एक रिप्लाई से देता है, उसी से जो उसके पास पहले से है। एजेंट को एक लक्ष्य और टूल्स का एक सेट दिया जाता है, फिर वह लूप में काम करता है: एक कदम की योजना बनाता है, कोई टूल बुलाता है जैसे डेटाबेस क्वेरी, नतीजा देखता है और अगला कदम तय करता है, जब तक उसके पास जवाब न हो या उसे किसी इंसान की ज़रूरत न पड़े। मॉडल उसी तरह का है; टूल और लूप उसे एजेंट बनाते हैं।

एजेंटिक AI में MCP क्या है? MCP, यानी Model Context Protocol, लैंग्वेज मॉडल को टूल्स और डेटा स्रोतों से जोड़ने का एक खुला स्टैंडर्ड है। हर मॉडल और हर सिस्टम के लिए अलग इंटीग्रेशन लिखने के बजाय आप, मान लीजिए, अपने मेंटेनेंस सिस्टम के लिए एक बार MCP सर्वर बनाते हैं, और MCP समझने वाला कोई भी असिस्टेंट उसके टूल इस्तेमाल कर सकता है। यह बताता है कि हर टूल क्या करता है, कौन-से इनपुट लेता है और क्या लौटाता है।

बेवरेज प्लांट में AI एजेंट को कितनी ऑटोनॉमी मिलनी चाहिए? ऑटोनॉमी को गलती की कीमत के हिसाब से तय कीजिए। डेटा पढ़ना और मसौदा बनाना कम जोखिम वाले काम हैं, इसलिए एजेंट इन्हें खुलकर कर सकते हैं। जो भी चीज़ किसी रिकॉर्ड को बदलती है, वह एजेंट प्रस्तावित करे और इंसान मंज़ूर करे। जो भी चीज़ प्रोसेस कंट्रोल को छूती है, जैसे सेटपॉइंट या PLC, वह एजेंट की पहुँच से पूरी तरह बाहर रहनी चाहिए।