छोटा जवाब: लार्ज लैंग्वेज मॉडल अगले शब्द का बहुत अच्छा अनुमान लगाने वाला है। वह टेक्स्ट को टोकन के रूप में पढ़ता है, उसकी एक सीमित मात्रा को कॉन्टेक्स्ट विंडो में रखता है, और एक-एक टोकन करके लिखता है, वह चुनते हुए जो सबसे विश्वसनीय लगे। इसीलिए वह धाराप्रवाह है, और इसीलिए हैलुसिनेट भी करता है: विश्वसनीय लगना और सच होना एक बात नहीं। उससे पूछिए कि फ़र्मेंटर 7 पर कल रात की CIP स्पेक पर थी या नहीं, और आपके SOP के बिना वह इंडस्ट्री के एक आम मान से तुलना करेगा और पक्का सुनाई देगा। रिट्रीवल (RAG) के ज़रिए उसे SOP की धारा और लॉग लाइनें दीजिए, और वह आपके अपने स्टैंडर्ड पर, हवाले के साथ, जवाब दे सकता है। प्लांट में जो मायने रखता है, उसका ज़्यादातर हिस्सा यही एक डिज़ाइन फ़ैसला है।

'क्या FV-7 पर कल रात की CIP स्पेक पर थी?' (उदाहरण) सिर्फ़ मॉडल सवाल + चिपकाई गई लॉग लाइन LLM सिर्फ़ सामान्य ट्रेनिंग 'हाँ, 78 C पर 1.8% आम दायरे में है।' विश्वसनीय, आत्मविश्वासी, पर आपका स्टैंडर्ड नहीं रिट्रीवल (RAG) के साथ रिट्रीवर SOP 4.2 + FV-7 लॉग लाइनें 2.0% NaOH, 80 C, 20 min LLM दिए गए टेक्स्ट से जवाब 'नहीं। तीनों सीमाओं पर SOP 4.2 से नीचे।' धारा और लॉग लाइनों का हवाला देता है वही मॉडल · फ़र्क इस बात का है कि आप उसके सामने क्या रखते हैं
उदाहरण के मान। SOP के बिना मॉडल झूठ नहीं बोल रहा। वह अच्छा अंदाज़ा लगा रहा है, जो और बुरा है।

यह एक फ़र्मेंटर के काल्पनिक CIP लॉग की एक लाइन है, उस तरह की जो हर ब्रुअरी, वाइनरी और डिस्टिलरी हज़ारों की तादाद में बनाती है:

02:14 | FV-07 | CAUSTIC STEP START | NaOH 1.8% | SUPPLY 78.0 C
02:31 | FV-07 | CAUSTIC STEP END | DURATION 17 MIN

इसे किसी चैटबॉट में चिपकाइए और पूछिए कि क्या सफ़ाई स्पेक पर थी। लगभग पक्का है कि आपको आत्मविश्वास भरा ‘हाँ’ मिलेगा: लगभग 75 से 85 डिग्री C पर 1 से 2 प्रतिशत कॉस्टिक CIP के लिए आम है, और 17 मिनट ठीक लगते हैं। अब मान लीजिए आपका SOP कहता है कि 80 डिग्री पर कम से कम 20 मिनट के लिए 2.0 प्रतिशत। सफ़ाई तीनों मानकों पर फ़ेल हुई, और चैटबॉट ने अभी-अभी आपसे कहा कि वह पास है।

इस सीरीज़ की पहली पोस्ट ने जेनरेटिव AI को सीढ़ी पर रखा था। यह पोस्ट उसे खोलकर दिखाती है, क्योंकि जैसे ही आप देखते हैं कि लैंग्वेज मॉडल कैसे काम करता है, वह गलत जवाब रहस्य नहीं रह जाता।

टोकन: मॉडल कैसे पढ़ता है

लैंग्वेज मॉडल अक्षर या पूरे शब्द नहीं पढ़ता। वह टोकन पढ़ता है, टेक्स्ट के टुकड़े जो अक्सर एक शब्द, शब्द का हिस्सा या कोई चिह्न होते हैं। ‘Caustic’ एक टोकन हो सकता है। ‘NaOH’ दो या तीन। अंग्रेज़ी के लिए मोटा नियम यह है कि एक हज़ार टोकन लगभग 750 शब्द होते हैं।

टोकन दो व्यावहारिक वजहों से मायने रखते हैं। लागत और सीमाएँ टोकन में गिनी जाती हैं, और संख्याएँ अजीब ढंग से टोकन में टूटती हैं। ‘78.0’ कई टुकड़े बन सकता है। यही एक वजह है कि लैंग्वेज मॉडल गणित में भरोसेमंद नहीं: वे संख्या के साथ नहीं, उसके टेक्स्ट के टुकड़ों के साथ काम कर रहे होते हैं।

कॉन्टेक्स्ट विंडो: मॉडल क्या देख सकता है

कॉन्टेक्स्ट विंडो वह सब कुछ है जो मॉडल एक साथ देख सकता है: आपका सवाल, आपके चिपकाए कोई भी दस्तावेज़, अब तक की बातचीत और उसका अपना जवाब। 2026 में अग्रणी मॉडल लाखों टोकन लेते हैं और कुछ दस लाख से भी आगे जाते हैं। सुनने में यह प्लांट का हर SOP चिपकाने के लिए काफ़ी लगता है।

बात इतनी सीधी नहीं है। बहुत लंबे कॉन्टेक्स्ट में मॉडल हर हिस्से पर बराबर ध्यान नहीं देते, और लंबे दस्तावेज़ के बीच के ब्योरे छूटने की संभावना ज़्यादा होती है। और कॉन्टेक्स्ट अस्थायी है। बातचीत ख़त्म होते ही मॉडल को कुछ याद नहीं रहता। उसने आपका SOP सीखा नहीं। उसने उसे एक बार पढ़ा।

अगले टोकन का अनुमान: मॉडल कैसे लिखता है

अपने मूल में लार्ज लैंग्वेज मॉडल एक ही काम करता है: अब तक के टोकन देखकर वह अनुमान लगाता है कि अगला कौन-सा टोकन आने की सबसे ज़्यादा संभावना है। फिर वह टोकन जोड़ता है और फिर से यही करता है। एक पूरा जवाब ऐसे सैकड़ों अनुमानों की कतार है।

उसने ये अनुमान लगाना भारी मात्रा में टेक्स्ट पर ट्रेनिंग से सीखा। उसका सामान्य ज्ञान वहीं से आता है। उसने CIP पर हज़ारों दस्तावेज़ पढ़े हैं, इसलिए वह आम कॉस्टिक दायरा जानता है। उसने आपका SOP कभी नहीं पढ़ा, इसलिए जब तक आप दिखाएँ नहीं, वह आपका स्टैंडर्ड नहीं जान सकता।

हैलुसिनेशन: आत्मविश्वासी गलत जवाब क्यों आता है

इन टुकड़ों को जोड़िए, और हैलुसिनेशन साफ़ समझ आ जाता है। मॉडल सबसे विश्वसनीय आगे का टेक्स्ट बनाने के लिए बना है। जब सच्चा जवाब उसके सामने होता है, तो विश्वसनीय और सच आमतौर पर एक ही होते हैं। जब नहीं होता, तब भी मॉडल कुछ विश्वसनीय बनाता है, क्योंकि उसे बस यही करना आता है। उसके भीतर कोई अलार्म नहीं जो कहे ‘मेरे पास यह जानकारी नहीं है’।

इसीलिए CIP का जवाब ‘हाँ’ निकला। ट्रेनिंग में मॉडल ने जो देखा था, उसके हिसाब से सबसे विश्वसनीय टेक्स्ट यही था कि 78 डिग्री पर 1.8 प्रतिशत एक सामान्य सफ़ाई है। उसने आपका स्टैंडर्ड नहीं जाँचा, क्योंकि उसके पास जाँचने को कोई स्टैंडर्ड था ही नहीं।

हैलुसिनेशन घटाया जा सकता है, कभी हटाया नहीं जा सकता। मुख्य लीवर बेहतर मॉडल नहीं है। वह मॉडल को सही टेक्स्ट देना है।

RAG: मॉडल को सही टेक्स्ट देना

रिट्रीवल-ऑगमेंटेड जेनरेशन, यानी RAG, मानक उपाय है। मॉडल के जवाब देने से पहले एक रिट्रीवल स्टेप आपके अपने दस्तावेज़ों (SOP, स्पेसिफ़िकेशन, मेंटेनेंस मैनुअल, पुरानी इंसिडेंट रिपोर्टें) में खोजता है और सबसे संबंधित अंश सवाल के साथ कॉन्टेक्स्ट में रख देता है। मॉडल को निर्देश होता है कि वह उन्हीं अंशों से जवाब दे और उनका हवाला दे।

RAG के साथ फिर से पूछने पर सिस्टम SOP सेक्शन 4.2 और FV-7 की लॉग लाइनें निकालता है। अब मॉडल जवाब देता है: कॉस्टिक स्टेप स्ट्रेंथ, तापमान और अवधि तीनों में SOP न्यूनतम से नीचे था, सेक्शन 4.2 देखें। वही मॉडल, अलग इनपुट, अलग जवाब।

दो सुधार इसे प्लांट में भरोसेमंद बनाते हैं:

  • हर चीज़ का हवाला दीजिए। हर जवाब उस दस्तावेज़ और सेक्शन का नाम बताए जहाँ से वह आया, ताकि ऑपरेटर SOP खोलकर जाँच सके।
  • तुलना कोड को करने दीजिए। मॉडल SOP से ‘2.0 प्रतिशत न्यूनतम’ पढ़ सकता है। 1.8, 2.0 से कम है या नहीं, यह कोड की एक लाइन का काम है, लैंग्वेज मॉडल का नहीं। सबसे अच्छे सिस्टम सीमाएँ और रीडिंग निकालते हैं, और तुलना साधारण सॉफ़्टवेयर को करने देते हैं।

मैंने पहले GenAI से ब्रुअरी SOP खोजने पर एक पोस्ट लिखी थी। विचार नहीं बदला है। बस मॉडल इतने अच्छे हो गए हैं कि अब रिट्रीवल की क्वालिटी ही कमज़ोर कड़ी है।

फ़ाइन-ट्यूनिंग: एक अलग टूल

फ़ाइन-ट्यूनिंग का मतलब है किसी मौजूदा मॉडल को अपने उदाहरणों पर थोड़ा और ट्रेन करना। लोग अक्सर मान लेते हैं कि मॉडल को अपने SOP सिखाने का यही तरीका है। उसके लिए यह आमतौर पर गलत टूल है।

फ़ाइन-ट्यूनिंग मॉडल का व्यवहार बदलने में अच्छी है: उसके जवाबों का फ़ॉर्मेट, हैंडओवर का लहजा, वह किसी तरह के लाइन स्टॉप को कैसे वर्गीकृत करता है। बदलने वाले तथ्य सहेजने में यह कमज़ोर है, क्योंकि तथ्य मॉडल के वेट्स में पक जाते हैं, बिना हवाले और बिना आसान अपडेट के। जब SOP बदलता है, तो RAG सिस्टम अगले ही दिन नया वर्शन पढ़ लेता है। फ़ाइन-ट्यून किया मॉडल दोबारा ट्रेन करने तक पुराना ही दोहराता रहता है।

एक काम का नियम: ज्ञान के लिए RAG, व्यवहार के लिए फ़ाइन-ट्यूनिंग, और ज़्यादातर प्लांट्स को दूसरे की कभी ज़रूरत नहीं पड़ती।

मल्टीमॉडल: जब इनपुट टेक्स्ट न हो

आज के कई मॉडल मल्टीमॉडल हैं: वे टेक्स्ट के साथ इमेज भी लेते हैं, और कुछ ऑडियो भी। प्लांट फ़्लोर पर इससे कुछ काम के दरवाज़े खुलते हैं। ऑपरेटर किसी गेज, HMI की फ़ॉल्ट स्क्रीन या हाथ से लिखी बैच शीट की फ़ोटो लेता है, और मॉडल उसे पढ़ लेता है। मेंटेनेंस टेक्नीशियन किसी नेमप्लेट की फ़ोटो लेता है और उसे मैनुअल का सही सेक्शन मिल जाता है।

यहाँ भी वही नियम लागू होते हैं। गेज की फ़ोटो पढ़ने वाला मॉडल उसे गलत पढ़ सकता है, और अपनी गलत रीडिंग उसी आत्मविश्वास से बताएगा। इसे जानकारी पकड़ने और मसौदा बनाने में इस्तेमाल कीजिए, फिर संख्याओं की पुष्टि कीजिए।

यह कहाँ टूटता है

रिट्रीवल गलत अंश ला सकता है। अगर ब्राइट बीयर टैंकों का SOP और फ़र्मेंटरों का SOP लगभग एक जैसे हों, तो रिट्रीवर गलत वाला उठा सकता है। हवाला ही वह चीज़ है जिससे कोई इंसान इसे पकड़ सकता है।

दस्तावेज़ अक्सर पुराने होते हैं। RAG मॉडल को ठीक उतना ही ताज़ा बनाता है जितनी आपकी दस्तावेज़ लाइब्रेरी। बिना संशोधन का SOP आत्मविश्वास से पुराने जवाब देता है।

संख्याएँ जोखिम भरी बनी रहती हैं। सही टेक्स्ट होने पर भी मॉडल किसी टेबल को गलत पढ़ सकता है या किसी मान को राउंड कर सकता है। जहाँ फ़ैसला किसी संख्या पर टिका हो, वहाँ संख्या सिस्टम ऑफ़ रिकॉर्ड या किसी गणना से आनी चाहिए, मॉडल के गद्य से नहीं।

गलत होने पर भी मॉडल वैसा ही सुनाई देता है। सही और गढ़े हुए जवाब के लहजे में कोई फ़र्क नहीं होता। लोगों को हवाला जाँचना सिखाना उतना ही ज़रूरी है जितना सिस्टम बनाना।

निचोड़

लैंग्वेज मॉडल एक-एक टोकन करके विश्वसनीय टेक्स्ट का अनुमान लगाता है। वह जानता है कि आम क्या है, और आपके प्लांट के बारे में कुछ नहीं, जब तक आप उसे दिखाएँ नहीं। इससे वह धाराप्रवाह, उपयोगी और आत्मविश्वासी गलतियों वाला बनता है। RAG आपके अपने SOP और लॉग मॉडल के सामने रखकर और उनसे हवाला दिलवाकर ज़्यादातर कमी पूरी कर देता है। फ़ाइन-ट्यूनिंग व्यवहार बदलती है, ज्ञान नहीं। और जब जवाब कोई अहम संख्या हो, तो उसे कोड से जँचवाइए।

अगली पोस्ट: एजेंटिक AI क्या है, जब मॉडल सवालों के जवाब देना छोड़कर टूल इस्तेमाल करने लगता है। इन बुनियादी बातों पर डिस्टिलरी का नज़रिया What Is Generative AI? The Difference That Matters for Distillers में है। यही विचार किसी वाइनरी के डेटा असिस्टेंट की नींव कैसे बनता है, यह Cellar Ledger सीरीज़ में है।

अक्सर पूछे जाने वाले सवाल

आसान शब्दों में लार्ज लैंग्वेज मॉडल क्या है? लार्ज लैंग्वेज मॉडल एक न्यूरल नेटवर्क है जिसे भारी मात्रा में टेक्स्ट पर ट्रेन किया गया है ताकि वह टेक्स्ट का अगला हिस्सा, एक-एक टोकन करके, अनुमान लगा सके। चूँकि उसने इतनी भाषा देखी है, वह लिख सकता है, सार बना सकता है, अनुवाद कर सकता है और सवालों के जवाब दे सकता है। जब तक आप उसे कोई रास्ता न दें, वह तथ्य खोजता नहीं, और उसके भीतर यह समझ नहीं होती कि वह जो लिख रहा है वह सच है या नहीं।

LLM हैलुसिनेट क्यों करते हैं? क्योंकि वे सबसे विश्वसनीय लगने वाले अगले शब्द बनाने के लिए बने हैं, सही शब्द नहीं। जब जवाब उन्हें दिए गए टेक्स्ट में नहीं होता, तो वे ख़ाली जगह किसी सही लगने वाली चीज़ से भर देते हैं। अपना SOP दिए बिना CIP कॉस्टिक कंसंट्रेशन के बारे में पूछिए, और आपको इंडस्ट्री का एक आम मान पूरे आत्मविश्वास के साथ मिलेगा, जो शायद आपका न हो।

प्लांट को RAG इस्तेमाल करना चाहिए या फ़ाइन-ट्यूनिंग? जो तथ्य दस्तावेज़ों में रहते हैं, जैसे SOP, स्पेसिफ़िकेशन और मेंटेनेंस मैनुअल, उनके लिए रिट्रीवल (RAG) इस्तेमाल कीजिए: सिस्टम संबंधित अंश ढूँढता है और सवाल के साथ मॉडल को देता है, ताकि जवाब आपके अपने दस्तावेज़ों का हवाला दें और दस्तावेज़ बदलने पर अपडेट हों। फ़ाइन-ट्यूनिंग मॉडल की शैली बदलती है या उसे किसी काम का फ़ॉर्मेट सिखाती है। बदलने वाले तथ्य सहेजने का यह ख़राब तरीका है।