संक्षिप्त उत्तर: वाइनरियों को बेचा जाने वाला ज़्यादातर AI किसी विंटेज के नतीजे की भविष्यवाणी करने की कोशिश करता है, जैसे harvest तारीख, उपज या quality score, और वाइनरी को साल में एक विंटेज मिलता है। दस साल का इतिहास प्रति ब्लॉक दस पंक्तियाँ है। उस पर train हुए मॉडल ज़्यादातर रट लेते हैं, और जिस जलवायु से वे दस साल आए, वह पहले ही बदल रही है। पर सीज़न के भीतर डेटा भरपूर है: हर टैंक का किण्वन कर्व, हर सेंसर, हर berry सैंपल और हर सेलर नोट। AI वहीं बनाइए, जहाँ सालों के पार भविष्यवाणी करनी ही हो वहाँ ब्लॉकों को मिलाइए, और ऐसी किसी भी चीज़ पर बहुत संदेह कीजिए जो दावा करे कि foundation model, synthetic data या LLM ने दस पंक्तियों को हज़ार बना दिया।

दस साल का इतिहास, training उदाहरणों में गिना गया (उदाहरण) ब्रूअरी बैच 300 प्रति वर्ष 3,000 वाइनरी किण्वन 120 टैंक प्रति वर्ष, सीज़न के भीतर 1,200 वाइनरी विंटेज प्रति ब्लॉक, harvest तारीख या उपज के लिए 10 AI वहाँ बनाइए जहाँ पंक्तियाँ हैं · जहाँ नहीं हैं वहाँ ईमानदार रहिए
वही वाइनरी, वही दस साल। डेटा सीज़न के भीतर भरपूर है और सीज़नों के पार पतला।

एक vendor वाइनरी को एक मॉडल दिखाता है जो हर ब्लॉक की सबसे अच्छी harvest तारीख बताता है। डेमो अच्छा दिखता है। accuracy चार्ट और भी अच्छा। फिर कोई पूछता है कि यह कितने विंटेज पर train हुआ, और जवाब है ग्यारह।

ग्यारह harvest यानी प्रति ब्लॉक ग्यारह पंक्तियाँ। साल में 300 बैच बनाने वाली ब्रूअरी दो हफ़्ते में किण्वन के उतने उदाहरण जमा कर लेती है जितनी harvest तारीखें वह वाइनरी एक दशक में जमा करती है। यह vendor या वाइनरी की आलोचना नहीं है। यह व्यवसाय का आकार है, और यही कारण है कि बहुत-सा वाइनरी AI डेमो में शानदार और दूसरे सीज़न में साधारण दिखता है।

यह The Cellar Ledger की आखिरी पोस्ट है। पहली पाँच डेटा की नींव बनाने के बारे में थीं। यह इस बारे में है कि उसके ऊपर ईमानदारी से क्या बनाया जा सकता है।

दस पंक्तियाँ आपको कैसे धोखा देती हैं

दस पंक्तियों और मुट्ठी भर features (growing degree days, बारिश, berry के कुछ माप) के साथ लगभग कोई भी मॉडल अतीत पर बढ़िया फ़िट हो सकता है। यही समस्या है। दस बिंदुओं पर करीबी फ़िट ज़्यादातर याददाश्त है। मॉडल ने यह सीखा है कि कौन सा साल कौन सा था, यह नहीं कि वाइनयार्ड कैसे काम करता है।

वाइन में तीन चीज़ें इसे और बिगाड़ती हैं:

  • जलवायु बदल रही है। training set के दस साल अगले दस का निष्पक्ष नमूना नहीं हैं। गरमाने का रुझान मतलब अगला विंटेज, स्वभाव से ही, उस दायरे के बाहर है जो मॉडल ने देखा है।
  • वाइनयार्ड बदलता है। बेलें बूढ़ी होती हैं, ब्लॉक दोबारा लगाए जाते हैं, सिंचाई और canopy के तरीके बदलते हैं। किसी ब्लॉक का दसवाँ विंटेज वही ब्लॉक नहीं है जो उसका पहला था।
  • लक्ष्य नरम है। harvest तारीख आंशिक रूप से एक फ़ैसला है, जिसे मौसम का पूर्वानुमान, तुड़ाई टीमें और टैंक की जगह आकार देते हैं। quality score एक पैनल का निर्णय है। किसी फ़ैसले की भविष्यवाणी के लिए मॉडल को train करना पुराने फ़ैसलों को, आदतों समेत, दोहराता है।

ऐसे मॉडल को परखने का ईमानदार तरीका है leave-one-vintage-out: नौ साल पर train कीजिए, दसवें की भविष्यवाणी कीजिए, हर साल के लिए दोहराइए। इसमें भी एक पेंच है। दस folds आपको खुद त्रुटि का एक शोर-भरा अनुमान देते हैं, इसलिए जो मॉडल वाइनमेकर के अंगूठे के नियम से थोड़ा बेहतर दिखता है, हो सकता है वह बिल्कुल बेहतर न हो।

पंक्तियाँ असल में कहाँ हैं

अच्छी खबर यह है कि वाइनरी के पास डेटा की कमी नहीं है। कमी विंटेज की है। हर सीज़न के भीतर भरपूर है:

  • किण्वन कर्व। हर टैंक का अपना किण्वन है, जिसमें घनत्व और तापमान दिन में कई बार दर्ज होते हैं। साल में 120 किण्वन वाली वाइनरी के पास दस साल बाद 1,200 कर्व होते हैं, हर एक में सैकड़ों बिंदु। यह सीखने के लिए काफ़ी है कि स्वस्थ किण्वन कैसा दिखता है और धीमे किण्वन को जल्दी फ़्लैग करने के लिए भी, जो किण्वन नियंत्रण पोस्ट में है।
  • सेंसर धाराएँ। टैंक के तापमान, सेलर की नमी, बैरल रूम की स्थितियाँ। लगातार डेटा, anomaly detection और soft sensors के लिए अच्छा।
  • पकने के दौरान berry सैंपलिंग। पूरे सीज़न प्रति ब्लॉक साप्ताहिक Brix, अम्ल और pH। शून्य से किसी विंटेज के नतीजे की भविष्यवाणी के लिए काफ़ी नहीं, पर इस सीज़न के पकने के कर्व को पिछले कुछ के सामने ट्रैक करने के लिए काफ़ी।
  • टेक्स्ट। tasting notes, सेलर लॉग, वर्क ऑर्डर, adjustment कारण। बरसों का, ज़्यादातर अनपढ़ा। यहीं large language models सचमुच चमकते हैं।

पैटर्न: जो मॉडल सीज़न के भीतर की गतिकी सीखते हैं, उनके पास असली डेटा है। जो मॉडल सीज़नों के पार का नतीजा सीखते हैं, उनके पास ज़्यादातर नहीं।

पतले डेटा का पूरा फ़ायदा उठाना

जब आपको सच में विंटेज के पार भविष्यवाणी करनी हो, तो कुछ तकनीकें बड़े मॉडल से ज़्यादा मदद करती हैं।

ब्लॉकों को मिलाइए। एक hierarchical (mixed-effects) मॉडल ब्लॉकों के बीच जानकारी साझा करता है और फिर भी हर ब्लॉक को अलग रहने देता है। चालीस ब्लॉक गुणा दस विंटेज चार सौ स्वतंत्र पंक्तियाँ नहीं हैं, पर दस से कहीं बेहतर हैं।

विज्ञान से शुरू कीजिए। heat accumulation पर आधारित phenology मॉडल, वही growing degree day तर्क जो पकाव की भविष्यवाणी के पीछे है, दशकों का viticulture शोध साथ लाते हैं। डेटा को एक ठोस मॉडल को समायोजित करने दीजिए, बजाय उससे दस बिंदुओं से वनस्पति विज्ञान खोजने को कहने के।

विंटेज नहीं, सीज़न की भविष्यवाणी कीजिए। अप्रैल में harvest तारीख बताने की बजाय, हर हफ़्ते berry सैंपल आने पर पकने का पूर्वानुमान अपडेट कीजिए। हर हफ़्ते का सैंपल एक नई पंक्ति है, और पूर्वानुमान को सिर्फ़ कुछ हफ़्ते आगे तक पहुँचना होता है।

क्षेत्रीय और सार्वजनिक डेटा इस्तेमाल कीजिए। मौसम स्टेशन के रिकॉर्ड, क्षेत्रीय harvest रिपोर्ट और उपग्रह vegetation indices किसी एक वाइनरी के रिकॉर्ड से ज़्यादा साल और ज़्यादा वाइनयार्ड कवर करते हैं।

नए टूल्स क्या कर सकते हैं और क्या नहीं

2026 में स्वाभाविक सवाल यह है कि क्या AI की नवीनतम पीढ़ी इसे बदलती है। आंशिक रूप से।

time-series foundation models (Chronos या TimesFM जैसे मॉडल, जो बहुत बड़ी संख्या में असंबंधित series पर pretrained हैं) ऐसे कर्व का zero-shot पूर्वानुमान दे सकते हैं जो उन्होंने कभी नहीं देखा। किण्वन कर्व के लिए यह उपयोगी है: पहले तीन दिनों से अगले दो दिनों का ठीक-ठाक पूर्वानुमान, आपके डेटा पर बिना किसी training के। विंटेज के नतीजे के लिए उनके पास काम करने को कुछ नहीं है। वे आम तौर पर जानते हैं कि कर्व कैसे दिखते हैं। वे आपके वाइनयार्ड को नहीं जानते।

synthetic data को अक्सर छोटे डेटा के इलाज के रूप में पेश किया जाता है। यह हो नहीं सकता। आपके दस असली विंटेज से बनाए गए synthetic विंटेज में ऐसी कोई जानकारी नहीं होती जो उन दस में पहले से न हो। ये किसी पाइपलाइन को परखने या चरम परिदृश्यों में मॉडल का stress-test करने में मदद कर सकते हैं, पर मॉडल को अंगूरों के बारे में कुछ नया नहीं सिखाते।

LLMs टेक्स्ट के साथ शानदार हैं: दस साल के सेलर लॉग का सार, tasting-note की भाषा के समूह, आपके SOPs पर सवालों के जवाब, रिपोर्ट के ड्राफ़्ट, जो सब इस सीरीज़ में पहले आ चुका है। harvest तारीख की भविष्यवाणी करने को कहें तो LLM एक आत्मविश्वास भरे वाक्य में तारीख दे देगा। वहाँ तक पहुँचने के लिए उसने आपके डेटा से कुछ नहीं सीखा होगा। डेमो में इसी पर नज़र रखिए।

यह कहाँ टूटता है

बड़े उत्पादक अलग हैं। दर्जनों estates और सैकड़ों ब्लॉक वाले समूह के पास कहीं ज़्यादा पंक्तियाँ हैं, और विंटेज के पार वाले मॉडल ज़्यादा उचित हो जाते हैं। दस-पंक्ति की समस्या एक अकेले estate के लिए सबसे तीखी है।

सीज़न के भीतर वाले मॉडल भी नई परिस्थितियों में फ़ेल हो सकते हैं। दस सामान्य विंटेज पर train हुआ किण्वन मॉडल शायद ऐसी heatwave harvest के stress पैटर्न न पहचाने जो उसने कभी नहीं देखी। सीज़न के भीतर भरपूर डेटा असामान्य सालों पर नज़र रखने की ज़रूरत खत्म नहीं करता।

मिलाना यह मानकर चलता है कि ब्लॉक काफ़ी हद तक एक जैसे हैं। ठंडी पहाड़ी वाले ब्लॉक और गरम घाटी की ज़मीन के बीच जानकारी साझा कीजिए, और मॉडल दोनों को ऐसे औसत की ओर खींच सकता है जो किसी पर फ़िट नहीं बैठता। मिलाने का ढाँचा जितना statistical फ़ैसला है, उतना ही viticultural भी।

वाइनमेकर का निर्णय भी कम विंटेज पर train हुआ है। बीस harvest वाले वाइनमेकर के पास भी बीस पंक्तियाँ हैं, हालाँकि उनके साथ बहुत सारा ऐसा संदर्भ आता है जो मॉडल के पास नहीं है। लक्ष्य उस निर्णय को बेहतर सबूत देना है, यह दिखावा नहीं कि किसी भी पक्ष के पास बड़ा डेटा है।

निचोड़

वाइनरी AI तब टूटता है जब वह विंटेज को बैच की तरह बरतता है। दस साल यानी दस पंक्तियाँ, जलवायु बदल रही है, और अतीत पर करीबी फ़िट ज़्यादातर याददाश्त है। मॉडल वहाँ बनाइए जहाँ डेटा भरपूर है, सीज़न के भीतर: किण्वन कर्व, सेंसर, berry सैंपलिंग और बरसों का अनपढ़ा टेक्स्ट। जहाँ विंटेज के पार भविष्यवाणी करनी ही हो, वहाँ ब्लॉकों को मिलाइए, विज्ञान से शुरू कीजिए और हर हफ़्ते अपडेट कीजिए। नए टूल्स कर्व और टेक्स्ट में मदद करते हैं। उनमें से कोई भी दस पंक्तियों को हज़ार नहीं बनाता, और जो भी इसके उलट कहे, उससे पूछिए कि उसने कितने विंटेज पर train किया।

इसी के साथ The Cellar Ledger पूरी होती है। यह तीन जवाब देने वाले चैटबॉट से शुरू हुई और यहाँ खत्म होती है, और छहों पोस्ट में एक ही धागा है: GenAI उतना ही भरोसेमंद है जितना उसके नीचे का डेटा मॉडल। पूरी सीरीज़ Cellar Ledger सीरीज़ पेज पर है, और वाइन का बड़ा कैटलॉग Winemaking & AI ट्रैक पर।

अक्सर पूछे जाने वाले सवाल

वाइनरी में machine learning ब्रूअरी से ज़्यादा कठिन क्यों है? क्योंकि सीखने की इकाई अक्सर विंटेज होती है, और वाइनरी को साल में एक मिलता है। दस साल का इतिहास harvest तारीख, उपज या quality score जैसे सवालों के लिए प्रति ब्लॉक दस पंक्तियाँ देता है, जबकि साल में सैकड़ों बैच बनाने वाली ब्रूअरी के पास हज़ारों होती हैं। दस पंक्तियों पर train हुए मॉडल ज़्यादातर अतीत से सीखने की बजाय उसे रट लेते हैं।

क्या synthetic data या foundation model छोटे वाइनरी dataset को ठीक कर सकता है? अकेले नहीं। आपके दस विंटेज से बने synthetic data में ऐसी कोई जानकारी नहीं होती जो आपके दस विंटेज में पहले से न हो। time-series foundation models किसी कर्व का, जैसे किण्वन का, ठीक-ठाक zero-shot पूर्वानुमान दे सकते हैं, पर वे आपके वाइनयार्ड के बारे में कुछ नहीं जानते। दोनों एक ठोस डिज़ाइन के भीतर उपयोगी हैं, और कोई भी गायब इतिहास पैदा नहीं करता।

वाइनरी में AI सचमुच कहाँ काम करता है? जहाँ एक ही सीज़न के भीतर डेटा भरपूर है: हर टैंक के किण्वन कर्व, सेलर की सेंसर धाराएँ, पकने के दौरान berry सैंपलिंग, और tasting notes व सेलर लॉग जैसा free text। किण्वन की गतिकी सीखने वाले मॉडल, या लॉग पढ़ने वाले LLM के पास साल भर में काम करने को सैकड़ों या हज़ारों उदाहरण होते हैं।