← कोर्सच्या मुख्य पानाकडे परत

⏮️ आधी काय होते & फायदे-तोटे

प्रत्येक साधनाने काहीतरी वाईट गोष्ट बदलली — आणि तेच साधन कुठेतरी चुकीचे ठरते. प्रत्येक मोठ्या कल्पनेसाठी: आधी जीवन कसे होते, प्रामाणिक फायदे ✅ / तोटे ❌, आणि कुठे वापरावी 👍 विरुद्ध कुठे नाही 👎.

🧠 Machine learning (विरुद्ध नियमपुस्तके) — धडे 01–02

⏮️ ML ने ताबा घेण्याआधी (दृश्यांसाठी 2012 पूर्वी, भाषेसाठी 2020 पूर्वी)

सॉफ्टवेअर म्हणजे नियमपुस्तके: expert systems, हजारो हाताने लिहिलेले if-then, ठिसूळ व्याकरण इंजिने. Spam filters वाईट शब्दांची यादी करत; भाषांतरक phrase tables साठवत. जे काही धूसर — प्रतिमा, आवाज, नैसर्गिक भाषा — ते लाजिरवाणे वाईट राहिले, कारण काही नियम लिहिताच येत नाहीत.

✅ फायदे

  • नियमपुस्तके कधीच हाताळू शकली नाहीत ते हाताळते: धूसरपणा, संदिग्धता, आकलन
  • जास्त if-statements ऐवजी डेटाने सुधारते
  • एक पद्धत प्रतिमा, आवाज, मजकूर, कोड सगळे व्यापते

❌ तोटे

  • नियम वाढवलेले असतात → तपासणे किंवा पूर्ण समजावणे अवघड
  • डेटातील त्रुटी आणि पूर्वग्रह वारशाने घेते
  • विचित्र पद्धतीने फसते (स्टिकर फसवतात), सुबकपणे नाही
  • training ला compute लागते; वर्तनाची हमी नाही

👍 वापरा जेव्हा

  • लिहिता येणाऱ्या नियमांपलीकडचे पॅटर्न: भाषा, दृश्य, शिफारस
  • 'साधारण बरोबर, बहुधा' चालण्यासारखे आणि तपासता येणारे

👎 दोनदा विचार करा जेव्हा

  • नेमके audit करता येणारे तर्कशास्त्र: पगार, कर, सुरक्षा कुलपे — कोड लिहा!
  • अगदी थोडा डेटा, प्रचंड जोखीम, धक्क्यांना शून्य सहनशीलता
  • regex पुरेल — कंटाळवाण्या साधनाला जिंकू द्यायची परवानगी आहे 😄

🗒️ Fine-tuning & LoRA विरुद्ध RAG विरुद्ध prompting — धडे 07, 08, 10

⏮️ हा निर्णय-वृक्ष अस्तित्वात येण्याआधी (~2022)

मॉडेलने वेगळे जाणावे किंवा वागावे असे वाटले तर एकमेव उपाय पूर्ण retraining — संग्रहालयाच्या बजेटचा प्रदेश. आज तीन शिड्या आहेत, आणि चुकीची निवड महिने जाळते: prompting (मोफत, प्रत्येक विनंतीला), RAG (टेबलावर ताजे तथ्य), fine-tuning/LoRA (शैली बेक करा).

✅ फायदे

  • prompting: तात्काळ, मोफत, उलटवता येणारे — नेहमी आधी प्रयत्न करा
  • RAG: ताजे + audit करता येणारे तथ्य, update = आज रात्री re-index
  • LoRA: छोट्या adapter ने खरी शैली/स्वरूप/domain-आवाजाची कमाई

❌ तोटे

  • prompting ज्ञान किंवा अतूट सवयी जोडू शकत नाही
  • RAG retrieval च्या दर्जावर जगते-मरते (कचरा आत…)
  • tuning: खर्च, शिळे होते, आणि तथ्य विश्वसनीयपणे जोडू शकत नाही
  • चांगला prompt पुरला असता तिथे टीम सर्रास fine-tune करतात

👍 वापरा जेव्हा

  • क्रम: prompt → तथ्यांसाठी RAG → शैलीसाठी tune
  • स्वरूप/सूर खोल आणि सुसंगत हवा तेव्हा tune करा (आणि prompts ची मर्यादा गाठल्यावर)

👎 दोनदा विचार करा जेव्हा

  • 'आपले docs कळावेत म्हणून fine-tune करू' — ते RAG चे काम, नेहमी
  • तुम्ही चांगला system prompt लिहिण्याआधीच

📖 RAG — धडा 10

⏮️ RAG च्या आधी (बहुतेक टीमसाठी 2023 पूर्वी)

कंपनीचे ज्ञान keyword search मागे (नेमका-शब्द-किंवा-काहीच-नाही), 12 प्रश्नांची उत्तरे देणारे हाताने बनवलेले FAQ bots, आणि 'प्रियाला विचारा, तिला माहीत आहे doc कुठे आहे' यात राहत असे. मॉडेल कंपनीच्या प्रश्नांची उत्तरे पुस्तक बंद ठेवून देत — म्हणजे बनवून सांगत (धडा 09).

✅ फायदे

  • संदर्भासह आधार असलेली उत्तरे — hallucination वरचा उत्तम उतारा
  • ज्ञान रोज रात्री update (re-index), retraining नाही
  • semantic: फक्त जुळणारे शब्द नव्हे, अर्थ शोधते
  • प्रत्येक प्रश्नाचा खर्च काही पैसे

❌ तोटे

  • बांधायची आणि monitor करायची खरी pipeline (chunking, top-k, rerank)
  • retrieval चुकले → आत्मविश्वासाने पुस्तक-बंद मूर्खपणा परत
  • अनेक दस्तऐवजांतील तर्काशी झगडते ('सगळ्या 50 करारांची तुलना करा')

👍 वापरा जेव्हा

  • chat-with-your-docs, support bots, policy प्रश्नोत्तरे — क्लासिक विजय
  • उत्तरांनी स्रोत सांगणे आवश्यक (compliance ला RAG आवडते)

👎 दोनदा विचार करा जेव्हा

  • संपूर्ण corpus टेबलावर सहज मावतो — फक्त paste करा
  • प्रश्नांना lookup नव्हे, जागतिक एकत्रीकरण हवे → डेटाबेस/BI
  • तुमचे दस्तऐवजच चुकीचे आहेत — RAG प्रामाणिकपणे कचरा उद्धृत करते 😅

📋 एजंट्स & साधनांचा वापर — धडा 11

⏮️ एजंट्सच्या आधी (~2023)

Automation म्हणजे ठिसूळ स्क्रिप्ट आणि pixel निर्देशांकांवर क्लिक करणारे RPA bots जे बटण हलले की तुटत. Chatbots फक्त बोलू शकत — प्रत्येक खरी कृती माणसाकडे परत जाई. 'मॉडेल सुचवते' आणि 'काहीतरी घडते' यामधला दुवा नेहमी माणूस होता.

✅ फायदे

  • सल्ल्याचे परिणामात रूपांतर: शोधते, नोंदवते, दुरुस्त करते, पुन्हा प्रयत्न करते
  • स्क्रिप्ट कधीच जमवू शकल्या नाहीत ती धूसर बहु-पायरी ध्येये हाताळते
  • पुन्हा-नियोजन करून धक्क्यांतून सावरते (स्क्रिप्ट फक्त crash होतात)

❌ तोटे

  • चुका पावलागणिक साचतात — आत्मविश्वासाने चुकीचे, वेगासह
  • तपासणे अवघड: तेच ध्येय, प्रत्येक वेळी वेगळा मार्ग
  • token खर्च गुणाकाराने वाढतो (प्रत्येक विचार-कृती-निरीक्षण लूप बिल लावतो)
  • खऱ्या परवानग्या = खरा blast radius — guardrails ऐच्छिक नाहीत

👍 वापरा जेव्हा

  • पडताळता येणारे परिणाम असलेले बहु-पायरी काम (tests पास, तिकीट नोंदवले)
  • वाचन-जड संशोधन/triage जिथे अंतिम कृतीवर माणूस सही करतो

👎 दोनदा विचार करा जेव्हा

  • एक ठरलेली पायरी — साधा API कॉल जलद आणि सुरक्षित
  • मानवी दारांशिवाय उलटवता न येणाऱ्या कृती (पैसे, हटवणे, पाठवणे)
  • तुम्ही अजून कामाचे यश मोजू शकत नाही — आधी evals बांधा

📺 Diffusion प्रतिमा निर्मिती — धडा 12

⏮️ diffusion च्या आधी (~2021)

खास दृश्ये म्हणजे stock-photo शोध, प्रत्येक प्रकारासाठी डिझायनरना काम देणे, किंवा GANs — प्रभावी पण train करायला अस्थिर आणि मजकुराने वळवायला अवघड. 'watercolor मध्ये मांजर-अंतराळवीर' हे एक काम होते, वाक्य नव्हे.

✅ फायदे

  • वर्णन करता येणारी कोणतीही प्रतिमा सेकंदांत; वाक्य बदलून पुनरावृत्ती करा
  • वळवता येणारे: शैली, रचना, बदल (inpainting), सुसंगत पात्रे
  • तीच पाककृती व्हिडिओ आणि ऑडिओला लागू

❌ तोटे

  • प्रतिमेतील मजकूर म्हणजे अक्षरांचे आकार (L03 चा सूड) — अनेकदा निरर्थक
  • जागतिक बंधने डळमळतात: बोटे, सममिती, वस्तूंची संख्या
  • training-data चा उगम आणि copyright अजूनही वादग्रस्त
  • photoreal बनावटींना खुलासा-नियम लागतात — ते वापरा

👍 वापरा जेव्हा

  • संकल्पना, mood, storyboards, चित्रे, product mockups
  • pixel-perfect अचूकतेपेक्षा संख्या + पुनरावृत्ती महत्त्वाची

👎 दोनदा विचार करा जेव्हा

  • brand-नेमका तपशील (logos, UI मजकूर) — डिझायनर अजूनही जिंकतात
  • तथ्यात्मक/तांत्रिक आकृत्या (खरे charts वापरा! — dataviz, vibes नव्हे)
  • निर्माण केलेल्या व्यक्ती/घटना खऱ्या म्हणून खपवणे काहीही

🔓 Open-weights विरुद्ध closed API मॉडेल

⏮️ ही निवड अस्तित्वात येण्याआधी (~2023)

Frontier AI = मूठभर closed APIs, घ्या किंवा सोडा. मग LLaMA-कुटुंबाच्या leaks आणि releases ने खरा दुसरा मार्ग तयार केला: weights download करा, स्वतः चालवा, मुक्तपणे tune करा (LoRA, L07). आता प्रत्येक टीमसमोर AWS ने शिकवलेला build-विरुद्ध-rent प्रश्न (EC2 कोर्स!) — मेंदूंसाठी.

✅ फायदे

  • closed API: frontier दर्जा, शून्य ops, प्रत्येक token चे पैसे
  • open weights: डेटा घरी राहतो, मोठ्या प्रमाणावर प्रत्येक token चा खर्च कोसळू शकतो, काहीही tune करा, vendor चा नकाराधिकार नाही

❌ तोटे

  • closed: डेटा बाहेर जातो, किमती/मॉडेल तुमच्याखाली बदलतात, rate limits
  • open: तुम्ही GPU चालवता (ops!), सहसा frontier दर्जाच्या मागे, security patches तुमचे काम

👍 वापरा जेव्हा

  • closed: इथून सुरू करा — infra ची मालकी घेण्याआधी product पडताळा
  • open: privacy चे आदेश, प्रचंड स्थिर volume, खोल customization

👎 दोनदा विचार करा जेव्हा

  • छोट्या प्रमाणावर 'पैसे वाचवायला' open — GPU ops बचत खाऊन टाकते
  • योग्य करार नसताना नियंत्रित डेटासाठी closed

🔌 MCP विरुद्ध खास बनवलेली tool integrations — धडा 13

⏮️ MCP च्या आधी (2025 पूर्वी)

प्रत्येक AI ॲप प्रत्येक साधन हाताने जोडत असे: IDE साठी एक GitHub integration, chatbot साठी दुसरे, एजंटसाठी तिसरे — N ॲप्स × M साधने = N×M adapters, एकही पुन्हा वापरता येणारे नाही. क्षमता म्हणजे खाजगी वायरिंग, वाटता येणारे भाग नव्हे.

✅ फायदे

  • सर्व्हर एकदा लिहा → प्रत्येक MCP host मध्ये चालतो (N+M)
  • जोडायला तयार servers ची वाढती परिसंस्था
  • मानक discovery: मॉडेल जोडणीच्या वेळी साधने शोधतात
  • integrations पुन्हा न जोडता AI ॲप्स बदला

❌ तोटे

  • तरुण मानक — server चा दर्जा प्रचंड बदलतो
  • प्रत्येक server = तुमच्या परवानग्यांसह installed सॉफ्टवेअर
  • साधनांचे निकाल prompt injection घेऊन येऊ शकतात — स्रोत audit करा
  • स्थानिक config चा त्रास (paths, env, versions) खरा आहे

👍 वापरा जेव्हा

  • आज आणि उद्या अनेक साधने लागणारे एजंट/ॲप्स
  • तुमची क्षमता अनेक AI ॲप्समधून चालावी
  • assistants मध्ये अंतर्गत साधने वाटणाऱ्या टीम

👎 दोनदा विचार करा जेव्हा

  • एका ॲपमध्ये एक hardcoded साधन — साधे function calling सोपे
  • संवेदनशील मशीनवर अविश्वसनीय तृतीय-पक्ष servers
  • तुमच्या कोडमधून साधा REST कॉल काम करतो — मॉडेलची गरज नाही