हिरवट-निळा = यंत्र (1–5) · लाल = वास्तव (6–8). वर्तुळातील क्रमांक अनुसरा.
1 📋 एजंट म्हणजे काय
उत्तरे विरुद्ध परिणाम — पाठ म्हणणारा विरुद्ध हॉल पास असलेला कर्ता.
🧒 सोप्या शब्दांत
वर्गाच्या सहलीला किती pizzas लागतील असे मित्राला विचारा, तो अंदाज सांगतो '6 ते 8'. त्याऐवजी hall pass असलेल्या मदतनीसाला पाठवा: तो 23 मुले मोजतो, 3 मुलांना 1 pizza हा नियम वाचतो, 8 काढतो आणि योजना साठवतो. chatbot आठवणीतून शब्द देतो; agent मर्यादेत राहून, एकेक पाऊल टाकत काम पूर्ण करतो.
📖 नवे शब्दchatbot — काहीही न तपासता एका दमात आठवणीतून उत्तर देतोagent — loop मध्ये चालणारे, tools वापरणारे आणि काम पूर्ण करणारे modeltool — agent करू शकतो ती कृती, जसे एखादी माहिती शोधणेhall pass — agent ला काय करायची परवानगी आहे त्याच्या मर्यादा
⏪ आधी
chatbot आठवणीतून "कदाचित 6 ते 8 pizzas" असे उत्तर देतो, वर्गांचा आकार तपासत नाही, आणि काहीच मागवले किंवा साठवले जात नाही.
💡 काय
agent म्हणजे tools आणि मर्यादांचा hall pass असलेला loop मधला model call, जो शब्दांऐवजी निकाल देतो.
⚙️ कसे
तो विचार करतो, lookup आणि calc सारख्या tools ने कृती करतो, निकाल पाहतो आणि पुन्हा करतो: 23 मुले, 8 pizzas, योजना साठवली.
🎯 का
मेंदू तोच आहे; loop आणि pass मुळेच हुशार पाठांतर करणारा, काम सोपवता येईल असा करणारा बनतो.
🚀 पुढे
पुढचे lessons loop चे एकेक भाग उघडतात: ठोका, tool belt, memory, guardrails आणि failure modes.
🧪 Try it here — तोच प्रश्न chatbot ला आणि agent ला विचारा
विचार → कृती → निरीक्षण — तुम्ही कामे कशी करता, आणि एजंट कसे करतात.
🧒 सोप्या शब्दांत
कामे करताना तुम्ही विचार करता 'दूध हवे', दुकानात जाता, मग पुढे काय करायचे ठरवण्याआधी काय झाले ते पाहता. agent loop मध्ये नेमके हेच करतो: विचार, कृती, निरीक्षण, पुन्हा पुन्हा. pizza योजनेला सहा फेऱ्या लागल्या, आणि काम पूर्ण झाले किंवा steps ची मर्यादा गाठली की loop थांबतो.
📖 नवे शब्दloop — काम पूर्ण होईपर्यंत त्याच steps पुन्हा करणेthink — model पुढची कृती ठरवतेact — model ने निवडलेले tool harness चालवतोobserve — निकाल पुढच्या विचारासाठी लिहून ठेवला जातोMAX_STEPS — curfew: loop जास्तीत जास्त किती फेऱ्या चालू शकतो
⏪ आधी
एक model call एकदाच अंदाज करून थांबतो, म्हणून तो काही तपासून मिळालेल्या माहितीनुसार विचार बदलू शकत नाही.
💡 काय
loop म्हणजे विचार, कृती, निरीक्षण, पुन्हा पुन्हा: तुम्ही कामे करताना निकाल तपासत पुढे जाता तसेच.
⚙️ कसे
THINK "वर्गाचा आकार हवा", ACT lookup class 3A, OBSERVE "12 students" scratchpad मध्ये जोडले; असे एकूण सहा ठोके.
🎯 का
प्रत्येक ठोका वास्तवाशी बोलतो, म्हणून agent 12 आणि 11 सारख्या खऱ्या आकड्यांवर काम करतो, अंदाजावर नाही.
🚀 पुढे
loop done किंवा MAX_STEPS पर्यंत चालतो, आणि पुढचे lessons प्रत्येक ठोक्यात तो काय वापरू व आठवू शकतो ते ठरवतात.
पट्टा: लेबले म्हणजे अर्धी बुद्धिमत्ता; वाचन वाहते, लिहिणे थांबते.
🧒 सोप्या शब्दांत
मदतनीसाच्या tool belt मध्ये काही tools असतात, प्रत्येकावर स्पष्ट लेबल: शोधा, हिशोब करा, note लिहा, संपवा. model ला tools च्या आत दिसत नाही; ते लेबले वाचून निवडते, म्हणून अस्पष्ट लेबल म्हणजे चुकीची निवड. वाचन सुरक्षित आणि मोकळे, पण लिहिण्याआधी माणसाच्या होकाराची वाट पाहावी लागते.
📖 नवे शब्दtool — नाव, लेबल आणि inputs असलेली छोटी कृतीlabel — tool निवडायला model वाचतो तो मदत मजकूरwrite gate — काहीही बदलण्याआधी माणसाला [y/N] विचारणारा थांबाallowlist — फक्त याच गोष्टींना परवानगी; बाकी सगळे नाकारले
⏪ आधी
tools शिवाय model फक्त बोलू शकतो; "does stuff" सारख्या अस्पष्ट tools मुळे काय call करायचे याचा चुकीचा अंदाज करतो.
💡 काय
tools म्हणजे agent चा पट्टा: lookup, calc, write_note आणि done, प्रत्येकाला स्पष्ट लेबल जे वाचून model निवडते.
⚙️ कसे
lookup आणि calc सारखी वाचने मोकळी चालतात, पण write_note gate वर थांबून माणसाच्या [y/N] उत्तराची वाट पाहतो.
🎯 का
लेबले हीच अर्धी हुशारी आहेत, आणि calc सुरक्षित allowlist वापरते, eval कधीच नाही, कारण model ला काहीही लिहायला लावता येते.
🚀 पुढे
हीच लेबल असलेल्या tools ची कल्पना खऱ्या APIs आणि agents ना tools चे पूर्ण पट्टे देणाऱ्या MCP servers पर्यंत वाढते.
🧪 Try it here — tool चे लेबल लिहा — model योग्य tool निवडते का?
Scratchpad, छोटे टेबल, compaction — आणि गृहपाठाची डायरी.
🧒 सोप्या शब्दांत
गृहपाठ करताना तुम्ही नोंदी छोट्या desk वर ठेवता आणि प्रत्येक पावलाआधी वाचता. agent चा desk म्हणजे त्याची context window: प्रत्येक निकाल त्यावर जातो, आणि model प्रत्येक फेरीत ते सगळे पुन्हा वाचते. desk भरला की जुन्या नोंदी एका सारांश ओळीत दाबल्या जातात; जे टिकायला हवे ते diary मध्ये, म्हणजे desk बाहेरच्या फाइलमध्ये जाते.
📖 नवे शब्दcontext window — मर्यादित desk: model एका वेळी वाचू शकते ते सगळेscratchpad — प्रत्येक step ला काय मिळाले त्याच्या चालू नोंदीcompaction — तथ्ये ठेवून अनेक नोंदी छोट्या सारांशात दाबणेdurable memory — run संपल्यावरही टिकणाऱ्या files किंवा databases
⏪ आधी
memory नसलेला agent आधीच केलेले lookups पुन्हा करतो, किंवा desk भरल्यावर step 3 विसरतो.
💡 काय
memory म्हणजे छोट्या desk वरचे scratchpad, म्हणजे मर्यादित context window जी THINK प्रत्येक ठोक्याला पूर्ण वाचते.
⚙️ कसे
30 नोंदींनी desk 90% भरले की compaction एकच सारांश ओळ ठेवते: "23 kids, 8 pizzas, not saved".
🎯 का
तथ्ये ठेवून गप्पा काढल्या की जागा न संपता agent ला आधी काय झाले ते कळते.
🚀 पुढे
टिकणारी memory desk बाहेर असते: write_note ची file, database, किंवा जुन्या runs वर RAG, गृहपाठाच्या diary सारखी.
🧪 Try it here — डेस्क भरा आणि compaction त्याला मर्यादेत ठेवताना पहा
सहलीचे नियम: curfew, write gates, कठोर साधने, पूर्ण logs.
🧒 सोप्या शब्दांत
सहलीचे नियम असतात: curfew पर्यंत परत या, काहीही विकत घेण्याआधी शिक्षकांना विचारा, गरजेपुरतेच सोबत घ्या, आणि सहलीची diary लिहा. agents ना हेच मिळते: steps ची मर्यादा, प्रत्येक लेखनाआधी माणसाचा होकार, धोकादायक input नाकारणारे tools, आणि प्रत्येक step चा log. loop आनंदाने कायम चालत राहील; guardrails कोणतीही चूक छोटी ठेवतात.
📖 नवे शब्दguardrail — चुकीमुळे किती नुकसान होईल ते मर्यादित करणारा नियमMAX_STEPS — curfew: agent.py मध्ये जास्तीत जास्त 8 फेऱ्याleast privilege — agent ला कामापुरत्याच keys द्याsandbox — बंद पेटी, म्हणजे वाईटात वाईट एक container गमावणेlog — नंतर पुन्हा पाहता येईल अशी प्रत्येक step ची क्रमांकित नोंद
⏪ आधी
मोकळा सोडला तर loop कायम चालायचा, सगळ्याला हात लावायचा आणि प्रत्येक input वर विश्वास ठेवायचा प्रयत्न करतो, त्यामुळे bill किंवा नुकसान होते.
💡 काय
guardrails म्हणजे सहलीचे नियम: curfew, write gates, hardened tools, पूर्ण logs आणि sandbox.
⚙️ कसे
MAX_STEPS = 8 पळणारा loop थांबवतो, आणि run() मधले एक if-statement प्रत्येक लेखनाला माणसाच्या [y/N] साठी थांबवते.
🎯 का
agent त्याच्या keys परवानगी देतात तेवढेच करू शकतो, आणि sandbox असेल तर सर्वात वाईट म्हणजे एक container नष्ट होणे.
🚀 पुढे
क्रमांक असलेले, पुन्हा चालवता येणारे logs "असे का केले?" चे उत्तर देतात; पुढच्या lesson मध्ये failure modes पकडायला हेच लागते.
🧪 Try it here — guardrails बंद करा आणि बिघडलेला agent चालू द्या
आत्मविश्वासाने चूक, वेगासह — ते मोडण्याचे पाच मार्ग, आणि evals.
🧒 सोप्या शब्दांत
गणिताच्या परीक्षेत सुरुवातीला एक चुकीचा आकडा उतरवला तर पुढची प्रत्येक पायरी नीटनेटकी दिसते, पण उत्तर चुकते. agents असेच चुकतात: चुकीचे वाचन पसरते, तीच step पुन्हा पुन्हा होते, data मध्ये लपलेले आदेश पाळले जातात, काम सोडून भलतीकडे जातात, किंवा काहीच न करता 'done' म्हणतात. evals म्हणजे प्रत्येक बदलानंतर घेतल्या जाणाऱ्या सराव परीक्षा, ज्या हे पकडतात.
📖 नवे शब्दcompounding error — पुढच्या प्रत्येक step मध्ये वाढत जाणारी सुरुवातीची एक चूकprompt injection — data मधला, आदेश असल्याचे भासवणारा मजकूरgoal drift — कोणी न सांगितलेली जादा कामे करणेfake done — काम न होताच यश मिळाल्याचे सांगणेeval — प्रत्येक बदलावर चालवली जाणारी गुण देणारी चाचणी
⏪ आधी
agent आत्मविश्वासाने आणि वेगाने चुकू शकतो, एका चुकीच्या वाचनातून 33 मुलांसाठी सुबक योजना बनवतो.
💡 काय
पाच failure modes: compounding errors, loops, prompt injection, goal drift आणि खोटे done.
⚙️ कसे
evals प्रत्येक बदलावर गुण दिलेले scenarios चालवतात: 8 pizzas आणि note लिहिली, steps ≤ 6, आणि प्रत्येक लेखनापूर्वी gate विचारले.
🎯 का
failures ना नाव दिले की त्यांची चाचणी करता येते, म्हणून "grades email करा" म्हणणारा tool result आदेश नव्हे, data मानला जातो.
🚀 पुढे
दिसलेली प्रत्येक failure नवीन eval बनते, आणि याच failures वरून lesson 8 मध्ये कोणते patterns जोडायचे ते ठरते.
agent.py संपूर्ण वाचा: 130 ओळी, प्रत्येक संकल्पना एका ओळ क्रमांकावर.
🧒 सोप्या शब्दांत
खेळणे उघडून पाहिले की ते खरे कसे चालते ते कळते. agent/agent.py हा सुमारे 130 ओळींचा पूर्ण agent आहे: tool belt, बदलता येणारा मेंदू, आणि curfew व write gate असलेला loop. तो वरपासून खालपर्यंत वाचला की कळते, यात जादू नाही, फक्त एक loop, काही tools आणि काही काळजीपूर्वक लिहिलेली if-statements.
📖 नवे शब्दharness — model भोवतीचा loop code, जो tools चालवतो आणि नियम पाळतोbrain — पुढची step ठरवणारा भाग; खरे LLM इथे बसतेScriptedBrain — चाचणीसाठी script प्रमाणे चालणारा नकली मेंदूscratchpad — प्रत्येक निकाल जोडला जातो ती list
⏪ आधी
agent frameworks जादूच्या पेटीसारखे वाटतात, म्हणून loop, tools किंवा मर्यादा नेमक्या कुठे आहेत ते दिसत नाही.
💡 काय
agent/agent.py हा सुमारे 130 ओळींचा पूर्ण agent आहे, ज्यात course मधली प्रत्येक कल्पना एका line number वर आहे.
⚙️ कसे
tools ओळी 18–70 मध्ये, बदलता येणारे brains 72–99 मध्ये, आणि run() 101–130 मध्ये MAX_STEPS curfew आणि write gate.
🎯 का
पूर्ण वाचल्यावर कळते की errors crash न होता observations बनतात, आणि brain बदलला तरी harness बदलत नाही.
🚀 पुढे
brain च्या जागी एक खरा LLM call बसवला की ScriptedBrain खेळणे त्याच harness सह खरा agent बनते.
🧪 Try it here — मेंदू बदला — harness कधीच बदलत नाही
नियोजक, समीक्षक, टीम, माणसाची दारे — आणि कधी नाही.
🧒 सोप्या शब्दांत
शाळेच्या project साठी एक विद्यार्थी करू शकेल अशा कामाला दहा जणांचा गट बनवत नाही. agents चेही तसेच: steps ठरलेल्या असतील तर साधी script लिहा; मार्ग तुम्हाला काय सापडते त्यावर अवलंबून असेल तर tools सह एक agent वापरा. खऱ्या अपयशाने गरज दाखवली तरच planner, checker किंवा team जोडा, आणि परत न फिरवता येणाऱ्या कोणत्याही गोष्टीला नेहमी माणसाची मंजुरी घ्या.
📖 नवे शब्दscript — मार्ग कधीच बदलत नसेल तेव्हा, model शिवाय ठरलेल्या stepsplanner — सुरू करण्याआधी कामांची यादी लिहितोcritic — काम तपासणारी दुसरी फेरीhuman gate — परत न फिरवता येणाऱ्या step आधी माणूस मंजुरी देतोteam — foreman सह अनेक agents, फक्त खऱ्या समांतर कामासाठी
⏪ आधी
teams अनेकदा script किंवा एका model call ने चांगले होणाऱ्या कामासाठी थेट multi-agent setups कडे उडी मारतात.
💡 काय
agent patterns म्हणजे planners, critics, teams आणि human gates; प्रत्येक म्हणजे तोच loop, भोवती जास्त भूमिकांसह.
⚙️ कसे
प्रश्नांवरून खाली चला: ठरलेले steps म्हणजे script, एकच उत्तर म्हणजे एक call, शोध लागत असेल तर tools सह solo agent.
🎯 का
लहान सुरुवात खर्च आणि धोका कमी ठेवते, आणि lesson 06 ची failure दिसल्यावरच भूमिका जोडली तर system सोपी राहते.
🚀 पुढे
production मध्ये उलटता न येणाऱ्या steps ला नेहमी human gates असतात, आणि खरोखर parallel कामाला foreman असलेली team मिळते.
🧪 Try it here — काम सांगा आणि प्रश्नांवरून खाली चाला