Why Focus on the Basics?
To build a career in AI, you need strong fundamentals. This series starts from the basics and moves to advanced concepts. The video covers ten common Generative AI keywords to get you started. For a more comprehensive overview, consider exploring Master Generative AI: From Basics to Advanced LangChain Applications.
Top 10 Generative AI Keywords Explained
1. Token and Tokenization
- What is a Token? A token is the smallest building block of text. A sentence is split into smaller parts (words or subwords) called tokens.
- Example: 'Hello I am a token' becomes 5 tokens (including spaces).
- What is Tokenization? The process of converting text into tokens. A tokenizer tool (like from OpenAI) shows this conversion.
- Byte Pair Encoding (BPE): The algorithm most models use for tokenization.
2. Large Language Model (LLM)
- What is an LLM? A model trained on massive datasets. Better data quality and quantity lead to better model performance (e.g., GPT-4, GPT-5).
- How it works: When you ask ChatGPT a question, it first tokenizes your text, then processes those tokens.
3. Context Window
- Definition: The maximum number of tokens an LLM can process and generate in one go.
- Example: A small model might have a 512-token context window. If your PDF is 1000 tokens, the model can only process half, truncating the rest and losing context.
4. Chunking
- Problem: You cannot send a whole large document (like a 1000-line PDF) to an LLM at once. It would exceed the context window.
- What is Chunking? A process that splits large documents into smaller, manageable pieces (chunks) while preserving meaning.
- Chunking Strategy: The algorithm you use to split text matters. Otherwise, chunks can lose context and meaning.
5. Embeddings
- What are Embeddings? When you create chunks, you convert them into numerical vectors.
- Example: Words like 'King', 'Queen', and 'Royal' have similar vectors because they belong to the same category.
- Use: These vectors are stored in a Vector Database. When you ask a question, the system finds similar vectors to retrieve relevant chunks.
6. Vector Database
- Role: Stores the numerical vectors (embeddings) created from your chunks.
- Process: Based on your query's context, it retrieves the most relevant vectors and sends those chunks to the LLM.
7. Transformers
- Definition: The architecture on which most LLMs are built. It has two main components:
- Encoder: Converts your text prompt into numerical representations (tokens/numbers).
- Decoder: Works on those numbers to generate the final response.
- Key Components: Encoder-Decoder model, Feed Forward networks, and Attention Mechanism. For a deeper dive into how these models work, read Understanding Generative AI: Concepts, Models, and Applications.
8. Temperature
- Definition: A hyperparameter that controls the randomness and creativity of an LLM's output.
- Range & Effect:
- High Temperature (e.g., 1.0): Very creative, imaginative, or fictional responses.
- Low Temperature (e.g., 0.0): Precise, factual, and deterministic answers.
- Note: Other factors like Top-K and Top-P also influence output.
9. RAG (Retrieval-Augmented Generation)
- Problem: LLMs only know public data. They cannot answer from your private, confidential company data without being trained on it (which is expensive).
- How RAG Works:
- Retrieve: Take your user's question, find the most relevant chunks from your private documents (using embeddings and vector DB).
- Augment: Combine the retrieved chunks with the user's original prompt.
- Generate: Send this combined context to the LLM, which then generates an answer based on that specific data.
- Keywords Used: Tokenization, Chunking, Embeddings, and Vector Databases are all part of the RAG pipeline. To understand this architecture in more detail, check out Understanding Retrieval Augmented Generation (RAG) in AI Applications.
10. Hallucination
- Definition: When an LLM gives an incorrect answer with high confidence.
- Control Factors:
- Temperature: Lower temperature reduces hallucination.
- Data Quality: Your chunks and embeddings must be accurate.
- Chunking Strategy: Poor chunking can lead to bad context and wrong answers.
- Embedding Model: The model must match the type of data (e.g., don't use a text embedding model for chart data).
Summary: How Keywords Connect in a RAG Workflow
- Data Ingestion Phase: Data is split into chunks, then tokenized, and finally converted into embeddings for storage in a Vector Database.
- Retrieval & Assembly Phase: The Vector Database finds the nearest neighbors (similar vectors) based on context. RAG injects the top chunks into the prompt, packaging them according to the Context Window.
- Inference & Output Phase: Transformers (self-attention) process the data, Temperature controls the output style, and good data reduces Hallucination. For a broader perspective on the landscape, see Understanding Generative AI, AI Agents, and Agentic AI: Key Differences Explained.
Final Advice: Focus on fundamentals first. Don't jump into complex diagrams. Be patient, take notes, stay curious, and you will progress from basics to production without frustration. To add to your vocabulary, review 20 Key AI Terms Every Engineer Must Know Explained Simply.
এআই-তে আপনার ক্যারিয়ার গড়ার জন্য
আপনাকে প্রথমে আপনার বেসিকগুলো
ঝালিয়ে নিতে হবে। বেসিক পরিষ্কার হয়ে
গেলে আপনি প্রোডাকশনের জন্য প্রস্তুত
হয়ে যাবেন। তাই জেনারেটিভ এআই- তে এগিয়ে
যাওয়ার আগে খুব হাই লেভেলে যাওয়ার
প্রয়োজন নেই। প্রথমে আপনার বেসিকগুলো
ক্লিয়ার করুন আর এর জন্য আমি আপনাকে
সাহায্য করতে এখানে আছি, আমি জেনারেটিভ এআই
ফাউন্ডেশন সিরিজ শুরু করছি যেখানে
আমি বেসিক থেকে শুরু করে অ্যাডভান্স
কনসেপ্টের দিকে যাব। তাই এই ভিডিওতে আমি
জেনারেটিভ এআই- এর শীর্ষ ১০ টি খুবই সাধারণ
কিওয়ার্ড নিয়ে আলোচনা করব। এখন আমরা
টোকেন দিয়ে শুরু করতে যাচ্ছি। এখন
টোকেন কী? দেখুন জেনারেটিভ এআই- এর একদম
প্রাথমিক বিল্ডিং ব্লক হলো আপনার
টোকেন। টোকেন কী আসলে? টোকেন হলো আপনার একটি
বাক্য। এখন এই বাক্যগুলোকে আমরা কিছু ছোট
ছোট অংশে ভাগ করব। সবচেয়ে ছোট যে অংশটি
হবে তাকে আমরা টোকেন বলব। কীভাবে? আসুন এই
উদাহরণের সাহায্যে আমি আপনাদের
বুঝিয়ে বলি। এটি ওপেন এআই-এর ওয়েবসাইট যা
একটি টোকেনাইজার। এটি আমাদের
বাক্যগুলোকে টোকেনে দেখাবে । এখন আপনি
এখানে বুঝতে পারবেন যে টোকেন আসলে কী।
এখানে আমি টাইপ করব হ্যালো আই এম আ টোকেন। তো
এটি আমার বাক্য । এখন দেখুন এই বাক্য থেকে
কতগুলো টোকেন তৈরি হলো। এখানে পাঁচটি
টোকেন তৈরি হয়েছে। তাই না? এখন দেখুন
এগুলোই হলো পাঁচটি টোকেন। পাঁচটি টোকেন
কীভাবে হলো? এখানে দেখুন হ্যালো আই এম আ
টোকেন। এটিকে পাঁচটি সেকশনে ভাগ করা হয়েছে,
এমনকি এটি স্পেসকেও বিবেচনা করেছে
। এখন দেখুন এই টোকেনগুলোকে অ্যাটাচ বা
যুক্ত করা হয়েছে। টোকেন আইডিগুলো
এখানে সংযুক্ত করা হয়েছে। এই পুরো
প্রক্রিয়াটিকে আমরা বলি টোকেনাইজেশন।
এখন এই টোকেনাইজেশনটা করছে কে? এটি
মডেলগুলোই করছে। এবং এর পেছনে একটি
অ্যালগরিদম থাকে যার নাম বাইট পেয়ার
এনকোডিং। এর প্রয়োজন কেন পড়ল? আমরা
এলএলএম-এর সাথে কথা বলি। এলএলএম কী?
লার্জ ল্যাঙ্গুয়েজ মডেল। এমন একটি
মডেল যা বিশাল ডেটাসেট দিয়ে প্রশিক্ষিত।
ডেটার গুণমান যত ভালো হবে, আপনার মডেল তত
ভালো হবে। যেমন জিপিটি -৪, জিপিটি -৫,
আপনারা যে ৪, ৫ বলছেন, এগুলোই হলো মডেল। যেমন
যেমন এদের ট্রেনিং ডেটাসেটের
গুণমান ও পরিমাণ বেড়েছে, সেই অনুযায়ী
নতুন নতুন মডেল তৈরি হয়েছে এবং মডেলগুলো
উন্নত হওয়ার সাথে সাথে এদের একুরেসি,
রেসপন্স টাইম, ল্যাটেন্সি, সবকিছুই উন্নত
হয়েছে। তাই এখানে ডেটার ভূমিকা অনেক বড়
। এখন আপনার কাছে চ্যাট জিপিটি আছে।
চ্যাট জিপিটিতে আপনি যখন কোনো বাক্য
জিজ্ঞেস করেন, যেমন 'সঠিক সময় কী' বা '
টোকেনাইজেশনের অর্থ কী'? তখন এটি এই
বাক্যটিকে ছোট ছোট শব্দ বা টোকেনে ভাগ করে
ফেলে। এরপর এর ওপর সমস্ত প্রসেসিং হয়।
ঠিক আছে? এখন ব্যাপার হলো, সে তো বাক্যটিকে
কনভার্ট করে দিল। কিন্তু তখন কী হবে যখন
আপনার কাছে পুরো একটা পিডিএফ থাকবে?
আপনি পুরো পিডিএফ তো আর চ্যাট জিপিটি
বা অন্য কোনো এআই-কে পাঠাতে পারবেন না।
আপনার পিডিএফ যদি ১০০০ লাইনের হয়।
সেটা তো আর পাঠাতে পারবেন না। তাতে এর
কন্টেক্সট বা প্রাসঙ্গিকতা হারিয়ে যাবে।
এবার এখানে কন্টেক্সটের প্রসঙ্গ আসে।
কন্টেক্সট মানে কী? এর অর্থ কী হয়। ধরা
যাক আপনার এলএলএম (LLM)-এর ক্যাপাসিটি
আছে। এর একটি কন্টেক্সট উইন্ডো থাকে।
ধরা যাক এটি ৫১২ টোকেন, যা সাধারণত থাকে।
ছোট মডেলগুলোতে এমনটাই হয়। ছোট
এলএলএম মডেলে এগুলো থাকে। ঠিক আছে? এখন
যদি আমাদের ৫০০ টোকেন থাকে আর আপনার পিডিএফ
যদি ১০০০ ওয়ার্ড বা ১০০০ লাইনের হয়। তখন
সে পিডিএফ-এর অর্ধেকই প্রসেস করতে
পারবে, কারণ তার টোকেন উইন্ডো শেষ হয়ে গেছে।
টোকেন ক্যাপাসিটির বাইরে চলে গেছে
। কন্টেক্সট উইন্ডো কী? একবারে কতগুলো
টোকেন গ্রহণ করা যাবে এবং জেনারেট হবে।
তো, এই সমস্ত কিছুই হলো টোকেন উইন্ডো।
এখন আপনার পিডিএফ-এর সামান্য অংশই
প্রসেস হলো আর বাকি অংশ বাদ পড়ে গেল।
ট্রাঙ্কেট বা কেটে গেল। তো, এখানে আপনার
কন্টেক্সট চলে গেল। আপনার মানে বা অর্থ
হারিয়ে গেল। এবার ধরা যাক আপনার কাছে
একটি পিডিএফ বা বই আছে। এখন আপনাকে একটি
লাইন খুঁজে বের করতে হবে। কিন্তু আপনি তো
তা জানেন না। আপনার ক্ষমতা হলো আপনি
একবারে মাত্র দুটি অধ্যায় পড়তে পারেন।
তাহলে আপনি শুধু প্রথম দুটি অধ্যায়ই
দেখবেন। বাকিগুলো দেখতেই পারবেন
না। কিন্তু সেই দুটি অধ্যায়ে আপনি হয়তো
উত্তরটি পাবেন না। তাই এখানেই চঙ্কিংয়ের কাজ
আসে। চঙ্কিং কী? চঙ্কিং হলো এমন একটি
প্রক্রিয়া যাতে আমরা বড় ডকুমেন্টগুলোকে
চঙ্ক বা টুকরোতে ভাগ করি। এর মানে
হলো, আপনার পিডিএফটিকে আমরা ছোট ছোট
অংশে ভাগ করব। কিন্তু এই টুকরোগুলো
আমরা এভাবে ভাগ করব না। হয়তো প্রথম দুটি
প্যারাগ্রাফে আমাদের উত্তর ছিল না। অর্থাৎ,
আমাদের তৈরি করা দুটি টুকরো এমনভাবে তৈরি
হলো যে দুটির মানেই বদলে গেল । তাই এখানেই
চঙ্কিং স্ট্র্যাটেজির বিষয়টি আসে।
চঙ্কিং স্ট্র্যাটেজির মাধ্যমে আপনি
যে ধরনের অ্যালগরিদম ব্যবহার করবেন,
চঙ্কিং তত ভালো হবে। এম্বেডিংস কী?
যখন আমরা চাঙ্ক তৈরি করি, আমরা সেগুলোকে
নম্বরে কনভার্ট করি। অর্থাৎ
ভেক্টরে কনভার্ট করি। ধরা যাক কিং,
কুইন এবং রয়্যাল। এই তিনটি একই
ক্যাটাগরির। তাই এদের ভেক্টরগুলো
একই ধরনের হবে। মানে এদের নিউমেরিক্যাল
রিপ্রেজেন্টেশন একই রকম হবে। তাহলে এখন কী
হবে? যখন নিউমেরিক্যাল রিপ্রেজেন্টেশনের
গ্রুপ একই হবে, তখন আমরা এগুলো কোথায় স্টোর
করব? ভেক্টর ডেটাবেসে। মানে এই
ভেক্টরগুলো তৈরি হয়ে গেল। এখন এগুলো গিয়ে
স্টোর হবে ভেক্টর ডেটাবেসে। এখন
কী হবে? যেমন আমি কিছু জিজ্ঞেস করলাম
। ঠিক আছে? যে আমার প্রিন্সেস
ট্রিটমেন্ট দরকার। এখন প্রিন্সেস
ট্রিটমেন্টে কী হলো? প্রিন্সেস। তো
এখন এর মানে কী বোঝা গেল? রয়্যালটি। তো
এখন এর যে কনটেক্সট বের হলো, এর
ভেক্টরগুলো হবে একই ভেক্টর । আমাদের কাছে
যে স্টোর্ড ভেক্টরগুলো আছে কিং এবং
কুইন বা রয়্যালটির, সেই একই
ভেক্টরগুলো দিয়ে ডেটাবেস থেকে
প্রাসঙ্গিক চাঙ্ক বের করা হবে, তারপর
সেগুলো এলএলএম- এর কাছে পাঠানো হবে এবং এলএলএম
এরপর তার কাজ শুরু করবে। এখন আসা যাক
কনটেক্সট উইন্ডোতে। আমরা আগেই
বুঝেছিলাম, একটি মডেল একসাথে যতগুলো
টোকেন প্রসেস করতে বা হ্যান্ডেল
করতে পারে, তাকে আমরা কনটেক্সট উইন্ডো বলি।
মডেল যত ছোট হয়, তার কনটেক্সট উইন্ডো তত ছোট
হয়। ঠিক আছে? তাই বলা হয় যে আপনাকে
কনটেক্সট প্রিজার্ভ করতে হবে। এখন
দেখুন, ধরুন আমরা অপ্রয়োজনীয়
চাঙ্কগুলো এলএলএম-এর কাছে পাঠিয়ে দিলাম।
এতে কী হবে, আমাদের খরচও তো বাড়ছে।
প্রতিবার আমরা যখন ৫১২ বা ১০,০০০ টোকেন
প্রসেস করছি, তখন আমাদের সময়ও নষ্ট
হচ্ছে। তাই আমাদের খরচও দেখতে হবে, আর
যদি আপনি ১০০০ পেজের পিডিএফ পাঠিয়ে দেন তবে
সময়ও বেশি লাগবে। তখন ইউজার চলে যাবে
। ইউজার এক্সপেরিয়েন্স খারাপ হবে।
তাহলে আমাদের কাছে কী আছে? আমাদের খরচ
বাঁচাতে হবে, গতি বাড়াতে হবে, ল্যাটেন্সি
এবং ইউজার এক্সপেরিয়েন্স —সবকিছু ঠিক
রাখতে হবে। আমাদের পুরো বিজনেস
বাঁচাতে হবে। তাই বলা হয় যে ইন্টারভিউতে
আপনার বেসিক যদি ক্লিয়ার থাকে তবেই আপনি
প্রোডাকশনে কাজ করতে পারবেন।
সেজন্যই ইন্টারভিউতে ফোকাস করা হয় যে
আপনার বেসিকগুলো ক্লিয়ার কি না।
আপনি যে জিনিসটি ইমপ্লিমেন্ট
করেছেন, কেন করেছেন? আপনি কি আরও ভালোভাবে
ইমপ্লিমেন্ট করতে পারতেন? বেসিকস আর ভেরি
ইমপর্টেন্ট। তবে চিন্তা করবেন না, এই
সিরিজে আমি সবকিছু খুব শীঘ্রই কভার
করব। তাই আপনার শুধু ফোকাস করা প্রয়োজন এবং
নোটস তৈরি করুন । ট্রান্সফর্মারস
কী? ট্রান্সফর্মারস একটি
আর্কিটেকচার। খুব সহজভাবে বলব যার ওপর
আপনার এলএলএম তৈরি হয়েছে। সহজ কথায়, আপনার
ট্রান্সফর্মার দুটি জিনিস দিয়ে তৈরি।
এনকোডার এবং ডিকোডার। ঠিক আছে? এনকোডার কী
কাজ করে? এটি আপনার ইউজার প্রম্পটকে
টেক্সট থেকে নাম্বারে, অর্থাৎ টোকেন
এবং নাম্বারে রূপান্তর করে। তারপর সেই
নাম্বারগুলোকে পাঠানো হয়। এরপর তার ওপর
ডিকোডার কাজ করে। এবং তারপর সে অনুযায়ী
এলএলএম পুরো কাজ করে এবং রেসপন্স নিয়ে
আসে। এনকোডার- ডিকোডার মডেল, ফিড ফরওয়ার্ড,
অ্যাটেনশন মেকানিজম—এসব বিষয়ে আমরা
আলাদা ভিডিওতে কথা বলব। আপনার শুধু বুঝতে হবে
ট্রান্সফর্মার কী। ট্রান্সফর্মার
আর্কিটেকচারের কী কী কম্পোনেন্ট
থাকে। এখন এখানে টেম্পারেচারের
বিষয়টি চলে আসে । আচ্ছা, টেম্পারেচার
বলতে আপনি কী বোঝেন? যখন আপনি এসিতে বসেন, তখন
আবহাওয়া অনুযায়ী আপনি এসির
টেম্পারেচার সেট করেন। আপনি আপনার মুড বা
স্বাস্থ্যের ওপর ভিত্তি করে টেম্পারেচার
ঠিক করেন। যদি আপনি খুব সাধারণ বা
স্বাভাবিক তাপমাত্রা চান, তবে আপনি সেই
অনুযায়ী টেম্পারেচার সেট করবেন, তাই
না? ঠিক সেইভাবেই, এলএলএম-এর
রেসপন্স আপনার সেট করা টেম্পারেচারের
ওপর নির্ভর করে । তবে শুধু টেম্পারেচারের
ওপরই কিন্তু নির্ভর করে না। আরও অনেক আলাদা
বিষয় থাকে। তবে টেম্পারেচার হলো এলএলএম-এর
অন্যতম একটি হাইপার প্যারামিটার।
ঠিক আছে? হাইপার প্যারামিটার হলো সেগুলো যা
আপনি নিজে পরিবর্তন করতে পারেন।
টেম্পারেচারের রেঞ্জ বলে দেয় যে আপনার
এলএলএম-এর রেসপন্স কেমন হবে। যদি
টেম্পারেচার রেঞ্জ বেশি থাকে, তার মানে
সে খুব সৃজনশীল বা কাল্পনিক কিছু বলবে, যেমন
ধরুন আমি চাইলাম সে আমার জন্য একটি
কাল্পনিক মুভির গল্প বলুক। যেখানে
সৃজনশীলতা একদম চরম পর্যায়ে থাকবে
। তাহলে সেই অনুযায়ী আমি টেম্পারেচার
একদম বাড়িয়ে সেট করব। কিন্তু আমি যদি
চাই যে আমাকে একদম সঠিক উত্তর দিক।
তাহলে আমি টেম্পারেচার একদম লো বা
জিরোতে রাখব। তো টেম্পারেচারের
কিছু নির্দিষ্ট রেঞ্জ থাকে।
টেম্পারেচারই ঠিক করে দেয় যে আপনার এলএলএম
কী ধরণের উত্তর দেবে। রেসপন্স কেমন হবে। তবে
আবারও বলছি, শুধু টেম্পারেচারের
ওপরই আপনার আউটপুট নির্ভর করে না। এর
পেছনে আরও অনেক আলাদা ফ্যাক্টর কাজ
করে। যেমন টপ-কে (Top-K), টপ-পি (Top-P)। এগুলো নিয়েও
আমরা আলাদা একটি ভিডিওতে আলোচনা করব।
এখন আমরা কথা বলব র্যাগ (RAG) বা রিট্রিভাল
অগমেন্টেড জেনারেশন নিয়ে । এটার
প্রয়োজনীয়তা কেন পড়ল? আমরা খুব বেসিক
লেভেলে বিষয়টি বুঝব। এলএলএম পাবলিক ডেটার
ভিত্তিতে উত্তর দিতে পারে। পাবলিক
বা লিগ্যাল ডেটার ভিত্তিতে সে
আপনাকে উত্তর দেবে। কিন্তু আপনার
ব্যক্তিগত বা প্রাইভেট ডেটার ওপর সে
উত্তর দিতে পারবে না। ঠিক আছে? তো এখন এর
জন্য আপনার কাছে দুটি বিকল্প আছে। হয়
আপনি নিজের এলএলএম তৈরি করুন। সেটিকে
আপনার ডেটার ওপর ট্রেন করুন । কিন্তু সেটা
খুবই ব্যয়বহুল । ঠিক আছে? অথবা আপনি কী করবেন
যে, আপনার এলএলএম-কে আপনার ডেটা
পাঠাবেন। কিন্তু আপনি এত বিপুল পরিমাণ
ডেটা কীভাবে পাঠাবেন? এবং ওটা আপনার
একান্ত ব্যক্তিগত ডেটা। লিগ্যাল
ডেটা হলো কনফিডেন্সিয়াল ডেটা। আপনি এটা
কীভাবে পাঠাবেন? সেখানেই
র্যাগ (RAG)-এর ভূমিকা আসে। র্যাগ কী করে?
এর মধ্যে পুরো একটি র্যাগ পাইপলাইন
রয়েছে। ইন্টারভিউয়াররা আপনাকে এটা
জিজ্ঞেস করেন। আপনি এটা ব্যাখ্যা করুন
। তবে এটি নিয়ে আমরা অন্য একটি ভিডিওতে কথা
বলব, যেখানে আমি ইন্টারভিউ প্রশ্নগুলোও
শেয়ার করব। তাই সাবস্ক্রাইব করতে ভুলবেন না
। তাই আমি চাই আপনারা সবাই কমেন্ট সেকশনে
আলোচনা করুন এবং আমাকে ও অন্যদেরও
জানান। আবার র্যাগে ফিরে আসি। র্যাগ
কেন এল? এবার র্যাগ আসলে কী করে? আমরা
আমাদের এলএলএম- কে আমাদের কাছে থাকা পিডিএফ বা
অন্যান্য ফাইলগুলো দেব। এগুলো থেকে
আমরা প্রাসঙ্গিক অংশ বা চাঙ্ক
দেব। তারপর সে সেখান থেকেই উত্তর দেবে।
আমরা আগে যা কিছু পড়েছি, তার সবটুকুই
র্যাগের মধ্যে ইমপ্লিমেন্ট
হবে। আমাদের এলএলএম (LLM) মডেলের
ক্ষেত্রে কী হয়, ঠিক? আমাদের কাছে যে
প্রাইভেট ডেটা আছে, আমরা সেখান থেকে কিছু অংশ
দেব। এখন এই অংশগুলো আমরা কীভাবে বের করব?
ধরুন আমি জিজ্ঞেস করলাম যে
ম্যাটারনিটি লিভ কীভাবে পাওয়া যায় বা
বছরে কতগুলো ছুটি পাওয়া যায়, এগুলো তো
কোম্পানি ভেদে আলাদা হয়, তাই না? তাই আমার
ইউজার প্রম্পট থেকে, যা আমি দিয়েছিলাম,
সেখান থেকে সে কনটেক্সট খুঁজে বের করবে
। সেই কনটেক্সটের ভিত্তিতে সে
ডেটাবেসে যাবে । তারপর সেই কনটেক্সটের
ওপর ভিত্তি করে সে সেরা বা প্রাসঙ্গিক
চাঙ্কগুলো বের করবে। মানে ডকুমেন্টগুলো
বের করবে। এবার আমার ইউজার প্রম্পট এবং
বের করা চাঙ্কগুলো মিলিয়ে সে
এলএলএম-কে দেবে । ফাউন্ডেশন মডেলকে দেবে।
তারপর মডেল সেগুলোর ওপর ভিত্তি করে
উত্তর তৈরি করবে। তাহলে আমরা কী কী
পড়েছিলাম মনে আছে? আমরা টোকেনাইজেশন,
চাঙ্কিং এবং এম্বেডিং পড়েছিলাম। এই
সব জিনিসগুলোই আমরা পড়েছিলাম । তো এখন এই
সবকিছু এখানে কাজে লাগবে। এটাই হলো
আমাদের র্যাগ । আমরা খুব বিস্তারিতভাবে
আলাদা একটি ভিডিওতে র্যাগ নিয়ে
আলোচনা করব। এটি আপনার চিন্তাভাবনা
বদলে দেবে। এবার আসি হ্যালুসিনেশন
অংশে। হ্যালুসিনেশন কী?
হ্যালুসিনেশন হলো এমন একটি বিষয় যেখানে
আপনার এলএলএম খুব আত্মবিশ্বাসের
সাথে ভুল উত্তর দেয়। হ্যালুসিনেশন
নিয়ন্ত্রণ করার অনেক উপায় আছে। তবে
টেম্পারেচার একটি বড় ফ্যাক্টর।
আপনি টেম্পারেচার যেভাবে সেট
করবেন, সেই অনুযায়ী সে উত্তর দেবে।
পাশাপাশি ডেটার গুণমানও নির্ভর করে যে
আপনার ডেটা কতটা ভালো মানের। আপনার
চাঙ্কিং স্ট্র্যাটেজি থেকে কেমন
চাঙ্ক আসছে এবং এই সব বিষয়, আপনার মডেল কী?
আপনার ডেটা কী? আপনার ডেটা সঠিক জায়গায়
স্টোর হচ্ছে কি না? অথবা আপনার এম্বেডিং মডেল
আপনার ডেটার ধরনের সাথে মানানসই কি না।
ঠিক আছে? আপনার ডেটা চার্টস এবং অন্যান্য
সব কিছু। কিন্তু আপনার এমবেডিং মডেল
শুধুমাত্র টেক্সট প্রসেস করে। এমবেড করে
। তাই আপনাকে নিজেকেই শনাক্ত করতে
হবে যে কোন ধরনের ডেটা কোথায় স্টোর
হবে। কোন ডেটাতে কোন এমবেডিং মডেল
ব্যবহার করবেন, খরচও আপনাকে দেখতে হবে।
সবকিছুই দেখতে হবে। আপনার প্রবলেম
স্টেটমেন্ট অনুযায়ী আপনি যতটা সম্ভব
ইমপ্রুভমেন্ট করতে পারেন, তা আপনাকে দেখতে
হবে। এখন, এখানে আমরা যে ১০ টি কিওয়ার্ড
পড়েছি, সেগুলো আমাদের জেনারেটিভ এআই
ইঞ্জিনিয়ারিংয়ে কোথায় এবং কীভাবে কাজে
লাগছে। দেখুন, ডেটা ইনজেশন ফেজে আপনার র '
ডেটাগুলো চাংকস-এ পরিবর্তিত হয়।
তারপর টোকেনাইজেশনের সাহায্যে আমরা
চাংকসকে টোকেনে রূপান্তর করি।
এবং শেষ পর্যন্ত স্টোরেজের
জন্য এগুলো এমবেডিংসে পরিণত হয়।
এরপর রিট্রিভাল এবং অ্যাসেম্বলি
ফেজে কী হয়? ভেক্টর ডেটাবেস যা
ইনডেক্স থাকে, সেগুলো নিয়ারেস্ট
নেইবারস খুঁজে বের করে। অর্থাৎ
কনটেক্সট অনুযায়ী যেটা রিলেটেড
কনটেক্সট, আমি এখনই বললাম, সিমিলার
ভেক্টরগুলোকে বের করা হয়। সেখান থেকেই
ভেক্টর ডেটাবেসের বিষয়টি আসে।
র্যাগ (RAG) কী করে, টপ চাংকসগুলোকে
প্রম্পটে ইনজেক্ট করে। এখন টপ চাংকস ও
প্রম্পট সব কনভার্ট করে কনটেক্সট
উইন্ডো অনুযায়ী সেগুলোকে
প্যাকেজ করে দেয়। এলএলএম (LLM)- কে দেয়। এবার
এখানে ইনফারেন্স এবং আউটপুট আসে।
ট্রান্সফরমারগুলো সেলফ অ্যাটেনশনের
মাধ্যমে ডেটা প্রসেস করে। টেম্পারেচার
আপনার আউটপুটকে নিয়ন্ত্রণ
করে এবং হ্যালুসিনেশন দূর করে। তো, এই
ছিল টপ ১০ টি কিওয়ার্ড। এর মাঝে আমি আরও
অনেক আলাদা কিওয়ার্ড ইমপ্লিমেন্ট
করেছি। আশা করি এই ভিডিওটি সাহায্যকারী
ছিল এবং আমি অনুরোধ করব কেউ যেন এই ভিডিওর
সারাংশ বা আমি যে কিওয়ার্ডগুলো
আলোচনা করেছি তা কমেন্টে লিখে দেয়, আর
আমি সেই দরকারি কমেন্টটি পিন করে দেব।
আপনাকে শুধু ফাউন্ডেশনের ওপর ফোকাস করতে
হবে। ট্রান্সফর্মার মডেল যা আমি
বলেছি, এনকোডার বা ডিকোডার, এগুলো নিয়ে
চিন্তার কিছু নেই। প্রথমে আপনি
কিওয়ার্ডগুলো বুঝুন, তারপর আমরা
বিস্তারিত যাব । কারণ আমি যদি এখনই সরাসরি
আপনাদের এজেন্ট এবং র্যাগের
ডায়াগ্রাম বোঝাতে শুরু করি। চাঙ্কিং
কী? এমবেডিং কী? আপনারা কিছুই বুঝতে পারবেন
না। বারবার ভিডিও দেখবেন, তারপর হতাশ
হয়ে ছেড়ে দেবেন যে আমার এইচটিএমএল,
সিএসএস-ই অনেক ভালো। কিন্তু বিষয়টা এমন নয়
। আপনাকে ফোকাসড থাকতে হবে, পজিটিভ
থাকতে হবে। সবকিছু ধীরে ধীরে হয়ে যাবে।
আপনি নিজেও বুঝতে পারবেন না। তবে ধৈর্য
ধরে আপনাকে আপনার কাজের ওপর মনোযোগ
দিতে হবে। বেসিক থেকে প্রোডাকশন
পর্যন্ত আপনি খুব সহজেই পৌঁছে যাবেন।
আপনি টেরও পাবেন না। এবং কৌতুহলী থাকুন
। আশা করি এই ভিডিওটি আপনাদের
উপকারে এসেছে এবং আমি সবাইকে সাবস্ক্রাইব
করার অনুরোধ করছি, দেখা হবে আমার পরের
ভিডিওতে। বাই।
A token is the smallest unit of text, such as a word or subword, that an AI model processes. Tokenization is the process of converting a sentence into these tokens using algorithms like Byte Pair Encoding (BPE). For example, the phrase 'Hello I am a token' becomes 5 tokens including spaces, and this conversion is done by a tokenizer tool.
A context window is the maximum number of tokens an LLM can process or generate at once, similar to short-term memory. For instance, a model with a 512-token window cannot handle a 1000-token PDF, leading to truncated data and lost context. Understanding this helps in strategies like chunking to manage large documents.
Embeddings convert text chunks into numerical vectors that represent semantic meaning, placing similar concepts like 'King' and 'Queen' close together. These vectors are stored in a vector database, which retrieves relevant chunks based on query similarity. This enables efficient search and retrieval in RAG workflows.
Temperature is a hyperparameter that controls output randomness: a high setting (e.g., 1.0) generates creative responses, while a low setting (e.g., 0.0) produces deterministic, factual answers. It must be balanced with other factors like Top-K and Top-P to fine-tune generation quality.
RAG retrieves relevant chunks from private documents using embeddings and a vector database, augments the user query with this context, then sends it to an LLM for generation. This allows models to answer questions about confidential data without costly fine-tuning, relying on components like tokenization, chunking, and embeddings.
Hallucination occurs when an LLM produces incorrect answers confidently, often due to high temperature, poor data quality, or mismatched chunking strategies. To reduce it, set lower temperature, ensure accurate embeddings and chunks, and use appropriate embedding models for your data type.
Transformers are the architecture behind most LLMs, consisting of an encoder that converts text into numerical representations and a decoder that generates responses. Key components like the attention mechanism enable models to focus on relevant parts of input, making them efficient for tasks like translation and generation.
Keep this summary
Save it to LunaNotes and it becomes a real note in your library — editable, searchable, and ready to turn into flashcards or a diagram. Free to start.
Save to LunaNotesOr summarise for another video.
This summary and transcript were automatically generated using AI with the Free YouTube Transcript Summary Tool by LunaNotes.
Related summaries
Understanding Retrieval Augmented Generation (RAG) in AI Applications
Discover how Retrieval Augmented Generation (RAG) enhances large language models by integrating external knowledge bases to overcome hallucination and improve accuracy. This comprehensive overview explains RAG's workflow, its advantages over traditional LLM approaches, and upcoming implementation strategies using vector databases and embeddings.
Master Generative AI: From Basics to Advanced LangChain Applications
Explore the comprehensive journey into generative AI, from foundational concepts and transformer architectures to practical implementation with LangChain. Learn how to leverage large language models, prompt engineering, retrieval augmented generation, and ChatGPT-like systems to build cutting-edge AI applications and stay ahead in the evolving AI landscape.
Understanding Generative AI: Concepts, Models, and Applications
Explore the fundamentals of generative AI, its models, and real-world applications in this comprehensive guide.
20 Key AI Terms Every Engineer Must Know Explained Simply
This video breaks down 20 essential AI and large language model (LLM) terms, from tokenization and vectors to RAG and reinforcement learning. Designed for engineers, it clarifies confusing jargon and connects concepts like transformers, fine-tuning, and MCP to real-world applications.
Understanding Generative AI, AI Agents, and Agentic AI: Key Differences Explained
In this video, Krishna breaks down the essential differences between generative AI, AI agents, and agentic AI. He explains how large language models and image models function, the role of prompts in generative applications, and the collaborative nature of agentic AI systems.
Most viewed summaries
A Comprehensive Guide to Using Stable Diffusion Forge UI
Explore the Stable Diffusion Forge UI, customizable settings, models, and more to enhance your image generation experience.
Kolonyalismo at Imperyalismo: Ang Kasaysayan ng Pagsakop sa Pilipinas
Tuklasin ang kasaysayan ng kolonyalismo at imperyalismo sa Pilipinas sa pamamagitan ni Ferdinand Magellan.
Mastering Inpainting with Stable Diffusion: Fix Mistakes and Enhance Your Images
Learn to fix mistakes and enhance images with Stable Diffusion's inpainting features effectively.
Pamamaraan at Patakarang Kolonyal ng mga Espanyol sa Pilipinas
Tuklasin ang mga pamamaraan at patakaran ng mga Espanyol sa Pilipinas, at ang epekto nito sa mga Pilipino.
How to Install and Configure Forge: A New Stable Diffusion Web UI
Learn to install and configure the new Forge web UI for Stable Diffusion, with tips on models and settings.
Found this summary useful?
Take it with you. One click puts it in your own LunaNotes library.
Save to LunaNotes