Capitol gratuit

LLM-uri și limitările lor (de ce RAG)

Un model de limbaj (LLM - Large Language Model) precum Claude, GPT sau Gemini este antrenat pe cantități uriașe de text și „învață" tipare de limbaj, fapte...

Introducere

Un model de limbaj (LLM - Large Language Model) precum Claude, GPT sau Gemini este antrenat pe cantități uriașe de text și „învață" tipare de limbaj, fapte generale și raționamente. Este extrem de capabil la nivel de conversație, scriere și logică, dar are câteva limitări structurale pe care orice afacere trebuie să le înțeleagă înainte de a construi un chatbot.

Limitările fundamentale ale unui LLM „gol"

LimitareCe înseamnă în practică
Cunoștințe înghețate în timpModelul „știe" doar ce exista până la data limită de antrenare (knowledge cutoff), nu evenimente sau prețuri recente
Nu are acces la datele privateNu a „citit" niciodată cataloagele, contractele sau baza de date a afacerii dumneavoastră
HalucinațiiCând nu știe răspunsul, poate genera un text plauzibil dar fals, cu aceeași încredere ca un răspuns corect
Fereastra de context limitatăNu poate „ține minte" simultan mii de pagini de documentație în fiecare conversație
Cost la scarăA trimite documentația întreagă în fiecare prompt este scump și ineficient
Atenție - riscul halucinației: Un chatbot AI conectat direct la un LLM, fără nicio bază de cunoștințe reală, poate inventa politici de retur, prețuri sau caracteristici de produs care nu există. Pentru o afacere, acest lucru înseamnă informații greșite transmise clienților, cu impact direct asupra încrederii și, uneori, asupra obligațiilor legale.

Cele trei strategii pentru a „învăța" un LLM date noi

StrategieCum funcționeazăCând se recomandă
Prompt stuffingInserați tot conținutul relevant direct în promptul de sistemVolum foarte mic de date (câteva pagini), fără actualizări frecvente
Fine-tuningReantrenați parțial modelul pe datele propriiAveți nevoie să schimbați stilul/comportamentul modelului, nu doar cunoștințele; costisitor și greu de actualizat
RAG (Retrieval-Augmented Generation)Căutați datele relevante în timp real dintr-o bază externă și le adăugați în context înainte de răspunsVolum mare de date, actualizări frecvente, nevoie de răspunsuri verificabile - recomandat pentru majoritatea afacerilor
De ce RAG câștigă în majoritatea cazurilor: Actualizați baza de cunoștințe (adăugați un document nou, modificați un preț) fără să reantrenați nimic - modelul „vede" automat informația actualizată la următoarea interogare. Costul este mult mai mic decât fine-tuning-ul, iar răspunsurile pot fi însoțite de sursa exactă din care provin.

RAG nu elimină halucinațiile, le reduce drastic

Este important de precizat de la început: RAG nu este o soluție magică 100% infailibilă. Un chatbot RAG poate încă halucina dacă baza de cunoștințe este incompletă, dacă întrebarea este ambiguă, sau dacă modelul „inventează" pe lângă contextul furnizat. Capitolul 11 din acest ghid tratează exact această problemă și modul în care o gestionați prin guardrails și evaluare continuă.

Context window vs. bază de cunoștințe

O confuzie frecventă: „dacă modelele au acum ferestre de context de 200.000 sau chiar 1 milion de tokeni, de ce mai avem nevoie de RAG?" Răspunsul are trei componente:

  • Cost - trimiterea a sute de pagini la fiecare întrebare este scumpă, chiar dacă tehnic este posibilă
  • Viteză - context mai mare înseamnă timp de răspuns mai mare
  • Precizie - modelele găsesc mai ușor informația relevantă într-un context restrâns (câteva fragmente relevante), decât „îngropată" în mii de pagini irelevante

RAG rezolvă exact această problemă: în loc să trimiteți toată documentația, trimiteți doar fragmentele cu adevărat relevante pentru întrebarea pusă, selectate automat printr-o căutare semantică. Modul concret în care se întâmplă acest lucru este subiectul capitolului următor.

Continuați cu restul cursului

Acesta este capitolul 2 din cele 14 ale cursului, cu 5 lecții din 82. Cumpărați cursul și parcurgeți tot conținutul în cont, cu progres salvat, test final și certificat.

Cumpărați cursul la 130 €