Pentru a scrie prompturi eficiente, trebuie să înțelegeți cum „gândește" un model de limbaj. Large Language Models (LLM-uri) sunt rețele neurale masive antrenate pe cantități imense de text, care au învățat să prezică următorul cuvânt dintr-o secvență.
Cum funcționează modelele AI (LLM-uri)
Pentru a scrie prompturi eficiente, trebuie să înțelegeți cum „gândește" un model de limbaj. Large Language Models (LLM-uri) sunt rețele neurale masive ant...
Introducere
Ce este un LLM
Un LLM este, la bază, un sistem de predicție statistică extrem de sofisticat. Când îi dați un prompt, modelul calculează probabilitățile pentru fiecare cuvânt următor și alege pe cel mai potrivit în context. Acest proces se repetă token cu token până la completarea răspunsului.
Tokeni - unitatea de bază
Modelele nu procesează cuvinte, ci tokeni. Un token poate fi un cuvânt, o silabă sau chiar un caracter. În medie, 1 cuvânt ≈ 1.3 tokeni în limba engleză și ≈ 1.5-2 tokeni în limba română (datorită diacriticelor și structurii diferite). Un text de 1.000 de cuvinte în română are aproximativ 1.500-2.000 de tokeni.
Modele populare în 2026
| Model | Companie | Puncte forte |
|---|---|---|
| Claude Opus 4.6 | Anthropic | Raționament avansat, cod, context 200K, siguranță |
| Claude Sonnet 4.6 | Anthropic | Echilibru performanță/viteză, cost eficient |
| GPT-4o | OpenAI | Multi-modal, viteză bună, ecosistem extins |
| Gemini 2.0 | Context 1M+, integrare Google, multi-modal | |
| Llama 3.1 | Meta | Open-source, rulare locală, cost zero |
| Mistral Large | Mistral AI | Performanță europeană, eficiență, multilingv |
Parametri importanți
Când interacționați cu un LLM (mai ales prin API), aveți control asupra mai multor parametri care influențează răspunsul:
Temperature
Controlează „creativitatea" modelului. Valori între 0 și 1 (sau 2 la unele modele).
- 0.0 - 0.3 - răspunsuri deterministe, factuale, repetabile (ideal pentru cod, extracție date)
- 0.4 - 0.7 - echilibru între creativitate și precizie (ideal pentru conținut general)
- 0.8 - 1.0 - răspunsuri creative, variate, imprevizibile (ideal pentru brainstorming, ficțiune)
Top-p (Nucleus Sampling)
Limitează selecția la tokenii cu cea mai mare probabilitate cumulativă. Un top-p de 0.9 înseamnă că modelul alege doar din tokenii care acoperă 90% din probabilitate.
Max Tokens
Limita maximă a răspunsului. Important de setat pentru a controla lungimea și costul.
Stop Sequences
Secvențe de caractere care opresc generarea. Util pentru a controla formatul output-ului.
Fereastra de context
Fereastra de context reprezintă cantitatea totală de text (prompt + răspuns) pe care modelul o poate procesa într-o singură interacțiune:
| Model | Context | Echivalent aproximativ |
|---|---|---|
| Claude Opus 4.6 | 200K tokeni | ~500 pagini A4 |
| Claude (Extended) | 1M tokeni | ~2.500 pagini A4 |
| GPT-4o | 128K tokeni | ~320 pagini A4 |
| Gemini 2.0 | 2M tokeni | ~5.000 pagini A4 |
Ce NU poate face un LLM
- Nu are acces la internet în timp real (fără tool use)
- Nu „știe" informații - prezice text bazat pe antrenament
- Nu are memorie între conversații separate
- Poate „hallucina" - genera informații false dar plauzibile
- Nu înțelege cu adevărat - procesează pattern-uri statistice
- Are un knowledge cutoff - nu știe evenimentele recente
Înțelegerea acestor limitări este esențială pentru prompt engineering. Când știți ce poate și ce nu poate face modelul, puteți formula prompturi care maximizează punctele forte și minimizează slăbiciunile.
Continuați cu restul cursului
Acesta este capitolul 2 din cele 14 ale cursului, cu 6 lecții din 82. Cumpărați cursul și parcurgeți tot conținutul în cont, cu progres salvat, test final și certificat.
Cumpărați cursul la 110 €