Capitol gratuit

Cum funcționează modelele AI (LLM-uri)

Pentru a scrie prompturi eficiente, trebuie să înțelegeți cum „gândește" un model de limbaj. Large Language Models (LLM-uri) sunt rețele neurale masive ant...

Introducere

Pentru a scrie prompturi eficiente, trebuie să înțelegeți cum „gândește" un model de limbaj. Large Language Models (LLM-uri) sunt rețele neurale masive antrenate pe cantități imense de text, care au învățat să prezică următorul cuvânt dintr-o secvență.

Ce este un LLM

Un LLM este, la bază, un sistem de predicție statistică extrem de sofisticat. Când îi dați un prompt, modelul calculează probabilitățile pentru fiecare cuvânt următor și alege pe cel mai potrivit în context. Acest proces se repetă token cu token până la completarea răspunsului.

Tokeni - unitatea de bază

Modelele nu procesează cuvinte, ci tokeni. Un token poate fi un cuvânt, o silabă sau chiar un caracter. În medie, 1 cuvânt ≈ 1.3 tokeni în limba engleză și ≈ 1.5-2 tokeni în limba română (datorită diacriticelor și structurii diferite). Un text de 1.000 de cuvinte în română are aproximativ 1.500-2.000 de tokeni.

Modele populare în 2026

ModelCompaniePuncte forte
Claude Opus 4.6AnthropicRaționament avansat, cod, context 200K, siguranță
Claude Sonnet 4.6AnthropicEchilibru performanță/viteză, cost eficient
GPT-4oOpenAIMulti-modal, viteză bună, ecosistem extins
Gemini 2.0GoogleContext 1M+, integrare Google, multi-modal
Llama 3.1MetaOpen-source, rulare locală, cost zero
Mistral LargeMistral AIPerformanță europeană, eficiență, multilingv

Parametri importanți

Când interacționați cu un LLM (mai ales prin API), aveți control asupra mai multor parametri care influențează răspunsul:

Temperature

Controlează „creativitatea" modelului. Valori între 0 și 1 (sau 2 la unele modele).

  • 0.0 - 0.3 - răspunsuri deterministe, factuale, repetabile (ideal pentru cod, extracție date)
  • 0.4 - 0.7 - echilibru între creativitate și precizie (ideal pentru conținut general)
  • 0.8 - 1.0 - răspunsuri creative, variate, imprevizibile (ideal pentru brainstorming, ficțiune)

Top-p (Nucleus Sampling)

Limitează selecția la tokenii cu cea mai mare probabilitate cumulativă. Un top-p de 0.9 înseamnă că modelul alege doar din tokenii care acoperă 90% din probabilitate.

Max Tokens

Limita maximă a răspunsului. Important de setat pentru a controla lungimea și costul.

Stop Sequences

Secvențe de caractere care opresc generarea. Util pentru a controla formatul output-ului.

Sfat practic: Pentru majoritatea cazurilor, lăsați temperature la valoarea implicită (0.7-1.0 pentru Claude) și concentrați-vă pe calitatea promptului. Un prompt bun la temperature 1.0 bate un prompt slab la temperature 0.

Fereastra de context

Fereastra de context reprezintă cantitatea totală de text (prompt + răspuns) pe care modelul o poate procesa într-o singură interacțiune:

ModelContextEchivalent aproximativ
Claude Opus 4.6200K tokeni~500 pagini A4
Claude (Extended)1M tokeni~2.500 pagini A4
GPT-4o128K tokeni~320 pagini A4
Gemini 2.02M tokeni~5.000 pagini A4

Ce NU poate face un LLM

Limitări importante de reținut:
  • Nu are acces la internet în timp real (fără tool use)
  • Nu „știe" informații - prezice text bazat pe antrenament
  • Nu are memorie între conversații separate
  • Poate „hallucina" - genera informații false dar plauzibile
  • Nu înțelege cu adevărat - procesează pattern-uri statistice
  • Are un knowledge cutoff - nu știe evenimentele recente

Înțelegerea acestor limitări este esențială pentru prompt engineering. Când știți ce poate și ce nu poate face modelul, puteți formula prompturi care maximizează punctele forte și minimizează slăbiciunile.

Continuați cu restul cursului

Acesta este capitolul 2 din cele 14 ale cursului, cu 6 lecții din 82. Cumpărați cursul și parcurgeți tot conținutul în cont, cu progres salvat, test final și certificat.

Cumpărați cursul la 110 €