Nu trebuie să înțelegeți matematica din spatele acestor modele pentru a le folosi eficient, dar câteva concepte de bază vă ajută să scrieți prompturi mai bune și să înțelegeți de ce apar anumite erori (mișcări nefiresti, obiecte care se transformă brusc, degete în plus).
Cum funcționează modelele text-to-video
Nu trebuie să înțelegeți matematica din spatele acestor modele pentru a le folosi eficient, dar câteva concepte de bază vă ajută să scrieți prompturi mai b...
Introducere
Modele de difuzie (diffusion models)
Majoritatea instrumentelor de video AI (Sora, Veo, Kling, Luma) se bazează pe modele de difuzie. Principiul, simplificat:
- Modelul este antrenat pornind de la video real, peste care se adaugă treptat „zgomot" digital, până când imaginea devine complet neinteligibilă
- Modelul învață procesul invers - cum să elimine zgomotul, pas cu pas, pentru a reconstitui un video coerent
- La generare, se pornește de la zgomot pur, iar modelul „curăță" acest zgomot în mai mulți pași, ghidat de promptul text, până rezultă un clip video
Transformer + difuzie (Diffusion Transformer)
Modelele de ultimă generație (inclusiv Sora și Veo) combină arhitectura de difuzie cu transformere, aceeași arhitectură care stă la baza modelelor de limbaj precum Claude sau GPT. Video-ul este împărțit în „patch-uri" spațio-temporale (bucăți mici din cadru, urmărite în timp), procesate similar cu modul în care un model de limbaj procesează cuvinte.
Textul devine ghidaj vizual
Un encoder de text transformă promptul dvs. într-o reprezentare numerică (embedding), care ghidează fiecare pas al procesului de eliminare a zgomotului. Cu cât promptul este mai specific și mai bine structurat, cu atât modelul are informații mai clare despre ce anume trebuie să apară în cadru, cum se mișcă și cum arată vizual.
Consistența temporală
Cea mai mare provocare tehnică a video AI nu este generarea unui cadru realist, ci menținerea coerenței între cadre succesive - ca personajul să rămână același, obiectele să nu se transforme și fizica să pară plauzibilă. Modelele din 2026 abordează problema prin:
- Atenție temporală extinsă - modelul „vede" simultan mai multe cadre din jurul celui curent, nu doar cadrul izolat
- World-state persistence - reprezentarea internă a scenei (poziții, obiecte, lumină) se păstrează pe mai multe planuri/tăieturi succesive
- Modele „reasoning" (ex. Luma Ray3) - modelul își evaluează propriul rezultat și reîncearcă generarea înainte de a vă afișa clipul final
Generarea audio sincronizată
Până în 2024, video-ul generat era mut - sunetul se adăuga separat, în etapa de editare. Începând cu Veo 3 (2025) și apoi Sora 2, Kling 2.6, modelele generează video și audio simultan, sincronizate nativ: dialog, sunete ambientale și muzică apar direct în clipul generat, aliniate cu mișcarea buzelor și acțiunea din cadru.
| Componentă | Rol |
|---|---|
| Text encoder | Transformă promptul în reprezentare numerică (embedding) |
| Diffusion Transformer (DiT) | Elimină treptat zgomotul, ghidat de embedding, generând cadre video |
| Modul temporal | Menține coerența subiectului și a mișcării între cadre |
| Modul audio | Generează dialog, sunet ambiental și muzică sincronizate cu imaginea |
| Decoder video | Transformă reprezentarea internă în pixeli, la rezoluția și rata de cadre cerută |
Rezoluție și rată de cadre
La generare, alegeți rezoluția și rata de cadre în funcție de destinația finală a clipului, nu automat la valoarea maximă disponibilă - fiecare treaptă suplimentară crește semnificativ costul și timpul de generare.
| Parametru | Valori uzuale | Recomandare |
|---|---|---|
| Rezoluție | 720p, 1080p, 4K | 720p pentru teste, 1080p pentru social media, 4K doar pentru livrabile finale |
| Rată de cadre | 24, 30, 60 fps | 24-30 fps pentru majoritatea conținutului, 60 fps pentru mișcare rapidă/sport |
| Raport de aspect | 16:9, 9:16, 1:1, 4:5 | Generați direct în formatul platformei țintă, nu recadrați ulterior |
Costul de calcul (compute)
Fiecare secundă de video generat necesită mult mai multă putere de calcul decât o singură imagine, pentru că modelul trebuie să genereze zeci de cadre coerente între ele, nu unul singur. De aceea, prețul video AI se calculează aproape universal per secundă de output, spre deosebire de generarea de imagini, unde prețul este de regulă per imagine.
Continuați cu restul cursului
Acesta este capitolul 2 din cele 14 ale cursului, cu 8 lecții din 91. Cumpărați cursul și parcurgeți tot conținutul în cont, cu progres salvat, test final și certificat.
Cumpărați cursul la 90 €