Kvalita výstupů umělé inteligence v oblasti obrázků i videa se posunula mílovými kroky. Modely jako Seedance 2.5 dokážou vytvořit až 30 vteřin videa včetně prostřihů a zvuků a zároveň se držet zadaného scénáře. Jak ale s pomocí AI vytvořit video, které nevypadá jako „AI slop“ a je skutečně použitelné pro firemní účely?
Obsah článku
Pokud jste jako já a rádi testujete nové věci, umělá inteligence přináší prakticky nekonečné možnosti. AI má samozřejmě i spoustu negativních dopadů – psali jsme například o tom, zda nahradí umělá inteligence zaměstnance, či o tom, proč díky AI stoupají ceny pamětí a hardwaru. V tomto článku se ale chci zaměřit na její pozitivní přínosy a ukázat, jak jsem s pomocí AI dokázal vytvořit následující video, jehož realizace by při běžné produkci a natáčení kamerou byla pro naši firmu rozpočtově nereálná.
Následující článek popisuje jednotlivé složky videa a procesy vedoucí k jeho vzniku.
1. Kreativita a nápady s pomocí AI
Dokáže AI přijít s inovativními nápady?
Osobně mi přijde, a možná se o tom dá částečně spekulovat, že AI stále není schopna přijít se skutečně unikátními nápady. Přeci jen, není to „skutečná“ inteligence – je to chytrý doplňovač slov, který hledá způsoby, jak vyřešit zadaný úkol, bez ohledu na širší kontext a následky – podobně jako v případě nedávného hacku Hugging Face od modelů OpenAI.
Setkáváme se s články o tom, že modely přišly s řešením matematických problémů, které lidé nedokázali vyřešit. Pomáhají v oblasti medicíny, chemie nebo fyziky. Mnohdy ale jde především o využití a kombinaci existujících prací lidí.
Na rozdíl od člověka dokáže umělá inteligence zpracovat obrovské množství dat a informací a efektivně je využít. Já jako člověk nemám šanci informace v takovém rozsahu zpracovat, a právě v tom je síla AI. Dokáže poskládat menší řešení do nového celku, ze kterého mohou vzniknout nové výsledky. Čistě z informací, bez existujících postupů a předchozích zkušeností, by ale podle mě model pravou kreativitu, jak ji známe u lidí, nenašel.
Příkladem může být automatické řízení. V 99 % situací již auto dokáže řídit bez problémů samo. Problémem je ale zbývající jedno procento – situace, které AI nezná nebo na ně není vycvičena a které vyžadují kreativní řešení v daném okamžiku. A právě to AI stále nezvládá.
Umělá inteligence nemá tělo, hormony ani emoce a není vystavena přímému vnímání okolního světa. Naše zkušenosti a zážitky jsou propojené s biologickou odezvou, což je činí unikátními a vytváří naši jedinečnost. Lidská kreativita není jen otázkou znalostí a informací, ale také mnoha dalších faktorů, které nelze jednoduše převést na čísla a spočítat – tedy alespoň prozatím.
Jak využít kreativitu AI prakticky
Umělou inteligenci používám pravidelně od příchodu ChatGPT 3.5 a jedno je pro mě jasné – opravdu kreativní nápady od ní nedostanu. AI mi poskytne spíše databázi recyklovaných nápadů, které již v nějaké podobě existují. Pokud chci unikátní obsah, který jinde v dané formě neexistuje, musím využít vlastní, lidskou kreativitu. V případě naší videoreklamy přišel nápad samovolně, aniž bych předtím dostal zadání typu „Vytvoř reklamní video pro kyberbezpečnost“.
Mám to štěstí, že pracuji ve firmě, kde marketing není jen o výkonu a honění čísel a statistik – výkonostní marketing ani není mou doménou, specializuji se na obsahový. V Solutia mám prostor k testování a experimentování, takže můj výstup ani kreativita nejsou zbytečně limitované. Můj mozek a podvědomí mají prostor přemýšlet nad věcmi bez předem nastavených omezení, a díky tomu často přicházejí nápady samy. Stačí se občas cíleně nudit a netříštit si neustále pozornost na sociálních sítích, které s výjimkou LinkedInu nemám a nepoužívám – věta, kterou by většina markeťáků asi nepronesla.
Mimochodem, pokud i vy hledáte prostředí menší firmy, ve kterém je prostor pro vlastní nápady a testování hranic, pak mrkněte na naše volná místa v IT.
Abych myšlenku sjednotil – opravdu kreativní nápad AI (zatím) neposkytne. Kde ale nabízí fantastickou podporu, je rozšiřování a vylepšování existujícího nápadu – v tomto ohledu jde o skvělého parťáka, nebo rovnou skupinu parťáků pro brainstorming a vylepšování nápadů. Stačí nápad zapsat či nadiktovat, dodat maximum kontextu a AI poté dokáže navrhnout spoustu možností, jak ho dále rozvinout. Může jít o humor, detaily nebo úhly pohledu, které by mě samotného nenapadly.
Kdybych měl vyhodnotit, jak velký vliv měla AI na scénář daného videa, řekl bych 70 % já a 30 % AI. Hlavní přínos umělé inteligence nebyl v konceptu ani příběhu. AI nenapadlo vložit do scény zvíře ani hlášku „Františku, oběd“. Největší přínos měla při návrhu jednotlivých scén vycházejících z příběhu, který jsem vymyslel já – a k tomu se dostaneme dále.
Tip: AI je skvělý nástroj pro „vžití se do postavy“. Může to být slavná osobnost nebo třeba zákazník vašich služeb, se kterým můžete probírat jeho potřeby a problémy. Stačí umělé inteligenci říct, kdo daná postava je a jak se má chovat. Využití postav je pro marketing skvělý nástroj.
Použité nástroje pro brainstorming:
- ChatGPT 5.6 Sol
- Claude Fable 5
2. Tvorba obrázků s umělou inteligencí
Když chcete vytvořit video pomocí AI, běžnou možností je generování textu na video nebo třeba obrázku na video. Úpravu existujících videí, mluvící hlavy nebo převod jednoduchých animací na komplexní vizualizace reálného světa v tomto článku pokrývat nebudeme.
Dlouhodobým problémem při generování obrázků a videí byla konzistence postav – tedy použití stejné postavy, například konkrétní osoby, napříč více obrázky či videi. V dnešní době je ale tento problém z velké části vyřešen. Jako zdroj si stačí vytvořit takzvaný „character sheet“, tedy obrázkové a případně i doplňující textové znázornění postavy.
Pro naše video jsem si vytvořil obrázek dvou operativců. Jelikož mají podobné oblečení a prakticky stejnou postavu, neřešil jsem komplexní character sheet pro každou postavu zvlášť z více úhlů.

Použitý character sheet
Velmi jednoduchý character sheet pro konzistenci postav napříč obrázky/videem
Pokud ale budeme mít ve videu více zcela rozdílných osob, je vhodné pro každou z nich vytvořit vlastní character sheet – tedy vizuální přehled, na kterém bude kompletní postava viditelná z více úhlů, případně i detail obličeje z různých stran. Je možné si k tomu vytvořit třeba i emotional sheet – tedy přehled toho, jak postava prožívá různé emoce.
Jak může vypadat takový prompt (příklad pro ChatGPT, který umí generovat série obrázků):
- „Budu vytvářet video [popis konceptu]. Bude v něm postava [popis, věk, vlastnosti, oblečení atd.]. Navrhni mi tři odlišné varianty. Styl je [fotorealistický / 3D animace / 2D ilustrace atd.].“
- Z návrhů si vyberu ten nejvhodnější, případně požádám o další varianty, pokud nebudu spokojený – pro další návrhy je vhodné AI popsat, co se mi na předchozích líbilo a nelíbilo.
- „Líbí se mi varianta X, vytvoř mi kompletní character sheet postavy z více úhlů. Character sheet poté použiji pro tvorbu obrázků a videí s pomocí AI.“
Obrázky character sheetů si uložím do počítače a následně si vytvořím obrázek ukázkové scény v daném prostředí. Přiložím character sheet, znovu popíšu kontext – pro jaké použití obrázek bude a proč ho vytvářím -, určím styl (např. zda jde o reklamu ve filmovém fotorealistickém stylu, nebo o ilustraci ve stylu Pixaru) a požádám o návrh obrázku či série obrázků, ze kterých si mohu vybrat vhodný vzor.

Typický character sheet
Detailnější character sheet s postavou znázorněnou z více úhlů
Tip: Pokud bych dělal video, které se odehrává v jedné místnosti, je vhodné si vytvořit i environment sheet pro danou místnost a zmapovat ji z více úhlů. Díky tomu pak dokážu udržet konzistenci prostředí.
V mém případě jsem postupoval tak, že jsem měl naplánovanou celou sérii scén – padáky nad výškovou budovou v Praze, pohyb na střeše budovy, prolomení zámku, strážného v chodbě a serverovnu. Jelikož jsem už celý scénář řešil s Claudem, požádal jsem ho, aby mi vytvořil prompt pro vyhotovení série obrázků. Ten jsem poté vložil do ChatGPT, přiložil character sheet a získal všechny obrázky v řadě.
Použitý prompt pro sérii obrázků Kliknutím zobrazíte celý prompt pro osm navazujících scén
@Create image
Using the attached character reference sheet, generate a series of 8 cinematic film stills forming one continuous action-thriller sequence. Keep the two operatives' gear, proportions and details exactly as in the reference sheet in every frame.
GLOBAL STYLE for all 8 images: cinematic film still from a modern action-thriller movie, night scene. Color palette: deep blue night tones, cold teal highlights, warm amber city lights in the distance. Anamorphic lens, shallow depth of field, subtle film grain, high contrast, moody cinematic lighting. Photorealistic, 16:9 widescreen. Faces never visible behind dark visors. No text, no logos, no captions or readable UI anywhere in any image. Consistent lighting logic and color grading across all frames. WEAPONS RULE: the operatives carry only the holstered pistols from the reference sheet — no rifles, no submachine guns, no other weapons in any frame; a pistol may appear in hand only where a scene explicitly says so, and then the belt holster must be visibly empty. The city is Prague, Czech Republic.
SCENE 1 — Aerial top-down shot: two dark rectangular parachutes descending through the night sky above Prague, Czech Republic, heading toward the rooftop of a modern glass high-rise tower. Far below, recognizable night-time Prague: the Vltava river with its illuminated bridges, the warm amber glow of the historic city center with Prague Castle in the distance. The canopies are small in frame, emphasizing the vast drop. Moonlight rim-lighting on the fabric.
SCENE 2 — Low-angle wide shot on the skyscraper rooftop: both operatives crouched in landing position, dark parachute fabric still settling behind them in the wind. In the background the recognizable night panorama of Prague: the illuminated Prague Castle and cathedral silhouette on the horizon, warm amber glow of the historic center below. Rooftop ventilation units silhouetted, moonlight rim-lighting on their helmets.
SCENE 3 — Extreme close-up: Operative A's gloved hand pressing a small sleek black electronic device against a wall-mounted card reader next to a steel rooftop service door. The reader's LED glows red. Shallow depth of field, Operative B blurred in the background keeping watch. Heist-movie tension.
SCENE 4 — Dark industrial service stairwell inside the building: both operatives descending, seen from below, helmet-mounted flashlights cutting visible cones of light through faint dust haze. Each operative holds their pistol in a two-handed low-ready grip pointed downward; both belt holsters are visibly empty. No other weapons. Concrete walls, steel railings, pipes, dim red emergency lighting. Dynamic diagonal composition.
SCENE 5 — Dark corporate corridor: Operative A pressed flat against the wall in deep shadow, frozen mid-motion. Around the corner ahead, a bright flashlight beam of an unseen security guard sweeps across the floor. A wall-mounted CCTV camera with a blinking red LED points down the corridor. Chiaroscuro lighting.
SCENE 6 — Compact corporate server room inside an office high-rise, realistic scale: a single short aisle with three or four server rack cabinets on each side, blinking blue and green LEDs, low suspended ceiling, cable trays overhead, thin cold-air fog hugging the raised floor. Operative A walks down the short aisle toward the camera, silhouetted, his shoulders almost filling the narrow space. One-point perspective, symmetrical composition. The room clearly ends after a few meters — a small dedicated server room, NOT a huge datacenter hall.
SCENE 7 — Close-up inside the server room: Operative A's gloved hands connecting a compact black device with a single cable into an open server rack. Small status LEDs on the device begin to glow. Blue rack LEDs reflected in the dark helmet visor above. Shallow depth of field.
SCENE 8 — Extreme close-up of the small rugged device screen showing an abstract glowing progress bar almost full, abstract UI elements only — no readable text or numbers. The screen's glow reflected in the dark tactical visor leaning over it. Red accent light beginning to pulse, peak-tension moment.
@Vytvoř obrázek
S využitím přiloženého referenčního listu postav vytvoř sérii 8 filmových záběrů, které tvoří jednu souvislou sekvenci z akčního thrilleru. V každém snímku zachovej vybavení, proporce a detaily obou operativců přesně podle referenčního listu.
GLOBÁLNÍ STYL pro všech 8 obrázků: filmový záběr z moderního akčního thrilleru, noční scéna. Barevná paleta: hluboké modré noční tóny, chladné tyrkysové odlesky, teplá jantarová světla města v dálce. Anamorfický objektiv, malá hloubka ostrosti, jemné filmové zrno, vysoký kontrast, náladové filmové osvětlení. Fotorealistické provedení, širokoúhlý formát 16:9. Tváře nesmí být za tmavými hledími nikdy viditelné. Na žádném obrázku nesmí být text, loga, titulky ani čitelné uživatelské rozhraní. Ve všech snímcích zachovej konzistentní logiku osvětlení a barevné ladění. PRAVIDLO PRO ZBRANĚ: operativci mají pouze pistole v pouzdrech z referenčního listu — žádné pušky, samopaly ani jiné zbraně v žádném snímku; pistole se smí objevit v ruce pouze ve scéně, která to výslovně uvádí, a v takovém případě musí být pouzdro na opasku viditelně prázdné. Městem je Praha v České republice.
SCÉNA 1 — Letecký záběr kolmo shora: dva tmavé obdélníkové padáky klesají noční oblohou nad Prahou v České republice směrem ke střeše moderní skleněné výškové budovy. Hluboko pod nimi je rozpoznatelná noční Praha: Vltava s osvětlenými mosty, teplá jantarová záře historického centra a v dálce Pražský hrad. Padáky jsou v záběru malé, což zdůrazňuje obrovskou výšku. Měsíční světlo vytváří na látce konturové osvětlení.
SCÉNA 2 — Široký záběr z podhledu na střeše mrakodrapu: oba operativci jsou přikrčení v přistávací pozici, zatímco se za nimi ve větru ještě usazuje látka tmavých padáků. V pozadí je rozpoznatelné noční panorama Prahy: osvětlený Pražský hrad a silueta katedrály na obzoru, pod nimi teplá jantarová záře historického centra. Siluety střešních ventilačních jednotek, měsíční konturové osvětlení na helmách.
SCÉNA 3 — Extrémní detail: ruka operativce A v rukavici přikládá malé elegantní černé elektronické zařízení ke čtečce karet umístěné na stěně vedle ocelových servisních dveří vedoucích na střechu. LED dioda čtečky svítí červeně. Malá hloubka ostrosti, operativec B je rozostřený v pozadí a hlídá okolí. Napětí ve stylu filmu o loupeži.
SCÉNA 4 — Tmavé industriální servisní schodiště uvnitř budovy: oba operativci sestupují dolů, záběr je veden zespodu. Svítilny na helmách vytvářejí viditelné kužely světla v jemném prachovém oparu. Každý operativec drží pistoli oběma rukama v pohotovostním úchopu se zbraní sklopenou dolů; obě pouzdra na opascích jsou viditelně prázdná. Žádné jiné zbraně. Betonové stěny, ocelová zábradlí, potrubí, tlumené červené nouzové osvětlení. Dynamická diagonální kompozice.
SCÉNA 5 — Tmavá firemní chodba: operativec A je přitisknutý ke stěně v hlubokém stínu a nehybně vyčkává. Za rohem před ním přejíždí po podlaze jasný paprsek svítilny neviditelného člena ostrahy. Kamera bezpečnostního systému umístěná na stěně s blikající červenou LED diodou míří do chodby. Šerosvitné osvětlení.
SCÉNA 6 — Kompaktní firemní serverovna v kancelářské výškové budově, realistické rozměry: jedna krátká ulička se třemi nebo čtyřmi serverovými racky po každé straně, blikající modré a zelené LED diody, nízký podhled, kabelové žlaby nad hlavou a tenká vrstva mlhy z chladného vzduchu těsně nad zdvojenou podlahou. Operativec A kráčí krátkou uličkou směrem ke kameře jako silueta, jeho ramena téměř vyplňují úzký prostor. Jednoúběžníková perspektiva, symetrická kompozice. Místnost po několika metrech zřetelně končí — jde o malou vyhrazenou serverovnu, NE o obrovskou halu datového centra.
SCÉNA 7 — Detail uvnitř serverovny: ruce operativce A v rukavicích připojují kompaktní černé zařízení jediným kabelem do otevřeného serverového racku. Na zařízení se začínají rozsvěcet malé stavové LED diody. Modré diody racku se odrážejí v tmavém hledí helmy nad zařízením. Malá hloubka ostrosti.
SCÉNA 8 — Extrémní detail obrazovky malého odolného zařízení, na níž je téměř dokončený abstraktní svítící ukazatel průběhu a pouze abstraktní prvky uživatelského rozhraní — žádný čitelný text ani čísla. Záře obrazovky se odráží v tmavém taktickém hledí, které se nad ní sklání. Začíná pulzovat červené akcentní světlo, okamžik vrcholného napětí.
A zde jsou výsledné obrázky. Obrázek osm byl později nahrazen za jiný, video animace z něj nebyla optimální.
Je vhodné poskytnou umělé inteligenci co nejvíce kontextu o tom, co dělám, a poté ji využít k tomu, aby mi připravila prompty pro vytváření obrázků a jednotlivých scén. Nemusím tak pokaždé vše popisovat ručně.
Tip: Občas narazíte na věci, které generování obrázků či videí prostě nezvládá. Původně jsem si představoval začátek videa tak, že operativci vystřelí lano ze střechy naproti výškové budově, poté po něm sjedou a dostanou se do budovy oknem. Výstřel lana byl ale vizuálně problematický – jednak bylo potřeba znázornit reálný nástroj, který lano vystřelí (zde bych mohl najít fotografii nástroje a vložit ji jako kontext), a zároveň správně zobrazit ukotvení konce lana. AI vytvářela nerealisticky obří přísavku na zeď v porovnání s budovou i samotným lanem. Vzhledem k tomu, že by generování videa mohlo narážet na podobné problémy, rozhodl jsem se změnit úvod na padáky, čímž se všechny tyto potíže vyřešily. Při práci s AI obrazem je tedy občas nutné upravit scénář tak, aby byla jeho vizuální stránka proveditelná bez zbytečných komplikací.

Ukázka nepovedeného obrázku
Konec vystřeleného lana má obří/nerealistickou přísavku na sklo. Zbraň je vzhledem k délce lana asi také nerealistická.
Použité nástroje pro tvorbu obrázků:
- Claude Opus 5 pro tvorbu promptů jednotlivých scén
- ChatGPT Images 2.0
3. Tvorba videí s umělou inteligencí
Tvorba videí pomocí AI modelů je jednou z oblastí, kde je mezi prvními videi před pár lety a aktuálními výstupy vidět obrovský posun. Ať už jde o rychlost vytvoření, možnou délku scény, kvalitu samotného videa a prokreslení postav či jejich pohybu, konzistenci postav na základě zdrojů, prostředí, fyziku nebo rozlišení videa. To vše se posunulo obrovsky dopředu, zároveň je ale nutné počítat s tím, že tvorba videí je výpočetně náročná a není zdarma.
Jak jsem již zmiňoval, modely mohou tvořit videa na základě textových pokynů, ale také vložených zdrojů. Do nových typů Omni modelů, které zvládají vše – text, zvuk, obrázky i video – můžete vložit velké množství podkladů (u některých modelů až 50 zdrojů). Mohou to být popisy, character sheety, obrázky prostředí, náčrty scén, zvuky nebo vzorové animace – model pak vygeneruje video na základě těchto vstupů.
Je ale nutné počítat s tím, že čím více komplexnosti a zdrojů přidáte, tím větší je prostor pro chyby a pro výsledek, který nebude odpovídat očekávání. Když pak vezmeme v úvahu cenu generování videa, která se může pohybovat v dolarech za několik sekund výsledného materiálu, bývá experimentování v této oblasti finančně náročnější.
V mém případě jsem chtěl generovat jednotlivé scény jednu po druhé, abych je poté ručně sestříhal do výsledného videa. Nepotřeboval jsem tedy model jako Seedance 2.5, který dokáže vygenerovat více scén za sebou. Potřeboval jsem hlavně konzistenci prostředí a postav, což jsem vyřešil tak, že jsem si nejprve vytvořil jednotlivé scény jako obrázky a následně na jejich základě generoval videa.
Co se týče tvorby videa z obrázku, zdrojový obrázek většinou slouží jako počáteční snímek (čím video začíná) nebo koncový snímek (čím video končí). Mohu ale vložit i dva různé obrázky – počáteční a koncový – a popsat, jakou animaci mezi nimi chci vytvořit.
Použité technologie pro tvorbu videa
Původně jsem zkoušel generovat video pomocí modelů od Googlu – Gemini Omni a Gemini Veo 3.1. Pro samotné generování jsem použil Google Flow, což je studio pro tvorbu videí. Gemini Omni nebyl pro danou situaci příliš vhodný a výsledné animace byly, řekněme, úsměvné – se spoustou chyb a vizuálních nelogičností.
Jako příklad přikládám video, ve kterém operativci místo směřování na střechu končí nad mostem, v pozadí se objevuje několik Pražských hradů a samotní operativci se slučují a rozmnožují – klasické potíže AI modelu, který pro danou scénu nemá dostatek inteligence (Google Omni):
Zkoušel jsem i Veo 3.1, které bylo lepší, ale kvalita obrazu mi stále nepřišla dostatečná – ani po využití upscalingu na 1080p (upscaling je umělé zvýšení rozlišení). Rozhodl jsem se proto hledat alternativní řešení.
Tip: Pokud chcete vyzkoušet generování videí z obrázků, fotografií nebo třeba úpravu existujícího videa, modely od Googlu mohou být dobrým řešením – zvlášť pokud máte předplatné Gemini, které vám poskytuje kredity pro generování videí.
Pro kreativce bývá nejlepší volbou využít prostředí, ve kterém lze testovat různé modely – například Artlist, Higgsfield, Krea, Magnific, Hedra a podobně. Nechtělo se mi ale zatím investovat do dalších předplatných nebo kreditů, dokud jsem neměl jistotu, že bude video proveditelné. Pak jsem si uvědomil, že už mám předplatné Adobe, a otevřel jsem Adobe Firefly. To nabízí více modelů a především mám v rámci předplatného k dispozici měsíční kredity pro generování videí.
Pro první zkoušku jsem zvolil nejlevnější Kling 3.0, rozlišení 1080p, délku klipu 5 vteřin a generování bez audia. Vložil jsem pouze počáteční obrázek a prompt pro scénu zkopíroval od Claude, který mi vytvořil nejen prompty pro tvorbu obrázků, ale i prompty pro tvorbu videí z daných obrázků. Výsledek byl skvělý.
Následně jsem vygeneroval všechny scény, přičemž každé generování v průměru zabralo 3-7 minut. Zhruba 50 % pokusů se nepovedlo – generování skončilo chybou, případně se ve výsledku objevil nějaký vizuální či animační problém. Podle konkrétní chyby jsem pak musel upravit prompt.
Například když jsem generoval scénu, ve které dva operativci scházejí po schodech dolů, v prvním videu měli naprosto totožné kroky a pohyby – výsledkem byl prakticky synchronizovaný balet.
Prompt pro tvorbu videa - špatný výsledek Kliknutím zobrazíte původní prompt a jeho český překlad
The two operatives descend several steps toward the camera in fluid, trained movements, their boots landing precisely on each step. Their helmet-mounted flashlight beams sweep slowly across the concrete walls as they move, dust drifting through the light cones. The red wall lamp glows steadily. The camera holds a static low angle; the clip ends before they reach the camera. Audio: quiet rapid footsteps on wet steel steps, controlled breathing through masks, a low pulsing tense score.
Constraints: Each operative holds exactly one pistol in a low-ready grip pointed at the floor — the pistols never rise to aim, never fire, and never change size or shape. No other weapons appear at any point; no rifles, no submachine guns. Their gear, clothing and equipment stay exactly as in the first frame — nothing new appears in their hands or on their bodies. Faces stay hidden behind the visors. No text, logos or readable UI anywhere.
Dva operativci sestupují několik schodů směrem ke kameře plynulými, nacvičenými pohyby; jejich boty dopadají přesně na každý schod. Paprsky svítilen připevněných na helmách pomalu přejíždějí po betonových stěnách a v kuželech světla se vznáší prach. Červené nástěnné světlo svítí bez přerušení. Kamera zůstává v nehybném podhledu; klip končí dříve, než operativci dojdou ke kameře. Zvuk: tiché rychlé kroky na mokrých ocelových schodech, kontrolované dýchání přes masky a nízký pulzující napínavý hudební podkres.
Omezení: Každý operativec drží přesně jednu pistoli v pohotovostním úchopu se zbraní namířenou k podlaze — pistole se nikdy nezvednou k zamíření, nikdy nevystřelí a nikdy nezmění velikost ani tvar. V žádném okamžiku se neobjeví žádné další zbraně; žádné pušky ani samopaly. Jejich výstroj, oblečení a vybavení zůstávají přesně jako v prvním snímku — v rukou ani na těle se jim neobjeví nic nového. Tváře zůstávají skryté za hledími. Nikde není text, logo ani čitelné uživatelské rozhraní.
Napsal jsem tedy Claudovi, v čem je chyba v rámci vytvořeného videa, a on mi přepsal prompt. Díky tomu jsou pohyby rozdílné a více realistické.
Opravený prompt pro tvorbu videa - správný výsledek Kliknutím zobrazíte opravený prompt a jeho český překlad
The two operatives descend the stairs toward the camera independently, each moving at his own natural rhythm — the lead operative moves faster and is already two steps lower, while the second pauses briefly at the top, glances over his shoulder, then follows at a slower, more deliberate pace. Their footsteps fall out of sync, never landing at the same moment. Their helmet-mounted flashlight beams sweep across the concrete walls in different directions as they move, dust drifting through the light cones. The red wall lamp glows steadily. The camera holds a static low angle; the clip ends before they reach the camera. Audio: irregular quiet footsteps on wet steel steps, controlled breathing through masks, a low pulsing tense score.
Constraints: Each operative holds exactly one pistol in a low-ready grip pointed at the floor — the pistols never rise to aim, never fire, and never change size or shape. No other weapons appear; no rifles, no submachine guns. Their gear, clothing and equipment stay exactly as in the first frame — nothing new appears in their hands or on their bodies. Faces stay hidden behind the visors. No text, logos or readable UI anywhere.
Dva operativci sestupují po schodech směrem ke kameře nezávisle na sobě, každý ve svém přirozeném rytmu — operativec vpředu se pohybuje rychleji a je již o dva schody níže, zatímco druhý se nahoře krátce zastaví, ohlédne se přes rameno a potom pokračuje pomalejším, rozvážnějším tempem. Jejich kroky nejsou synchronizované a nikdy nedopadnou ve stejném okamžiku. Paprsky svítilen připevněných na helmách při pohybu přejíždějí po betonových stěnách různými směry a v kuželech světla se vznáší prach. Červené nástěnné světlo svítí bez přerušení. Kamera zůstává v nehybném podhledu; klip končí dříve, než operativci dojdou ke kameře. Zvuk: nepravidelné tiché kroky na mokrých ocelových schodech, kontrolované dýchání přes masky a nízký pulzující napínavý hudební podkres.
Omezení: Každý operativec drží přesně jednu pistoli v pohotovostním úchopu se zbraní namířenou k podlaze — pistole se nikdy nezvednou k zamíření, nikdy nevystřelí a nikdy nezmění velikost ani tvar. Neobjeví se žádné další zbraně; žádné pušky ani samopaly. Jejich výstroj, oblečení a vybavení zůstávají přesně jako v prvním snímku — v rukou ani na těle se jim neobjeví nic nového. Tváře zůstávají skryté za hledími. Nikde není text, logo ani čitelné uživatelské rozhraní.
Tip: Pokud mi AI vytvoří video, které obsahuje chyby, mohu svému jazykovému modelu popsat, jaké chyby ve videu vidím (pokud nemá v historii potřebný kontext, přidám i původní prompt a požádám o jeho úpravu). Zároveň je dobré sledovat, kde AI chybuje, a tyto poznatky přenášet do dalších promptů. Například, dokud jsem v promptech neměl větu „Neobjeví se žádné další zbraně; žádné pušky ani samopaly.“, měl video generátor tendenci operativcům vkládat náhodné zbraně do ruky. Proto jsem po první opravě tuto větu používal jako součást všech budoucích promptů.
U první scény druhé sekvence s Frantou, kdy kameraman jde směrem k Frantovi, který sedí před monitory, jsem netvořil video pouze na základě jednoho obrázku. Přes ChatGPT jsem vytvořil druhou verzi obrázku, která je více oddálená od Franty a zabírá větší část místnosti. Poté jsem oba obrázky vložil jako First frame (první snímek) a Last frame (poslední snímek). Díky tomu video model jasně ví, kde má začít a kde skončit. Proč právě u této scény? Pracovna je relativně komplexní a obsahuje hodně předmětů, například v pozadí na policích. Průlet kamerou jsem potřeboval mít konzistentní a u takto komplexní scény je pravděpodobné, že by video model při generování pouze z jednoho obrázku dělal chyby.
Tip: Dva obrázky jako první a závěrečný snímek lze použít třeba v případech, kdy animace podle textového popisu neprobíhá podle mých představ. Dva snímky jsem používal například i u úvodní scény s padáky nad Prahou.
Především platí, že generování obrázků pomocí AI je dnes prakticky zadarmo, zatímco generování videí vyžaduje spoustu kreditů či peněz. Je tedy snazší vytvořit spousty nepovedených obrázků, než nákladně experimentovat s tvorbou videí, dokud se nepovede správný výsledek. Vytvořil jsem si tedy A-B obrázek s konzistentním pozadím a průlet pak ve videu vyšel na první pokus.
Kombinací obrázků a generování videí přes Kling jsem vytvořil všechny „živé“ scény, tedy scény s osobami či kočkou.
Použité nástroje pro tvorbu videí:
- Claude Fable 5 pro prompty jednotlivých scén
- ChatGPT pro úpravy a generování obrázků
- Kling 3.0 v Adobe Firefly pro generování videí z obrázků
4. Tvorba animací do videí pomocí umělé inteligence
Jestli jste někdy pracovali v programu, jako je například Adobe After Effects, a tvořili pohyblivou grafiku, například animace textů, log a podobně, určitě víte, jak časově i znalostně náročný celý proces je. V After Effects jsem především v mládí strávil stovky hodin, a přesto se mohu označit pouze za pokročilého amatéra.
Představme si třeba jednoduchou úvodní animaci, ve které probíhá odpočet ve stylu analogového filmového pásu v kině. V After Effects bych musel:
- Zvolit font, velikost, zapsat a nastavit vzhled textu, řádkování atd.
- Pro čísla v pozadí zvolit vhodný font, velikost atd.
- Vykreslit kruhy a poté vše, co se hýbe, animovat. To obnáší ruční nastavování klíčových snímků u jednotlivých parametrů (např. změna pozice – v čase X je pozice 28, v čase Y je pozice 35).
- Vše namapovat na vrstvu a na ní nastavit náhodné chvění v daném rozsahu – aby animace působila dojmem, že filmový pás způsobuje náhodné pohyby celé scény.
- Vytvořit překryvnou vrstvu, která upravuje barvy a kontrast a přidává šum – tedy tak, aby animace vypadala jako ze starého filmového pásu.
Taková animace by pro mě byla otázkou několika hodin. Pohyblivá grafika bývá mravenčí práce, a pokud chci následně dělat změny například v časování, u komplexnějších scén to bývá peklo. Nechtělo se mi tímto procesem procházet a vytvářet pohyblivou grafiku do videa ručně. Zkusil jsem tedy využít AI.
Jak rozpohybovat texty a loga pro video
Díky umělé inteligenci jsem se naučil hodně využívat kód, přestože nejsem programátor a sám bych nenapsal ani řádek. Začal jsem ho používat například pro generování prezentací místo toho, abych musel vše ručně vytvářet v PowerPointu. Využívám ho také pro tvorbu interaktivních prvků na našem webu Solutia – ten běží na WordPressu, ale umožňuje vkládat vlastní kód (Avada Code Block) a vytvářet různé animované prvky nebo třeba i celé animace, jako například v sekci Historie společnosti. Stejně tak ho používám pro tvorbu grafů a interaktivních znázornění, která vkládám do článků na blogu. Zajímalo mě tedy, zda AI dokáže vytvořit animaci s exportem do videosouboru, přestože nejde o klasický model pro generování videí.
Zadal jsem Claude své požadavky (v aplikaci Claude pro Windows, ne Claude v prohlížeči). Popsal jsem, jak si animaci představuji, co má obsahovat, dodal zdroje (např. loga) a určil požadovaný výstup, například rozlišení 1920×1080. Claude vytvořil HTML kód animace. Poté jednotlivé snímky animace převedl na obrázky, například PNG, a ty následně spojil do jednoho MP4 videa. Video je v principu posloupnost obrazových snímků a u různých formátů a kodeků (např. MP4, MOV atd.) se pak řeší například barevná hloubka, komprese, velikost souboru, kvalita obrazu, náročnost přehrávání (decoding), kódování obsahu (encoding) nebo kompatibilita s různými zařízeními.
Claude mi tímto způsobem vytvořil animace a HTML převedl do videosouborů MP4. Po zhlédnutí jsem jen popsal úpravy, které chci, a za chvíli jsem měl novou verzi. Ruční úpravy animací bývají náročné a bylo skvělé jednoduše slovně popsat, co potřebuji změnit. Právě zde umělá inteligence opravdu kraluje, protože kdybych měl všechnu tuto pohyblivou grafiku vytvářet ručně, zabralo by mi to hromadu hodin a výsledek by pravděpodobně nebyl tak dobrý.
Ukázka animace vytvořené pomocí webového HTML kódu:
Někdy tedy není potřeba video model k tomu, aby AI vytvořila video. Je možné vytvořit animace, vizualizace nebo třeba prezentace a grafy v HTML a ty následně převést na videosoubor, se kterým se dá dál pracovat. Fantastické ulehčení práce.
Použité nástroje pro pohyblivou grafiku:
- Claude Opus 5 (v aplikaci Claude)
- Claude Fable 5 (v aplikaci Claude)
5. Tvorba hudby pomocí umělé inteligence
Kvalita hudby vytvořené umělou inteligencí také zaznamenala výrazný pokrok. Osobně jsem vyzkoušel několik modelů a jako nejlepší mi vždy připadalo Suno. Pro reálné použití se neobejdete bez placené verze, ale základní předplatné stojí jen pár dolarů a umožňuje vytvořit dostatek hudby pro několik videí. Bezplatná verze poskytuje kredity na několik testů s využitím starší verze modelu.
Pro úvodní sekvenci s operativci jsem nejprve potřeboval akční hudbu ve stylu filmového traileru. Zde jsem opět použil Claude Opus, který mi vytvořil několik promptů pro Suno. V něm jsem nastavil délku 25 vteřin a vhodnou hudbu vytvořil prakticky na první pokus.
Prompt pro tvorbu hudby Kliknutím zobrazíte původní prompt a jeho český překlad
Dark cinematic action-thriller opening score, 110 BPM, hybrid orchestral, Starts sparse and tense: deep pulsing sub-bass, quiet ticking percussion, low sustained strings, Gradually builds layer by layer — staccato string ostinato, muted braams, rising synth pulse — into a driving percussive climax with heavy drum hits and brass stabs, then cuts off abruptly, Modern spy-movie heist tension, Mission Impossible / Bond cold-open energy, Instrumental, no vocals, no melody hooks — rhythm and tension driven
Temná filmová úvodní hudba pro akční thriller, 110 BPM, hybridní orchestrální styl. Začíná řídce a napjatě: hluboké pulzující subbasy, tiché tikající perkuse, nízké dlouze držené smyčce. Postupně se vrstvu po vrstvě rozvíjí — staccatové smyčcové ostinato, tlumené braamy a stoupající syntezátorový puls — až do energického perkusivního vyvrcholení s mohutnými údery bicích a krátkými žesťovými akcenty, poté náhle utichne. Napětí moderního špionážního filmu o loupeži, energie úvodní sekvence ve stylu Mission: Impossible / Bond. Instrumentální, bez vokálů a bez výrazných melodických motivů — hudba postavená na rytmu a napětí.
A zde audio výsledek:
Poté jsem potřeboval hudbu pro druhou sekvenci, která měla vytvořit jasný kontrast mezi filmovou akcí a klidnou scénou hackera Františka v garáži. Na základě popisu scény jsem si nechal opět od Clauda doporučit vhodné prompty, ale tentokrát jsem nebyl spokojený s žádným navrženým stylem. Zde byla opět důležitá má vlastní kreativita a znalosti, protože jsem měl jasnou představu o využití hudby ve francouzském stylu. Stačilo už jen pomocí konverzace s AI zjistit, o jaký konkrétní hudební styl jde, a následně ho popsat pro Suno.
V Suno jsem vytvořil ještě další dva druhy hudby – temnou hudbu, do které přejde francouzská skladba při padoušském úsměvu Františka, a závěrečnou hudbu jako podklad pro titulky.
Použité nástroje pro tvorbu hudby:
- Prompty a doporučení stylu v Claude Opus 5
- Suno AI (v5.5) pro tvorbu hudby
Co se týče zvukových efektů, použil jsem jich pět a zde jsem výjimečně nevyužil žádný AI nástroj. Místo toho jsem použil zvuky nalezené na freesound.org.
6. Tvorba hlasu pomocí umělé inteligence
Lidský hlas je dnes v AI relativně vyřešená záležitost. Kvalita je skvělá, otázkou budoucích generací modelů jsou především emoce a přirozená nepravidelnost – tedy více lidskosti namísto technické přesnosti.
Voiceovery, tedy hlasové nahrávky používané ve videích, reklamách a podobně, se tradičně řeší nahráváním ve studiu. Důležitá je kvalita mikrofonu, jeho zesilovače a záznamového zařízení, stejně jako akustika místnosti. V neposlední řadě hraje roli samotná kvalita hlasu a projevu, herecké schopnosti a emoční vyjádření interpreta.
Když jsem před lety potřeboval nahrát v angličtině několik řádků textu rodilým mluvčím, musel jsem najít portál nabízející podobné služby a zhruba 30 vteřin nahrávky mě stálo asi 1 500 Kč. Dnes mohu získat vyšší kvalitu, plnou kontrolu nad výsledkem i podporu více jazyků a 30 vteřin hlasu vytvořit prakticky zdarma – případně v placené verzi získat více možností a větší výběr hlasů.
Pro generování hlasu existuje spousta modelů. Pro toto video jsem použil ověřený ElevenLabs. Nabízí širokou škálu různých hlasů a především i ve variantě zdarma, dostupné po pouhé registraci, můžete experimentovat a bez problémů pokrýt kratší voiceover. Pro komerční využití je však vyžadována placená verze.
Verzi v3 jsem použil prakticky jen pro „Františku, oběd“, kde jsem na začátek zadal [screaming] a tím získal hlasový projev v podání, které jsem potřeboval (verze 3 umožňuje kontrolovat emoce a způsob projevu). Ostatní věty ve videu jsou řešené verzí v2 – do pole se jednoduše zadají slova, která má hlas přečíst.
Použité nástroje pro tvorbu hlasu:
- Prompty a text s Claude Opus 5
- ElevenLabs v2 a v3
7. Střih videa
Ačkoliv existují AI nástroje pro střih a určitě mohou pomoci například u delšího obsahu (třeba podcastů, kde je možné stříhat na základě práce s textem, který program vygeneroval z obsahu videa), většinou jsou vhodné spíše pro specifické operace. Může jít například o tvorbu krátkých videí z delšího obsahu nebo následné titulkování. Samotný střih je ale z velké části kreativní práce a nemyslím si, že je v tuto chvíli pomocí AI plně vyřešený. Přiznám se ale, že příliš mnoho nástrojů jsem v této oblasti nezkoušel. Jsem zvyklý stříhat ručně a mít výsledek pod kontrolou.
V životě jsem vyzkoušel mnoho programů na střih – co se týče jednoduchosti, přehlednosti a samotné práce se střihem, prakticky nikdy jsem nenarazil na nic lepšího než Vegas Pro. Problémem je cena a nestabilita – neustálé problémy při práci nebo exportu videa dokážou odradit. Z hlediska jednoduchosti a logiky samotného střihu jde ale o fantastický nástroj. Případně lze použít některý z novějších programů, jako je CapCut.
V mém případě používám DaVinci Resolve, jehož základní verze je zdarma a pro střih běžných videí stačí prakticky na všechno. Nevýhodou je jeho komplexnost a nepřijde mi, že je příliš vhodný pro začátečníky – spíše pro ty, kteří se chtějí videu věnovat více do hloubky. Jelikož si platím balík Adobe, mohl bych používat Premiere Pro – osobně mi ale nikdy nesedl.
Proces střihu videa
Začal jsem tím, že jsem nejprve stříhal první část – akční sekvenci. Potřeboval jsem k tomu videozáběry a hudbu. Při střihu jsem zjistil, kde jsou hluchá místa, kde chybí dynamika a jaké záběry je potřeba doplnit. Pro akčnější pojetí jsem například doplnil záběr, ve kterém operativec zezadu „uspí“ strážného. Původně jsem chtěl klasické chycení pod krkem a přiškrcení, ale jelikož jde o formu násilí, filtry v Adobe Firefly mi neumožnily video vytvořit. Zde jsem opět požádal Clauda, aby mi prompt upravil na „verzi bez násilí“. Určitě by se našly necenzurované video modely, které by takovou scénu dokázaly vytvořit, ale nechtěl jsem kvůli jednomu záběru utrácet další peníze.
Také jsem upravil poslední záběr v serverovně. Původní obrázek a video obsahovaly tablet s „polámaným textem“ (animace textu bývá problém), takže jsem se rozhodl vytvořit záběr operativce z výšky – od stropu serverovny. Zde jsem opět využil první a poslední snímek, tedy animovaný přechod mezi dvěma obrázky. Na prvním je pohled více shora, kamera je lehce natočená doprava a indikátor průběhu hackování na tabletu ukazuje přibližně 30 %. Druhý obrázek je blíže operativci, kamera už není natočená a indikátor hackování je naplněný.
Nejtěžší bylo vymyslet přechod mezi dvěma sekvencemi – akční scénou operativců a klidnou sekvencí Franty v garáži. Bylo nutné divákovi jasně vysvětlit, že první sekvence představuje možnou představu lidí o tom, jak hackování vypadá (protože nás to tak často učí televize a filmy), zatímco druhá ukazuje realitu. Nakonec jsem to vyřešil pomocí odpočtů s popisem toho, co bude následovat – tím se eliminují pochybnosti o tom, co video znázorňuje. Opět šlo o můj vlastní nápad, protože návrhy Clauda zde nebyly příliš dobré a jeho přístupy by mohly vést k více možným výkladům obsahu a příběhu. Například jeho návrh:
Příklad návrhu Clauda:
0,0 hudba usekne, ale VO pokračuje ve stejném tónu
0,0–6,0 jízda garáží, hacker pořád není vidět
6,0–9,0 Franta v záběru — ospalý, papuče, drobí si rohlík do klávesnice
9,0 zvenku: „FRANTO, OBĚD!"
9,5 Franta: „Jo, už jdu." — vstane, nechá to běžet
10,0 na monitoru dobíhá CONNECTED
Prakticky by to mohlo působit tak, že operativci hacknuli serverovnu, Franta s nimi spolupracuje a následně se vzdáleně připojuje do systému – což odporuje hlavní myšlence reklamy.
Vytvořil jsem tedy odpočty popisující jednotlivé scény, poté sekvenci s Frantou a závěrečnou pohyblivou grafiku s CTA (Call to action) „Jděte na web solutia.cz/bezpecnost„.
Při střihu mi hodně pomohl ChatGPT především s používáním DaVinci Resolve, protože jsem v programu začátečník. Příkladem je úprava hlasu, kdy jsem potřeboval, aby „Františku, oběd!“ znělo tak, že hlas přichází shora a zpoza dveří. ChatGPT v takovém případě doporučí vhodné efekty a když mu pošlu screenshot jejich nastavení, dokáže mi detailně popsat, jaké hodnoty nastavit.
Po úpravě s nápovědou ChatGPT – úprava panoramy (umístění zvuku v prostoru), efekty Reverb a Delay:
V průběhu exportování sestříhaného videa jsem narážel na chyby exportu, opakované chybové hlášky a nedostupnost souborů. Převedl jsem tedy všechny MP4 soubory generované pomocí AI na soubory .mov v kodeku Apple ProRes 422 LT. Od té doby vše fungovalo bez problémů.
Použité nástroje:
- DaVinci Resolve pro střih
- Adobe Media Encoder pro převod formátů videí
- ChatGPT pro nápovědu
Lze vytvořit video reklamu s umělou inteligencí?
Na některé druhy reklam, třeba falešné recenze – kdy osoba mluví o tom, jak použila nějaký produkt a má ho třeba v ruce – často stačí jediný výstup od AI. Pro pokročilejší sekvence se střihem lze použít i modely jako Seedance 2.5. Otázkou ale zůstává – jak z toho neudělat AI slop?
Přijde mi, že stejně jako u všeho ostatního v oblasti AI platí jedno – hlavní kontrolu a řízení musí mít člověk, který rozumí tomu, na čem pracuje. V životě jsem natočil i sestříhal spoustu videí. Mám nakoukány tisíce hodin filmů a seriálů a díky tomu jsem měl představu, jak má výsledek vypadat. Paradoxně reklamy nesleduji, tradiční televizi nemám a komerčním reklamám se vyhýbám, jak jen je to možné (prohlásil člověk z marketingu…).
Pointa je v tom, že vím, co dělám. Nejsem úplný expert, ale mám pokročilé zkušenosti. Neřešil jsem video promptem „Tady máš nástroje, které můžeš použít, udělej firmě solutia.cz reklamu na kybernetickou bezpečnost“. Výsledek by možná byl v pořádku, už proto, jak se frontier AI modely neustále posouvají. Samotná AI ale stále nenahradí lidský názor, pohled, kreativitu a unikátní způsob přemýšlení, které modelům chybí.
Na většinu věcí jsem použil umělou inteligenci – obrázky, z nich následně videa, hudbu, hlas i pohyblivou grafiku. AI mi pro spoustu těchto ingrediencí vytvářela také prompty. Vždy ale potřebovala kontext. Je to stejné jako v reálném životě – když někomu řeknu „Kup mi jogurt“, ale vůbec nezmíním své preference ani to, jaký typ jogurtu chci, asi nebudu se svačinou příliš spokojený.
V tomto ohledu je dobré přemýšlet o umělé inteligenci jako o skupině juniorních zaměstnanců. Práci mi udělají, ale je nutné je vést, využívat vlastní expertízu a celý proces koordinovat. Autonomní AI už pro mnoho use casů funguje, ale u komplikovanější kreativní práce bez lidské vize a odborného vedení jsme stále daleko od kvality výsledku, které lze dosáhnout pod vedením zkušeného člověka.
Pokud chcete tvořit videa stále dokola ve stejném duchu, lze pro ně odladit specifický proces a poté už může AI výsledky sypat jako na běžícím pásu. Rozdílné výsledky ale vyžadují rozdílné přístupy a právě definice vize, vhodných procesů a kontrola kvality jsou stále především lidskou doménou.
Díky AI jsem mohl svou vizi přenést do reality bez potřeby týmu lidí, herců nebo obřího rozpočtu. Ano, je to zároveň smutné, protože tyto technologie berou práci lidem v některých odvětvích. Je ale fantastické, že dostupnost těchto nástrojů odbourává spoustu limitů, které ve video produkci dlouho existovaly. Tvorba kvalitního videa už není omezena pouze na profesionály – je dostupná prakticky komukoliv, kdo je ochoten věnovat jí čas a úsilí.
Přesto je nutné doplnit, že kdybych neměl znalosti a zkušenosti z oblasti video produkce, výsledek by nebyl ani zdaleka tak dobrý. Proto je podle mě stále důležité učit se a nenechávat vše na AI. Je snadné podlehnout dojmu, že umělá inteligence udělá všechno lépe, a proto nemá smysl se vzdělávat a experimentovat. Výsledkem by ale bylo, že by všechno začalo vypadat podobně a chyběla by variabilita, kterou přináší lidská jedinečnost a kreativita.
Pro menší firmy, které tvoří video obsah, je umělá inteligence fantastický nástroj. Pravou kreativitu ani tým odborníků ale v tomto ohledu stále nenahradí. Je samozřejmě otázkou, zda k tomu vůbec někdy dojde – i když možná lepší otázka zní: „Kdy k tomu dojde?“ Pokrok totiž nezastavíme.















