Prompt Hotel Lobby AI: quello che usiamo, più 5 da copiare
Un prompt Hotel Lobby AI deve fissare il set arancione, l’unico microfono condiviso, chi sta dove e chi rappa. Molti prompt che girano online sono tentativi alla cieca; i due qui sotto sono quelli veri che il nostro studio manda per ogni ripresa. Il primo gira su Wan 3.0, il nostro modello predefinito, e tiene la traccia Hotel Lobby. Il secondo è la versione Seedance, che scrive un rap nuovo. Dopo trovi cinque prompt che abbiamo scritto per strumenti che accettano solo due foto, poi la spiegazione riga per riga e una tabella per risolvere i problemi. Oppure salta tutto: il prompt lo aggiunge lo studio al posto tuo.
Rivisto il

PROMPT AI HOTEL LOBBY
Guida la performance
- Persone
- Movimento
- Suono
Il prompt Wan 3.0 usato da Hotel Lobby Video
Questa versione funziona con due foto in qualunque formato; le proporzioni viaggiano come impostazione del modello, non come parole. Prima che parta la ripresa, GPT Image 2 ridisegna ogni foto come ritratto da studio a figura intera della stessa persona o dello stesso animale. Il modello riceve poi quattro allegati, sempre in quest’ordine: Image 1, il ritratto di sinistra; Image 2, il ritratto di destra; Video 1, la clip di riferimento Hotel Lobby senza audio; Audio 1, la traccia Hotel Lobby tagliata alla stessa durata.
Segui Video 1 dall’inizio alla fine: copia la sua inquadratura, i suoi tempi e ogni movimento, gesto, giro di testa, espressione e forma della bocca, insieme allo sfondo arancione uniforme e al microfono argentato che pende dal soffitto tra i due performer. Mantieni l’inquadratura di Video 1: niente zoom in avanti, niente zoom indietro, nessuna panoramica. Non aggiungere movimenti o elementi di scena che non sono in Video 1.
Usa Audio 1 come musica di sottofondo per tutto il video, così com’è: è l’intero sonoro del video. Non scrivere testi nuovi, non ricantarlo, non aggiungere altra musica o altre voci.
Il performer a sinistra è il soggetto in Immagine 1; quello a destra è il soggetto in Immagine 2. Sostituiscono completamente le due persone di Video 1: volto, capelli o pelo, corporatura e vestiti vengono dalle foto, niente dalle persone di Video 1. Nessuno dei due indossa guanti (a meno che non li abbia già nella foto): le persone mostrano le proprie mani, gli animali tengono le proprie zampe. Ignora lo sfondo delle foto.
Il performer a sinistra rappa al microfono la voce di Audio 1, con le labbra perfettamente a tempo con Audio 1. Quello a destra segue i movimenti della persona a destra in Video 1: reagisce e gesticola a tempo, muovendo le labbra solo per brevi ad-lib.
L’arancione riempie tutto il quadro, senza zone nere né angoli scuri. Niente split screen, nessuna persona in più, niente sottotitoli o scritte sullo schermo. I volti restano uguali dall’inizio alla fine.La variante rap AI su Seedance
Su Seedance l’audio è sempre un rap AI che il modello compone da sé. Sul set arancione di Hotel Lobby però ascolta comunque la traccia Hotel Lobby mentre compone: la clip di riferimento parte muta, la traccia viene allegata a parte come audio di riferimento 1 e il prompt chiede un beat nuovo che ne segua il ritmo, con parole nuove e senza la sua melodia né le sue voci. Qui gli allegati sono chiamati a parole (“reference image 1”). L’esempio qui sotto è stato costruito per l’argomento indicato nella sua etichetta.
Usa il video di riferimento 1 per tutta l’esibizione: copia la sua inquadratura, i suoi tempi e ogni movimento, gesto, giro di testa, espressione e movimento della bocca, lo sfondo arancione uniforme e l’unico microfono argentato sospeso tra i performer. Mantieni l’inquadratura del video di riferimento 1: niente zoom in avanti, niente zoom indietro, nessuna panoramica. Non aggiungere movimenti o elementi di scena che non sono nel video di riferimento 1.
Performer a sinistra: la persona nell’immagine di riferimento 1. Performer a destra: la persona nell’immagine di riferimento 2. Sostituiscono completamente le due persone del video di riferimento 1: volto, capelli, corpo e vestiti vengono dalle foto, niente dalle persone del video di riferimento 1. Se una foto non mostra nessun capo di una persona (solo il viso o le spalle scoperte), vestila con abiti semplici di tutti i giorni adatti a lei, come una maglietta semplice e dei jeans; mai il costume, il mantello, il cappotto, le cinture, i guanti o la benda sugli occhi delle persone del video di riferimento 1. Gli animali restano come sono, senza vestiti. Ignora lo sfondo delle foto.
Colonna sonora: una canzone trap scura di Atlanta originale, fatta per questo video, che segue l’audio di riferimento 1 per beat e ritmo: lo stesso tempo, groove, pattern di batteria e rimbalzo, a tempo con i movimenti del video di riferimento 1. Fai un beat nuovo in quello stile con un testo nuovo; non riutilizzare testo, melodia o voci dell’audio di riferimento 1. Essenziale ma potente: un 808 martellante e graffiante che scivola tra le note, un rullante con battimani penetrante e hi-hat secchi, e un unico loop di melodia inquietante dal sapore orientale. Atmosfera scura, minacciosa e sicura. Il rap è un flow in terzine veloce e rimbalzante che corre sopra il beat lento. Mix: la voce chiara sopra, il beat subito dietro quasi allo stesso livello, forte e incisivo, mai basso e senza mai interrompersi tra una frase e l’altra. Il performer a sinistra rappa nel microfono sospeso una strofa originale e pulita su: "i 30 anni di Maya e il suo pessimo parcheggio in parallelo". Rappa nella lingua di quel tema. Voce rap chiara, labbra a tempo con ogni parola, cenni naturali della testa e bocca espressiva. Il performer a destra è il compagno di hype: indica il rapper, reagisce, sorride e aggiunge brevi ad-lib a tempo. Non usare canzoni esistenti, testi esistenti o la voce di artisti reali.
9:16. L’arancione riempie tutto il quadro da un bordo all’altro, senza zone nere o scure. Niente split screen, nessuna persona in più, niente sottotitoli o scritte sullo schermo. I volti restano uguali dall’inizio alla fine.
Cinque prompt Hotel Lobby AI per due foto e nessuna clip
Tanti strumenti video accettano foto di riferimento ma non una clip di riferimento. Questi cinque prompt descrivono a parole il set e la performance, quindi si incollano così come sono in uno strumento image-to-video che prende due foto. Seguono le regole che rendono il formato riconoscibile al primo sguardo: una foto per lato, un microfono che pende dall’alto, una voce sulla strofa mentre l’altra reagisce, e una camera che non si muove. Li abbiamo scritti per questa pagina e non li abbiamo testati; ogni modello legge un prompt a modo suo, quindi mettete in conto un paio di tentativi. Sono in inglese, la lingua che questi modelli seguono meglio.
Prompt per una coppia
Make a vertical 9:16 clip, 12 seconds long, using two reference photos of a couple. Place the subject of photo 1 on the left side of the frame and the subject of photo 2 on the right side, head to toe, and keep every face, haircut, outfit and height true to its photo. The room is a bare studio painted orange on the wall and floor, lit softly and evenly. A single silver studio mic dangles on a thin cord from above, halfway between them. The partner on the left delivers the verse into that mic with sure, easy hand moves; the partner on the right grins, points at them, sways to the beat and leans toward the mic for the closing line. The camera sits at chest height and never moves: one unbroken shot with no cuts, zoom or pan. Nobody else in the room, no on-screen words, no logos.Prompt per due migliori amici che si passano il microfono
Make a vertical 9:16 clip, 12 seconds long, from two reference photos of two grown-up best friends. Photo 1 goes on the left, photo 2 on the right, both seen from head to feet, with faces, hair, clothing and build copied exactly. The set is an orange studio with a seamless orange wall and floor, and one silver mic hanging from the ceiling on a cable between the two friends. In the first six seconds the left friend raps into the mic while the right friend nods, laughs and hypes with big arm moves; in the last six seconds the right friend takes the mic and the left friend reacts. Each friend moves in their own way, never as mirror images. Locked-off camera, a single continuous take, gentle even lighting, both pairs of feet in frame. No other people, props, captions or logos.Prompt per un nonno e un nipote adulto
Make a vertical 9:16 clip, 12 seconds long, from two reference photos: photo 1 shows a grandparent, who stands on the left, and photo 2 shows their grown-up grandchild, who stands on the right. Show both from head to toe and keep each face, hairstyle, outfit and height as photographed. They share a rap duet in an empty orange studio, one silver mic hanging from the ceiling between them. The grandparent raps into the mic with calm, steady, self-assured gestures; the grandchild looks delighted, laughs, dances in time and joins the mic for the final line. Keep every movement relaxed and natural for both ages. A single fixed shot under soft studio light, with no cuts, zoom or pan, nobody else in the scene and no captions.Prompt per personaggi disegnati o anime
Usa personaggi creati da te o di cui hai i diritti; quelli famosi appartengono a qualcun altro.
Make a vertical 9:16 clip, 12 seconds long, from two reference images of original drawn characters. The character from image 1 stands on the left and the character from image 2 on the right, shown in full, each keeping its exact art style, palette, proportions and costume, with both drawn in that same style throughout. They perform a rap duet in a plain orange studio, a single silver mic hanging from the ceiling between them. The left character raps into the mic with lively hand gestures; the right character reacts, points and bounces on the beat. One locked camera, one continuous take, no cuts, zoom or pan. No additional characters, no lettering, no logos.Prompt Hotel Lobby AI per un cane, un gatto o tutti e due
Gli animali sono stati tra le prime clip Hotel Lobby a diventare virali, fatte con altri strumenti (esempi, con i crediti). Dai a ogni animale una foto nitida con tutto il corpo nell’inquadratura.
Make a vertical 9:16 clip, 12 seconds long, from two reference photos of pets. The animal from photo 1 stands up on its back legs on the left and the animal from photo 2 stands on the right, each keeping its breed, face, eye color, coat markings, size and collar. The set is an empty orange studio with one silver mic hanging from the ceiling between them. The left animal opens and closes its mouth on the beat and waves its front paws as though rapping into the mic; the right animal bobs its head, glances at the camera and dances in time. Keep the anatomy real: four legs and one tail per animal, both visible from the tips of the ears to the paws. A single fixed, unbroken shot. No humans, no extra animals, no text.Al nostro studio non serve nessuno di questi, né per le persone né per gli animali, perché il prompt è già integrato; la pagina del video rap con animali lo apre già impostato per un animale e il suo compagno. Abbiamo testato un cane accanto a una persona. I gatti, e due animali insieme, non sono ancora stati testati.
Perché ogni istruzione sta nel prompt
- Performance. Il primo paragrafo affida a Video 1 l’inquadratura, il ritmo e ogni movimento: gesti, giri di testa, espressioni, forme della bocca, più lo sfondo arancione pieno e l’unico microfono argentato appeso tra i due. Blocca la camera (niente avvicinamenti, allontanamenti o panoramiche) e vieta tutto ciò che la clip non contiene.
- Audio. Audio 1 è l’intera colonna sonora e resta intatto: niente testi riscritti, niente righe ricantate, niente musica o voci aggiunte.
- Chi è chi. Ogni immagine è legata a un lato e i due soggetti prendono del tutto il posto dei due interpreti della clip: viso, capelli o pelo, corpo e vestiti vengono dalle immagini e i loro sfondi spariscono. La formula è “il soggetto in Image 1” e non uomo o donna, così va bene per una persona o per un animale e non contraddice mai la foto. Vieta anche i guanti, perché i due ballerini della nostra clip di riferimento li indossano e il modello tendeva a dipingerli su mani e zampe.
- Ruoli. L’interprete a sinistra rappa le voci di Audio 1 con le labbra a tempo; quello a destra copia la spalla della clip, reagisce e gesticola sul beat con pochi brevi ad-lib.
- Paletti di sicurezza. Arancione fino a ogni bordo senza angoli scuri, niente schermo diviso, niente persone in più, niente sottotitoli e gli stessi volti dal primo all’ultimo fotogramma. Queste righe evitano gli errori che abbiamo visto più spesso.
Portare il prompt su un altro modello video
- Ti serve un modello che accetti immagini di riferimento, un video di riferimento e una traccia audio di riferimento, e che tenga la traccia. Wan 3.0 lo fa. ByteDance Seedance 2.x accetta tutti e tre, ma nei nostri test ha composto musica nuova.
- Chiama gli allegati come fa il tuo strumento. Noi li numeriamo in ordine di caricamento (Image 1, Image 2, Video 1, Audio 1); altri strumenti vogliono @Image1 o tag propri. Tieni fisso l’ordine: prima la foto di sinistra, poi quella di destra.
- Non dare un nome agli interpreti. “Il soggetto in Image 1” va bene per qualunque cosa ci sia nella foto, umano o animale. Il nostro studio cambia solo la disposizione delle foto (due foto o una di entrambi) e, quando carichi La tua clip, i movimenti.
- Il formato non sta nel testo; scegli 9:16, 16:9 o 1:1 nelle impostazioni dello strumento.
- Niente clip di riferimento? Descrivi a parole il set e la performance invece di rimandare a Video 1, come nei cinque prompt qui sopra. Dreamina e strumenti simili pubblicano le loro versioni solo testo. Noi abbiamo testato solo i due prompt in cima a questa pagina.
Tabella dei problemi: cosa va storto e perché
| Cosa vedi | Causa probabile | Prova così |
|---|---|---|
| Un volto diventa quello di uno sconosciuto | La foto è di profilo, con occhiali da sole o con il viso minuscolo | Metti una foto frontale e luminosa, inquadrata dalla vita in su |
| Sinistra e destra si scambiano | Nel prompt niente lega ogni foto a un lato | Indica l’interprete di sinistra e quello di destra con la loro immagine |
| Entra una persona in più | Vengono copiate persone della clip o dello sfondo di una foto | Tieni “nessuna persona in più” e chiedi di ignorare gli sfondi delle foto |
| Compare del testo a schermo | Il modello si inventa i sottotitoli | Tieni la riga che vieta sottotitoli e scritte a schermo |
| Le bocche vanno fuori tempo | Nessun audio allegato, o la traccia parte con un silenzio | Allega la traccia e falla partire su una parola |
| Bordi neri intorno all’arancione | Il prompt chiede un movimento di camera che la clip non fa | Tieni l’inquadratura della clip e chiedi arancione da bordo a bordo |
| Una musica diversa sostituisce la traccia | Il modello scrive la sua colonna sonora (a noi è successo con Seedance 2.x) | Scegli un modello che tiene la traccia di riferimento, come Wan 3.0 |
Oppure lascia che lo scriva lo studio
In Hotel Lobby Video il prompt, la clip di riferimento e la traccia di riferimento sono già collegati. Aggiungi due foto e premi crea. Una ripresa di 12 secondi su Wan 3.0 a 480p costa 6 crediti.
Domande frequenti
Cosa rende buono un prompt Hotel Lobby AI?
Fissa il set arancione, l’unico microfono appeso, quale foto va su quale lato e cosa fa ciascuno. Il prompt Wan 3.0 qui sopra è quello che il nostro studio manda per ogni ripresa.
Con quali modelli funziona il prompt?
Il primo lo usiamo con Wan 3.0, che tiene la traccia di riferimento, e la versione rap AI con Seedance 2.x, che scrive la sua musica. Entrambi accettano immagini, video e audio di riferimento. Altri modelli vogliono i loro tag e potrebbero non accettare tutti e tre.
Posso incollare il prompt per la coppia in Dreamina o Kling con due foto prese dal rullino?
È proprio lo scopo dei cinque prompt solo foto: strumenti image-to-video che accettano due foto di riferimento. Rinomina le foto come le vuole il tuo strumento e tieni fissi sinistra e destra. Fuori dal nostro studio non li abbiamo testati.
Voglio esserci io con il mio cane. Mi serve il prompt per animali?
Su Hotel Lobby Video no: la [pagina del video rap con animali](/dog-and-cat-rap-video) è già impostata per un animale e il suo compagno, senza prompt da scrivere. Un cane accanto a una persona è testato; gatti e due animali insieme non ancora.
Perché il mio prompt continua a produrre musica nuova invece della traccia Hotel Lobby?
Alcuni modelli compongono la loro colonna sonora qualunque cosa chiedi; nei nostri test lo ha fatto Seedance 2.x. Usa un modello che tiene una traccia di riferimento, come Wan 3.0, e allega la traccia come audio.
Devo proprio scrivere un prompt?
No. Hotel Lobby Video integra il prompt nello studio, quindi devi solo aggiungere le foto.
Riferimenti
Prossima lettura
Come fare il trend Hotel Lobby: 3 strade a confronto (2026)
Come creare il trend Hotel Lobby con Hotel Lobby Video e due ritratti, con un prompt per un modello video o un template di montaggio; prezzi, opzioni gratis e pubblicazione
Generatori Hotel Lobby AI a confronto (4 ottobre 2026)
Un confronto datato dei generatori di video Hotel Lobby AI (Hotel Lobby Video, LightX, Dreamina, Media.io, Summrs, Fuzana, Kapwing, Higgsfield, Starrd) ricavato dalle loro stesse pagine
Le foto migliori per Hotel Lobby AI: la checklist del cast
Le foto migliori per Hotel Lobby AI: un provino in cinque domande, cosa sostituire agli scatti deboli, cosa fa il ridisegno del ritratto, una foto o due e i difetti dei modelli
Hotel Lobby Video è un’app indipendente, senza legami con Quavo, Takeoff, Migos, Quality Control Music, Motown o COLORS.