直接看正文

Hotel Lobby AI 提示词:本站原文加 5 段可抄

一段 Hotel Lobby AI 提示词,必须把橙色布景、两人共用的那一支麦、谁站哪边、谁来唱这几件事钉死。网上很多提示词是凭感觉写的;下面两段则是本站每次出片真正发出去的。第一段跑在默认模型 Wan 3.0 上,保留 Hotel Lobby 音轨。第二段是 Seedance 版,会重新写一段说唱。再往后是我们给只收两张照片的工具写的五段提示词,然后是逐行解释和一张排错表。嫌麻烦也可以全部跳过:页面里的工具会替你把提示词加好。

最近修订

记录创作指令的笔记本、参考人像与舞台照片。

HOTEL LOBBY AI 提示词

用提示词指导表演

  • 人物
  • 动作
  • 声音
AI · 插图 · Hotel Lobby Video

Hotel Lobby Video 背后的 Wan 3.0 提示词

这一版适用于两张照片、任何画幅:画面比例作为模型参数单独传,不写进文字。开拍之前,GPT Image 2 会把每张照片重画成同一个人或同一只宠物的全身棚拍照。之后模型收到四个附件,顺序固定:图1 是左边的人像,图2 是右边的人像,视频1 是去掉声音的 Hotel Lobby 参考视频,音频1 是剪到同样长度的 Hotel Lobby 音轨。

Hotel Lobby AI 提示词(Wan 3.0)
全程参照视频1:照搬它的取景、节奏和每一个动作、手势、转头、表情和嘴型,以及纯橙色背景和两人之间从天花板垂下的那支银色麦克风。保持视频1的机位取景,不要推近、拉远或平移。不要加入视频1里没有的动作或场景元素。

全程使用音频1作为整条视频的背景音乐,原样保留:它就是视频的全部声音。不要新写歌词,不要重唱,不要加入其他音乐或人声。

左边的表演者是图1里的主体,右边的表演者是图2里的主体。他们完全替换视频1里的两个人:脸、发型或毛发、身材和衣服都来自照片,视频1里的人一样都不要。两位表演者都不戴手套(照片里本来戴着的除外):人露出本来的手,动物的前爪保持本来的爪子。忽略照片的背景。

左边的表演者对着麦克风说唱音频1的人声,嘴型与音频1精确同步。右边的表演者照着视频1右边那个人的动作:跟着节拍做反应和手势,只做简短的附和口型。

橙色铺满整个画面,没有黑色或暗角。不要分屏,不要多余的人,画面上不要字幕或文字。人脸从头到尾保持一致。

Seedance 上的 AI 说唱版

在 Seedance 上,声音永远是模型自己编的 AI 说唱。在 Hotel Lobby 的橙色布景里,它编曲时仍会参考 Hotel Lobby 音轨:参考视频静音发送,音轨作为参考音频1单独附上,提示词要求按它的节奏做一段新伴奏,配新歌词,不用它的旋律和人声。这里的附件用文字来称呼(“参考图片1”)。下面这个例子是按标签里写的主题生成的;提示词要求“用主题的语言来唱”,所以主题写中文,就会唱中文。

Hotel Lobby AI 说唱提示词(Seedance,9:16,12 秒)
全程参照参考视频1的表演:照搬它的取景、节奏和每一个动作、手势、转头、表情和嘴型,以及纯橙色背景和两人之间悬挂的那支银色麦克风。保持参考视频1的机位取景:不要推近,不要拉远,不要平移。不要加入参考视频1里没有的动作或场景元素。

左边的表演者:参考图片1里的人。右边的表演者:参考图片2里的人。他们完全替换参考视频1里的两个人:脸、发型、身材和衣服都来自照片,参考视频1里的人一样都不要。照片里完全看不到某个人的衣服时(只有脸、或者光着肩膀),给这个人穿适合他的普通便装,比如简单的 T 恤和牛仔裤;绝不要参考视频1里那两个人的戏服、披风、外套、皮带、手套和蒙眼布。动物保持原样,不加衣服。忽略照片的背景。

配乐:一首为这条视频原创的暗黑亚特兰大 trap 歌曲,节拍和节奏跟着参考音频1走:同样的速度、律动、鼓点和弹跳感,卡准参考视频1里的动作。按这个风格做一段新的伴奏、写新歌词;不要重复使用参考音频1的歌词、旋律和人声。精简但有力:砸地、粗砺、在音符之间滑动的 808,尖锐的军鼓加拍手配利落的踩镲,再加一条阴森、带东方色彩的旋律循环。情绪暗、有压迫感、自信。说唱是快速、有弹性的三连音 flow,跑在缓慢的节拍上面。混音:人声清楚地在最上面,伴奏紧跟其后、几乎一样响,有力、有冲击感,从不变小,两句之间也不断。左边的表演者对着悬挂的麦克风说唱一段原创、干净的歌词,主题是:“Maya 的 30 岁生日和她糟糕的侧方停车”。用这个主题的语言来唱。说唱人声清晰,嘴型与每个字同步,自然地点头,嘴部表情丰富。右边的表演者是助兴搭档:指着说唱的人,做反应、微笑,跟着节拍加简短的附和。不要使用任何现成的歌曲、现成的歌词或任何真实歌手的声音。

9:16。橙色从一边铺到另一边,填满整个画面,没有黑色或暗的区域。不要分屏,不要多余的人,画面上不要字幕或文字。人脸从头到尾保持一致。
生成 AI 说唱时,写下姓名和一个具体细节。这是主题输入框,不是完整的视频提示词。
生成 AI 说唱时,写下姓名和一个具体细节。这是主题输入框,不是完整的视频提示词。真实界面截图,英文版 · 2026-10-02

五段不需要参考视频、只用两张照片的 Hotel Lobby AI 提示词

不少视频工具能收参考照片,却收不了参考视频。这五段提示词把布景和表演都用文字讲清楚,可以直接贴进能上传两张照片的图生视频工具。它们遵守让这个格式一眼就能认出来的几条规矩:一边一张照片,一支从上方吊下的麦,一个人唱主歌、另一个人接反应,机位不动。这些是我们为本页写的,没有实测过,而且每个模型对提示词的理解都不一样,最好预留一两次重试。

情侣用的提示词

情侣(9:16,12 秒)
根据一对情侣的两张参考照片,做一条 12 秒长的 9:16 竖版短片。把照片1的主体放在画面左侧,照片2的主体放在右侧,从头到脚完整入镜,每个人的五官、发型、穿着和身高都要和照片一模一样。房间是一间空荡的摄影棚,墙面和地面刷成橙色,打光柔和、均匀。一支银色录音麦用细线从上方吊下来,悬在两人中间。左边的人对着这支麦唱主歌,手上动作笃定、松弛;右边的人咧嘴笑,指着对方,跟着节拍左右摇摆,唱到最后一句时也凑近麦克风。机位在胸口高度,全程不动:一个连续镜头,不剪切、不变焦、不摇镜。房间里没有别人,画面上不出现文字和标志。

两个死党轮流拿麦的提示词

死党(9:16,12 秒)
根据两张参考照片做一条 12 秒长的 9:16 竖版短片,照片上是两位已成年的死党。照片1放左边,照片2放右边,两人都从头到脚入镜,脸、头发、衣服和身材照原样复制。场景是一间橙色摄影棚,橙色墙面和地面无缝相连,一支银色麦克风顺着线缆从天花板吊在两人之间。前六秒,左边的朋友对着麦说唱,右边的朋友点头、大笑,用大幅度的手臂动作捧场;后六秒换成右边的朋友接过麦,左边的朋友在旁边接反应。两人各有各的动作,绝不互为镜像。机位锁定,一条长镜头拍完,光线温和均匀,两人的双脚都在画面里。不要其他人、道具、字幕或标志。

祖辈和成年孙辈的提示词

祖辈和成年孙辈(9:16,12 秒)
根据两张参考照片做一条 12 秒长的 9:16 竖版短片:照片1是一位祖辈,站在左边;照片2是这位长辈已经成年的孙辈,站在右边。两人都从头到脚入镜,脸、发型、衣着和身高都按照片保留。他们在一间空的橙色摄影棚里合唱一段说唱,一支银色麦克风从天花板垂在两人之间。长辈对着麦说唱,手势沉稳、不紧不慢、很有底气;孙辈一脸开心,笑着跟拍子跳,最后一句也凑到麦前一起唱。两人的动作都放松自然,符合各自的年龄。摄影棚柔光下一个固定镜头拍到底,不剪切、不变焦、不摇镜,画面里没有别人,也没有字幕。

手绘或动漫角色的提示词

只用你自己创作、或你有权使用的角色;知名角色都归别人所有。

插画角色(9:16,12 秒)
根据两张原创手绘角色的参考图,做一条 12 秒长的 9:16 竖版短片。图1的角色站在左边,图2的角色站在右边,全身出现,各自保留原本的画风、配色、比例和服装,两个角色从头到尾都用这同一种画风来画。他们在一间素净的橙色摄影棚里合唱说唱,一支银色麦克风从天花板垂在两者之间。左边的角色对着麦说唱,手势活泼;右边的角色在一旁接反应、伸手指向对方,踩着节拍上下弹跳。一个锁定的机位,一条连续镜头,不剪切、不变焦、不摇镜。不加别的角色,不要字,不要标志。

狗、猫或猫狗同框的 Hotel Lobby AI 提示词

宠物版是最早爆红的 Hotel Lobby 视频之一,用的是别家工具(注明出处的例子)。每只动物给一张清晰、全身入镜的照片。

宠物(9:16,12 秒)
根据两张宠物参考照片做一条 12 秒长的 9:16 竖版短片。照片1里的动物在左边用后腿站起来,照片2里的动物站在右边,各自保留品种、脸型、眼睛颜色、毛色花纹、体型和项圈。场景是一间空的橙色摄影棚,一支银色麦克风从天花板垂在它们中间。左边的动物踩着节拍张嘴、闭嘴,挥动前爪,像在对着麦说唱;右边的动物摇头晃脑,瞄一眼镜头,跟着节奏扭动。身体结构要真实:每只动物四条腿、一条尾巴,从耳朵尖到爪子都看得见。一个固定、不间断的镜头。不要人,不要多余的动物,不要文字。

在本站,不论拍人还是拍宠物,这几段都用不上,因为提示词已经内置;宠物说唱视频页打开时就设好了宠物和它的搭档。我们实测过一只狗站在一个人旁边;猫,以及两只宠物同框,都还没测。

每条指令为什么写进去

  1. 表演。开头一段把取景、节奏和所有动作都交给视频1:手势、转头、表情、口型,加上纯橙色背景和两人之间那一支银色吊麦。它把机位定死(不推、不拉、不摇),并禁止出现视频里没有的东西。
  2. 音频。音频1 就是整条成片的全部声音,原封不动:不改歌词,不重唱,不加别的音乐或人声。
  3. 谁是谁。每张图绑定一侧,图里的两个主体完整替换视频里的两位表演者:脸、头发或毛发、身体和衣服都取自图片,图片背景一律丢掉。用词是“图1中的主体”,不说男人或女人,所以人和宠物都适用,也不会和照片冲突。它还禁止戴手套,因为我们参考视频里的两位舞者戴着手套,模型以前会把手套画到人手和狗爪上。
  4. 分工。左边的表演者唱音频1 里的人声,嘴型对上;右边的表演者模仿视频里的搭档,踩着节拍做反应和手势,只喊几句简短的 ad-lib。
  5. 安全栏。橙色铺到四个边、没有暗角,不分屏,不加人,不加字幕,从第一帧到最后一帧脸都不变。这几条拦住的是我们见得最多的失败。

把提示词搬到别的视频模型上

  • 你需要一个能同时收参考图片、参考视频和参考音轨、而且会保留音轨的模型。Wan 3.0 可以。字节跳动的 Seedance 2.x 三样都收,但在我们的测试里它会另配新音乐。
  • 按你所用工具的方式称呼附件。我们按上传顺序编号(图1、图2、视频1、音频1);别的工具要写 @Image1 或它自己的标签。顺序别乱:左边照片第一,右边照片第二。
  • 不要给表演者起名字。“图1中的主体”能套住图里的任何东西,人或动物都行。本站只改照片布局(两张照片或一张合照),以及你上传「你的片段」时的动作。
  • 画幅不写在文字里;在工具设置里选 9:16、16:9 或 1:1。
  • 没有参考视频?那就别指向视频1,改用文字描述布景和表演,像上面那五段一样。Dreamina 等工具也公开了自己的纯文字版本。我们只实测过本页开头那两段提示词。

排错表:哪里出问题、为什么

你看到大概的原因试试这样
脸变成了陌生人照片是侧脸、戴墨镜,或脸太小换一张正面、明亮、腰部以上的照片
左右两人换了位置提示词没把每张照片绑定到一侧把左边和右边的表演者分别和对应图片写在一起
多出一个人走进来参考视频里或照片背景里的人被照搬了保留“不要多余的人”,并要求忽略照片背景
画面上冒出文字模型自己编了字幕保留禁止字幕和画面文字的那句
嘴型和音频对不上没附音频,或音轨开头是一段静音附上音轨,并从一个字开始
橙色外面一圈黑边提示词要求了参考视频里没有的运镜沿用参考视频的取景,并要求橙色铺满画面
音轨被换成了别的音乐模型自己写了配乐(我们测 Seedance 2.x 时就这样)换一个会保留参考音轨的模型,比如 Wan 3.0

或者交给本站来写

在 Hotel Lobby Video 里,提示词、参考视频和参考音轨都已经接好。你只要放两张照片,点生成。Wan 3.0、480p、12 秒的一条成片花 6 积分。

用两张人像做你的 Hotel Lobby 视频

问答

好的 Hotel Lobby AI 提示词要写什么?

要把橙色布景、唯一那支吊麦、哪张照片站哪边、每个人做什么都定下来。上面那段 Wan 3.0 提示词,就是本站每次出片发出去的那一段。

这段提示词能配哪些模型?

第一段我们配 Wan 3.0 用,它会保留参考音轨;AI 说唱版配 Seedance 2.x,它会自己写音乐。两者都能收参考图片、参考视频和参考音频。别的模型要换成自己的标签写法,也不一定三样都收。

我能把情侣那段提示词,连同相册里的两张照片,贴进 Dreamina 或可灵吗?

那五段纯照片提示词就是为这种情况写的:能收两张参考照片的图生视频工具。按你所用工具的习惯给照片改名,左右位置保持不变。我们没有在本站以外实测过它们。

我想和我家狗一起出镜,需要宠物那段提示词吗?

在 Hotel Lobby Video 上不需要:[宠物说唱视频页](/dog-and-cat-rap-video)已经为宠物和它的搭档设置好,不用写提示词。狗和人同框实测过;猫和两只宠物同框还没测。

为什么我的提示词总是生成新音乐,而不是 Hotel Lobby 音轨?

有些模型不管你怎么写,都会自己配乐;我们测 Seedance 2.x 时就是这样。换一个会保留参考音轨的模型,比如 Wan 3.0,并把音轨作为音频附上。

我一定要自己写提示词吗?

不用。Hotel Lobby Video 把提示词内置在页面工具里,你只需要放照片。

参考

Hotel Lobby Video 是一款独立应用,和 Quavo、Takeoff、Migos、Quality Control Music、Motown、COLORS 都没有任何关系。