把需求发给提示词生成器,要求输出含「场景+人物+动作+光线+镜头+设备参数」公式、模拟 iPhone 随手拍、并标注 [定量] 与 {变量} 的 5 条 UGC 提示词。输出示例(晨间厨房):
iPhone front camera selfie, {young woman, mid-20s, messy bun}, standing in [American suburban kitchen], [holding portable coffee maker in right hand], pressing brew button with left thumb, morning sunlight from window casting warm side light, medium shot, slightly tilted angle, countertop has {cereal box, half-eaten toast}, condensation on coffee maker, no text, no subtitles, no watermarks
人物一致性锁定(oval face 原句)
面部几何粒度=一致性核心;写 "beautiful young woman" 是一致性失败的根源。产品同理需 ≥30 词。
人物描述锁死到这个粒度(标记 [定量],新场景不动):
oval face, single eyelid, dark brown iris, straight nose bridge, warm ivory skin with visible pores on cheeks
工作流:① 用逆向提示词拆出基准人物参数表 ② 外观全部标 [定量] 锁死 ③ 新场景只改 {变量}(场景/动作/光线)④ 每条提示词完整复制人物描述,不简化。
UGC 三图合一 · 统一光照
多图合成防穿帮:开头声明每张图角色,强制「同一透视 / 焦平面 / 环境光」。
图1人物参考,图2场景参考,图3产品参考。参考人物的外貌发型肤色气质、场景的环境色调光线方向氛围,生成她在该场景中正在 [交互动作] 的 UGC 手机随拍,[视角景别]。三者必须同一光照系统——以场景图光源方向为准,人物与产品的受光面、阴影、色温都一致,产品表面反射环境光。手机随手拍真实感、自然皮肤质感、轻微颗粒、无摄影棚感。同一透视、同一焦平面、同一环境光。
You are VisionStruct UGC Edition, a CV & data-serialization engine for raw authentic UGC. Transcode every visual element into machine-readable JSON. STRICT UGC: do NOT say "high-quality / cinematic / flawless"; treat scene as raw iPhone 13/14 snapshot — mixed color temperatures, harsh overhead LEDs, blown-out window highlights, oversharpening, digital grain, unstyled clutter, candid posture. Skin realistic: visible pores, uneven tone, oils, redness; ban "smooth/glowing/flawless". Ignore subtitles/watermarks. Return ONLY one valid JSON (meta/global_context/persons/objects/spatial_relationships/background_elements).
分镜 → Veo3 I2V 四维动态
I2V 只写「从 A 到 B 的变化」,静态交给关键帧;动作链加微瑕=真实感;台词必须英语原句。
从关键帧静止图出发,只写接下来 8 秒的四维动态(不重复长相/穿着/房间/光线):
① 动作:身体部位+方向+幅度连续过程,≥3 动词用 → 连接,含 1 个微瑕(右手拿瓶→举到脸颊停顿→拧盖拧到一半手滑重新握紧→倒到左掌)
② 表情:表情变化序列 + 说话嘴型节奏
③ 微观:头发甩动方向、衣服褶皱、产品材质反应
④ 镜头:手机怎么动(手持微晃/推拉/对焦游移),不用影视术语
台词(Veo3 直接生成英语语音,引号内只能英语):"Wait wait wait— this is TWENTY dollars?!"