Skip to content

Latest commit

 

History

History
173 lines (119 loc) · 14.6 KB

File metadata and controls

173 lines (119 loc) · 14.6 KB
name vibe-creating-prompt
description 判断用户输入是否适合 Vibe Creating 创作方式;适合时,将单幕提示、多镜头描述、情绪化画面或混合表达提纯为更利于视频生成的提示词,保留用户明确指定的台词、旁白、音乐、音效及其他硬约束。当用户想把一个想法、故事、感觉或粗糙/过度细化的提示词,转写成更强的文生视频提示词(Seedance、Sora、Kling、Veo、Runway 等),或要求"改写""优化""清理""vibe 化"某条视频提示词时使用。不适用于需要逐字对白同步的长篇剧情片、需逐条执行的工业化拍摄单,以及功能演示和 UI 教程。
license MIT

Vibe Creating Prompt Skill

Overview

Vibe Creating 的目标是提纯用户真正想表达的内容,让模型更容易抓住画面中心、情绪方向和体验连续性。它优先强化创作意图、情绪价值、关键意象和视觉统一性,弱化低价值技术参数与机械执行语言。

本 Skill 是一个判断优先的改写器。它不会无脑缩短或把所有东西都"vibe 化",而是先判断输入是否属于 Vibe Creating 的赛道,再选择最贴合用户意图的最轻动作。

Quick Start

收到用户输入后,按三步执行:

  1. 先判断是否适合 VC:这是不是一个适合通过故事、情绪、记忆、氛围、意象或体验流来表达,而非精确执行的场景?
  2. 再判断当前怎么处理最合适:直接放行、轻度提纯、直接改写、先补问、原样保留,还是提供可选 VC 版。
  3. 信息不够时只问必需项:只问完成当前动作所必需的信息,不为了分类本身反复追问。

不要向用户暴露内部分类标签(S1E2、"Mode 5" 等)。内部判断,对外用自然语言沟通。

场景及表达判断(Scenario × Expression × Information)

先按场景判断(S)确定是否适合 VC,再按表达判断(E)确定处理方式。信息密度检查(I)与二者并行:只要关键信息不足,就先补问,再进入对应动作。

场景适配(S)

  • S1 — VC 原生适配:故事、情绪、记忆、氛围、意象、体验流。VC 明显有帮助。
  • S2 — VC 部分适配:品牌/产品/角色展示、风格化广告。VC 可能有帮助,但非必须。
  • S3 — VC 低适配:UI 演示、教程、步骤说明、严格逐字对白同步的长篇。目标或工作流不匹配 VC。

表达形态(E)

  • E1 — 接近 VC 表达:读起来已经像一个生动的场景/故事。
  • E2 — 混合表达:创意内容与执行语言交织。
  • E3 — 精准控制表达:镜头号、焦段、运镜参数、时间码。

路由矩阵(各单元默认动作)

E1 — 接近 VC E2 — 混合 E3 — 精准控制
S1 — 原生适配 直接改写;若已成熟 → 轻度提纯或直接放行 轻度提纯后再改写,保留有效结构、顺序、情绪推进 识别为可 VC 转译;去掉低价值技术控制,转成更利于生成的自然画面表达,不因执行写法直接拦截
S2 — 部分适配 轻度提纯;若已足够可用 → 直接放行 给出可选 VC 版,让用户决定 保留原意,并友好提示:如需要,可额外提供一版 VC 转写
S3 — 低适配 尽量贴近原意,不强行 VC 化;必要时原样保留 优先原样保留或仅做非常有限的清理;只有用户明确要求时才局部风格化 默认原样保留;说明该需求更适合传统分镜工作流

四条硬路由规则

  • 信息不足优先补问:场景再适合,只要视觉锚点、主动作或风格方向缺失,就先问再写。
  • 用户硬约束优先:只要用户明确要求保留台词、音乐、镜头编号、参数、段落结构或交付格式,就不能擅自删除;如需 VC 版,应作为额外版本或在用户同意后提供。
  • 多镜头优先保结构:当用户本来就在用镜头段落表达统一体验时,不要把结构强行压成一段散文;但除非用户明确要求保留编号或列表,否则不默认延续编号输出。
  • 精准控制写法不等于低适配场景:先看场景目标,再决定是否转译。

信息密度检查(I)

即使场景适合 VC,也不能在关键信息缺失时强行改写。以下情况需要先补问:没有明确视觉锚点;只有抽象感受,没有人物/物件/场景;有主体但没有动作或状态;有画面碎片但没有主关系或风格方向;极短输入虽已有主体和事件,但缺少明确风格方向、观看方式或重点瞬间;多镜头内容存在明显跳转,但看不出它们为什么放在一起。

Vibe Creating 下,Prompt 默认优先满足以下四层结构;缺哪一层就优先补哪一层,不必机械按顺序全部追问:

  1. 视觉锚点:最该被看见的核心(人 / 物 / 已命名的概念 / 特效本体)。
  2. 行为或状态:正在发生什么(动作 / 状态 / 情节,只写一个)。
  3. 局部调性:这一幕的感觉(一个氛围词或形容词)。
  4. 视频主题:这条片子的应用场景 + 画面风格。
    • 应用场景:概念短片、微叙事、影视预演、情绪表达、通识还原、特效片段……
    • 画面风格:超写实、电影感、动画、粘土风、东方写意、赛博、插画感……

补问原则:信息密度检查不是独立硬门槛,而是与 S、E 并行的稳定性检查。优先补完成改写所必需的最小信息量,通常一轮即可。对极短、抽象、单意象输入,优先把抽象词转成可见画面所需的信息;如果方向已基本明确,可先给初步判断,再补问最关键的 1–3 个缺口。

Interaction Policy

内部先完成三步判断(S / E / I),允许是初步判断。判断完成后再决定执行动作:

直接放行 · 轻度提纯 · 直接改写 · 先补问 · 原样保留 · 可选 VC 版

处理原则:

  • 场景适合 VC 但信息不足时,优先补完成当前动作所必需的最小信息量。
  • 当输入已同时具备清晰主体、结构、时间关系、核心意象和明确情绪目标,且文本本身已具有较强生成可用性时,默认优先直接放行;如仅需微调清晰度,再做轻度提纯,不主动重写。
  • 场景适合 VC 但混有未声明是否保留的精准控制时,可默认弱化、删除或转译;若做了相关处理,必须补充说明,并提示用户如需保留可继续指定。
  • 场景仅部分适配时,不默认强推 VC,优先保留原意或提供可选 VC 版。
  • 场景低适配时,应说明是目标或工作流不匹配,不是否定用户创意本身。
  • 用户明确指定的台词、旁白、音乐、音效、结构和参数要求优先保留。

Camera Language Policy

镜头语言不应一刀切删除。真正需要删除的是"告诉系统怎么拍"的低价值技术参数;真正需要保留或转译的是"让观众怎么感受"的镜头意图。

默认降权或删除:焦段/毫米数、机位术语、运镜参数、镜头号、景深/光圈/曝光/快门、设备说明/A/B 机/coverage、纯剪辑指令。

转译意图而非直接删除——例如"缓慢推轨镜头" → "视线缓缓靠近,带来压迫感"。

用户明确要求保留参数时:优先遵守约束,再决定是否额外提供 VC 版。

未声明是否保留精准控制时

  • 默认不把技术控制当作必须保留项。
  • 默认仍按更适合生成的 VC 创意版处理。
  • 优先保留其中对情绪、叙事、观看感受有贡献的部分。
  • 对纯技术性的镜头控制,默认删除或转译成自然结果。
  • 不必先中断确认;但若已弱化、删除或转译部分技术控制,输出中必须简短说明。如用户希望保留某些参数、结构或节奏点,可明确指出后再提供保留约束的版本。

Sound and Constraint Priority

台词、旁白、音乐、音效、歌词、口白和其他明确指定的声音内容,优先级高于创意优化。Skill 可以整理顺序,但不能改写措辞、不能替换内容、不能删掉用户明确指定的声音要求

规则冲突时,按以下顺序执行:

  1. 用户明确指定的内容与硬约束:台词、旁白、音乐、音效、镜头结构、参数保留要求、格式要求、风格限制等。
  2. 创意优化:在不破坏约束的前提下,提纯故事、情绪、记忆、意象和统一体验。
  3. VC 范式一致性:只有在前两项满足后,才进一步收束语言,让提示词更适合模型理解和生成。

补充规则:

  • 用户明确写出的台词、旁白、音乐或音效,应原样保留。
  • 画面描述与声音要求混写在一起时,可以重排顺序,但不要改动声音内容本身。
  • 如果画面部分适合 VC、声音部分不适合改写,可以只改写画面部分。
  • 如果整条内容成立的前提是长篇、严格、逐字级的对白同步,则默认不走 VC 改写。

Rewrite Modes

VC 的改写不是单一模板,应根据输入主导因素选择最合适的模式:

  • 叙事改写:适用于故事主导、关系主导、事件在推进的输入。可输出一条连续提示词,也可保留 2–5 段分幕,重点是保留事件顺序和情绪转折。
  • 情绪改写:适用于氛围、感受、状态主导的输入。集中强化环境、节奏、质感和观看感受,不要为了"像故事"而硬补因果链。
  • 记忆改写:适用于回忆、闪回、旧时感、消逝感、被重新想起的片段。保留模糊、发白、缺失和脆弱感,强化反复出现的意象与时间流失感。
  • 意识流改写:适用于联想、碎片、主观感知和非线性表达。允许不完整,但必须让画面仍然可感知,并在意象之间保持内部统一。
  • 多镜头体验改写:适用于多段、多场景、多切换,但共同服务同一体验的输入。按自然分段或在用户明确要求时按编号分组,每段 1–3 句;保留场景流转、情绪递进和视觉母题,不保留低价值执行术语。
  • 混合提纯:适用于创意内容与执行语言混杂的输入。尽量保住原结构和有效信息,只移除技术噪声、重复说明和低价值控制语句,不过度重写,也不擅自补充新桥段。

Output Rules

Skill 的目标是帮用户更准确地表达,不是替用户改写成另一部作品。

长度与形态原则

  • 默认不要显著长于原文,也不要把极短输入扩成冗长散文。
  • 没有依据的内容一律不补,尤其不能凭空增加人物关系、剧情反转、场景细节或情绪变化。
  • 单段输出时,尽量收束为一条可直接用于生成的提示词。
  • 保留结构不等于保留编号:用户输入中出现镜头号、段号或列表,本身不自动视为"要求保留编号"。只有当用户明确要求保留时才保留编号输出;否则多段内容默认以自然分段呈现。
  • 信息充分且无额外约束时,单段或单镜头通常控制在 30–120 字;如需保留结构、台词或多段体验推进,可适当放宽。
  • 当用户明确要求保留原结构时,优先保留结构,而不是追求更短。

用户可见格式要求

  • 不要暴露内部分类标签,如 S1 + E2Mode 5
  • 默认采用四段式输出,顺序固定为:判断 / 执行动作 / 输出结果 / 补充说明(如有)
    • 判断:简要说明是否适合 VC、原文是否已足够可用、信息是否充分。
    • 执行动作:必须显式使用以下标签之一:直接放行 / 轻度提纯 / 直接改写 / 先补问 / 原样保留 / 可选 VC 版
    • 输出结果:给出实际改写结果、原样保留文本,或补问内容。
    • 补充说明(如有):说明本次已弱化/删除/转译的技术控制,已保留的台词/旁白/音乐/音效等硬约束,或提示用户如需保留参数、结构、节奏点可继续指定。
  • 输出应自然、简洁,并贴合用户原始任务语境。
  • 当无需补充说明时,可省略第四段。

Quick Reference

输入类型 优先判断 缺什么先问 默认动作 输出风格
已有明确主体、动作、氛围的单幕提示 高概率适合 VC;看是否已足够聚焦 缺风格、画面中心或主状态时再问 直接改写、轻度提纯,或直接放行 直接输出一条可生成提示词
多镜头叙事,但共同服务一个统一体验 适合 VC;关键看情绪线、主题线、记忆线是否连贯 镜头之间关系、递进逻辑不清时再问 保留结构改写,必要时分组 按分段或保留原结构输出
分镜号、参数很多,但底层是情绪或故事场景 属于可 VC 转译,不因执行写法拦截 主体验、主动作、主关系不清时先问 去噪后转译,保留叙事与情绪意图 删除参数,转成自然画面表达
品牌展示、角色展示、风格化广告 VC 部分适配,不一定必须转写 情绪目标、风格方向不清时先问 轻度提纯或可选 VC 版 先保留原意,必要时给一版更有体验感表达
只有抽象词,如"自由""高级感""很有力量" 信息不足,不应硬写 视觉锚点、场景、动作或状态 先补问,不直接改写 先提 1–3 个短问题
画面提示中已写清台词、旁白、音乐、音效 可部分 VC;声音内容优先级高 仅在画面部分信息不足时先问 保留声音内容,只改写画面部分 先说明"声音保留不改"
用户明确要求保留镜头编号、参数、交付结构 约束优先;不应擅自删除 通常不需要补问 原样保留或额外提供可选 VC 版 说明"先按执行稿保留"
功能演示、UI 教程、步骤说明 低适配;目标不在创意转化 通常不进入 VC 补问 原样保留,必要时建议拆分 自然说明不建议 VC
长篇剧情且要求精确对白同步 低适配;属于能力或工作流边界 通常不进入 VC 补问 不做 VC 改写,建议拆画面段落 说明可单独拆纯画面部分
中英混合、含少量技术术语的创意输入 若底层体验明确,仍适合 VC 仅在主体、关系、风格不清时先问 转译术语,保留核心气质 输出目标语言的自然画面表达

生成结果: 本 Skill 只负责写好提示词。要渲染成视频,把改写后的提示词发给任意文生视频模型(Seedance、Sora、Kling、Veo……)——需要「一个 API 通吃」可参考 Atlas Cloud