289 lines
9.8 KiB
JSON
289 lines
9.8 KiB
JSON
{
|
||
"model": "wan2.6-r2v-flash",
|
||
"input": {
|
||
"prompt": "Character2 坐在靠窗的椅子上,手持 character3,在 character4 旁演奏一首舒缓的美国乡村民谣。Character1 对Character2开口说道:“听起来不错”",
|
||
"negative_prompt": "",
|
||
"media": [
|
||
{
|
||
"type": "reference_image",
|
||
"url": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20260408/sjuytr/wan-r2v-object-girl.jpg",
|
||
"reference_voice": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20260408/gbqewz/wan-r2v-girl-voice.mp3"
|
||
},
|
||
{
|
||
"type": "reference_video",
|
||
"url": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20260129/qigswt/wan-r2v-role2.mp4",
|
||
"reference_voice": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20260408/isllrq/wan-r2v-boy-voice.mp3"
|
||
},
|
||
{
|
||
"type": "reference_image",
|
||
"url": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20260129/rtjeqf/wan-r2v-object3.png"
|
||
},
|
||
{
|
||
"type": "reference_image",
|
||
"url": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20260129/qpzxps/wan-r2v-object4.png"
|
||
},
|
||
{
|
||
"type": "reference_image",
|
||
"url": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20260129/wfjikw/wan-r2v-backgroud5.png"
|
||
}
|
||
]
|
||
},
|
||
"parameters": {
|
||
"resolution": "1080P",
|
||
"ratio": "16:9",
|
||
"duration": 10,
|
||
"prompt_extend": true,
|
||
"watermark": true,
|
||
"seed": 2147483647
|
||
}
|
||
}
|
||
|
||
//model string (必选)
|
||
//
|
||
//模型名称。模型列表与价格详见模型价格。
|
||
//
|
||
//示例值:wan2.7-r2v、wan2.7-r2v-2026-06-12。
|
||
//
|
||
//input object (必选)
|
||
//
|
||
//输入的基本信息,如提示词等。
|
||
//
|
||
//属性
|
||
//
|
||
//prompt string (必选)
|
||
//
|
||
//文本提示词。用来描述生成视频中期望包含的元素和视觉特点。
|
||
//
|
||
//支持中英文,每个汉字、字母、标点占一个字符,超过部分会自动截断。
|
||
//
|
||
//wan2.7-r2v、wan2.7-r2v-2026-06-12:不超过5000个字符。
|
||
//
|
||
//参考指代:当为中文提示词时,参考图片时通过“图1、图2”这类标识指代,参考视频时通过“视频1、视频2”这类标识指代。英文提示词则写为“Image 1”、"Video 1”这类标识。英文字母和数字之间有空格,首字母大写。顺序与media数组顺序一致。图和视频分别计数,即同时存在图1、视频1等标识。若参考素材有且仅有一张图片或一个视频,则可简化表述为”参考图片”或“参考视频”。
|
||
//
|
||
//画面描述:假设参考图1是一只猫,图2是一个房间,要描述猫在房间里玩耍,支持两种写法:一种是直接使用标识指代(如“图1在图2里玩耍”);另一种是结合主体与场景补充说明(如“图1的猫在图2的房间里玩耍”)。
|
||
//
|
||
//当参考图片为多宫格(故事板图像)时,提示词建议按照多分镜的形式描述画面内容。无需描述每个宫格,提供关键分镜内容即可,模型将自动识别宫格逻辑并智能补全镜头内容。为达到更好的效果,建议单次仅输入一张多宫格图。
|
||
//
|
||
//提示词的使用技巧请参见文生视频/图生视频Prompt指南。
|
||
//
|
||
//negative_prompt string (可选)
|
||
//
|
||
//反向提示词,用来描述不希望在视频画面中出现的内容,可以对视频画面进行限制。
|
||
//
|
||
//支持中英文,长度不超过500个字符,超过部分会自动截断。
|
||
//
|
||
//示例值:低分辨率、错误、最差质量、低质量、残缺、多余的手指、比例不良等。
|
||
//
|
||
//media array (必选)
|
||
//
|
||
//媒体素材数组,素材包括图像、视频和音频。支持图像/视频输入作为视觉参考,图像支持多视图,常见参考角色、道具、场景等。
|
||
//
|
||
//数组中每个元素为一个媒体对象,包含 type 与 url 字段。
|
||
//
|
||
//按照数组顺序定义prompt中角色引用的顺序。图和视频分别计数,即可同时存在图1、视频1。
|
||
//
|
||
//数组中的第 1 个reference_video 对应 视频1,第 2 个对应 视频2,以此类推。
|
||
//
|
||
//数组中的第 1 个reference_image对应 图1,第 2 个对应 图2,以此类推。
|
||
//
|
||
//属性
|
||
//
|
||
//type string (必选)
|
||
//
|
||
//媒体素材类型。可选值为:
|
||
//
|
||
//reference_image:参考图像。提供主体角色(人物/动物/物体)和场景参考。
|
||
//
|
||
//reference_video:参考视频。提供主体角色(人物/动物/物体)和音色参考,不推荐传入空镜视频。
|
||
//
|
||
//first_frame:首帧图像。基于首帧生成视频,通常包含主体角色(人物/动物/物体)。支持同时传入首帧图联合控制,常见用法如下:
|
||
//
|
||
//首帧中已经出现待参考主体:此时可以搭配主体参考强化一致性,或进行音色参考。
|
||
//
|
||
//首帧中未出现待参考主体:此时可以用主体参考来定义视频动态过程中新出现的主体特征。
|
||
//
|
||
//素材限制:
|
||
//
|
||
//首帧图像,最多传入1张。
|
||
//
|
||
//参考图像和参考视频至少传入1个,参考图像 + 参考视频 ≤ 5。
|
||
//
|
||
//参考素材为主体角色时,仅包含单一角色。
|
||
//
|
||
//url string (必选)
|
||
//
|
||
//媒体素材URL。每个值可指向一张图像或一段视频。
|
||
//
|
||
//传入参考图像(type=reference_image)
|
||
//
|
||
//参考图像URL或 Base64 编码数据。参考图可以是主体(人物/动物/物体)或者背景。当包含主体时,仅包含一个角色。
|
||
//
|
||
//图像限制:
|
||
//
|
||
//格式:JPEG、JPG、PNG(不支持透明通道)、BMP、WEBP。
|
||
//
|
||
//分辨率:宽度和高度范围为[240, 8000]像素。
|
||
//
|
||
//宽高比:1:8~8:1。
|
||
//
|
||
//文件大小:不超过20MB。
|
||
//
|
||
//支持输入的格式:
|
||
//
|
||
//公网URL:
|
||
//
|
||
//支持HTTP或HTTPS协议。
|
||
//
|
||
//示例值:https://xxx/xxx.png。
|
||
//
|
||
//临时URL:
|
||
//
|
||
//支持OSS协议,必须通过上传文件获取临时 URL。
|
||
//
|
||
//示例值:oss://dashscope-instant/xxx/xxx.png。
|
||
//
|
||
//Base64 编码图像后的字符串:
|
||
//
|
||
//数据格式:data:{MIME_type};base64,{base64_data}。
|
||
//
|
||
//示例值:data:image/png;base64,GDU7MtCZzEbTbmRZ......。(编码字符串过长,仅展示片段)
|
||
//
|
||
//详情请参见传入图像。
|
||
//
|
||
//传入参考视频(type=reference_video)
|
||
//
|
||
//参考视频URL。视频内容建议包含主体(人物/动物/物体),不建议使用背景或空镜视频。当包含主体时,仅包含一个角色。若视频有声音,也可以参考音色。
|
||
//
|
||
//视频限制:
|
||
//
|
||
//格式:mp4、mov。
|
||
//
|
||
//时长:1~30s。
|
||
//
|
||
//分辨率:宽度和高度范围为[240,4096]像素。
|
||
//
|
||
//宽高比:1:8~8:1。
|
||
//
|
||
//文件大小:不超过100MB。
|
||
//
|
||
//支持输入的格式:
|
||
//
|
||
//公网URL:
|
||
//
|
||
//支持HTTP和HTTPS协议。
|
||
//
|
||
//示例值:https://xxx/xxx.mp4。
|
||
//
|
||
//临时URL:
|
||
//
|
||
//支持OSS协议,必须通过上传文件获取临时 URL。
|
||
//
|
||
//示例值:oss://dashscope-instant/xxx/xxx.mp4。
|
||
//
|
||
//reference_voice string (可选)
|
||
//
|
||
//音频 URL。用于指定参考素材(图像/视频)中主体角色的音色。与reference_image或reference_video搭配使用。该音频仅参考音色,与说话内容无关。建议参考音频语种与提示词语种保持一致,匹配效果更佳。
|
||
//
|
||
//音频生效逻辑:
|
||
//
|
||
//默认行为:若 reference_video 本身包含音频,但未指定 reference_voice,默认使用视频原声。
|
||
//
|
||
//优先级:若同时传入 reference_video(含音频)和 reference_voice,则优先使用 reference_voice 的音色,覆盖视频原声。
|
||
//
|
||
//音频限制:
|
||
//
|
||
//格式:wav、mp3。
|
||
//
|
||
//时长:1~10s。
|
||
//
|
||
//文件大小:不超过15MB。
|
||
//
|
||
//支持输入的格式:
|
||
//
|
||
//公网URL:
|
||
//
|
||
//支持HTTP和HTTPS协议。
|
||
//
|
||
//示例值:https://xxx/xxx.mp3。
|
||
//
|
||
//临时URL:
|
||
//
|
||
//支持OSS协议,必须通过上传文件获取临时 URL。
|
||
//
|
||
//示例值:oss://dashscope-instant/xxx/xxx.mp3。
|
||
//
|
||
//parameters object (可选)
|
||
//
|
||
//视频处理参数,如设置视频分辨率。
|
||
//
|
||
//属性
|
||
//
|
||
//resolution string (可选)
|
||
//
|
||
//重要
|
||
//resolution直接影响费用,请在调用前确认百炼控制台。
|
||
//
|
||
//生成视频的分辨率档位,用于控制视频的清晰度(总像素)。
|
||
//
|
||
//wan2.7-r2v、wan2.7-r2v-2026-06-12:可选值:720P、1080P。默认值为1080P。
|
||
//
|
||
//ratio string (可选)
|
||
//
|
||
//生成视频的宽高比。
|
||
//
|
||
//生效逻辑:
|
||
//
|
||
//未传入首帧图像:按指定的 ratio 参数生成视频。
|
||
//
|
||
//已传入首帧图像:自动忽略 ratio 参数,以首帧图像的宽高比生成近似比例的视频。
|
||
//
|
||
//可选值为:
|
||
//
|
||
//16:9(默认值)
|
||
//
|
||
//9:16
|
||
//
|
||
//1:1
|
||
//
|
||
//4:3
|
||
//
|
||
//3:4
|
||
//
|
||
//不同宽高比对应的输出视频分辨率(宽高像素值)见下方表格。
|
||
//
|
||
//duration integer (可选)
|
||
//
|
||
//重要
|
||
//duration直接影响费用,请在调用前确认模型价格。
|
||
//
|
||
//生成视频的时长,单位为秒。
|
||
//
|
||
//wan2.7-r2v、wan2.7-r2v-2026-06-12:默认值为5。
|
||
//
|
||
//当参考素材中包含视频时:取值为[2, 10]之间的整数。
|
||
//
|
||
//当参考素材中不包含视频时:取值为[2, 15]之间的整数。
|
||
//
|
||
//prompt_extend boolean (可选)
|
||
//
|
||
//是否开启prompt智能改写。开启后使用大模型对输入prompt进行智能改写。对于较短的prompt生成效果提升明显,但会增加耗时。
|
||
//
|
||
//true:默认值,开启智能改写。
|
||
//
|
||
//false:不开启智能改写。
|
||
//
|
||
//watermark boolean (可选)
|
||
//
|
||
//是否添加水印标识,水印位于视频右下角,文案固定为“AI生成”。
|
||
//
|
||
//false:默认值,不添加水印。
|
||
//
|
||
//true:添加水印。
|
||
//
|
||
//seed integer (可选)
|
||
//
|
||
//随机数种子,取值范围为[0, 2147483647]。
|
||
//
|
||
//未指定时,系统自动生成随机种子。若需提升生成结果的可复现性,建议固定seed值。
|
||
//
|
||
//请注意,由于模型生成具有概率性,即使使用相同 seed,也不能保证每次生成结果完全一致。 |