Files
2026-07-17 13:14:08 +08:00

289 lines
9.8 KiB
JSON
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
{
"model": "wan2.6-r2v-flash",
"input": {
"prompt": "Character2 坐在靠窗的椅子上,手持 character3,在 character4 旁演奏一首舒缓的美国乡村民谣。Character1 对Character2开口说道:“听起来不错”",
"negative_prompt": "",
"media": [
{
"type": "reference_image",
"url": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20260408/sjuytr/wan-r2v-object-girl.jpg",
"reference_voice": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20260408/gbqewz/wan-r2v-girl-voice.mp3"
},
{
"type": "reference_video",
"url": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20260129/qigswt/wan-r2v-role2.mp4",
"reference_voice": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20260408/isllrq/wan-r2v-boy-voice.mp3"
},
{
"type": "reference_image",
"url": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20260129/rtjeqf/wan-r2v-object3.png"
},
{
"type": "reference_image",
"url": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20260129/qpzxps/wan-r2v-object4.png"
},
{
"type": "reference_image",
"url": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20260129/wfjikw/wan-r2v-backgroud5.png"
}
]
},
"parameters": {
"resolution": "1080P",
"ratio": "16:9",
"duration": 10,
"prompt_extend": true,
"watermark": true,
"seed": 2147483647
}
}
//model string (必选)
//
//模型名称。模型列表与价格详见模型价格。
//
//示例值:wan2.7-r2v、wan2.7-r2v-2026-06-12。
//
//input object (必选)
//
//输入的基本信息,如提示词等。
//
//属性
//
//prompt string (必选)
//
//文本提示词。用来描述生成视频中期望包含的元素和视觉特点。
//
//支持中英文,每个汉字、字母、标点占一个字符,超过部分会自动截断。
//
//wan2.7-r2v、wan2.7-r2v-2026-06-12:不超过5000个字符。
//
//参考指代:当为中文提示词时,参考图片时通过“图1、图2”这类标识指代,参考视频时通过“视频1、视频2”这类标识指代。英文提示词则写为“Image 1”、"Video 1”这类标识。英文字母和数字之间有空格,首字母大写。顺序与media数组顺序一致。图和视频分别计数,即同时存在图1、视频1等标识。若参考素材有且仅有一张图片或一个视频,则可简化表述为”参考图片”或“参考视频”。
//
//画面描述:假设参考图1是一只猫,图2是一个房间,要描述猫在房间里玩耍,支持两种写法:一种是直接使用标识指代(如“图1在图2里玩耍”);另一种是结合主体与场景补充说明(如“图1的猫在图2的房间里玩耍”)。
//
//当参考图片为多宫格(故事板图像)时,提示词建议按照多分镜的形式描述画面内容。无需描述每个宫格,提供关键分镜内容即可,模型将自动识别宫格逻辑并智能补全镜头内容。为达到更好的效果,建议单次仅输入一张多宫格图。
//
//提示词的使用技巧请参见文生视频/图生视频Prompt指南。
//
//negative_prompt string (可选)
//
//反向提示词,用来描述不希望在视频画面中出现的内容,可以对视频画面进行限制。
//
//支持中英文,长度不超过500个字符,超过部分会自动截断。
//
//示例值:低分辨率、错误、最差质量、低质量、残缺、多余的手指、比例不良等。
//
//media array (必选)
//
//媒体素材数组,素材包括图像、视频和音频。支持图像/视频输入作为视觉参考,图像支持多视图,常见参考角色、道具、场景等。
//
//数组中每个元素为一个媒体对象,包含 type 与 url 字段。
//
//按照数组顺序定义prompt中角色引用的顺序。图和视频分别计数,即可同时存在图1、视频1。
//
//数组中的第 1 个reference_video 对应 视频1,第 2 个对应 视频2,以此类推。
//
//数组中的第 1 个reference_image对应 图1,第 2 个对应 图2,以此类推。
//
//属性
//
//type string (必选)
//
//媒体素材类型。可选值为:
//
//reference_image:参考图像。提供主体角色(人物/动物/物体)和场景参考。
//
//reference_video:参考视频。提供主体角色(人物/动物/物体)和音色参考,不推荐传入空镜视频。
//
//first_frame:首帧图像。基于首帧生成视频,通常包含主体角色(人物/动物/物体)。支持同时传入首帧图联合控制,常见用法如下:
//
//首帧中已经出现待参考主体:此时可以搭配主体参考强化一致性,或进行音色参考。
//
//首帧中未出现待参考主体:此时可以用主体参考来定义视频动态过程中新出现的主体特征。
//
//素材限制:
//
//首帧图像,最多传入1张。
//
//参考图像和参考视频至少传入1个,参考图像 + 参考视频 ≤ 5。
//
//参考素材为主体角色时,仅包含单一角色。
//
//url string (必选)
//
//媒体素材URL。每个值可指向一张图像或一段视频。
//
//传入参考图像(type=reference_image
//
//参考图像URL或 Base64 编码数据。参考图可以是主体(人物/动物/物体)或者背景。当包含主体时,仅包含一个角色。
//
//图像限制:
//
//格式:JPEG、JPG、PNG(不支持透明通道)、BMP、WEBP。
//
//分辨率:宽度和高度范围为[240, 8000]像素。
//
//宽高比:1:88:1。
//
//文件大小:不超过20MB。
//
//支持输入的格式:
//
//公网URL:
//
//支持HTTP或HTTPS协议。
//
//示例值:https://xxx/xxx.png。
//
//临时URL
//
//支持OSS协议,必须通过上传文件获取临时 URL。
//
//示例值:oss://dashscope-instant/xxx/xxx.png。
//
//Base64 编码图像后的字符串:
//
//数据格式:data:{MIME_type};base64,{base64_data}。
//
//示例值:data:image/png;base64,GDU7MtCZzEbTbmRZ......。(编码字符串过长,仅展示片段)
//
//详情请参见传入图像。
//
//传入参考视频(type=reference_video
//
//参考视频URL。视频内容建议包含主体(人物/动物/物体),不建议使用背景或空镜视频。当包含主体时,仅包含一个角色。若视频有声音,也可以参考音色。
//
//视频限制:
//
//格式:mp4、mov。
//
//时长:130s。
//
//分辨率:宽度和高度范围为[240,4096]像素。
//
//宽高比:1:88:1。
//
//文件大小:不超过100MB。
//
//支持输入的格式:
//
//公网URL
//
//支持HTTP和HTTPS协议。
//
//示例值:https://xxx/xxx.mp4。
//
//临时URL
//
//支持OSS协议,必须通过上传文件获取临时 URL。
//
//示例值:oss://dashscope-instant/xxx/xxx.mp4。
//
//reference_voice string (可选)
//
//音频 URL。用于指定参考素材(图像/视频)中主体角色的音色。与reference_image或reference_video搭配使用。该音频仅参考音色,与说话内容无关。建议参考音频语种与提示词语种保持一致,匹配效果更佳。
//
//音频生效逻辑:
//
//默认行为:若 reference_video 本身包含音频,但未指定 reference_voice,默认使用视频原声。
//
//优先级:若同时传入 reference_video(含音频)和 reference_voice,则优先使用 reference_voice 的音色,覆盖视频原声。
//
//音频限制:
//
//格式:wav、mp3。
//
//时长:110s。
//
//文件大小:不超过15MB。
//
//支持输入的格式:
//
//公网URL
//
//支持HTTP和HTTPS协议。
//
//示例值:https://xxx/xxx.mp3。
//
//临时URL
//
//支持OSS协议,必须通过上传文件获取临时 URL。
//
//示例值:oss://dashscope-instant/xxx/xxx.mp3。
//
//parameters object (可选)
//
//视频处理参数,如设置视频分辨率。
//
//属性
//
//resolution string (可选)
//
//重要
//resolution直接影响费用,请在调用前确认百炼控制台。
//
//生成视频的分辨率档位,用于控制视频的清晰度(总像素)。
//
//wan2.7-r2v、wan2.7-r2v-2026-06-12:可选值:720P、1080P。默认值为1080P。
//
//ratio string (可选)
//
//生成视频的宽高比。
//
//生效逻辑:
//
//未传入首帧图像:按指定的 ratio 参数生成视频。
//
//已传入首帧图像:自动忽略 ratio 参数,以首帧图像的宽高比生成近似比例的视频。
//
//可选值为:
//
//16:9(默认值)
//
//9:16
//
//1:1
//
//4:3
//
//3:4
//
//不同宽高比对应的输出视频分辨率(宽高像素值)见下方表格。
//
//duration integer (可选)
//
//重要
//duration直接影响费用,请在调用前确认模型价格。
//
//生成视频的时长,单位为秒。
//
//wan2.7-r2v、wan2.7-r2v-2026-06-12:默认值为5。
//
//当参考素材中包含视频时:取值为[2, 10]之间的整数。
//
//当参考素材中不包含视频时:取值为[2, 15]之间的整数。
//
//prompt_extend boolean (可选)
//
//是否开启prompt智能改写。开启后使用大模型对输入prompt进行智能改写。对于较短的prompt生成效果提升明显,但会增加耗时。
//
//true:默认值,开启智能改写。
//
//false:不开启智能改写。
//
//watermark boolean (可选)
//
//是否添加水印标识,水印位于视频右下角,文案固定为“AI生成”。
//
//false:默认值,不添加水印。
//
//true:添加水印。
//
//seed integer (可选)
//
//随机数种子,取值范围为[0, 2147483647]。
//
//未指定时,系统自动生成随机种子。若需提升生成结果的可复现性,建议固定seed值。
//
//请注意,由于模型生成具有概率性,即使使用相同 seed,也不能保证每次生成结果完全一致。