1
提供视频或音频
音频输出 类型 接受音频文件或包含音频流的视频。
音频输出 类型 接受音频文件或包含音频流的视频。
复制兼容音频、编码可预测格式、标准化为 -16 LUFS、修剪静音或准备 16 kHz 单声道 WAV。
将字幕设置附加到音频输出,以在音频工件旁边生成 SRT、WebVTT 或两者。
以 M4A、MP3、Opus 形式交付 AAC,或复制兼容的源流而无需重新编码。
提交 MOV、MP4、WebM 或其他支持的视频,并仅返回其选定的音频格式。
在 AAC 交付之前标准化响度、删除前导和尾随静音或组合这两种操作。
生成为下游语音系统准备的 SRT 和 WebVTT 转录本或 16 kHz 单声道 PCM WAV。
audio_copy_fastaudio_aac_128kaudio_mp3_128kaudio_opus_96kaudio_loudnorm_aac_128kaudio_trim_silence_aac_128kaudio_loudnorm_trim_aac_128kaudio_whisper_prep使用您的 MediaRuntime API 密钥从受信任的服务器提交。源可以是任何可获取的 HTTPS URL;通过 MediaRuntime 上传是可选的。
{
"file_url": "https://cdn.example.com/media/interview.mp4",
"metadata": {
"media_type": "video",
"asset_id": "interview-0426"
},
"outputs": [
{
"type": "audio",
"preset": "audio_aac_128k",
"path_suffix": "audio-and-transcript",
"subtitles": {
"enabled": true,
"languages": [
"auto"
],
"format": "both",
"model": "ggml-base.bin",
"translate_to_english": false
}
}
]
}