MiniMax H3MiniMax H3
註冊
Seed Audio 1.0 AI audio generation model hero visual with cinematic waveform control room
模型介紹

Seed Audio 1.0

AI 音訊模型總覽:打造完整聲音場景

Seed Audio 1.0 可理解為場景級音訊生成模型:能將人聲、表達風格、環境音、音樂方向及音效整合為一份可立即使用的草稿。

文字、圖片、音訊

提示與參考輸入

最多 3 個音訊參考

用於人聲或風格引導

2 分鐘

單次輸出最長時間

音訊集錦

來自原始素材的可播放範例

這些片段取自內部參考文件,壓縮為 MP3 後重新上傳至專案 CDN。此處的文字為本頁面新撰寫的摘要。

Seed Audio 1.0 AI 音訊示範畫廊,包含電影場景範例、波形疊加及播放控制
01 / 99s

懸疑對話包

雙角色犯罪劇風格音訊,包含對話、電話質感及戲劇性背景張力。

02 / 36s

電商直播人聲

雙主播購物場景,融合地域口音、促銷節奏及背景音樂。

03 / 55s

對話式 Podcast

雙人談話形式,著重自然停頓、非正式節奏及清晰的口語呈現。

04 / 30s

多角色廣告短片

簡短的廣告風格片段,包含多種人聲、音樂轉場及充滿活力的聲音佈局。

05 / 55s

受控人聲參考

參考引導的結果,展示如何將音質、節奏及口語風格帶入新的輸出。

06 / 72s

多參考場景

一個範例,展示多個參考音軌如何塑造最終對話節奏及人聲互動。

簡短說明

不只是 TTS,也不只是音效。

傳統 TTS 將文字轉為語音。Seed Audio 1.0 定位於完整音訊創作:口白、角色聲音、節奏、環境、背景音樂及擬音細節可一併規劃。這讓需要快速產出完整音訊場景初稿的創作者受益。

Seed Audio 1.0 AI 音訊生成模型製作台,顯示分層的人聲、環境音、音樂及音效波形

能力圖譜

模型的適用範圍

最強應用場景是人聲與情境需協同運作之處,而非單純的旁白。

多模態引導

可從文字提示、圖片參考或短音訊參考出發,引導人聲、情緒、節奏或角色特質。

對話與表達控制

直接在提示中描述說話者、語氣、節奏、情感、口音、停頓、笑聲或對話風格。

分層聲音設計

將環境音、音樂鋪底、轉場及音效事件一併規劃,無需在獨立工具中逐層製作。

人聲一致性工作流程

參考音訊有助於在較長的角色或品牌音訊中保留可辨識的人聲特徵。

模型備註

設計提示前需了解的限制

Seed Audio 1.0 多模態音訊生成工作流程,包含文字、圖片及音訊參考輸入

文字輸入

每次請求最多 3,000 字元。

參考媒體

可使用一張圖片或最多三個音訊參考,但同一請求中請勿混用兩者。

音訊參考

每個參考應在 30 秒內以確保可靠處理。

輸出長度

單次生成結果最長約 2 分鐘。

語言

主要支援中文與英文。

輸出格式

常見輸出格式為 WAV、MP3、PCM 及 OGG Opus。

控制項

速度、音高、音量、時間戳記及浮水印選項可能因存取管道而異。

API 風格

公開整合模式為非串流 HTTP。

適用場景

場景級音訊生成的理想任務

短影音與廣告

快速製作產品旁白、廣告口號、社群短片及在地化版本,並包含聲音設計。

有聲書與廣播劇

在進錄音室前,先草擬旁白、角色演繹、空間感及輕量擬音。

遊戲與互動媒體

在早期製作階段探索 NPC 人聲、UI 音效、環境循環及過場動畫音訊方向。

Podcast 與解說影片

將主題轉化為引導式音訊草稿,包含人聲、節奏、轉場音效及背景質感。

提示框架

實用的提示結構

01

場景

說明格式、地點、情緒及目標聽眾。

02

人聲

描述說話者人數、語言、風格、情感及清晰度優先級。

03

層次

加入環境音、音樂方向及最重要的音效事件。

04

檢視

聆聽最嘈雜的層次,然後逐一修改。