懸疑對話包
雙角色犯罪劇風格音訊,包含對話、電話質感及戲劇性背景張力。

音訊集錦
這些片段取自內部參考文件,壓縮為 MP3 後重新上傳至專案 CDN。此處的文字為本頁面新撰寫的摘要。

雙角色犯罪劇風格音訊,包含對話、電話質感及戲劇性背景張力。
雙主播購物場景,融合地域口音、促銷節奏及背景音樂。
雙人談話形式,著重自然停頓、非正式節奏及清晰的口語呈現。
簡短的廣告風格片段,包含多種人聲、音樂轉場及充滿活力的聲音佈局。
參考引導的結果,展示如何將音質、節奏及口語風格帶入新的輸出。
一個範例,展示多個參考音軌如何塑造最終對話節奏及人聲互動。
簡短說明
傳統 TTS 將文字轉為語音。Seed Audio 1.0 定位於完整音訊創作:口白、角色聲音、節奏、環境、背景音樂及擬音細節可一併規劃。這讓需要快速產出完整音訊場景初稿的創作者受益。

能力圖譜
最強應用場景是人聲與情境需協同運作之處,而非單純的旁白。
可從文字提示、圖片參考或短音訊參考出發,引導人聲、情緒、節奏或角色特質。
直接在提示中描述說話者、語氣、節奏、情感、口音、停頓、笑聲或對話風格。
將環境音、音樂鋪底、轉場及音效事件一併規劃,無需在獨立工具中逐層製作。
參考音訊有助於在較長的角色或品牌音訊中保留可辨識的人聲特徵。
模型備註

文字輸入
每次請求最多 3,000 字元。
參考媒體
可使用一張圖片或最多三個音訊參考,但同一請求中請勿混用兩者。
音訊參考
每個參考應在 30 秒內以確保可靠處理。
輸出長度
單次生成結果最長約 2 分鐘。
語言
主要支援中文與英文。
輸出格式
常見輸出格式為 WAV、MP3、PCM 及 OGG Opus。
控制項
速度、音高、音量、時間戳記及浮水印選項可能因存取管道而異。
API 風格
公開整合模式為非串流 HTTP。
適用場景
快速製作產品旁白、廣告口號、社群短片及在地化版本,並包含聲音設計。
在進錄音室前,先草擬旁白、角色演繹、空間感及輕量擬音。
在早期製作階段探索 NPC 人聲、UI 音效、環境循環及過場動畫音訊方向。
將主題轉化為引導式音訊草稿,包含人聲、節奏、轉場音效及背景質感。
提示框架
01
說明格式、地點、情緒及目標聽眾。
02
描述說話者人數、語言、風格、情感及清晰度優先級。
03
加入環境音、音樂方向及最重要的音效事件。
04
聆聽最嘈雜的層次,然後逐一修改。