> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-docs-comfy-router-docs.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# ByteDance Seed Audio 1.0 - ユニバーサルオーディオ生成

> ComfyUIでSeed Audio 1.0を使用し、音声クローン、プリセット音声、キャラクタ駆動オーディオを用いて、単一のプロンプトから音声、音楽、効果音、複数話者による対話を生成します

Seed Audio 1.0 はByteDanceの汎用オーディオ生成モデルで、ComfyUIのビルトインノードとして利用可能になりました。テキストを読み上げるだけの従来のテキスト読み上げシステムとは異なり、Seed Audioは音の全スペクトルを理解します。単一のテキストプロンプトから、発話、音楽、効果音、環境音、複数話者の対話を生成できます。

<Tip>
  APIノードを使用するには、正しくログインしていることと、許可されたネットワーク環境で使用していることを確認する必要があります。APIノードの使用に必要な具体的な要件については、ドキュメントの「[APIノードの概要](/ja/tutorials/partner-nodes/overview)」セクションをご参照ください。
</Tip>

<Tip>
  <Tabs>
    <Tab title="ローカルユーザー">
      ComfyUI が最新版に更新されていることを確認してください。

      * [ComfyUI のダウンロード](https://www.comfy.org/download)
      * [更新手順](/ja/installation/update_comfyui)

      このガイドで紹介するワークフローは、[ワークフローテンプレート](/ja/interface/features/template)から入手できます。
      テンプレート内に該当のワークフローが見つからない場合、ComfyUI のバージョンが古くなっている可能性があります。

      ワークフローを読み込んだ際にノードが欠落している場合の考えられる原因：

      1. 最新の ComfyUI（Nightly 版）を使用していない
      2. 起動時に一部のノードのインポートに失敗している
    </Tab>

    <Tab title="クラウドユーザー">
      * [Cloud](https://cloud.comfy.org) は、ComfyUI の安定版リリース後に更新されます。

      したがって、このドキュメントでコアノードが見つからない場合、それは新しいコアノードがまだ最新の安定版にリリースされていない可能性があります。次回の安定版リリースをお待ちください。
    </Tab>
  </Tabs>
</Tip>

## 主な機能

* **マルチモーダルオーディオ生成** — 1つのプロンプトから、音声、音楽、効果音、環境音を生成します。聞こえた内容を説明するだけで、Seed Audioがそれを生成します。
* **音声クローン** — 最大3つの参照クリップ（プロンプト内で`@Audio1`、`@Audio2`、`@Audio3`とタグ付け）から音声をクローンし、複数キャラクターのダイアログや一貫したナレーションを実現します。
* **プリセット音声** — 参照クリップなしで信頼性の高い高品質なナレーションが必要な場合、内蔵のTTS 2.0音声から選択できます。
* **画像駆動音声** — キャラクター画像から音声を派生させ、トーンやスタイルをビジュアルに合わせます。
* **きめ細かな制御** — 再生速度、ピッチ、音量、サンプルレートを各生成ごとに個別に調整できます。
* **マルチスピーカーダイアログ** — プロンプト内でキャラクター名を指定するだけで、Seed Audioが音声の割り当て、ターン交代、感情表現を処理します。
* **1回の実行で最大2分** — ナレーション、ポッドキャストクリップ、ビデオ吹き替え、サウンドデザインに適した長尺オーディオクリップを生成します。

これらの機能により、Seed Audio 1.0はビデオナレーション、複数キャラクターのオーディオドラマ、商品デモ、eラーニングナレーション、ゲームオーディオプロトタイピング、アクセシビリティコンテンツなど、幅広いユースケースに対応します。

## 利用可能なワークフロー

<h3 id="api_bytedance_seed_audio1_0_t2a">
  Seed Audio 1.0: テキストからオーディオ
</h3>

テキストプロンプトを入力して、1つのオーディオファイルに音声、会話、BGM、効果音を生成します。

<img src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/templates/api_bytedance_seed_audio1_0_t2a-1.webp" alt="Seed Audio 1.0: テキストからオーディオ ワークフロープレビュー" />

<CardGroup cols={2}>
  <Card title="Comfy Cloudで実行" icon="cloud" href="https://cloud.comfy.org/?template=api_bytedance_seed_audio1_0_t2a&utm_source=docs&utm_medium=referral&utm_campaign=seed-audio-1-0">
    Comfy Cloudで開く
  </Card>

  <Card title="ワークフローをダウンロード" icon="download" href="https://github.com/Comfy-Org/workflow_templates/blob/main/templates/api_bytedance_seed_audio1_0_t2a.json">
    JSONをダウンロード、またはテンプレートライブラリで「Seed Audio 1.0: Text to Audio」を検索
  </Card>
</CardGroup>

<h3 id="api_bytedance_seed_audio1_0_ta2a">
  Seed Audio 1.0: テキスト + オーディオからオーディオ
</h3>

参照オーディオクリップをアップロードし、テキストプロンプトを入力して、新しいシーンに声をクローンします。

<img src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/templates/api_bytedance_seed_audio1_0_ta2a-1.webp" alt="Seed Audio 1.0: テキスト + オーディオからオーディオ ワークフロープレビュー" />

<CardGroup cols={2}>
  <Card title="Comfy Cloudで実行" icon="cloud" href="https://cloud.comfy.org/?template=api_bytedance_seed_audio1_0_ta2a&utm_source=docs&utm_medium=referral&utm_campaign=seed-audio-1-0">
    Comfy Cloudで開く
  </Card>

  <Card title="ワークフローをダウンロード" icon="download" href="https://github.com/Comfy-Org/workflow_templates/blob/main/templates/api_bytedance_seed_audio1_0_ta2a.json">
    JSONをダウンロード、またはテンプレートライブラリで「Seed Audio 1.0: Text + Audio to Audio」を検索
  </Card>
</CardGroup>

**入力素材**

このファイルを該当する`LoadAudio`ノードにアップロードしてください:

<CardGroup cols={2}>
  <Card title="seed_audio_ref_audio1.mp3" icon="music" href="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/input/seed_audio_ref_audio1.mp3">
    `LoadAudio` ノード8 · `seed_audio_ref_audio1.mp3`
  </Card>
</CardGroup>

<h3 id="api_bytedance_seed_audio1_0_ti2a">
  Seed Audio 1.0: テキスト + 画像からオーディオ
</h3>

キャラクター画像をアップロードし、テキストプロンプトを入力して、視覚的な被写体に合った声スタイルでオーディオを生成します。

<img src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/templates/api_bytedance_seed_audio1_0_ti2a-1.webp" alt="Seed Audio 1.0: テキスト + 画像からオーディオ ワークフロープレビュー" />

<CardGroup cols={2}>
  <Card title="Comfy Cloudで実行" icon="cloud" href="https://cloud.comfy.org/?template=api_bytedance_seed_audio1_0_ti2a&utm_source=docs&utm_medium=referral&utm_campaign=seed-audio-1-0">
    Comfy Cloudで開く
  </Card>

  <Card title="ワークフローをダウンロード" icon="download" href="https://github.com/Comfy-Org/workflow_templates/blob/main/templates/api_bytedance_seed_audio1_0_ti2a.json">
    JSONをダウンロード、またはテンプレートライブラリで「Seed Audio 1.0: Text + Image to Audio」を検索
  </Card>
</CardGroup>

**入力素材**

このファイルを該当する`LoadImage`ノードにアップロードしてください:

<CardGroup cols={2}>
  <Card title="girl_and_fish.png" icon="image" href="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/input/girl_and_fish.png">
    `LoadImage` ノード6 · `girl_and_fish.png`
  </Card>
</CardGroup>

<div style={{display: 'grid', gridTemplateColumns: 'repeat(2, minmax(0, 1fr))', gap: '1rem', alignItems: 'start'}}>
  <img src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/input/girl_and_fish.png" alt="girl_and_fish.png" style={{width: '100%', height: 'auto', objectFit: 'contain'}} />
</div>

## ComfyUIでSeed Audio 1.0を使う方法

Seed Audio 1.0は **ByteDanceSeedAudio** ビルトインノードとして提供されます。ノードメニューのByteDance以下にあります。

### 参照モードの選択

このノードには、生成される音声の条件付け方法を決定する4つの参照モードがあります。

| モード         | 説明                                                                      | 使用するタイミング                    |
| ----------- | ----------------------------------------------------------------------- | ---------------------------- |
| **テキストのみ**  | プロンプトですべて（声のスタイル、感情、雰囲気、会話）を記述                                          | 参照素材なしでのクイック生成               |
| **オーディオ参照** | 最大3つのオーディオ参照クリップ（各最大30秒）を接続し、プロンプトで`@Audio1`、`@Audio2`、`@Audio3`としてタグ付け | 特定の声のクローン作成、または複数キャラクターの会話作成 |
| **画像参照**    | 1つのキャラクター画像を接続；モデルがそこから声を導出                                             | ビジュアルキャラクターデザインから声を導出        |
| **プリセット音声** | ドロップダウンからビルトインのTTS 2.0音声を選択                                             | クローンなしでの信頼性の高いナレーション         |

### プロンプトの構造

最良の結果を得るには、プロンプトを構成してオーディオシーンを説明します：

* **声と感情** — トーン、年齢、性別、アクセント、または感情表現を説明する
* **雰囲気と背景** — 音響環境（静かなスタジオ、賑やかな通り、コンサートホール）を説明する
* **効果音** — タイムラインの適切な瞬間に特定の音を説明する
* **会話のセリフ** — 話すセリフを書き、マルチスピーカーシーンではキャラクター名を指定する

**例 — 雰囲気のあるナレーション:**

> 落ち着いた温かみのある男性の声が自信を持って話します。柔らかな雨が背景に降り、時折遠くの雷が聞こえます。「Seed Audio 1.0は、ペース、ピッチ、プレゼンスを完全に制御して自然な音声を生成します。」

**例 — オーディオ参照を使ったマルチスピーカーの会話:**

> @Audio1 が緊張して低く速いささやきで言う：「見た？」 @Audio2 が落ち着いてゆっくりした口調で答える：「何を？ただの風だよ。」全体に軽い風の雰囲気。

### パラメータ調整

入力を接続した後、以下のパラメータを調整して希望の出力を得ます：

* **話速** — デフォルト0（ノーマル）。範囲 -50（0.5倍）～ 100（2.0倍）。リラックスしたナレーションには負の値、エネルギッシュなナレーションには正の値を使用
* **ピッチ** — 半音単位でのシフト（-12～+12）。キャラクターボイスや特定の声域のマッチングに便利
* **ラウドネス** — デフォルト0（ノーマル）。範囲 -50（0.5倍）～ 100（2.0倍）。異なるソース素材間で音量を一定に調整
* **サンプルレート** — 8kHzから48kHzから選択。音声には24kHzが良いデフォルト；音楽には44.1kHzまたは48kHz
* **シード** — ノードが再実行されるかどうかを制御；シード値に関わらず結果は非決定論的

### エッジケースと制限事項

* **参照クリップの長さ**: オーディオ参照クリップはそれぞれ30秒に制限されています。より長い参照素材を使用する場合は、接続する前にクリップをトリミングまたは編集してください
* **オーディオ参照の順序**: 参照入力は、隙間なく1、2、3と順番に接続する必要があります
* **タグ制限**: 1つのプロンプトでサポートされる`@AudioN`タグは最大3つです
* **文字数制限**: プロンプトは3000文字に制限されています
* **時間制限**: 1回の実行で最大2分のオーディオです

## はじめる

1. ComfyUIを最新バージョンにアップデートしてください。
2. ノードメニューから**ByteDanceSeedAudio**ノードを追加するか、上記のワークフローテンプレートのいずれかを開いてください。
3. リファレンスモードを選択して入力を接続してください。
4. オーディオシーンとダイアログを説明するプロンプトを記入してください。
5. ワークフローを実行してください。
