> ## Documentation Index
> Fetch the complete documentation index at: https://docs.comfy.org/llms.txt
> Use this file to discover all available pages before exploring further.

# SyncTalkingImageNode - ComfyUI Built-in Node Documentation

> 静止した肖像写真を、音声によって駆動されるトーキングビデオにアニメーション化します。

静止した肖像写真を、音声によって駆動されるトーキングビデオにアニメーション化します。sync.so の sync-3 モデルを使用します。出力の長さは音声の長さに一致し、コストは出力の長さに応じてスケールします。

## 入力

| パラメータ               | 説明                                                                                                                                                                | データ型    | 必須  | 範囲                               |
| ------------------- | ----------------------------------------------------------------------------------------------------------------------------------------------------------------- | ------- | --- | -------------------------------- |
| `image`             | 顔がはっきりと写った単一の画像。最大 4K（4096x2160）まで対応。                                                                                                                             | IMAGE   | はい  | 画像は1枚のみ必須                        |
| `audio`             | トーキングビデオを駆動する音声。出力の長さはこの音声に一致します。テキストからアニメーションを駆動するには、ここに任意の TTS ノードを接続してください。                                                                                    | AUDIO   | はい  | 最大長さ: 600秒                       |
| `prompt`            | 肖像画がどのように動き出すかに関する任意のガイド。例：「被写体を微笑ませてカメラを見せる」。空欄の場合は自然な話し言葉の動きになります。（デフォルト: ""）                                                                                   | STRING  | いいえ | 複数行テキスト                          |
| `seed`              | シードはノードを再実行するかどうかを制御します。結果はシードに関係なく非決定的です。（デフォルト: 0）                                                                                                              | INT     | いいえ | 0 から 2147483647                  |
| `model`             | sync.so の生成モデル。画像入力は sync-3 専用です。                                                                                                                                 | COMBO   | はい  | `"sync-3"`                       |
| `speaker_selection` | 複数の人物が写っている場合に、どの顔をアニメーション化するかを指定します。`default`: モデルに決定させます。`coordinates`: 画像内のピクセル座標（`speaker_x`, `speaker_y`）の顔を対象にします。画像に対する自動検出はサポートされていません。（デフォルト: "default"） | COMBO   | いいえ | `"default"`<br />`"coordinates"` |
| `speaker_x`         | 話者の顔の X ピクセル座標。`speaker_selection` が `"coordinates"` のときのみ使用されます。（デフォルト: 0）                                                                                       | INT     | いいえ | 0 から 4096                        |
| `speaker_y`         | 話者の顔の Y ピクセル座標。`speaker_selection` が `"coordinates"` のときのみ使用されます。（デフォルト: 0）                                                                                       | INT     | いいえ | 0 から 4096                        |
| `auto_downscale`    | 画像が 4K（4096x2160）の入力制限を超える場合に、自動的にダウンスケールします。話者の座標もそれに合わせてスケールされます。無効にすると、サイズ超過の画像はエラーになります。（デフォルト: True）                                                         | BOOLEAN | いいえ | True<br />False                  |

**注記:** `speaker_x` と `speaker_y` のパラメータは、`speaker_selection` が `"coordinates"` に設定されている場合にのみ使用されます。`auto_downscale` が有効な場合、話者の座標はダウンスケールされた画像の寸法に合わせて自動的にスケールされます。

## 出力

| 出力名     | 説明                                        | データ型  |
| ------- | ----------------------------------------- | ----- |
| `video` | 入力音声に同期したアニメーション化された肖像画を含む、生成されたトーキングビデオ。 | VIDEO |

> このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください！ [GitHub で編集](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/SyncTalkingImageNode/ja.md)

***

**Source fingerprint (SHA-256):** `21f722cdcc5ff017949887ed2252854feebb9b913034dc6a6c3ce196ad089468`
