
少し前にSCAILというものがリリースされました。
ComfyUIだとkijai氏のComfyUI-WanVideoWrapperで動かせます。
今回はこのSCAILをComfyUIで動かす方法について紹介します。
SCAILとは?

SCAILは、動画のモーションを画像のキャラクターなどに適用できるフレームワークです。
複雑な動き(バク転や回転)やスタイルの異なるキャラクターへの適用、さらに複数キャラクター間の相互作用なども高精度に再現できるとのこと。
主な特徴(AI訳)
・高度な3D一貫性とポーズ表現
https://github.com/zai-org/SCAIL
3D的に一貫性のあるポーズ表現を「インコンテキスト学習(In-Context Learning)」を通じて学習。これにより、2Dキャラクターであっても3D的な空間関係を理解した自然な動きが可能。
・複雑なシナリオへの対応
マルチキャラクター: 複数の人物が絡み合うような複雑なシーンの生成が可能。
大きなモーション: 宙返り(flipping)や回転(turning)といった、従来のモデルが苦手としていた激しい動きも正確に捉える。
・驚異的な汎用性(ゼロショット能力)
学習データにほとんど含まれていない「アニメキャラ」や「手書きの落書き(Doodle Art)」、さらには「動物(クリーチャー)」に対しても、リギングなしで動きを適用できる能力。
・アイデンティティの保持
キャラクターの見た目(アイデンティティ)を崩さずに、動きの情報だけを注入する技術的な工夫がされている。
redditのサンプル:

ComfyUIのインストール
ComfyUIのインストールがまだの方はこちらを参考にしてみてください。

ComfyUIでSCAILを使う方法
モデルの用意
diffusion_models
・bf16

・fp8

ComfyUI\models\diffusion_modelsYOLO・ViTPose
こちらは手動でdetectionフォルダを作成しその中に入れる必要があります。


ComfyUI\models\detectionLoRA

ComfyUI\models\lorasText encoder

ComfyUI\models\text_encodersCLIP Vision

ComfyUI\models\clip_visionVAE

ComfyUI\models\vaeworkflow
リポジトリにあるやつそのまま使ってます。
D&Dして足りないノードがあればManager→Install Missing Custom Nodesからインストールしてください。

ノードの設定&実行
Load Video (Upload)
お借りした動画:https://www.pexels.com/ja-jp/video/4008162/

Load Image: Reference

ONNX Detection Model Loader

WanVideo Torch Compile Settings
SteadyDancerと同じでONだとエラーが出たため、バイパスして使ってます。

WanVideo Model Loader

WanVideo Lora Select

WanVideo VAE Loader

WanVideo TextEncode Cached

Load CLIP Vision

結果:
モデル読み込みありで2秒の動画が約5分26秒(326.68 seconds)でした。

まとめ
過去に似たような技術はいっぱいありましたが、ローカル生成だとダントツでクオリティ高い気がします。
顔も手も崩れてないし、ほぼ完ぺきに近いんじゃないでしょうか。
VRAM16GBでも実行できたしこの技術で2秒約5分なら許容範囲だと思います。
モーションさえ用意出来れば、いろいろ映像作品の幅を広げられるような気がしました。
個人的には従来のモデルに比べるとSCAILが一番使いやすい気がします。
興味ある方は使ってみてください。
以上ComfyUIでSCAILを使う方法について紹介しました。
参考になれば幸いです。

