「あと少し動きを変えたい。でも、もう一度生成を待つのは長い……」。AI動画で試作を重ねるとき、気になるのがこの待ち時間です。今回紹介するFastH3は、MiniMax H3の動画生成を少ない計算で進める高速化モデル。自分のキャラクターで、動きや見せ方を試しやすくなることに期待して検証しました。
この記事では、2026年9月5日のライブ配信をもとに「何ができるか→事前検証の作例と実プロンプト(生成時に実際に使った指示文)→配信のおさらいと資料の使い方」をつなげて紹介します。最後は、CodexやClaude Codeに環境準備や生成を手伝ってもらう方法へ。まだ配信を見ていない方も、見終えてもう少し試したい方も、自分の1本へ進む材料にしてください。
FastH3とは?待ち時間を減らして、動画の試作を重ねるために
FastH3は、それ単体で編集画面を持つ動画編集ソフトではなく、動画を生成するモデルです。FastVideoの公式案内では、FastH3 Preview v1はMiniMax H3をもとにした、映像と音声を生成する4ステップのモデルと説明されています。ここでいうステップは、映像を作る計算の段階。少ない段階で作れるよう調整することで、生成を速くする仕組みです。FastVideo公式の案内

配信で使ったComfyUIは、処理の箱をつないで画像や動画を作るアプリです。その中でFastH3を動かし、文章から作るT2V、1枚の絵から動かすI2V、キャラクター資料などを参考にするR2Vを試せます。たとえば「この人物が振り向く短いカット」「キャラクターを主役にした音楽プロモ」といった使い方です。
ざすこ速いこと自体より、「もう一案試してみよう」と思えるのが嬉しいんだよね。髪の動きやカメラを少し変えて見比べたいから。



そのための待ち時間を減らすのが、今回注目したところジェネ。ただし、速ければ毎回きれいに仕上がるわけではないジェネ。必要な環境をそろえて、実際の動画で判断するところまでがセットジェネ。
今回の構成では、重要な情報を選んで計算するVSAという工夫も使っています。細かな仕組みや準備条件は、ライブの入門解説(43:31〜)と、後ほど紹介するメンバーシップ特典のPDFへ。その前に、構成と導入の要点を図で押さえます。
誰の技術を、どう組み合わせて使う?
今回のComfyUI環境は、元モデル・高速化技術・対応する実装を組み合わせたものです。下の図は役割分担を整理したもの。FastH3 Preview v1そのものの開発案内と、ここで使った実行環境は区別して読むと分かりやすくなります。


導入の要点は、いつもの環境と分けて準備すること。
今回使った構成では、モデルだけを置くのではなく、専用のComfyUIと高速化用の追加部品・設定をそろえました。図の細かな設定を暗記する必要はありません。実際の準備は、後半で紹介する虎の巻を使って進めます。


仕組みと準備の全体像をつかんだところで、次は実際の待ち時間と作例を見てみましょう。
配信前の検証で分かったこと――速さと、作例を作る指示の中身
15秒の動画を、どのくらい待てば作れる? 9月2日のX投稿では、Google ColabのA100・80GBという環境で、1888×1056 pxの動画を9分50秒で生成できたことを紹介しました。同じ15秒でも、1376×768 pxでは3分44秒、1632×928 pxでは6分54秒。解像度を上げるほど時間も増えています。


作例動画と当時の検証結果をXで見る。投稿では、髪のなびきに溶けるような崩れが見られたことにも触れています。「10分未満で作れた」という速さだけでなく、使いたい場面の動きが自然かを見ることが大切です。この時間は投稿時の条件での記録で、すべてのPCや別の作例に当てはまる数字ではありません。



待つ時間が短くなれば、完成前に動きを見比べる余裕もできそう。でも、画像がきれいでも動かすと崩れることはあるんだね。



そこで、時間と仕上がりを一緒に見るジェネ。顔や服だけでなく、動いている途中の髪や背景も確認する。次のRion作例では、どんな指示を渡したのかまで見てみるジェネ。
Rionちゃんの検証動画:短い音楽プロモを狙う
こちらは、キャラクター資料を参照し、人物・英文字・音の波形・カメラの切り替わりを組み合わせた別の検証です。短い時間の中で、音楽の勢いを映像として見せようとしました。
① 入力素材:Rionのキャラクター資料


この作例では参照用の音声・動画は入力せず、映像と音の指示を文章で渡しています。下の全文Promptと、続く生成動画をセットで見比べてください。
実Promptでは、最初に人物の外見と舞台を指定し、その後に「0〜1.5秒」「1.5〜3.2秒」のように場面を区切っています。各場面で人物の動き・カメラ・画面に見せる言葉を組み合わせ、最後に効果音と音楽を指定する構成です。動画を見るだけでは分からない、指示の組み立て方をここで補足します。
下の折りたたみには、動画の記録から取り出した実Promptを省略せず全文掲載しています。展開して文字を選択・コピーできます。別画面で全選択する場合はRion作例の実Prompt全文(TXT)をひらいてください。
② Rion作例の実Prompt全文をひらく(コピー用)
integrated_multimodal_description: 15-second 16:9 anime editorial music promo. One character only: RION, exactly matching the latest reference sheet — a cool young female AI vocalist with a short asymmetrical ash-silver bob, one matte-black inner-color section, subtle electric-cyan-to-blue-violet tips, a thin side braid with a silver AI-chip clasp, sharp luminous cyan eyes, multiple silver ear cuffs and a right-ear monitoring headset. She wears a cropped asymmetrical black-and-silver punk biker jacket with cyan resonance piping and dark violet tartan lining, a black cropped performance top, a glowing hexagonal resonance core at her collarbone, structured high-waisted distressed black stage shorts, a short silver chain, one damaged matte-black asymmetrical legging, one bare leg, and sturdy black, silver, cyan and violet combat boots. Her appearance, costume construction and accessories remain identical in every shot.
The setting is a bright white futuristic AI music studio transformed into a sophisticated punk-rock editorial space. Matte black, silver, electric cyan and deep violet depth planes intersect with giant physical English typography, audio waveforms, equalizer bars, fragmented tartan panels, chrome frames, floating sound cards, translucent music interfaces, cables, tuning-fork symbols, torn-paper edges, halftone textures and restrained digital glitches. The visual density rises continuously toward the final beat. Cool neutral 6500K lighting, no sepia or warm vintage tint.
[0.0-1.5s] RESONANCE BOOT: extreme close-up through floating waveform bars. An 18mm camera rushes toward RION as she lifts her gaze and touches the glowing resonance core at her collarbone. Her cyan eyes activate, the word RESONATE slams into frame as a solid chrome-and-cyan 3D object, and a sharp waveform flash wipes the lens.
[1.5-3.2s] BAND LEADER: low-angle tracking shot. RION walks confidently toward the camera while dark tartan fragments, silver chains, translucent mixing cards and pulsing equalizer bars assemble around her outfit. She makes a subtle conducting gesture and the surrounding sound layers synchronize. The words TAKE THE LEAD appear behind her in bold physical lettering.
[3.2-4.9s] AI SOUND DESIGN: a translucent audio card wipes across the lens. RION performs a fast controlled turn, revealing the glowing R-shaped waveform across the back of her jacket. The camera follows tightly as cyan sound trails and violet data fragments respond to her movement. The words SHAPE THE SOUND appear.
[4.9-6.6s] PUNK MIX: the environment shifts to matte black, white and deep violet with restrained cyan highlights. Torn tartan panels, tuning-fork shapes, speaker cones and waveform ribbons float around RION. A rapid 90-degree camera orbit moves clockwise while she turns in the opposite direction and raises the SOUND KEY. The words BREAK THE CODE appear in distressed but clean readable lettering.
[6.6-8.4s] THREE-WAY SPLIT: the screen divides vertically into three dynamic panels, each filmed from a clearly different angle. Left: a low-angle full-body shot of RION stepping forward. Center: a frontal medium shot as she controls floating audio layers with one hand. Right: an energetic side close-up as she sings into the headset microphone. Each panel remains in motion. A large word SYNC spans cleanly across all three panels.
[8.4-10.3s] LIVE MODE: white, black, electric cyan, blue-violet and chrome. RION reaches toward the lens as the camera passes beneath her hand into a dramatic low angle. Her resonance core brightens, cyan-violet waveform light travels through her hair tips, and her irises gain a subtle digital glow. Controlled audio rings orbit her without obscuring her body. The words LIVE MODE appear, followed by her gloved hand covering the lens.
[10.3-12.2s] SOUND EXPLOSION: a hard cut to black, silver and cyan. The words MAKE SOME NOISE fill the frame as enormous physical typography. The camera flies rapidly through the letterforms while torn paper, tartan strips, waveform shards, equalizer blocks and precise print-offset glitches explode outward in synchronization with the drums.
[12.2-15.0s] MAXIMUM RESONANCE: a rapid pull-back reveals a dense futuristic performance space filled with floating music cards, chrome frames, waveform ribbons, sound-key symbols and layered AI interfaces. RION stands at the center in a strong, confident band-leader pose, one foot forward and the SOUND KEY resting naturally over her shoulder. Her jacket waveform and resonance core pulse together on the final beat. It ends on the words AI MICHIKUSA with the smaller word RION beneath them.
The only words that appear anywhere are RESONATE, TAKE THE LEAD, SHAPE THE SOUND, BREAK THE CODE, SYNC, LIVE MODE, MAKE SOME NOISE, AI MICHIKUSA and RION, all rendered as clean, accurate and readable English letterforms. No additional writing, logos, pseudo-text or Japanese characters. RION is the only visible person. Her face, hairstyle, AI core, headset, jacket, shorts, asymmetrical legwear and boots remain perfectly consistent throughout. Keep her femininity healthy, athletic and confident rather than sexualized. Clean anatomy, correct hands, crisp cel-shaded edges and stable facial identity in every shot.
overall_soundscape: Crisp editorial impacts, metallic chain accents, tuning-fork resonance, interface clicks, restrained glitch ticks, electric amplifier textures, paper and tartan-card flutters, camera swishes and synchronized waveform pulses. No spoken dialogue and no human singing voice.
non_diegetic_music: Fast, stylish electro-punk rock instrumental combining punchy live drums, distorted electric guitar riffs, tight bass, sharp digital synth arpeggios and controlled glitch percussion. The arrangement builds in intensity through every section, briefly drops before SOUND EXPLOSION, then lands on a powerful unified final hit.
③ 生成結果:Rionの音楽プロモ風動画
そのまま万能テンプレートになる、という意味ではありません。原文には16:9とある一方、実際の設定と動画は9:16です。また、人物が歌う演出と「歌声なし」の音の指定が混在しています。これは実際の投入文なので修正せず掲載しました。自分用に使うときは、人物名・参照画像・縦横比・音の意図をそろえ、秒数や文字が指定どおり出るかは生成結果で確かめてください。
まず短く試すなら:人物と場面だけを伝える
Rionのような細かい場面指定の前に、短い指示から試す方法もあります。下は、参照画像1枚で人物の生成を確認した別の作例です。
① 入力素材:ざすこの参照画像


② この人物作例の実Prompt全文をひらく(コピー用)
integrated_multimodal_description: A cheerful young woman with a short brown bob and blue round glasses stands in a bright white room and smiles at the camera.
overall_soundscape: quiet room tone.
non_diegetic_music: soft piano.
③ 生成結果:参照画像から作った動画
内容は「短い茶色の髪と丸眼鏡の女性が、明るい白い部屋でカメラに笑顔を向ける。静かな室内音と穏やかなピアノ」というもの。人物・場面・音を分ける構造は同じです。シードは乱数の出発点、eulerは計算方法の名前で、比較用に記録した設定です。本記事では、この作例の音声の出来は評価していません。



長い文章を真似する前に、まず短い指示で自分のキャラクターを出してみると、何を変えたいかも見えてきそう。



最初の1本を残して、次は表情だけ、次はカメラだけと変えるジェネ。画像から始めるI2Vでは最初に見せたい絵を、R2Vでは人物の参考資料を使う。文字入りの設定資料と、動画の最初の画面は役割を分けると考えやすいジェネ。
こうした事前検証を踏まえ、ライブでは「自分でも試すための準備」と「実際の操作」を紹介しました。次は、記事で見た作例を、配信とお土産を使って自分の制作へつなげます。
ライブ配信のおさらいと、お土産の使い方
9月5日の配信では、FastH3の入門解説から、Colabと自分のPCで動かす環境、ComfyUIの設定、生成結果の確認へ進みました。記事で概要をつかんだら、操作や映像の変化は本編で見返していただくとつながりやすくなります。
- 43:31〜 入門解説:モデルと高速化の全体像。
- 1:07:28〜 Colabの準備/1:21:18〜 PCでの環境構築:試す場所を用意する。
- 1:33:01〜 ワークフローの解説:素材と生成設定を確認する。
- 1:59:50〜 生成結果を確認:森の中を進む人物の作例を、動きも含めて見る。
この流れを配信後もたどれるように用意したのが、ライブ配信のお土産です。見るだけで終わらず、環境の準備や作例の生成へ進みたい方に向けたメンバーシップ特典になっています。


- ❶ 入門ガイド・つまづき対策編:何ができるか、使う前に何を確認するかを図解でおさらい。途中で困ったときは対策編へ戻ります。
- ❷ ローカル環境構築の虎の巻:自分のPCで用意する部品と、準備が成功したかの確認方法をまとめた文書。AIエージェントへ渡して使う方法を次章で紹介します。
- ❸ Google Colab用Notebook:ネットの先の計算機で環境を準備・起動する、説明と実行欄が並んだ文書。毎回ファイルを取得する非常駐版と、Driveへ保存して使う常駐版があります。
- ❹ ComfyUIワークフローセット:処理のつながりと設定を保存したファイル。T2V・I2V・FLF2V・Ref2Vを使い分けます。FLF2Vは最初と最後の画像を指定する方法です。



資料がいくつもあるけど、全部をいっぺんに使うわけではないんだね。自分がPCで試すか、Colabで試すかで変わるんだ。



まず❶で全体像を確認し、PCなら❷、Colabなら❸で作業場を準備する。動いたら❹で画像やPromptを設定するジェネ。「環境を作るもの」と「生成の設定」を分ければ、使う順番が見えてくるジェネ。
Colabの常駐版は再取得を減らす選択肢ですが、Driveの容量も必要です。どちらの版も、利用できるGPUと料金を確認して使います。ワークフローは同梱の「はじめにお読みください」で用途を確認し、まず配布時の構成で動かしてから自分の素材へ替えると、問題の場所を追いやすくなります。
特典の受け取りは当該回のメンバー限定投稿から。🍀メンバーシップの内容紹介で案内しています。配信の続きとして、手元で確認できる図解や実用ファイルを活用していただければ嬉しいです。では、PCの環境準備が難しそうな場合は、どう進めればよいでしょうか。
Codex・Claude Codeに虎の巻を渡し、準備から生成まで手伝ってもらう
今回もうひとつ伝えたいのが、AIに説明を聞くだけでなく、ツールの準備や実行も手伝ってもらう使い方です。CodexやClaude CodeのようなAIエージェントは、許可されたファイルや道具を使って作業を進められます。FastH3が動画を作る担当なら、エージェントは環境を確認し、素材や指示を渡し、結果を保存する担当です。
お土産の「ローカル環境構築の虎の巻」は、そのためにAIへ渡せる文書として作っています。いきなり「FastH3を入れて」とだけ頼むより、資料を渡し、まず自分のPCで条件を満たすか調べてもらう。次に専用の場所へ環境を用意し、小さな生成で動作を確かめる、という進め方です。



専門用語やエラーを全部自分で調べなくても、資料を見ながら一緒に準備を進めてもらえるんだ。それなら試す入口が少し近くなるね。



ただし、資料があればどんなPCでも動く魔法ではないジェネ。まずGPUや保存容量、資料の版と今の配布状況を照合するジェネ。条件が合わなければ、その段階で分かるように頼むのが大事ジェネ。
エージェントへの依頼例(実作例の生成Promptとは別です)
添付のFastH3環境構築の虎の巻を読んでください。
まず、このPCのGPU・メモリ・保存容量と、資料の手順が現在も使えるかを確認してください。
普段使っているComfyUIは変更せず、検証専用フォルダで進めてください。
条件が合わない場合や途中で失敗した場合は、先へ進まず原因を報告してください。
準備ができたら、指定した参照画像とPromptで1本だけ生成してください。
動画と実際に使ったPrompt・設定・保存場所をまとめ、動作確認した結果を報告してください。
虎の巻で重視しているのは、各段階の確認を飛ばさないこと。たとえば、動画が保存できても、高速化の処理が使われているとは限りません。次の図は、その見落としを説明しています。


当時の構成では、必要な処理が使えるかと、生成中に実際にその処理を通ったかを、画面の処理記録で確認しました。エージェントにも「起動できた」だけで完了にせず、動画の保存・再生に加えて、高速化の処理が実際に使われたことも、資料に沿って処理記録で確認してもらいます。途中でエラーが出たら、その欄を飛ばして次へ進めないことも共通です。



準備の手伝いだけじゃなく、作った動画と設定もまとめてもらえると、次の修正を頼みやすいね。



「この画像で1本。次はカメラだけ変えて」と続けられるジェネ。今回の検証でも生成環境へプログラムから指示を渡す方法を使ったけれど、利用するエージェントごとの接続と実行権限は別に準備が必要ジェネ。採用する映像は、自分の目でも確かめるジェネ。
この考え方は、FastH3だけでなく別の生成ツールを試すときにも使えます。大切なのは、手順書を丸投げすることではなく、資料を共通の地図にして、条件確認→準備→1本生成→結果確認を一緒に進めることです。
まとめ――速く作れることを、自分の試作につなげよう
この記事で伝えたかったのは、FastH3の速さを数字として眺めるだけでなく、自分のキャラクターや演出を試す回数につなげられるということです。検証の作例では、短い人物の指示から、場面ごとにカメラや文字を指定する音楽プロモまで試しました。実Promptは、その組み立て方を参考にする材料です。
- まず、作ってみたい作例をひとつ選ぶ。
- 本編で操作の流れを見て、PCかColabか、自分に合う資料を選ぶ。
- 必要ならAIエージェントに準備を手伝ってもらい、1本作って、次に変える点を決める。



最初から大作を完成させるより、「この動きを自分でも試したい」から始めればいいんだね。



その1本と、使った指示や設定が次の試作の土台になるジェネ。気になった場面は配信で、手順はお土産で、文章はこの記事で見返せるようにしたジェネ。自分の制作に合う使い方を探してみてほしいジェネ。
免責事項・利用前に確認してほしいこと


本記事は2026年9月初めの資料と検証に基づく記録です。実験的な構成を含むため、仕様や導入方法は変わります。紹介した速度・画質・動作はすべての環境で保証されるものではなく、掲載Promptも同じ出力を保証しません。利用前に最新の配布元の案内を確認し、ご自身の環境で小さく試してください。
入力する画像・音声などの素材と、生成物の権利は利用者自身で確認してください。モデルやサービスごとの利用条件も別途確認が必要です。本記事は商用利用や再配布の許可を与えるものではありません。会員向け資料の紹介は一部抜粋で、全文の配布先はメンバー限定投稿をご確認ください。
正式な確認先:FastVideo/今回参照したKijai氏の実験モデル/ComfyUI/comfy-kitchen/Google Colab。当時のComfyUIへの対応提案は9月7日の確認でClosedでした。古い導入手順をそのまま現行手順とはしていません。
※ざすこ・ジェネコの会話は説明のために再構成したもので、配信中の発言をそのまま引用したものではありません。







コメント