記事一覧へ

台本から字幕付きショート動画まで自動生成するMoneyPrinterTurboをローカルで試す

PC内と外部サービスのどちらからも台本 音声 字幕 素材を選び ローカルの動画合成を経てMP4へ集約する構造図
ローカルかクラウドかはアプリ全体ではなく、制作工程ごとに選びます。

MoneyPrinterTurboは、ブラウザから操作するローカルの動画制作アプリです。題材から台本、素材検索、音声、字幕、動画合成までを一つの処理につなぎますが、既定の構成ではAIモデル、合成音声、映像素材を外部サービスから取得します。何がPC内で動き、何が外部へ送られるのかを工程ごとに分け、関連OSSや動画制作部品との違いを整理します。

ブラウザで開くローカルアプリ

この記事の検証で実際に生成した80秒のショート動画です。台本、音声、字幕、素材選定、合成まで2分39秒で完了しました。作り方は後半の「知能圏のショート動画を一本作った記録」で説明します。

冒頭の動画は、この記事の検証でMoneyPrinterTurboから実際に生成した80秒の完成品です。何をどう設定し、どこまで自動で進んだかは、後半の「知能圏のショート動画を一本作った記録」で説明します。

MoneyPrinterTurboのWebUIは、ブラウザで操作する画面という意味です。通常は自分のPCでStreamlitという画面用プログラムを起動し、127.0.0.1のアドレスへ接続します。インターネット上のサービスへのログインは不要で、完成したMP4と途中の台本、音声、字幕、素材はPC内の作業フォルダへ保存されます。

ただし、画面がローカルにあることと、全処理がローカルで完結することは別です。既定の構成では、台本を作るAIモデル、Edge TTSによる音声合成、Pexelsなどの素材検索にインターネット接続を使います。利用者は「ローカルアプリかWebサービスか」の二択ではなく、工程ごとにローカル処理と外部サービスを選ぶ形です。

操作の入口はWebUIのほかにも用意されています。文字のコマンドで実行するCLI、ほかのプログラムから依頼するAPI、そしてCodexなどのAIエージェントから公式Skillを通じて実行する経路です。どの入口から始めても、後ろでは同じ台本、音声、字幕、素材、合成の処理が動きます。

題材からMP4までの制作工程

MoneyPrinterTurboの中身は、役割の異なる処理を順番に呼び出す制作工程です。公式実装では、題材から次の六段階を進みます。

  1. 大規模言語モデルが題材からナレーション台本を作る。
  2. 台本から映像検索に使う語句を5個前後作る。
  3. 台本を合成音声へ変換し、ナレーションの長さを測る。
  4. 音声の時刻情報または音声認識から字幕ファイルを作る。
  5. 検索語を使って外部素材を取得するか、指定されたローカル素材を読む。
  6. 映像、音声、字幕、背景音楽を重ねてMP4へ書き出す。

途中結果が分かれているため、台本だけを自分で書く、手持ちのナレーションを渡す、字幕を外す、映像素材をローカルへ限定するといった差し替えができます。完全自動の一本だけを作る仕組みというより、各段階の既定値を用意した動画制作の処理管だと捉えると構造が分かります。

公式のAIエージェント用Skillが自動化するのは、この処理管のさらに外側です。エージェントがインストール先を用意し、既存の設定を調べ、足りないAPIキーだけを確認し、CLIを実行して完成ファイルの場所を返します。エージェントが映像を直接作るのではなく、ローカルの制作アプリを設定して最後まで動かす関係です。

AIが担当する処理

この構成でAIが担当するのは、主に文章生成、音声合成、音声認識の三つです。標準的な動作では、SoraやKlingのような動画生成モデルが全フレームを一から描いているわけではありません。

文章生成では、AIモデルが題材から台本と素材検索語を作ります。OpenAI、Gemini、Kimi、DeepSeekなどのクラウドAIに加え、Ollama経由でPC内のモデルも利用できます。OllamaはPC上でAIモデルを動かし、標準ではlocalhost:11434にプログラム用の入口を開きます。台本の品質と日本語の自然さは、ここで選ぶモデルと指示文に左右されます。

音声合成では、初期設定のEdge TTSに注意が必要です。APIキーは不要ですが、Microsoft Edgeのオンライン音声サービスをPythonから利用する仕組みであり、PC内だけで推論するモデルではありません。外部送信を避けたい場合は、自己運用するChatterboxの音声サーバーや、あらかじめ用意した音声ファイルへ切り替えます。

字幕は、合成音声から返された時刻情報を使う方式と、faster-whisperで完成音声を文字起こしする方式があります。後者はモデルをPCへダウンロードして動かせます。NVIDIA製GPUでは高速化できますが、Apple Silicon版Macのfaster-whisperはCUDAを使えないため、CPU処理の所要時間を見込む必要があります。

ローカルとクラウドの境界

完全ローカルへ近づけるには、工程ごとに外部接続を置き換えます。動画の合成だけを見ればPC内で完結しますが、題材から自動で一本を作る便利さは、複数の外部サービスを組み合わせることで得られています。

工程使いやすい既定構成ローカルへ寄せる構成外部へ渡る内容
台本と検索語クラウドAIモデルOllama上のAIモデル題材、台本、追加指示
ナレーションEdge TTSやクラウド音声Chatterboxまたは手持ち音声読み上げる台本
字幕合成音声の時刻情報faster-whisperクラウド字幕を選んだ場合の音声
映像素材Pexels、Pixabay、Coverr手持ち素材検索語、素材取得要求
背景音楽同梱曲またはクラウド生成権利確認済みの手持ち曲音楽生成の指示や元動画
動画合成MoviePyとFFmpeg同じ通常は外部送信なし
SNS公開Upload-Post完成後に手動投稿動画、説明文、投稿先情報

この表から分かるように、完全ローカル化にはOllamaだけでは足りません。台本をローカル化しても、Edge TTSを選べば文章は外部へ送られ、素材検索を使えば検索語と取得要求が外へ出ます。機密情報を含む動画では、台本、音声、素材、公開の四か所をまとめて確認する必要があります。

一方、一般向けの解説動画を少数作る場合は、すべてをローカル化することが最適とは限りません。クラウドAIとオンライン音声は導入が軽く、PCの性能もあまり要求しません。ローカル構成は、外部送信を減らせる代わりに、モデルの取得、メモリ、処理時間、更新作業を利用者が引き受けます。

MoviePyとFFmpegが担う最後の編集

完成動画を作る中心は、Pythonから動画を扱うMoviePyと、映像と音声を変換するFFmpegです。MoneyPrinterTurboはAIモデルの出力をそのまま動画ファイルにするのではなく、素材を読み、縦横比を合わせ、必要な長さへ切り、字幕と音声と音楽を重ねてから圧縮します。

MoviePyは、動画、画像、文字、音声を時間のある部品として扱い、それらを重ねる処理をPythonから記述できるライブラリです。実際の読み書きや圧縮ではFFmpegを利用します。MoneyPrinterTurboの現行実装は、複数クリップの連結にFFmpegを直接呼び出す経路も持ち、同じ素材を何度も再圧縮しないようにしています。

この層は生成AIに依存しません。台本を人が書き、音声と映像を手元から渡しても、同じ合成処理を使えます。また、PythonよりWeb技術に慣れた開発者には、Reactで画面部品と時間を記述してMP4を作るRemotionという別の選択肢があります。OpenReelsなど新しい制作OSSは、MoviePyではなくRemotionを最終合成に使っています。

素材検索で決まる画面の意味

MoneyPrinterTurboの映像品質を大きく左右するのは、動画生成モデルの性能より素材検索語です。AIモデルは台本全体から検索語を作り、Pexels、Pixabay、Coverrへ問い合わせます。取得した素材はナレーションの長さを満たすまで集められ、設定に応じてランダムまたは台本順に並べられます。

この方法が向くのは、旅行、都市、食事、自然、働く人といった映像素材が豊富な一般題材です。一方、特定の新製品、企業の発表、ソフトウェアの操作、人物の発言などでは、似た雰囲気の映像が見つかっても事実を示す映像にはなりません。抽象的な「AIが社会を変える」という台本に、サーバー室、ロボット、都市の映像を置けば見栄えは整いますが、文章との対応を検証したことにはなりません。

現行実装には、台本の順序に合わせて検索語と素材を並べる設定があります。任意でTwelveLabsの映像理解サービスを使い、検索語の順序を調整する経路もあります。ただし、素材が主張の根拠になるか、同じ人物や場所として扱ってよいか、画面が誤解を招かないかという編集判断は残ります。

関連OSSは目的で分かれる

同じ「AI動画生成」という名前でも、既存素材を組み立てる道具、元動画へナレーションを付ける道具、映像自体を生成する道具では役割が異なります。比較する際は、入力と映像の作り方をそろえる必要があります。

OSS主な入力映像の作り方ローカル性向く用途
MoneyPrinterTurbo題材または台本ストック映像または手持ち素材部品ごとに選択多言語の短編動画をWebUIやAPIから作る
MoneyPrinter題材ストック映像を自動編集Ollamaを中心に構成ローカルAIでYouTube Shortsを作る
ShortGPT題材または元動画Pexelsや画像を自動編集主に外部AIと素材を利用短編生成、長編生成、動画の翻訳と吹き替え
NarratoAI元動画元映像の解析と再編集ローカルアプリと外部AIの混成映画や短編ドラマの解説動画
OpenReels題材生成画像、生成動画、検証済み素材を混成外部生成サービスが中心調査、演出、AI映像、品質評価まで含む制作
Automated Video Generator台本または指示ストック素材をRemotionで合成ローカル音声を重視APIキーを減らした自己運用

MoneyPrinterは名称が近い別プロジェクトで、現在はOllamaを中心に台本を作り、データベース付きの処理待ち行列で生成を管理します。MoneyPrinterTurboは対応するAIと音声と素材の選択肢が広く、WebUI、API、CLI、AIエージェントの入口をそろえている点が違います。

ShortGPTは、短編だけでなく長編動画や既存動画の翻訳と吹き替えを処理する枠組みです。NarratoAIはMoneyPrinterTurboを参考にしつつ、入力済みの映画や短編ドラマを解析して解説動画へ再編集する方向へ進みました。新しいOpenReelsは、Web調査、生成画像、生成動画、生成音楽、映像の確認、完成後のAI評価まで範囲を広げています。映像を一から作りたい場合、MoneyPrinterTurboから設定を探すより、この系統を別に評価する方が比較軸がそろいます。

部品から組む選択肢

既製の制作OSSを使わず、必要な部品を組み合わせる方法もあります。台本はOllama、音声はChatterboxやKokoro、字幕はfaster-whisper、素材管理は手持ちのライブラリ、合成はMoviePyまたはRemotionという構成です。

部品から組む利点は、台本の確認後に音声へ進む、素材ごとに出典を保存する、ブランドの字幕様式を固定する、公開前に必ず承認を挟むといった制作ルールをコードへ埋め込めることです。大量生成では、生成速度よりも失敗した段階から再開できること、同じ素材を再利用できること、設定と出典を一本ごとに残せることが運用費を左右します。

欠点は、部品同士の更新を自分で吸収する必要があることです。音声モデルの出力形式、字幕の時刻、FFmpegの符号化設定、SNSの投稿仕様は別々に変わります。MoneyPrinterTurboの価値は、個々のAIモデルを新しく発明したことではなく、この接続と設定画面と失敗処理を一つのアプリへまとめた点にあります。

権利確認と公開前の仕事

無料素材を自動取得できても、完成動画の公開責任まで自動化されるわけではありません。PexelsとPixabayは商用利用を広く認めていますが、素材をほぼそのまま再配布する利用、映り込んだ商標、人物の肖像、私有地、誤解を招く利用には別の確認が必要です。Coverrも商用利用を認める一方、映像内の商標や場所など、すべての第三者権利を保証しているわけではありません。

背景音楽にも別の問題があります。ライセンス上利用できても、YouTubeなどの自動判定で権利の申し立てを受ける場合があります。素材ページ、作者、取得日、利用条件、音楽の証明書を動画ごとに残しておけば、後から公開根拠を確認できます。

SNSへの自動投稿は最後に有効化する機能です。台本の事実、読み方、字幕、映像の対応、権利、説明文を確認する前に自動公開までつなぐと、制作時間の短縮がそのまま誤公開の速度になります。生成と公開の間に、人が完成動画を再生して承認する地点を残す方が安全です。

用途に合わせて構成を選ぶ

導入時は、すべての機能を試すより、目的に合わせて構成を固定すると評価しやすくなります。

早く一本を試す構成

クラウドAI、Edge TTS、Pexelsなどのオンライン素材、Edgeの時刻情報による字幕を使います。GPUを必要とせず、導入の軽さを優先できます。一般公開できる題材を使い、台本と検索語が外部へ送られる前提で試します。

外部送信を減らす構成

Ollama、自己運用のChatterbox、faster-whisper、手持ち素材、手持ち音楽を使えば、台本と音声をPC内へ置けますが、モデルの取得容量と処理時間が増えます。Macではfaster-whisperのCUDA高速化を利用できないため、短い動画から所要時間を測るのが現実的です。

画面の独自性を高める構成

台本と絵コンテを先に確定し、OpenReelsなどから生成画像や生成動画を作るか、Remotionで図、数値、画面、字幕の動きを組みます。外部素材の検索だけに頼らないため、技術解説や製品紹介に向きます。その代わり、生成費用、待ち時間、映像の一貫性、再生成の管理が新しい課題になります。

知能圏のショート動画を一本作った記録

この記事の検証として、Claude Codeから公式Skillを通じてMoneyPrinterTurboを実行し、「AIエージェントはソフトウェアの使い方をどう変えるのか」という題材で80秒の縦型動画を一本作りました。台本生成からMP4書き出しまでの実行時間は2分39秒です。人が行ったのは、題材と条件の指定、APIキーの用意、完成動画の確認で、途中の工程はエージェントとローカルアプリの担当です。

最初の実行は途中で止まりました。Skillのヘルパーは既定でホームディレクトリ直下へ新規インストールする設計のため、設定済みの既存環境を見つけられず、APIキーの入力を求めて終了コード10で停止します。インストール先を--rootで指定して再実行すると、既存の設定とPexelsキーの検証が通り、依存関係の確認を経てそのまま生成へ進みました。エージェントへ任せる場合も、どの環境で動かすかは人が伝える必要があります。

日本語の動画にするには、既定値の変更が三つ必要でした。音声名を日本語のEdge TTS音声へ、生成言語を日本語へ、字幕フォントを同梱の日中両対応フォントへ指定します。既定構成は中国語の動画を想定しているためです。実行後の工程別の記録は次のとおりでした。

工程所要時間外部へ送った内容
台本生成(OpenAI)7秒題材と追加指示
検索語生成(OpenAI)3秒題材
音声合成(Edge TTS)4秒台本全文
字幕生成(時刻情報方式)1秒未満なし
素材の検索と取得、結合約1分24秒英語の検索語5個
字幕とBGMを重ねる最終合成約1分なし

途中結果もすべてPC内に残りました。検索語は「AI agent software」など英語の5個が自動生成され、Pexelsの候補44本から17本のクリップが取得されています。字幕はEdge TTSの時刻情報から79.5秒分が作られ、音声認識は使われていません。前節までに整理した「工程ごとにローカル処理と外部サービスを選ぶ」構造が、そのまま実行記録として確認できます。

完成した動画を見ると、人の検品が残る理由も分かります。映像はタスク管理画面やコーディング風景といった雰囲気の一致にとどまり、台本の各文と画面の対応は緩いままです。字幕の分割位置やBGMとの音量差も、公開前に人が確認する項目でした。素材の権利表示と公開先の判断も含めると、2分39秒で終わるのは制作の反復作業であり、公開責任の部分は人の仕事として残ります。

制作自動化が変える人の仕事

MoneyPrinterTurboが減らすのは、素材を探し、音声を作り、字幕を置き、縦長の動画へ書き出す反復作業です。ブラウザで開くローカルアプリでありながら、AI、音声、素材、公開は必要に応じて外部サービスへ接続します。ローカルかクラウドかは製品全体の属性ではなく、工程ごとの設計です。

ここからは筆者の見立てです。ショート動画制作OSSは、単純な一括生成から、途中結果を見て直せる制作システムへ進みます。台本と素材の対応、素材の出典、字幕の時刻、生成費用、公開承認を一本の記録として残せることが、モデルの種類より重要になります。

MoneyPrinterTurboは、その入口として分かりやすい位置にあります。完全自動で公開品質を保証する道具ではありませんが、動画制作を交換可能な部品へ分け、人の仕事を手作業の編集から企画、検品、権利確認、公開判断へ移す仕組みを具体的に観察できます。

参照リンク24件
  1. MoneyPrinterTurbo公式リポジトリ
  2. MoneyPrinterTurbo日本語README
  3. MoneyPrinterTurbo動画生成工程 task.py
  4. MoneyPrinterTurboAIモデル接続 llm.py
  5. MoneyPrinterTurbo映像素材の取得 material.py
  6. MoneyPrinterTurbo動画合成 video.py
  7. MoneyPrinterTurbo設定例 config.example.toml
  8. MoneyPrinterTurbo公式AIエージェント用Skill
  9. OllamaAPI Introduction
  10. rany2edge-tts
  11. SYSTRANfaster-whisper
  12. travisvnchatterbox-tts-api
  13. MoviePyInstallation and FFmpeg dependency
  14. RemotionReactで動画をプログラム生成する公式リポジトリ
  15. FujiwaraChokiMoneyPrinter
  16. RayVenturaShortGPT
  17. linyqhNarratoAI
  18. tsenseiOpenReels
  19. itsPremkumarAutomated Video Generator
  20. PexelsAPI Documentation
  21. PexelsTerms of Service
  22. PixabayContent License Summary
  23. PixabayFAQ and Content ID guidance
  24. CoverrLicense

2026年8月23日時点の公式資料を確認しています。仕様は更新される可能性があります。

この記事はここまで024

このテーマで使うツールを探す

以下は公式情報にもとづく紹介です。この記事で各製品を実機検証したことを示すものではありません。

Runwayの公式紹介画像Runway生成AIで映像素材を作るPikaの公式ロゴPika画像や文章を短い動画に変えるLuma Dream Machineの公式紹介画像Luma映像の動きと場面を生成するElevenLabsの公式紹介画像ElevenLabs台本からナレーション音声を作るOpusClipの公式紹介画像OpusClip長い収録動画からショート動画を切り出す
関連サービスを比較する →

この作業を終える便利ツール

登録は要りません。ファイルも文章もブラウザの中だけで処理し、外へ送りません。

字幕タイムコード変換字幕を点検する動画切り出し・音声書き出し動画を編集する

この用途の入口

この記事が扱うのは、「小規模チームで短い動画を1本仕上げる」という仕事の一工程です。素材と公開先の決め方から、切り出し、字幕、音声、書き出し、配信までの手段を一枚にまとめた入口があります。

小規模チームで短い動画を1本仕上げる

次の記事

AIにWeb操作を安全に任せる CodexとClaude Code用Chromeプロファイルの分け方

関連記事

短い動画を作るAIは何で選ぶか Runway・Pika・Lumaを納品条件で比較

Claude CodeとCodexで製品紹介動画を作る video-shotcraftで絵コンテから実画面・音入りMP4まで進める

AIで見栄えのいいSaaS画面を作る デザインスキルを工程ごとに使い分ける