# 動画の切り抜きをGeminiに頼む準備 候補の指定からMP4書き出しまで

- 媒体: 知能圏（CHINOUKEN）
- 公開日: 2026-09-19
- カテゴリー: エージェント・ソフトウェア
- タグ: Gemini、動画制作、動画理解、AIエージェント
- 想定読了時間: 約15分
- 調査基準日: 2026年9月19日
- 出典: 9件（末尾の「参照リンク」に番号順で記載）
- ページ: https://www.chinouken.com/articles/gemini-video-clip-selection
- このMarkdown: https://www.chinouken.com/articles/gemini-video-clip-selection.md
- 利用条件: 引用する場合は出典として「知能圏（chinouken.com）」と該当ページのURLを明記してください。本文の再配布は行わず、要約や引用の範囲で使ってください。

長い録画から短い動画を作るとき、最初に時間がかかるのは使う場面を探す作業です。Geminiの新しい動画理解では、質問に応じて必要な場面を探して読み直せます。候補の時刻と根拠を受け取り、元映像で確認してから切り出す手順を、配布コード付きで紹介します。APIによる候補抽出は未実測です。手元の動画で、時刻の確認と音声付きMP4への書き出しを試しました。

![長い動画を表すフィルム帯からパソコンを使う人物の一場面を選択枠で取り出す概念図](https://www.chinouken.com/images/articles/gemini-video-clip-selection/hero.png)

*動画から使う場面を選び出す作業を表しています。写真は本文の書き出し素材の一画面で、Geminiによる候補抽出の実測結果ではありません。*

## 探したい場面を決めてから動画を渡す

[動画: 手入力した区間の書き出し例](https://www.chinouken.com/media/articles/gemini-video-clip-selection/manual-export/clip-01.mp4)

*元動画の24.075秒〜36.987秒を手入力で選んだ約13秒の例です。Geminiが抽出した候補ではありません。*

セミナーや操作説明を短く紹介したいとき、「動画を要約して」だけでは編集に使う区間が決まりません。「操作が成功する場面」「よくある質問への回答」「商品の違いが分かる実演」のように、切り抜きを見る人へ何を伝えるかを先に決めます。

例えば、AIエージェントが任せられる仕事を説明する動画なら、「予定調整やファイル整理など、具体的な仕事を挙げている区間」が候補です。Geminiには開始と終了だけでなく、その区間を選んだ理由、映像に見えるもの、音声で説明していることを分けて返してもらいます。

![元動画と依頼文からGeminiが時刻と理由を持つ候補を出し、人が元映像を確認して採用した区間をPC上でMP4へ書き出す流れ。Gemini APIの候補抽出は未実測。](https://www.chinouken.com/images/articles/gemini-video-clip-selection/figure-gemini-clip-workflow.png)

*提案する制作工程です。Gemini APIの候補抽出は未実測で、今回は候補時刻を手入力し、元映像の確認とMP4書き出しを試しました。*

筆者は、公開済みの80.41秒の説明動画から、24.075秒〜36.987秒を手入力で選び、約13秒の音声付きMP4を書き出しました。この時刻は字幕を読んで選んだもので、Geminiが見つけた候補ではありません。

この区間には、使い道を判断するときの注意点もありました。区間内から取り出した静止画を字幕と見比べると、予定調整や社内ツールへの登録という説明に、パソコンを使う人物やロボットなどのイメージ映像が対応していました。「できる仕事を説明する短い動画」と「実際に予定を登録する操作の実演」では、採用する画面の条件を変える必要があります。

## 切り出し工程を使って分かったこと

手元で試した範囲では、開始と終了を候補ファイルへ保存すると、選んだ区間を同じ条件で書き出せるのが便利でした。切り直すときも、そのファイルの時刻を変更すれば済みます。Geminiに候補を探し直してもらう操作と、採用区間を編集する操作を分けられます。

ただし、配布コードが行う編集は区間の切り出しまでです。今回の出力は元動画と同じ1080×1920の縦動画で、画面に焼き込まれていた字幕もそのまま残りました。横動画の縦型への構図変更、字幕の書き換え、音楽の追加は行いません。SNS向けに仕上げるなら、切り出した後の編集も見込む必要があります。

同じ約13秒でも、音声の説明を聞かせる用途と、実操作の証拠を見せる用途では採否が変わります。候補の時刻が正しいかに加え、「この画面で何を伝えたと言えるか」を確認する作業が残ります。Geminiの候補抽出そのものの使い勝手や正確さは、まだ評価できていません。

## 新しい動画理解で変わる場面の探し方

Googleは2026年9月1日、Geminiの「Agentic Video Understanding」を発表しました。質問に応じて動画内を探し、必要な画像、音声、文字起こしを読み直す機能です。プログラムからGeminiを呼び出すAPIで利用します。

従来の標準的な読み方では、一定間隔で取り出した画像と音声などを処理します。新しい方式では、Geminiが必要な箇所を選んで調べるため、長い動画から特定の出来事を探す用途が想定されています。ただし、素材と質問によって使い分けが必要です。

| 素材と目的 | 最初に試す処理 |
| --- | --- |
| 長い録画から特定の発言や出来事を探す | 必要な場面を探して読む`agentic` |
| 短い動画全体を詳しく確認する | 一定間隔で読む`static` |
| 操作の順序を細かく追い、抜けを減らしたい | `static`の読み取り間隔や対象区間を調整 |

これはGoogleの現行資料に基づく選び方です。今回の80秒の素材で新方式の速度や精度が優れると確認したものではありません。長尺で試す前にも、内容を把握している短い素材で、欲しい場面を指示できるか確かめると判断しやすくなります。

2026年9月19日時点では、Gemini 3.8 Flashなどが対応しています。配布コードは`gemini-3.8-flash`を初期値にしています。利用するモデルと提供状況は、末尾のGoogle公式資料で実行時に確認してください。

## 用途と映像の条件を分けた依頼文

自分の素材に当てはめるなら、作りたい短編に合わせて探す条件を変えます。次は依頼の組み立て方の例であり、Geminiで成功を確認した用途一覧ではありません。

| 作りたい動画 | 探す条件の例 | 候補を見て確認すること |
| --- | --- | --- |
| セミナーの一問一答 | 一つの質問に具体例を添えて答える区間 | 質問の背景が切り抜きだけでも分かるか |
| 操作マニュアルの抜粋 | 操作開始前と完了後の状態が画面に見える区間 | 入力やクリックの途中が抜けていないか |
| 商品紹介の短編 | 特徴が実物の動きや比較で見える区間 | 音声の宣伝文句だけで選んでいないか |

まず、候補を「何秒程度」「何件まで」出すかを決めます。見つからなければ空の候補を返すようにして、無理に場面を作らせない形にします。次は、配布コードの依頼文を自分の動画へ書き換える際の例です。

```text
この動画から、AIエージェントに任せられる具体的な仕事を
説明している切り抜き候補を探してください。

用途は、AIに詳しくない人へできることを紹介する短い動画です。
候補は最大3件、各8〜25秒にしてください。
文の途中で始まったり終わったりする区間は避けてください。
条件に合う場面がなければ、clipsを空配列にしてください。

各候補の開始秒をstart_s、終了秒をend_s、選んだ理由をreasonに入れてください。
visual_evidenceには実際に画面に見えるものを、
audio_evidenceには音声で説明していることを書いてください。
音声の説明を、画面で実行された操作として扱わないでください。
approvedはすべてfalseにしてください。
```

開始と終了は、機械で読みやすいJSONという形式で受け取ります。配布する`prompt.txt`には、この依頼文に加えてJSONの項目名も指定してあります。用途を変えるときは、冒頭の題材と採用条件を書き換え、項目名は残してください。

例えば、操作マニュアルの抜粋が目的なら、「操作開始前の状態と、完了後の状態が画面に見える区間」を条件に足します。音声だけで説明している区間を採用しない、と書けば、先ほどのイメージ映像との取り違えを確認しやすくなります。

## 配布コードで候補を保存する手順

末尾の「切り抜き用コード一式」には、Geminiへの依頼文、候補の保存、時刻の検査、動画の書き出しを行うPythonコードを入れています。Python 3.10以降と、動画を処理するFFmpegが必要です。`ffmpeg`と`ffprobe`をターミナルから呼び出せる状態で使います。

### APIなしで切り出しを試す場合

末尾の元動画をダウンロードし、キットと同じフォルダへ`recording.mp4`という名前で置きます。`manual-example.json`を`approved.json`という名前で複製し、元動画の24.075秒〜36.987秒を確認してから、`approved`を`true`へ変更してください。後の「元映像を見てから採用区間を書き出す」節にある`check`と`cut`を実行すれば、Gemini APIのキーも追加のPythonライブラリも使わずに書き出せます。

この操作で試せるのは、元動画から採用区間を取り出す工程です。候補を探すAIの精度は、次のAPI呼び出しで別途確かめます。

### Geminiへ動画を送って候補を探す場合

このコードの候補抽出部分は、Gemini APIで未実行です。利用するAPI環境で最後まで動くことや、候補の正しさは確認できていません。以下は公式仕様に基づいて用意した実行手順です。

コードを展開したフォルダで、次の準備をします。

```bash
python3 -m venv .venv
source .venv/bin/activate
python -m pip install -r requirements.txt
```

Gemini APIのキーを`GEMINI_API_KEY`環境変数に設定し、調べる動画を`recording.mp4`として置きます。キー自体を依頼文やコードへ書き込む必要はありません。

```bash
python video_clips.py analyze recording.mp4 --mode agentic --out review-agentic
```

このコマンドは動画と依頼文をGoogleへ送ります。契約と使用量に応じてAPI利用料が発生するため、最初は送信できる素材を一つ選びます。処理終了後に一時アップロードを削除し、削除できたかも記録するコードです。

成功すると、候補が`review-agentic/candidates.json`へ保存されます。応答の原文と使用量も同じフォルダに残ります。候補抽出の通信が失敗した場合は停止し、自動で繰り返し送信しません。

## 元映像を見てから採用区間を書き出す

候補を受け取ったら、元動画を開始時刻の数秒前から再生します。話の途中から始まっていないか、終了時刻で語尾が切れないか、映像の内容が用途に合うかを見て、必要なら開始と終了を直します。採用する候補だけ`approved`を`true`にし、別名の`approved.json`へ保存してください。

![候補の区間について映像と音声を人が確認し、採用と開始・終了の調整後、配布コードが時刻を検査して書き出す流れ。](https://www.chinouken.com/images/articles/gemini-video-clip-selection/figure-gemini-clip-review.png)

*映像に何が見えるか、音声の説明が途切れないかを人が確認し、採用区間を決めます。配布コードは時刻の逆順や範囲外を検査してから、採用済みの区間を書き出します。*

次は、今回手入力した区間を採用する場合の例です。自分の動画を使う場合は、その動画の時刻と根拠へ置き換えます。

```json
{
  "clips": [{
    "start_s": 24.075,
    "end_s": 36.987,
    "reason": "任せられる仕事の具体例を短く説明している",
    "visual_evidence": "パソコンを使う人物とロボットなどのイメージ映像",
    "audio_evidence": "予定調整やファイル整理などを説明している",
    "approved": true
  }]
}
```

```bash
python video_clips.py check recording.mp4 approved.json
python video_clips.py cut recording.mp4 approved.json --out clips
```

`check`は、時刻が逆順でないか、元動画の長さを超えていないかを調べます。映像の意味や話の切れ目までは判定しません。`cut`は、採用した区間だけをPC上で処理し、`clips/clip-01.mp4`などへ保存します。元動画を変更せず、同名の出力フォルダがあれば停止します。

実行で止まった場合は、次のように入力と保存先を見直します。

| 表示や状態 | 次にすること |
| --- | --- |
| 「採用した候補がありません」 | 元映像を確認し、採用する候補だけ`approved`を`true`にする |
| 「時刻が逆順または動画の範囲外」 | 開始秒と終了秒を確認する。`01:30`は`90`秒として入力する |
| 出力フォルダがすでに存在する | 別名のフォルダを`--out`へ指定する |
| `ffmpeg`や`ffprobe`が見つからない | FFmpegの導入と、ターミナルから呼び出せる状態かを確認する |

手入力した区間の書き出しでは、12.912秒の指定に対して12.933秒のMP4になりました。フレームや音声の単位で端がそろうため、指定した長さと小さな差があります。完成した動画も再生し、必要なら編集ソフトで終端や字幕を整えてください。

配布コードの`manual-example.json`を使えば、末尾の元動画と組み合わせて同じ書き出しを試せます。最初は未採用の状態なので、映像を確認してから`approved`を変更します。

## 長い録画へ広げる前に見る結果

最初の素材で見たいのは、候補の数より「編集にそのまま使える区間があるか」です。候補ごとに、採用できたか、時刻の修正が必要だったか、映像の内容を取り違えたかを残すと、次の依頼文を直す材料になります。

処理方式を比較するなら、同じ動画と依頼文を使い、別の出力先で`--mode static`も実行します。追加のAPI利用になるため、一回目の結果を読んでから比較するか決めます。所要時間とともに、入力だけでなく出力や内部処理を含む使用量を`run.json`で確認し、モデルの現行料金表に照らしてください。短い一素材の結果から、長尺動画での削減率を見積もることはできません。

`run.json`の`model`が実行モデル、`analysis_seconds`が候補抽出の処理時間、`usage`がAPIから返った使用量です。`total_seconds`にはアップロードなども含まれます。使用量が取得できなかった場合は無料だったと解釈せず、料金の比較から外してください。

| 今回確認した範囲 | 結果 |
| --- | --- |
| 手入力した候補の書き出し | 音声付きの約13秒のMP4を保存 |
| 逆順や範囲外の時刻 | 書き出し前に停止 |
| 未採用の候補 | 動画を作らず停止 |
| Geminiによる場面の発見と所要時間 | 未実測 |
| 長尺動画での精度と費用 | 未実測 |

まずは、欲しい場面の場所を自分が知っている録画を一つ選びます。その場面をGeminiへどう説明すると見つかるか、候補をどこまで直せば使えるかを確かめてから、見返す負担が大きい録画へ広げる順序が実用的です。

## 参照リンク

1. [Google: 新しい動画理解の発表](https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/)
2. [Google: 動画理解の利用方法](https://ai.google.dev/gemini-api/docs/video-understanding)
3. [Google: 分割された応答の受信](https://ai.google.dev/gemini-api/docs/streaming)
4. [Google: Files API](https://ai.google.dev/gemini-api/docs/files)
5. [Google: 使用量の数え方](https://ai.google.dev/gemini-api/docs/tokens)
6. [Google: Gemini API料金表](https://ai.google.dev/gemini-api/docs/pricing)
7. [FFmpeg: 利用方法](https://ffmpeg.org/ffmpeg.html)
8. [知能圏: 切り抜き用コード一式](https://www.chinouken.com/downloads/gemini-video-clip-selection-kit.zip)
9. [知能圏: 書き出しに使った元動画](https://www.chinouken.com/videos/moneyprinterturbo/chinouken-agent-short.mp4)

2026年9月19日時点の公式資料を確認しています。仕様は更新される可能性があります。

---

© 知能圏 https://www.chinouken.com/articles/gemini-video-clip-selection
