記事一覧へ

操作動画からAIへ仕事を引き継ぐvideo-to-skillで作る再利用手順

動画から取り出したPythonのコード画面と入力 操作 成功条件を記したSKILL.mdファイルを重ねた概念図
動画の画面から読み取った操作を、入力と成功条件を持つ手順ファイルへまとめます。本文では、生成したスキルを別の入力でも再実行しました。

video-to-skillは、動画から画像を取り出し、ClaudeなどのAIが読み取った操作を手順ファイルへまとめるオープンソースのツールです。売上CSVを集計した実際のコマンド出力を並べた24秒のデモ映像からスキルを作ると、元動画を見ていない別のClaudeでも、金額を変えたデータを集計できました。一方、必要な画面は追加で取り出す必要があり、生成されたコードは商品名の空欄を見逃しました。録画から手順を起こす使い方と、実務へ持ち込む前に残る手間を紹介します。

動画と違う売上データでも集計できた

実際のコマンド出力から構成した24秒の自作デモです。人がアプリを操作した録画ではありません。入力表、コード、実行、完成表を各6秒表示します。

筆者が試した作業は、売上を商品ごとに合計し、別のCSVファイルへ保存することです。CSVは、表の行と列をカンマ区切りで保存したファイルです。入力には商品名のproduct列と、整数の金額を入れたamount列があり、出力には商品ごとのtotal列を作ります。

題材にした24秒の映像は、実際にコマンドを動かした出力から構成した自作デモです。人がアプリを操作した録画ではありません。入力表、集計用Pythonコード、実行コマンド、完成した表の4画面を順に表示しました。売上はすべて架空の値です。

映像から取り出した画像をClaudeへ渡すと、「入力を見る」「集計用ファイルを作る」「実行する」「結果を確認する」という4手順になりました。video-to-skillは、手順書のSKILL.md、実行コード、根拠となる画像と時刻を一つのフォルダへまとめます。

動画から画像を抽出し、人が不足場面の時刻を指定して追加抽出した後、Claudeが操作を読み取り、手順書とコードへまとめる流れ。
今回の実験での役割分担です。必要な画面の時刻は人が指定し、追加した画像をClaudeが読み取りました。手順書と実行コードはvideo-to-skillで一つのスキルにまとめています。

次に、前の会話を引き継がない別のClaudeを起動し、生成された手順書とコードだけを渡しました。元動画や抽出作業の記録は見せず、別の作業フォルダで実行しています。

入力Folderの合計Notebookの合計Penの合計全商品の合計
動画で示した6行1,0002,0008003,800
金額と行数を変えた4行5001,5001,0003,000

元入力、変更した入力、期待する出力、生成スキルは、末尾の「再実行用キット」にまとめました。キットの説明に沿って、同じ集計を手元で試せます。

値を変えた方でも、動画に映っていた3,800を答えとして使わず、新しい入力から3,000を計算しました。画面の答えを書き写すだけでなく、次のデータに使える処理を渡せたことになります。別のClaudeへの引き継ぎを確かめたのは、商品名と整数金額という同じ形式の、小さな入力2種類です。

代表画像だけでは入力と完成画面が揃わなかった

最初の抽出で、24秒の映像は一つの区間として扱われました。代表画像と補助画像は得られましたが、手順の根拠として必要な4画面が揃いませんでした。今回の映像は、背景がほぼ同じまま文字が変わる構成です。この1本では、画面の変化を自動抽出に任せるだけでは足りませんでした。

そこで、入力表が見える3秒、コードが見える9秒、実行結果の15秒、完成表の21秒を指定し、画像を追加で取り出しました。video-to-skillには、一つの時刻を指定して画面を見直す機能があります。抽出された代表画像だけで説明がつながるかを先に読み、不足している場面を取りに戻る流れです。

自分の動画でも、最初に「入力は何か」「何を実行したか」「何ができれば完了か」の三点が画像で分かるかを確認してください。完成表が抜けていたら末尾付近を、設定値が見えなければ設定画面を追加します。見えていない値をAIに補わせると、次の実行で確かめるべき答えまで曖昧になります。

今回Claudeへ渡したのは、追加で取り出した4枚です。自動抽出だけで必要な画面が揃った実験としては扱っていません。

9秒時点から取り出した画像。CSVを商品ごとに合計してsummary.csvへ書くPythonコードを表示している。
追加確認した9秒の画面。Claudeは表示されたコードを読み、手順書と実行ファイルへまとめました。

商品名は変えられたが空欄は見逃した

次に、生成済みのPythonコードを変えずに、入力の形を少しずつ変えて実行しました。ここではClaudeに修正させず、各入力を別の作業フォルダで処理しています。業務データへ持ち込む前に、どの条件で動き、どこで確認が必要になるかを見るためです。

生成済みのスキルと別の売上CSVを元動画を見ていないClaudeへ渡し、合計3000との一致を確認。その後、生成コードを変えず直接実行し、空欄、小数、上書きの条件を確かめる流れ。
まず別のClaudeが、変更後のデータを合計3,000と集計できるか確かめました。続いて同じコードを直接実行し、空欄や小数、既存ファイルの上書きも確認しました。
変えた条件実際の結果使う前に確かめること
新商品「マグ」を追加し、列の順序も入れ替えたマグ1,000、Pen250を出力列名がproductとamountなら、この入力では集計できた
商品名が空欄の行を入れた空欄の商品として500を集計し、正常終了入力の不備を自動で見つける機能はない
金額を1200.50にした整数に変換できず停止小数を使うなら計算方法の変更が必要
保存先に古いsummary.csvを置いた新しい集計で上書き元の結果を残すなら、別フォルダで実行する

気をつけたいのは、空欄でもファイルが完成した点です。「エラーなく終了した」を合格条件にすると、商品名のない売上をそのまま受け取ってしまいます。今回の集計なら、計算結果だけでなく「商品名が全行にある」「金額が整数である」も、実行前の条件へ加える必要があります。

この結果は、今回の動画から生成した短い集計コードの性質です。video-to-skillが生成するすべての手順に同じ欠点があるとは言えません。録画で示されていない例外を、どこまで手順へ追加するかを判断する材料になります。

動画を読むAIと手順を実行するAIの分担

video-to-skillは、開発者のbrenoepicsが公開しているツールです。確認した最新版は2026年8月10日公開のv0.2.4でした。Claude CodeやCodexなど、ファイルを読み書きして作業するAIから呼び出して使います。

処理の前半では、PC上のプログラムが動画から画像や音声の文字起こしを取り出します。続いて、video-to-skillを呼び出したAIが画像を読み、操作、成功条件、根拠の時刻を整理します。ツールが手順の形式を確認し、スキルのフォルダを書き出すと、別のAIがその手順を試します。

ここでいうスキルは、AIが必要なときに読む手順書やコードのまとまりです。モデル自体の学習をやり直す作業はありません。今回も、生成されたPythonコードが新しいCSVを読み、商品ごとの合計を計算しています。

別のAIを使う理由は、手順書に書かれていない知識で穴埋めできてしまうのを避けるためです。動画を読んだAIには分かっていても、引き継ぐファイルに入力形式や成功条件がなければ、次の会話で同じ仕事を再現できるとは限りません。

動画の抽出とコードの実行はPC内で行います。一方、今回のようにClaudeを使う場合、読ませる画像、手順の文章、実行結果はClaude側へ送られます。録画に顧客名や認証情報を含めず、最初は外部へ渡せるダミーデータを使うのが実行しやすい始め方です。

自分の操作動画から始める手順

生成済みのキットで出力を確かめる

まず動きを見たい場合は、末尾の「再実行用キット」を展開してください。生成されたskill/scripts/summarize.pyは、売上CSVを読み、同じフォルダに集計結果を書き出す短いコードです。内容を読んでから、付属の架空データで試せます。この再実行にClaudeやGeminiの契約は要りません。

MacでPython 3を使うなら、キットのフォルダで次を実行します。新しい一時フォルダへ入力とコードをコピーするため、前の集計結果と混ざりません。

コマンド例bash
trial_dir="$(mktemp -d)"
cp inputs/changed/sales.csv "$trial_dir/sales.csv"
cp skill/scripts/summarize.py "$trial_dir/summarize.py"
(cd "$trial_dir" && python3 summarize.py && cat summary.csv)

Wrote summary.csvに続いて、Folderが500、Notebookが1,500、Penが1,000と表示されれば、付属の変更後データと一致しています。これは動画理解をやり直す操作ではなく、生成された処理を使う例です。

二つの入力を実行制限付きの環境でまとめて照合する場合は、付属のrun-demo.shを使います。こちらにはvideo-to-skillの実行プログラムvts-extractと、Macのsandbox-execまたはLinuxのbubblewrapが必要です。キットのREADMEに導入先の指定と成功時の表示を載せています。

自分の録画から新しくスキルを作る

最初は、完了をファイルや数値で確認できる一つの作業を選びます。例えば、同じ列のCSVを集計する、画像の寸法をそろえて別フォルダに保存する、といった仕事です。入力と操作と完成結果を一続きに映し、コマンドや設定値が読める大きさで残します。

今回と同じMacで試す場合は、導入コマンドを動かすNode.jsとClaude Codeを使える状態にします。普段の作業と分けた実験用フォルダを開き、開発元のvideo-to-skillを導入してください。公式の導入コマンドは次のとおりです。導入先や、追加で取得するプログラムが表示されたら、対象を確認して進めます。

コマンド例bash
npx skills@latest add brenoepics/video-to-skill

導入後は動画の保存先を指定し、任せたい仕事と確認条件を伝えます。今回の集計なら、次のような依頼です。

入力例text
/video-to-skill ./sales-demo.mp4

この動画の集計手順を、別の売上CSVにも使えるスキルにしてください。
入力はproduct列と整数のamount列を持つsales.csvです。
動画に映った金額は見本として扱い、新しい入力から計算してください。

各手順に、操作内容、成功条件、根拠の時刻と画像を残してください。
入力・コード・完成結果の画像が揃わなければ、時刻を指定して見直してください。
生成後は元動画を見ていない別のAIに渡し、隔離された作業フォルダで試してください。
既存ファイルを上書きする箇所を示し、生成スキルの導入先は最後に確認してください。

今回のClaude出力では、機械処理用の手順データに説明文と、コードを囲む記号も付いていました。説明文と外側の記号を除き、手順データ本体だけを保存して先へ進めています。同じ形式の問題が起きたら、「説明文を含めず、手順データ本体だけをファイルへ保存してください」と依頼し直します。手順内のコードまで削らないように確認してください。

生成物を受け取ったら、次の順で使い回せるか確かめます。

  1. SKILL.mdに、入力ファイル名、列名、使える値の種類が書かれているかを見る。
  2. 別の作業フォルダへ、値を変えた小さな入力を置いて実行する。
  3. 出力を手計算できる範囲で照合し、元動画の数値が固定されていないかを見る。
  4. 保存先と上書きの動作を確認してから、使うAIへスキルを追加する。

自分の売上データに空欄や小数があるなら、生成時の依頼にも条件を追加します。例えば「商品名が空欄なら、行番号を示して集計前に止める」「小数を丸めるルールが未指定なら質問する」と伝え、その入力で停止や質問が起きるかを試します。例外処理まで任せる範囲を、録画にある正常例から一段ずつ広げる形です。

録画から手順を起こす価値がある仕事

今回使って評価できたのは、手順とコードに、根拠となる画面と時刻を添えて渡せる点です。あとから処理を直したいときも、何を読み取ってその手順になったかを元の画面へ戻って確認できます。一方、必要な画面を選び直す手間と、別の入力で確かめる手間は残りました。

手元に残っている資料に応じて、次の使い分けを提案します。

残っている資料と仕事最初に選ぶ進め方
操作説明の録画しかなく、同じ形式のファイル処理を繰り返すvideo-to-skillで手順を起こし、別入力で確かめる
実行コードや詳しい手順書がすでにある元のコードや文章から直接スキルを作る
ログインや外部サイトの画面操作が中心操作手順の整理に使い、実行方法を別途用意する

コマンドと出力が画面に残る今回の仕事は、再実行しやすい条件でした。ブラウザへのログイン、外部サービスへの送信、特定のボタンの位置などが必要な作業では、手順を抽出できても、そのまま実行確認できるとは限りません。

video-to-skillの検証では、別のAIが実行できた工程、失敗した工程、実行を見送った工程を分けて記録します。そのAIは書き込み先や通信を制限した作業環境で手順を試します。ネットワークが禁止されるため、外部サイトとの通信が仕事の一部なら、そこで完了までは確かめられません。今回もブラウザや表計算アプリの画面操作は試していません。

検証後の手順書SKILL.mdには、実行で確認済みという意味のVerified by executionと、実行できた手順数が記載されます。この記載だけで判断せず、どの入力で何を実行し、どの成功条件を満たしたかを読みます。表の計算が合ったことと、業務システムへ正しい顧客の行を登録できたことは、それぞれ別に確かめる必要があります。

実行環境と所要時間

今回の実験は2026年9月19日に行い、画面読解と手順生成にClaude Sonnet 5を使いました。生成と再実行はそれぞれ新しい会話で行っています。

項目今回の条件・実測
PCApple M5 Max、macOS 26.4.1
使用ツールvideo-to-skill v0.2.4、FFmpeg 8.1.1、Python 3.14.6
素材24秒、1440×1000、無音。実行出力から構成した自作デモ
動画からの画像抽出0.318秒。音声の文字起こしは省略
Claudeによる画像読解と手順生成46.649秒。追加抽出した4枚を使用
スキルのファイル生成0.011秒
別のClaudeによる再実行・確認29.529秒。入力2種類、各4手順
外部へ渡した内容公開資料、自作画像4枚、生成手順、架空の入力と出力

時間は各工程の1回分です。素材の準備、人による画面選択、調査や待ち時間は含めていないため、合計を「動画から仕事を引き継ぐまでの時間」とは扱えません。無音映像だったので、音声認識のモデルは追加せず、画面からの抽出だけを試しました。

最初の一件には、入力と完成結果を自分で見比べられる仕事が向いています。別の入力でも再現できたら、次は実際のデータにある空欄や小数への対応を加え、保存先を変えても正しく動くかを確かめます。動画から手順を起こす手間を省きながら、次のAIへ何が伝わったかを具体的な出力で確認できます。

参照リンク8件
  1. brenoepicsvideo-to-skill GitHub
  2. brenoepicsv0.2.4リリース
  3. brenoepicsv0.2.4の利用手順
  4. brenoepics手順データの形式
  5. brenoepics実行による検証手順
  6. brenoepics外部取得とデータの扱い
  7. AnthropicスキルでClaudeを拡張する
  8. 知能圏再実行用キット

2026年9月19日時点の公式資料を確認しています。仕様は更新される可能性があります。

この記事はここまで067

この作業を終える便利ツール

登録は要りません。ファイルも文章もブラウザの中だけで処理し、外へ送りません。

動画切り出し・音声書き出し動画を編集する

次の記事

LLMの使い分けでコストと待ち時間を下げる 分類と検査を文章生成から切り離す

関連記事

一つのAIチャットで社内業務を受ける 固定処理・AI・人の分け方

動画の切り抜きをGeminiに頼む準備 候補の指定からMP4書き出しまで

AIエージェントとは 任せられる仕事と任せられない仕事の見分け方