Visual AI Labでは、AI画像・動画生成モデルを日本の実務シーンで実際に使えるかどうかを判断するため、 同一条件での比較、再現性の記録、人間による最終評価を行っています。原則として4秒の動画(画像は1枚)を1つの制作ショット単位として比較しています。
Visual AI Lab では、生成AI動画が実制作でショット単位に生成・確認・編集されること、および継続的なモデル比較コストを考慮し、4秒を標準ベンチマーク尺としています。
4秒評価は、基礎的な動き、入力維持、カメラ制御、初期の時間的一貫性を比較するものであり、8秒以上の長時間安定性、音声同期、完成動画全体の品質、編集後の再現性を保証するものではありません。
サイト内で使う集計単位を以下のように定義しています。
| 用語 | 定義 |
|---|---|
| Run | 1モデルに対する1回の生成実行 |
| タスク | 1つの入力・プロンプト・制作目的の組み合わせ |
| 3-Runタスク | 同一モデル・同一条件で3回生成したタスク |
| 比較ケース | 1タスクを複数モデルで比較した単位 |
| テーマ | ラーメン、うちわ、商品回転などの題材単位 |
| カテゴリ | 能力、用途、日本市場適合性などの分類 |
| 記事 | 比較結果を解説する編集コンテンツ |
すべての比較に、評価タイプを表示します。
記事制作、集計、初期分類は自動化してよいものの、以下は人間が最終確認します。
自動評価(Gemini 等)は補助的にのみ利用し、最終的な評価スコアは管理画面 `/admin/evaluations` からの手動評価を原則とします。
本サイトに掲載する平均スコア、ランキング、勝率は以下のルールで計算しています。
画像と動画では「日本市場で使えるか」の判断軸が異なります。
「日本の動物」「日本の風景」「日本人」など、対象が曖昧になりやすいカテゴリは以下のように再定義・運用しています。
本サイトの比較は、厳密な学術ベンチマークではなく、制作実務に基づく実証レビューです。 掲載内容はモデルアップデートや価格変更により変動する可能性があります。最新情報は各モデル提供元の公式ドキュメントをご確認ください。