Pollo MCP
エンドツーエンドのコンテンツ制作。動画4本/画像20枚まで無料。
Gemini Omni Flashは、テキスト・画像・音声の参照を組み合わせ、判読しやすいテキストとスタイルの一貫性を保ちながら、物理法則を考慮した高速生成を実現します。Pollo AIでGemini Omni Flashを無料で試してみよう!
従来のモデルがテキストから動画への生成をベースに、画像から動画への変換機能を後から追加しているのに対し、Gemini Omni Flashは、最初からマルチモーダル入力に対応しています。キャラクターデザイン、背景スタイルの参考画像、テキストプロンプトを同時に指定でき、これらの情報を統合して一貫性のある動画を生成します。指定したビジュアルアセットを忠実に反映し、キャラクターや世界観の一貫性を保った映像表現を実現します。
| 画像1 | 画像2 | 出力ビデオ |
![]() | ![]() |
Gemini Omni Flashは、表面的なフォトリアリズムを超え、シーンの物理法則を忠実にシミュレートします。ビー玉がレールを転がる様子、液体が飛び散る様子、重力が様々な物質に及ぼす影響など、物体がどのように相互作用するかを理解しています。Geminiが持つ膨大な世界史と科学の知識と組み合わせることで、非常に精度の高い教育用解説動画や複雑な連鎖反応シーケンスを生成することが可能です。
| プロンプト | 出力ビデオ |
| タンパク質の折り畳みを非常に正確に解説するクレイアニメーションのストップモーションアニメーション。シーン内の全ては粘土で作られていなければならない。アミノ酸鎖が3Dタンパク質構造へと折り畳まれる複雑な過程を示すこと。粘土の動きは物理的にリアルに見えるようにし、画面内に人間の手が映り込まないようにすること。 |
Gemini Omni Flashは、革新的なマルチターン編集ワークフローを導入しました。変更を加えたいときにビデオを最初から作り直すのではなく、モデルと対話することができます。照明の変更、特定のオブジェクトの交換、カメラアングルの変更などを指示すると、モデルはコンテキストを記憶し、シーンの他の部分を維持しながら編集を適用します。
注:この機能は現在Pollo AI向けに開発中で、今後のアップデートで利用可能になる予定です。
| 入力ビデオ | プロンプト | 出力ビデオ |
| 「環境をネオンライトに照らされたサイバーパンク風の街並みに変更してください。」→ [ターン2] 「今度は、雨を激しく降らせ、濡れた路面に反射光が映るようにしてください。」→ [ターン3] 「カメラアングルを変更して、人物の背後から低い角度で追跡するようにしてください。」 |
AIによる動画制作における大きな課題の一つは、シーンに合わせて自然に動く読みやすいテキストをレンダリングすることでした。Gemini Omni Flashは、ユーザーが動画に直接、動きのあるタイポグラフィや解説テキストをレンダリングできるようにすることで、この課題を解決します。これらのテキスト要素を画面上の動きと同期させることができるため、教育コンテンツ、タイトルシーケンス、マーケティング動画などを素早く作成するための非常に強力なツールとなります。
| プロンプト | 出力ビデオ |
| 木製のテーブルの上に置かれた、A、B、Cで始まるアイテムを次々と表示する映像。リンゴ、本、カメラを順番に表示してください。各アイテムには、黒いマーカーで文字が書かれた紙切れのような、対応する下部3分の1のグラフィックが必要です。一度に表示するのは1つのアイテムとその下部3分の1のみとし、1アイテムあたり約9フレーム(24FPS)で表示してください。 |
クリエイターや企業広報担当者向けに、 Gemini Omni Flashはパーソナライズされたデジタルアバターを作成する機能を提供します。自分自身のデジタル版を作成することで、アバターが自然に話したり行動したりする動画を生成できます。この機能は、責任あるAIガードレールに基づいて設計されており、SynthIDウォーターマークを通じて、生成されたコンテンツが高い安全性と透明性を維持することを保証します。
| プロンプト | 出力ビデオ |
| プロフェッショナルな企業紹介ビデオを作成してください。アバターは、明るくモダンなオフィス空間に立ち、自然な身振り手振りで新入社員への歓迎のメッセージを伝えるようにしてください。 |
Gemini Omni Flashは、ビデオ出力の精密な制御を必要とするクリエイター、教育者、企業チーム向けに設計されています。
| 特徴 | Gemini Omniフラッシュ | Sora 2 | Kling 3.0 |
| 体幹の強さ | マルチモーダルな入力と世界知識 | 物理法則の正確さと映画的なリアリズム | 4K映像とマルチショットのストーリーボード |
| ネイティブオーディオ | はい(起動時の音声;完全な音声は後日公開予定) | はい(会話と環境音が同期している) | はい(Omni Native Audio、複数文字) |
| 会話型編集 | はい(複数回の反復的な改良。Pollo Pollo AIに近日搭載予定) | いいえ | いいえ |
| 世界知識 | ディープ(統合されたGemini知識ベース) | 中程度(物理学中心) | 適度 |
| 動画におけるテキストレンダリング | はい(同期型キネティックタイポグラフィ) | 限定 | 限定 |
| 最大持続時間 | 公表されていない | 最大25秒 | 最大15秒 |
Gemini Omni Flashは、動画を単なる動くピクセルとしてではなく、シミュレーションされた環境として扱うことで、動画生成の概念を根本から変革します。その特長は以下のとおりです。
Gemini Omniフラッシュを選択
Pollo AI 画像から動画へのページに移動し、モデルのドロップダウンメニューからGemini Omni Flashを選択してください。
参考文献とプロンプトをアップロード
元の画像をアップロードし、希望する動き、音、カメラワークについて説明してください。
動画を生成
「生成」をクリックし、レンダリングが完了したらビデオをダウンロードしてください。
何千人もの満足したユーザーがTrustpilotでPollo AIの体験を共有し、「素晴らしい」と評価しています。彼らが当プラットフォームのどんな点を気に入っているか、ぜひご覧ください。
Gemini Omni Flashは、動画の生成と編集向けに設計された、Googleの最新の高性能マルチモーダルモデルです。テキスト、画像、音声、動画を同時に処理することで、現実世界の知識に基づいた、非常にまとまりのある、物理的に正確な動画を作成できます。
複数の参照画像を使用して出力を精密に制御する必要がある場合、流体力学や重力などの物理的に正確なシミュレーションが必要な場合、または読みやすくGemini Omniされたテキストをビデオに直接レンダリングする必要がある場合は、Gemini Omni Flashを選択することをお勧めします。
はい。Pollo AIは、 Gemini Omni Flashモデルを使用して動画をテストおよび生成するための無料クレジットをユーザーに提供しており、そのマルチモーダル機能を直接体験することができます。
はい、 Gemini Omni Flashはネイティブにマルチモーダルに対応しており、ビデオ出力と同時に音声も生成します。発売当初は音声参照とアバターの音声に対応しており、より幅広い音声生成機能が近日中に展開される予定です。
このモデルは、運動エネルギーなどの物理学に関する直感的な理解と、ジェミニの歴史、科学、文化に関する膨大な知識を組み合わせています。これにより、タンパク質の折り畳みをクレイアニメーションで解説するなど、非常に精度の高い教育コンテンツを生成することが可能になります。
AI動画生成機能をWebサービスやアプリに組み込みたい場合は、Pollo APIを活用できます。Pollo APIでは、複数のAI動画・画像モデルを1つのAPIプラットフォームから利用できるため、AI生成機能を自社サービスやクリエイティブワークフローに効率的に統合できます。
