ビデオ通話の相手が本当に人間かどうか、あなたは自信を持って答えられますか。2026年10月、米国のスタートアップTavus(タバス)が公開した新しいAIモデル「Griffin(グリフィン)」は、1分間のビデオ通話で48%の参加者に「相手は実在の人間だ」と思い込ませました。同社の従来システムで同じ実験をしたときの通過率は2.4%でした。わずか1年足らずで、AIアバターは「見破られる存在」から「見破れない存在」へと性格を変えつつあります。この記事では、リアルタイムAIアバターの技術的な仕組み、すでに表面化している偽動画の実例、そして検出技術と規制の現在地を順に整理します。
Griffinとは何か——「Human Interaction Model」という新しい分類
TavusはGriffinを「世界初のHuman Interaction Model(HIM)」と位置づけています。これは人間同士の対面コミュニケーションを理解し、リアルタイムで生成するための、まったく新しいモデル分類という意味です。これまでのAIアバターとの違いは、動画の作り方そのものにあります。
従来のAIアバターは、あらかじめ生成した動画クリップを切り替えて再生する方式が主流でした。話す内容ごとに素材を用意し、口の動きを音声に合わせて貼り付ける仕組みです。これに対してGriffinは、1枚の参照画像からフレームの全ピクセルをリアルタイムで生成します。生成されるのは顔や腕、指だけではありません。椅子の動き、落ちる影、背景までもが同時に描き直されます。出力は720pで320ミリ秒単位、音声から映像までの遅延はNVIDIAのH100 GPU上で平均0.43秒です。
もう一つの特徴がフルデュプレックスの対話です。相手の話を聞きながら、同時にこちらも話し、表情を変え、身振りを返します。トランシーバーのように順番を待つのではなく、電話のように双方向で重なり合える設計です。Tavusは2020年にサンフランシスコで創業し、Y Combinatorを2021年に修了、累計で約6,400万ドルを調達しています。2025年11月にはCRV主導で4,000万ドルのシリーズBを実施しました。
何が変わったのか——2.4%から48%への跳躍
数字の裏側にある実験の設計を確認しておきましょう。Tavusは独立した調査プラットフォームを通じて参加者を募り、米国と欧州の54人を対象に検証しました。参加者には「別の参加者と1分間ビデオ通話をして、今年楽しみにしていることを話す」とだけ伝えられます。通話の相手は、Griffin-Liteで動くAIペルソナでした。
通話の直後に「相手は実在の人物だったと思いますか」と尋ねたところ、26人(48%)が「人間だった」と回答しました。「人間」と答えた層の確信度は平均79%、「AIだった」と答えた層は81%でした。つまり双方が強い自信を持って正反対を答えていたことになります。同じ手順で旧システムのPhoenix-4.5を試したときは、41人中1人(2.4%)だけが「人間」と答えました。
NVIDIAのVideo Full-Duplex Benchmarkでも、Griffin-Liteは生成・知覚の両トラックで1位を記録しています。生成トラックのスコアは3.83で、次点は2.80、人間の参照値は3.92でした。知覚トラックは3.73で、最強のベースラインは3.44、人間の参照値は4.20です。ただし、この48%はTavus自身が実施した自社研究であり、サンプルは54人、通話時間は1分間という条件付きの数字です。X上では「独立検証されておらず標準的な手順でもない」とするコミュニティノートも付いています。Tavusは安全性の仕組みを整えるまで、一般提供を見送ると明言しました。
【比較表】従来のAIアバターとGriffin世代の違い
両者を並べると、変化の大きさがはっきりします。特に「割り込みへの対応」と「遅延」は、会話の自然さを左右する要素です。
| 項目 | 従来のAIアバター | Griffin世代 |
|---|---|---|
| 生成方式 | 事前生成クリップの再生 | 参照画像1枚から全ピクセルをリアルタイム生成 |
| 描画範囲 | 顔と口元が中心 | 身体・椅子・影・背景まで |
| 対話方式 | 半二重(順番待ち) | フルデュプレックス(同時進行) |
| 音声からの遅延 | 1秒以上かかる場合が多い | 平均0.43秒 |
| 割り込みへの対応 | 不可 | 割り込みも、される側も許容 |
| ビデオTuringテスト通過率 | 2.4% | 48% |
なぜ「ビデオ通話」は難しかったのか
音声だけの対話と、映像を伴う対話の間には大きな壁がありました。人は言葉の内容ではなく、表情、口調、身振り、間の取り方で相手の意図を読み取るからです。文字ベースのアシスタントは単語を読み、音声アシスタントは音を読みます。しかしGriffinはカメラ越しの顔を読み、それに反応し、生の会話の流れの中で応答を返します。
技術的な鍵は、聴覚と視覚の信号を一つの系で扱う点にあります。Griffinは入力される音声と映像を連続的に処理し、自分が話すか、待つか、主導権を譲るかを判断します。デモでは、参加者がルービックキューブを解く手元を見ながら手順を教えたり、サイモンセッズを一緒に遊んだりする様子が公開されました。人が黙って考える間は待ち、話題が変われば追従します。感情の整合性も改善されました。悪い知らせを聞いて笑顔になるような、現実では起こりえない反応は抑えられています。
遅延0.43秒という値も見逃せません。人間同士の会話では、話し手の交代が数百ミリ秒単位で進みます。応答が1秒を超えると、相手は「間」を不自然に感じ取ります。この遅延の壁を越えたことが、欺瞞率の跳ね上がりに直結したと考えられます。
すでに起きている——AI偽動画が選挙を揺らした現場
リアルタイムアバターは研究室の中だけの話ではありません。同じ技術の土台は、すでに社会の表面に影響を及ぼしています。2026年の衆院選では、生成AIで作られた偽動画や偽画像が急速に拡散しました。
マイクを向けられた高齢女性が首相を手放しで称賛する偽インタビュー動画は、Xで200万回近く閲覧されました。元のYouTubeには「AI」の表記がありましたが、Xへの転載時にその表記は消え、代わりに支持を呼びかけるハッシュタグが添えられていました。政見放送を改ざんし、政党の代表が扇子を手に踊り出す内容に変えた動画も出回りました。投稿者が削除しても、他ユーザーによる転載は止まりません。立候補者をタンクトップ姿に改変した写真、中指を立てさせた偽画像、さらに米大リーグの選手が特定政党への投票を呼びかける偽動画まで確認されています。
日本ファクトチェックセンター編集長の古田大輔氏は、「自分はだまされやすいんだと思っていいぐらい、ネットは偽・誤情報であふれている」と指摘します。時事ドットコムの記者が実際にSoraで自作の偽演説動画を作ったところ、約10分で10秒の動画が完成したといいます。以下は、同氏が示した見分けるための三つのポイントです。
| ポイント | 具体的な確認方法 |
|---|---|
| ロゴやラベル | SoraやGemini(Veo)の透かし、YouTubeやTikTokのAIラベルの有無を見る |
| ディテールの不自然さ | 指の本数、歯の並び、消える物体、看板の文字、国旗のデザインを確認する |
| 関連情報との比較 | 投稿者がその場にいたか、発信元のプロフィールや過去投稿の画一性を調べる |
注意したいのは、AIによる検証ツールも誤るという点です。ある演説会場の映像について、XのGrok(グロック)が「AIが作った」と判定したため捏造疑惑が広がりました。しかし別角度から撮影された映像を検証した結果、本物でした。ツールの判定は参考程度に留め、人間による確認を重ねる姿勢が求められます。
企業と社会へのインパクト——なりすまし詐欺の現在地
欺瞞率の跳ね上がりは、そのまま詐欺の手口を底上げします。2024年2月、香港の多国籍企業でディープフェイクの最高財務責任者(CFO)がビデオ会議に登場し、社員に送金を指示した事件では、約2,500万ドル(当時のレートで約37億円)が流出しました。会議に参加していた他の人物も、すべて偽造された存在でした。
規模は年々拡大しています。2026年には、イタリア最大手銀行で約150億円規模の被害が報じられました。業界調査では46%の企業が生成AIを使った詐欺被害の増加を報告しています。米国では60%の国民が、誤解を招くAI生成の音声や映像を目にしたと答えました。電話越しに数秒の音声があれば、声を複製できる時代です。ビデオ通話であれば「顔を見たから安心」という前提が、そのまま崩れます。
私もこれまで、オンライン会議では「顔が見えている」ことを安心材料にしてきた一人です。相手の表情やうなずきを見て、話の信頼度を無意識に測っていました。Griffinの数字は、その無意識の習慣が技術的に無効化されつつあることを示しています。私の場合は、金額や権限が関わる依頼ほど、別の経路で本人確認を取る習慣をつけました。
検出技術と規制の現在地
対抗手段は二層に分かれます。一つはC2PAのContent Credentialsで、ファイルに署名付きのメタデータを埋め込みます。作成ツール、日時、編集履歴などを記録でき、カメラメーカーや報道機関も採用を進めています。もう一つがSynthIDです。生成されたメディア自体に目に見えない電子透かしを埋め込み、メタデータが消えても信号が残りやすい仕組みです。
OpenAIは2026年5月、ChatGPTで生成した画像にSynthIDを追加しました。C2PAのメタデータと併用することで、片方が失われても来歴を示せるようにしています。GoogleのVeoは動画をフレーム単位で透かし処理し、音楽生成のLyriaは音声に聞き取れない透かしを入れます。C2PAには2026年、TikTokが運営委員として加わりました。
ただし弱点もはっきりしています。C2PAのメタデータはスクリーンショットやSNSへの再アップロードで失われます。SynthIDが答えられるのは「AI生成かどうか」だけで、誰が作ったかや編集履歴までは分かりません。EU AI法はAI生成コンテンツの表示義務を段階的に適用しており、日本でも投稿時のラベル運用が議論されています。法整備の速度は、生成技術の進化に追いついているとは言い切れません。判定の主軸は、最終的に受け手の確認行動に残ります。
【FAQ】AIアバターと偽動画に関するよくある質問
ここでは、リアルタイムAIアバターと偽動画をめぐってよく出る疑問をまとめました。要点だけを短く整理します。
| Griffinはもう誰でも使えるのですか? | 使えません。現在は選ばれた研究者向けの研究プレビューに限定されています。Tavusは開示機能と安全対策を整えるまで一般提供を保留すると表明しています。 |
| 48%という数字は信頼できますか? | 方向性は疑いようがありませんが、自社研究・54人・1分間という条件下の値です。独立した追試と、より長い対話での検証を待つ必要があります。 |
| ビデオ通話で相手がAIかどうか見分ける方法はありますか? | ロゴやラベル、ディテールの破綻、関連情報の三点を確認してください。ただし短い会話では判断が難しく、最終的には別経路での本人確認が有効です。 |
| AI生成の動画には必ず透かしが入りますか? | 入るとは限りません。対応していないツールで作られた場合や、編集・変換・形式変更でメタデータが失われた場合は信号が消えます。透かしがないことは「本物の証拠」になりません。 |
| ディープフェイク詐欺を防ぐために企業は何をすべきですか? | 送金や権限変更の依頼は、映像で本人確認できても別経路で再確認する運用を定めてください。合言葉の設定や承認フローの二重化も有効です。 |
| 日本でもAI生成コンテンツの表示は義務ですか? | 2026年時点では、EU AI法のような包括的な表示義務は整備途上です。動画プラットフォームの自主的なラベル運用が先行しており、制度の動きは今後も注視が必要です。 |
まとめ——「顔を見た」はもう証拠にならない
Griffinの48%は、AIが人間を完全に模倣したという証明ではありません。自社研究で、54人を対象にした1分間の実験にすぎません。それでも、2.4%から48%への跳躍は、方向性の確かさを示しています。リアルタイムで反応し、割り込みを受け入れ、遅延0.43秒で顔と声を作り出すAIは、もはやデモの見世物ではありません。
同時に、選挙で拡散した偽動画や、ビデオ会議を使ったなりすまし詐欺は、この技術がすでに悪用の現場に達していることを示しています。透かしやラベルは補助線にはなりますが、スクリーンショットや再アップロードで簡単に失われます。最終的な防波堤は、受け手の確認行動です。
怪しいと感じたときは、ロゴやラベル、細部の破綻、関連情報の三点を確認してください。加えて、お金や権限が絡む依頼では、映像での本人確認だけで済ませず、別経路での再確認を組み合わせてください。そして、これからは「この相手は本当に人間か」という問いを前提に会話を始めましょう。安心できるオンラインの前提を、今日から組み直しましょう。


コメント