TavusのGriffin AIは、ライブビデオ通話で54人中26人に対し、実際に人間と話をしていると信じ込ませた。同社は、この理由から本モデルを一般顧客には公開していない。
Tavusはこのモデルを「ビデオ版チューリングテスト」を初めて通過したと主張する。従来システムでは、同様の検証で41人中1人しか騙せなかった。
Griffinはなぜ26人もの他人を欺けたのか
Tavus共同創業者でCEOのハサーン・ラザ氏は、「人は言語だけでなく表情、声のトーン、タイミングで意思疎通する」と指摘する。同氏は、従来の機械はユーザーに特定のコマンドやクリック、プロンプトで適応させていたと説明する。
同氏は、人のようにトーンや表情を読み取れる、しかも人のような見た目を持つコンピューターの実現を訴える。
Tavusは、Griffinを「カスケード型システム」と対比する。カスケード型は音声認識・言語モデル・音声合成が順次作動し、ユーザーの発言が終わるまで応答を保留する。
Griffinは会話中、0コンマ数秒ごとに発言とノンバーバル(非言語)信号を同時解析する。さらに、通常は多くの対話型システムが省略するビデオ映像も解析対象とする。
この設計により、相手の発言中でもうなずいたり「うんうん」と相槌を打つことが可能となり、割り込みがあっても会話の流れを維持できる。
「Griffin-Liteの音声生成は会話レベルの低遅延で高音質の音声を生み、わずか10秒の音声から話者の声を複製可能」とTavusは説明する。
NVIDIAのVideoFDBベンチマークは、AIがライブビデオ会話をどこまで実現できるかを評価する。Griffinのスコアは5点中3.83。
人間による参考録音は3.92点で、次点はGemini 2.5とAnamの組み合わせによる2.80点だった。
TavusはなぜGriffin AIの提供を制限しているのか
調査参加者は、新年の計画をテーマに1分間、人と会話するよう求められた。半数超がAIの存在を全く想定していなかったと答えた。
一方、違和感を持った人は、多くが最初の20秒以内にそれを感じ取っていた。Tavusは、このリアルさが逆に人間との会話と誤認させうるリスクを認めている。
このため、Griffin-Lite(プレビュー版)の一般公開は信頼できる限定テスターに絞っている。今後は、AIによる「開示機能」の開発や、AI安全団体との協業を進めた後、段階的な提供範囲拡大を目指すとしている。
暗号資産詐欺の事例は、このリスクが現実的であることを示唆する。TRM Labsは、犯罪組織によるAI導入が2026年に前年比40%増加し、その主因が詐欺にあることを確認した。
GriffinのようなAIモデルが普及すれば、ビデオ通話で見知った顔でも相手が本物か判断できなくなる可能性が高まる。
YouTubeチャンネルではリーダーや記者による専門的インサイトを配信中









