← 用語辞書トップ

マルチモーダルAI

Multimodal AI まるちもーだるえーあい
最頻出 🟠 重要 テクノロジ系 新しい技術

意味・解説

テキスト、画像、音声、動画など、種類の異なる複数のデータ(モダリティ)を組み合わせて学習・処理できるAIのこと。

従来の「テキストのみ」のAIから進化し、画像を見て内容を説明したり、音声から感情を読み取ったりすることが可能。情報の「形式」を問わず、統合的に人間のような理解を行う。

くわしく

「五感(目・耳・言葉)を併せ持つAI」です。

1.仕組み:

画像データ(視覚)とテキストデータ(言語)を同じ空間(ベクトル)で捉え、その関係性を学習します。

2.利点:

人間と同じように、「写真を見せながら『これは何?』と聞く」といった、自然で高度なコミュニケーションが可能になります。ポイントは、現実の世界は文字だけでなく画像や音で溢れており、これらを統合して理解できることが、AI(人工知能)が「汎用的な知性」へと近づくための必須条件だからです。

例文

視覚障害者の歩行支援アプリにおいて、カメラの映像と周囲の音を解析して音声で状況を伝えるマルチモーダルAIが活用されている。

同義語: 多感覚AI
分類: 次世代AIシステム
📱

アプリでもっと効率的に学習

2,651語の用語辞書・過去問29回分・232ステージ

7日間無料でお試し

Google Playで見る