マルチモーダルAI
意味・解説
テキスト、画像、音声、動画など、種類の異なる複数のデータ(モダリティ)を組み合わせて学習・処理できるAIのこと。
従来の「テキストのみ」のAIから進化し、画像を見て内容を説明したり、音声から感情を読み取ったりすることが可能。情報の「形式」を問わず、統合的に人間のような理解を行う。
くわしく
例文
視覚障害者の歩行支援アプリにおいて、カメラの映像と周囲の音を解析して音声で状況を伝えるマルチモーダルAIが活用されている。
同義語: 多感覚AI
分類: 次世代AIシステム