非構造化データ
意味・解説
テキストや画像、音声など、明確な行と列の形式を持たないデータ。SNS投稿が典型例で、AIによる解析が必要となる。
電子メール、文書ファイル、画像、音声、動画、SNSの投稿内容など、特定の行と列に収まらない多種多様なデータである。ビッグデータの大部分(約8割)を占めるとされ、構造化データとは異なり、解析にはAIや自然言語処理などの高度な技術を必要とする。
くわしく
デジタルの世界に無秩序に存在する「生の情報」である。
1.多様な形式:テキスト、画像、音声など、発生源によってフォーマットがバラバラである。これらは人間には理解しやすいが、コンピュータがそのまま集計することは難しい。
2.価値の埋没:膨大なデータ量があるものの、そのままでは「ゴミの山」となりかねない。例えば、コールセンターの録音データ(非構造化)をAIでテキスト化し、感情分析にかけることで、初めて「顧客の不満」という価値ある情報に変わる。
なぜ重要か:現代のビジネスでは、SNSでの評判や監視カメラの映像など、非構造化データの中に競争力の源泉(隠れたインサイト)が隠されているからである。これらをAI技術で構造化データに変換して活用することがDXの鍵となっている。
例文
SNS上の非構造化データを収集し、ブランドに対する消費者の感情をAIでポジティブ・ネガティブに判定した。
同義語: 非定型データ
対義語: 構造化データ
分類: データ形式