マルチモーダルとは?画像も音声も扱えるAIをわかりやすく解説

AI用語集

一言でいうと

マルチモーダルとは、文章だけでなく、画像・音声・動画など複数の種類の情報をまとめて扱えることを指します。

もう少し詳しく

「モーダル」は情報の種類のこと。かつてのAIは文章専用・画像専用と分かれていましたが、今の主要なAIは、写真を見せて「これは何?」と聞いたり、資料の画像を読み取って要約したりできます

できることの例

  • グラフの画像を見せて内容を説明させる
  • 手書きのメモを撮影して文字に起こす
  • 音声で話しかけて答えてもらう
  • 資料のスクリーンショットから要点を抜き出す

初心者が知っておくべきこと

「文章で説明しづらいものは、画像で見せた方が早い」場面が多くあります。エラー画面のスクリーンショットを見せて相談する、といった使い方が便利です。

関連する言葉

「マルチモーダル」に関する記事をもっと読む
マルチモーダルの記事一覧を見る →

コメント

タイトルとURLをコピーしました