LF&L株式会社
← Glossary
AI

マルチモーダルAI

文章・画像・音声など、複数種類の情報を同時に理解して扱える AI。

これまでは文章専用・画像専用のように用途ごとにモデルが分かれていたが、複数の種類の情報を同じモデルの中で統合的に理解し、組み合わせて出力できるようになっている。

写真を見せて状態を説明させる、図表を含む資料をそのまま読ませる、といった用途で活用が進んでいる。物流の検品や現場写真の確認など、文章化されていない現場情報を扱う業務との相性が良い。

よくある誤解

文章生成AIに画像も足しただけだと思われがちだが、文章・画像・音声を同じモデルの中で統合的に理解する設計である。別々のAIを裏で組み合わせているのではなく、画像の中の文字と文脈を同時に読み取れるため、単純な画像認識とは扱える範囲が異なる。

関連する用語
LLM
大量の文章を学習し、文脈に続く言葉を予測して生成するAIの基盤モデル。
AIエージェント
与えられた目的に対して、AI が自ら手順を考え複数の作業を実行する仕組み。
こうした論点を実際の業務に落とすところは 業務改善・DX支援 で扱っている。関連する読み物は コラム にある。