AI
マルチモーダルAI
文章・画像・音声など、複数種類の情報を同時に理解して扱える AI。
これまでは文章専用・画像専用のように用途ごとにモデルが分かれていたが、複数の種類の情報を同じモデルの中で統合的に理解し、組み合わせて出力できるようになっている。
写真を見せて状態を説明させる、図表を含む資料をそのまま読ませる、といった用途で活用が進んでいる。物流の検品や現場写真の確認など、文章化されていない現場情報を扱う業務との相性が良い。
よくある誤解
文章生成AIに画像も足しただけだと思われがちだが、文章・画像・音声を同じモデルの中で統合的に理解する設計である。別々のAIを裏で組み合わせているのではなく、画像の中の文字と文脈を同時に読み取れるため、単純な画像認識とは扱える範囲が異なる。
関連する用語
LLM
大量の文章を学習し、文脈に続く言葉を予測して生成するAIの基盤モデル。
AIエージェント
与えられた目的に対して、AI が自ら手順を考え複数の作業を実行する仕組み。